
FlashNeRD : une dynamique neuronale de robots avec contacts multiples, conçue pour la performance
FlashNeRD, un travail déposé sur arXiv (2610.09130v1), propose une nouvelle génération de modèles de dynamique neuronale pour la simulation robotique. Il s'appuie sur Neural Robot Dynamics (NeRD), qui garde la détection de collision analytique mais remplace la dynamique numérique du robot par un modèle appris. Les auteurs identifient trois limites de NeRD: un gain de vitesse quasi nul face au simulateur d'origine, des contacts acceptés uniquement en des points prédéfinis, et l'absence de couplage bidirectionnel avec les objets manipulés. FlashNeRD y répond par une architecture parallèle en flux continu (« streaming »), un encodeur qui accepte les contacts où qu'ils surviennent, et un couplage bidirectionnel avec des objets simulés par des solveurs analytiques. Sur trois robots, le modèle de dynamique est jusqu'à 55 fois plus rapide qu'un NeRD optimisé, et plus précis sur de longs rollouts. Une politique de locomotion ANYmal est entraînée par PPO en 34 secondes, soit 3,8 fois plus vite qu'avec le simulateur analytique et 2,7 fois plus vite qu'avec un NeRD optimisé. Avec DIAL-MPC, une commande prédictive par échantillonnage, le robot franchit les six plateformes de test là où NeRD à contacts fixes n'en passe qu'une, pour environ la moitié du temps de planification du simulateur analytique. Des politiques de réorientation de cube entraînées avec FlashNeRD atteignent un nombre de cibles à 2 % près de celui d'une politique entraînée dans le simulateur. Les expériences portent sur cinq robots.
L'enjeu est de savoir si un simulateur appris peut devenir plus qu'une curiosité académique. Jusqu'ici, la promesse d'une simulation différentiable et adaptable à des données réelles se heurtait à un obstacle: si le modèle appris n'accélère pas l'entraînement, personne n'a de raison de quitter un simulateur analytique éprouvé. Un gain de 3,8 fois sur l'apprentissage de locomotion et une planification deux fois moins coûteuse changent ce calcul pour les équipes qui entraînent des politiques par apprentissage par renforcement ou par MPC. Le résultat sur le cube est aussi significatif: un transfert à 2 % près suggère que les politiques apprises dans un simulateur neuronal conservent leur performance en manipulation riche en contacts. Il faut toutefois rester prudent: ce sont des résultats de simulation sur cinq robots, sans validation sim-to-real annoncée, et le « jusqu'à 55 fois » est un maximum obtenu sur trois robots, pas une moyenne.
Ce travail prolonge NeRD, qui avait posé le principe d'un modèle appris remplaçant uniquement la dynamique du robot. Il s'inscrit dans une course où les simulateurs analytiques accélérés par GPU, dont celui qui sert ici de référence, restent la norme industrielle, tandis que les approches neuronales cherchent à s'imposer par la différentiabilité et l'adaptation aux données réelles. La suite logique serait de valider ces modèles sur du matériel physique et sur des scènes plus complexes. À ce stade, il s'agit d'une préimpression non évaluée par les pairs, sans produit ni déploiement annoncé.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




