Aller au contenu principal
FlashNeRD : une dynamique neuronale de robots avec contacts multiples, conçue pour la performance
RecherchearXiv cs.RO 

FlashNeRD : une dynamique neuronale de robots avec contacts multiples, conçue pour la performance

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

FlashNeRD, un travail déposé sur arXiv (2610.09130v1), propose une nouvelle génération de modèles de dynamique neuronale pour la simulation robotique. Il s'appuie sur Neural Robot Dynamics (NeRD), qui garde la détection de collision analytique mais remplace la dynamique numérique du robot par un modèle appris. Les auteurs identifient trois limites de NeRD: un gain de vitesse quasi nul face au simulateur d'origine, des contacts acceptés uniquement en des points prédéfinis, et l'absence de couplage bidirectionnel avec les objets manipulés. FlashNeRD y répond par une architecture parallèle en flux continu (« streaming »), un encodeur qui accepte les contacts où qu'ils surviennent, et un couplage bidirectionnel avec des objets simulés par des solveurs analytiques. Sur trois robots, le modèle de dynamique est jusqu'à 55 fois plus rapide qu'un NeRD optimisé, et plus précis sur de longs rollouts. Une politique de locomotion ANYmal est entraînée par PPO en 34 secondes, soit 3,8 fois plus vite qu'avec le simulateur analytique et 2,7 fois plus vite qu'avec un NeRD optimisé. Avec DIAL-MPC, une commande prédictive par échantillonnage, le robot franchit les six plateformes de test là où NeRD à contacts fixes n'en passe qu'une, pour environ la moitié du temps de planification du simulateur analytique. Des politiques de réorientation de cube entraînées avec FlashNeRD atteignent un nombre de cibles à 2 % près de celui d'une politique entraînée dans le simulateur. Les expériences portent sur cinq robots.

L'enjeu est de savoir si un simulateur appris peut devenir plus qu'une curiosité académique. Jusqu'ici, la promesse d'une simulation différentiable et adaptable à des données réelles se heurtait à un obstacle: si le modèle appris n'accélère pas l'entraînement, personne n'a de raison de quitter un simulateur analytique éprouvé. Un gain de 3,8 fois sur l'apprentissage de locomotion et une planification deux fois moins coûteuse changent ce calcul pour les équipes qui entraînent des politiques par apprentissage par renforcement ou par MPC. Le résultat sur le cube est aussi significatif: un transfert à 2 % près suggère que les politiques apprises dans un simulateur neuronal conservent leur performance en manipulation riche en contacts. Il faut toutefois rester prudent: ce sont des résultats de simulation sur cinq robots, sans validation sim-to-real annoncée, et le « jusqu'à 55 fois » est un maximum obtenu sur trois robots, pas une moyenne.

Ce travail prolonge NeRD, qui avait posé le principe d'un modèle appris remplaçant uniquement la dynamique du robot. Il s'inscrit dans une course où les simulateurs analytiques accélérés par GPU, dont celui qui sert ici de référence, restent la norme industrielle, tandis que les approches neuronales cherchent à s'imposer par la différentiabilité et l'adaptation aux données réelles. La suite logique serait de valider ces modèles sur du matériel physique et sur des scènes plus complexes. À ce stade, il s'agit d'une préimpression non évaluée par les pairs, sans produit ni déploiement annoncé.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

NeuralActuator : modélisation neuronale de l'actionnement pour la dynamique des robots et la perception des forces externes
1arXiv cs.RO 

NeuralActuator : modélisation neuronale de l'actionnement pour la dynamique des robots et la perception des forces externes

Une équipe de recherche publie NeuralActuator (arXiv:2607.11734v1), un modèle neuronal d'actionneur capable de prédire simultanément trois grandeurs : un équivalent d'effort généralisé pour la propagation de trajectoires sur des plateformes à faible coût, une force externe accompagnée d'une porte de probabilité de contact permettant une perception de force sans capteur dédié, et un score d'état moteur pour la maintenance de l'articulation supervisée. Les chercheurs introduisent aussi le Neural Actuation Dataset (NAD), constitué via un système de téléopération à deux bras qui enregistre conjointement les états du robot, la télémétrie des actionneurs et des labels de force externe. La tête chargée du couple est entraînée par simulation différentiable à partir de trajectoires de pose, sans label direct, tandis que les têtes de force, de porte et d'état moteur reçoivent une supervision directe ; un Transformer capture les dépendances temporelles tout en permettant une inférence temps réel. Le système est évalué sur trois plateformes : le bras 5 degrés de liberté OpenManipulator-X, le 6 DDL SO-101 (issu de l'écosystème open source LeRobot popularisé par Hugging Face), et le 7 DDL Franka Emika Panda, soit une fourchette de prix allant d'environ 500 dollars à plus de 30 000 dollars. L'enjeu dépassé ici est celui du fossé sim-to-real causé par la dynamique réelle des actionneurs (frottement, hystérésis, jeu mécanique, effets thermiques), qui rend la relation linéaire couple-courant peu fiable, en particulier sur les servomoteurs bon marché utilisés dans la robotique low-cost et l'apprentissage par renforcement. En permettant une estimation de force sans capteur de force/couple, généralement coûteux, cette approche ouvre la voie à une perception de contact plus accessible pour l'intégration industrielle légère. Les auteurs montrent également qu'utilisé comme module pré-entraîné, NeuralActuator améliore les performances du clonage de comportement (behavior cloning), et qu'il permet une estimation de l'état moteur exploitable pour la maintenance prédictive sur l'OpenManipulator-X. Ce travail s'inscrit dans la lignée des simulateurs différentiables, de plus en plus utilisés pour l'apprentissage de politiques, où la modélisation des actionneurs reste le maillon faible. Il s'agit d'un preprint académique, non encore relu par les pairs, sans déploiement produit annoncé : la validation reste circonscrite aux trois bras testés, avec le Franka Panda utilisé hors ligne comme référence haut de gamme pour l'estimation de force sous charge.

RecherchePaper
1 source
Apprendre la bonne abstraction : dynamique réduite neuronale pour le contrôle robotique complexe
2arXiv cs.RO 

Apprendre la bonne abstraction : dynamique réduite neuronale pour le contrôle robotique complexe

Une équipe de recherche a publié sur arXiv, le 21 août 2026 (référence 2608.19375v1), un article intitulé « Learning the Right Abstraction: Neural Reduced Dynamics for Complex Robot Control », proposant un cadre baptisé Neural Reduced Dynamics (NRD). L'objectif : remplacer les simulateurs physiques haute-fidélité, trop coûteux pour l'apprentissage par renforcement à grande échelle, par un modèle neuronal appris qui ne conserve que l'état réduit pertinent pour le contrôle, avant de valider les politiques entraînées dans le simulateur complet. Le cadre est testé sur trois tâches : suivi de trajectoire d'un véhicule HMMWV (Humvee) sur terrain rigide, accidenté et déformable, modélisé via un Continuum Representation Model (CRM), et atteinte d'objectifs pour un véhicule à chenilles équipé d'un bras articulé frontal. Une politique unique, entraînée sans recevoir d'information de terrain en entrée, obtient une erreur de suivi inférieure à celle de politiques spécialisées par terrain, y compris sur un terrain accidenté jamais vu (zero-shot). Le véhicule atteint 100 objectifs sur 100, le bras 97 sur 100, sans collision ni dépassement de butée articulaire, et les modèles NRD tournent environ quatre ordres de grandeur plus vite en temps simulé que les scènes qu'ils remplacent. Cette accélération déplace le goulot d'étranglement classique de l'apprentissage robotique : entraîner des politiques directement dans un simulateur haute-fidélité reste souvent hors de portée pour l'itération rapide à grande échelle, ce que ce travail contourne sans sacrifier le transfert vers la physique complète. Pour les équipes développant des véhicules autonomes tout-terrain ou des plateformes hybrides mobilité-manipulation, la généralisation à un terrain non vu, sans capteur dédié, suggère qu'une seule politique bien entraînée peut remplacer plusieurs modèles spécialisés. Ces résultats restent toutefois obtenus entièrement en simulation, sans validation sur robot physique. Le travail s'inscrit dans la lignée des approches par dynamique neuronale ou « world models » destinées à accélérer l'apprentissage par renforcement, en alternative aux moteurs physiques classiques comme Chrono, dont est issue la terminologie CRM, ou aux plateformes de simulation massivement parallèles type Isaac Gym. Plutôt que d'apprendre une dynamique complète, NRD mise sur une abstraction volontairement réduite de l'état, le reste étant fourni en entrée ou recalculé analytiquement. L'article ne mentionne ni partenariat industriel ni calendrier de déploiement ; il se positionne comme une contribution méthodologique pour les laboratoires travaillant sur les véhicules terrestres autonomes et la manipulation mobile.

RecherchePaper
1 source
Diffusion : un apprentissage de l'impédance pour la manipulation avec contacts multiples
3arXiv cs.RO 

Diffusion : un apprentissage de l'impédance pour la manipulation avec contacts multiples

Une équipe de chercheurs décrit sur arXiv (arXiv:2509.19696, quatrième version) Diffusion-Based Impedance Learning (DIL), un framework combinant un modèle de diffusion Transformer et un contrôle d'impédance classique pour la manipulation robotique en contact riche. Conditionne par cross-attention sur les forces et couples externes mesures, le modèle reconstruit des trajectoires simulées a force nulle (sZFT), complétées par un ordonnanceur de bruit quaternion SLERP pour les rotations. Un estimateur énergétique adapte ensuite en ligne la raideur et l'amortissement du bras. Entraine sur des démonstrations de franchissement d'obstacles et de robotique thérapeutique collectées via téléopération au casque Apple Vision Pro, avec seulement quelques dizaines de milliers d'échantillons, le modèle atteint une précision sous le millimètre et sous le degré. Deploye en temps réel sur un bras KUKA LBR iiwa, il obtient 100% de réussite sur une tache d'insertion peg-in-hole multi-géométries. La manipulation en contact riche (insertion, assemblage, interaction physique) reste un point faible des politiques robotiques purement apprises, qui peinent a garantir la sécurité lors du contact, tandis que le contrôle d'impédance classique exige un réglage manuel spécifique a chaque tache. En couplant les deux approches, ce travail vise a automatiser ce réglage tout en conservant les garanties de stabilité de l'impédance, un enjeu concret pour les intégrateurs qui déploient des bras collaboratifs sur des lignes d'assemblage ou en assistance thérapeutique. Les résultats restent toutefois ceux d'une démonstration de laboratoire, sur un seul bras et des taches contrôlées, et non d'un déploiement industriel a l'échelle. Le contrôle d'impédance, théorisé il y a plusieurs décennies, reste la référence pour l'interaction physique sure homme-robot, tandis que les modèles de diffusion se sont imposes plus récemment comme méthode d'apprentissage de politiques robotiques, a l'image des travaux sur les diffusion policies, sans toutefois bien couvrir les taches de contact face aux approches VLA généralistes comme Pi-0 ou GR00T N2. Le recours a l'Apple Vision Pro pour la téléopération illustre une tendance croissante a collecter des démonstrations via des casques de réalité mixte plutôt que des combinaisons de capture de mouvement dédiées. Le KUKA LBR iiwa, bras collaboratif a détection de couple du fabricant allemand KUKA, sert de plateforme d'essai. Code et vidéos sont publics, sans annonce de pilote industriel a ce stade.

UELe bras collaboratif utilise pour la demonstration est fabrique par l'entreprise allemande KUKA, mais aucune equipe de recherche europeenne ni pilote industriel europeen n'est mentionne.

RecherchePaper
1 source
Robotique humanoïde : optimisation cinétodynamique de la trajectoire corps entier avec contacts multiples
4arXiv cs.RO 

Robotique humanoïde : optimisation cinétodynamique de la trajectoire corps entier avec contacts multiples

Une équipe de recherche présente KDMR (KinoDynamic Motion Retargeting), un nouveau framework pour adapter des mouvements de capture de mouvement (MoCap) humains à des robots humanoïdes. Contrairement aux méthodes classiques de retargeting purement cinématiques, qui se contentent de transposer spatialement les données MoCap et génèrent des artefacts physiquement incohérents (glissement des pieds, pénétration du sol), KDMR formule le problème comme une optimisation de trajectoire dynamique multi-contact sur le corps entier du robot. La méthode intègre des contraintes de dynamique du corps rigide et de complémentarité de contact, et combine les données MoCap avec des mesures de force de réaction au sol (GRF) pour détecter automatiquement les événements de contact talon-orteil et reproduire fidèlement les schémas de contact humains. Les auteurs comparent KDMR à GMR, la référence actuelle du domaine, sur trois critères : la faisabilité dynamique et la fluidité des mouvements retargetés, la précision du suivi des forces de réaction au sol par rapport aux données sources, et l'efficacité d'entraînement des politiques de contrôle en aval via le framework BeyondMimic. Le pipeline complet sera publié en open source. Ce travail s'attaque à un goulot d'étranglement peu visible mais critique dans l'apprentissage par imitation pour robots humanoïdes : la qualité des données de référence utilisées pour entraîner les politiques de locomotion. Un retargeting purement cinématique produit des trajectoires irréalistes que les robots ne peuvent pas exécuter sans corrections coûteuses, ce qui ralentit la convergence de l'entraînement et dégrade la stabilité de la marche obtenue. En démontrant que des trajectoires dynamiquement viables accélèrent l'apprentissage et améliorent la stabilité finale, KDMR renforce l'idée que le sim-to-real et l'apprentissage par imitation pour humanoïdes ne sont pas seulement une question d'algorithmes de contrôle, mais aussi de qualité des données de démonstration en amont. Pour les équipes qui développent des politiques de locomotion humanoïde, cela suggère qu'investir dans un retargeting physiquement cohérent peut réduire le temps et le coût d'entraînement plutôt que de complexifier uniquement la politique elle-même. Le retargeting de mouvement humain vers robot est une étape standard dans les pipelines d'apprentissage par imitation pour humanoïdes, où GMR sert aujourd'hui de référence de facto. KDMR s'inscrit dans une tendance plus large visant à combler l'écart entre capture de mouvement et physique réelle du robot, en s'appuyant explicitement sur des données de force au sol plutôt que sur la seule cinématique. Les auteurs annoncent la publication complète du pipeline en open source à la publication de l'article, ce qui permettrait à la communauté robotique d'évaluer et de réutiliser directement la méthode, sans toutefois préciser à ce stade de calendrier précis ni de robot physique sur lequel les politiques entraînées ont été validées en conditions réelles.

RecherchePaper
1 source