Aller au contenu principal
RecherchearXiv cs.RO 

EIDA : adaptation de la dynamique d'exécution et d'interface pour la navigation de robots, du réel à la simulation puis au réel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.01219) EIDA, pour « Execution-Interface Dynamics Adaptation », une méthode qui vise à réduire l'écart entre simulation et robot réel en navigation. Le problème ciblé est précis. Une politique apprise en simulation échoue souvent parce que les commandes de vitesse produisent, sur la plateforme réelle, un mouvement et un retour de vitesse différents de ceux modélisés à l'entraînement. EIDA ajuste ces réponses à partir de données d'exécution recueillies sur la plateforme cible, sans reconstruire la dynamique des actionneurs. Un premier modèle, qui prédit les incréments de pose dans le repère du corps, met à jour la géométrie du simulateur. Un second modèle prédit le retour de vitesse que perçoit la politique, et un court historique de ce retour est ajouté à son entrée. Le tout tourne dans un simulateur léger parallélisé sur GPU. Sur les jeux de validation complets du Jackal (robot à roues) et du Unitree Go2 (quadrupède), les modèles ajustés réduisent les erreurs de position et de lacet par rapport au modèle de mouvement prédéfini du simulateur. Sur 100 environnements de navigation évalués dans un autre simulateur physique, EIDA obtient le meilleur taux de réussite et le meilleur score de navigation parmi les politiques apprises comparées, avec ou sans guidage global. Sur un Go2 réel, il atteint le but sans collision dans 20 essais sur 20 en scène statique, contre 4 sur 20 pour la base de référence.

L'intérêt tient à l'approche. Beaucoup d'équipes cherchent à résoudre le « sim-to-real » en modélisant finement les moteurs, les couples et les frottements, ce qui est coûteux et propre à chaque machine. EIDA place l'adaptation à l'interface d'exécution, c'est-à-dire entre la commande de vitesse et le mouvement observé, et s'appuie sur des données collectées à l'exécution. Pour un intégrateur qui déploie des politiques de navigation sur plusieurs plateformes, un recalage à partir d'un jeu de données de conduite est plus réaliste qu'une identification complète de la dynamique. Le résultat sur les ablations est aussi instructif : l'écart ne vient pas seulement du mouvement réel, mais de la manière dont la politique estime sa propre vitesse, ce qui oblige à aligner ces estimations. Il faut toutefois relativiser. Il s'agit d'un préprint non évalué par des pairs. Le test physique porte sur un seul robot, en scène statique, avec 20 essais, et rien n'indique encore une tenue en environnement dynamique ou sur d'autres morphologies.

Ce travail s'inscrit dans la lignée des méthodes « real-to-sim-to-real », qui vont des approches de randomisation de domaine à l'identification de systèmes et aux modèles de dynamique appris. La navigation par apprentissage par renforcement entraîné en simulation parallèle sur GPU est devenue courante pour les quadrupèdes comme le Go2, et la question du transfert reste son principal frein. Le choix du Jackal et du Go2 montre la volonté de couvrir un robot à roues et un robot à pattes, mais la validation en conditions réelles ne concerne que ce dernier. Les auteurs ne mentionnent ni pilote industriel ni calendrier. La suite logique serait des essais en scènes dynamiques, sur davantage de plateformes, et une comparaison avec des méthodes d'adaptation en ligne.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Interface de navigation universelle : données sans robot pour la navigation des robots à roues
1arXiv cs.RO 

Interface de navigation universelle : données sans robot pour la navigation des robots à roues

Un article arXiv (2609.20114v1) présente Universal Navigation Interface (UNI), une méthode de collecte de données de navigation pour robots à roues sans robot cible ni téléopération. Le dispositif est un déambulateur à quatre roues (rollator) équipé d'un smartphone, poussé par un opérateur humain ; incapable de monter des escaliers, de franchir des bordures non abaissées ou de passer par des espaces étroits, il biaise naturellement les trajectoires vers des itinéraires praticables en roues. Les auteurs ont collecté 37,2 km de données réelles, converties en trajectoires métriques pour entraîner des modèles de navigation conditionnés par objectif. Le fine-tuning sur ces données réduit l'erreur de prédiction de trajectoire de 17,4 à 24,8 % sur le jeu de test UNI, avec des gains plus inégaux sur d'autres datasets, et un transfert en boucle fermée vers un fauteuil roulant motorisé a été validé sur des scénarios de bordures et d'escaliers. Cette approche s'attaque à un goulot d'étranglement connu de la robotique mobile : la collecte de données de navigation exige d'ordinaire une téléopération spécifique à chaque plateforme, coûteuse et difficile à faire passer à l'échelle. En montrant qu'un objet du quotidien, sans robot cible ni capteurs sophistiqués, peut produire des trajectoires exploitables pour l'entraînement, UNI ouvre une piste de réduction de coûts pour les intégrateurs de robots à roues, qu'il s'agisse d'AMR industriels, de robots de livraison ou d'aides à la mobilité comme les fauteuils roulants. Le résultat appuie l'idée que des proxys physiques bon marché peuvent fournir une supervision réelle sans simulation ni robot final, même si les gains ne se généralisent pas uniformément aux jeux de données externes testés, un rappel que la méthode reste sensible au domaine d'entraînement. UNI prolonge une lignée d'outils de collecte "robot-free" popularisée en manipulation par des dispositifs comme Universal Manipulation Interface, qui enregistrait des démonstrations via une pince portative sans bras robotique ; UNI transpose cette logique à la navigation à roues en exploitant les contraintes physiques d'un objet grand public, un déambulateur pour personnes à mobilité réduite. Il s'agit d'un travail de recherche publié en preprint sur arXiv, sans lien annoncé avec un produit commercial ou un déploiement industriel. Les prochaines étapes évoquées par les auteurs portent sur l'élargissement des tests à d'autres jeux de données et plateformes robotiques, au-delà du fauteuil roulant motorisé utilisé pour la validation en boucle fermée.

RecherchePaper
1 source
WAVE-Go : navigation par modèle du monde à exécution adaptative pour robots à roues-pattes
2arXiv cs.RO 

WAVE-Go : navigation par modèle du monde à exécution adaptative pour robots à roues-pattes

Un article arXiv (2609.18193, catégorie "new") paru mi-septembre décrit WAVE-Go, un système de navigation par image-cible pour robots à roues et jambes, qui sépare la prédiction d'un world model de l'exécution des commandes, rendue interruptible. Un exécuteur choisit un préfixe d'actions et l'annule dès qu'une observation l'invalide, par exemple face à un obstacle mobile ou un changement de mode de locomotion, sous un budget de risque cumulé et des contrôles de stabilité pour les transitions de posture. Résultats : 74,1% de réussite en distribution et 63,3% en distribution dynamique hors distribution, soit 4,7 et 7,7 points de plus que la meilleure référence, avec des collisions réduites de 4,4 à 2,9 pour 100 mètres. Face à une exécution interruptible à quatre commandes fixes, le gain est de 4,0 points de réussite, avec 51,2% de replanifications et 6,5% de collisions en moins ; le code est publié sur GitHub sous vigorlee/wave-go. Le travail cible un problème concret pour les intégrateurs de robots mobiles hybrides : un plan de navigation calculé à un instant donné devient souvent caduc dès qu'un obstacle bouge ou qu'un changement de terrain impose de basculer entre roulage et marche. En montrant qu'une exécution interruptible et adaptative surpasse un modèle sans interruption et une version à commandes interruptibles mais figées, l'étude illustre que le compromis entre performance et charge de replanification peut être arbitré en temps réel plutôt que fixé à la conception, un argument utile face à l'écart souvent pointé entre démonstrations et conditions réelles en robotique mobile. Les ablations confirment ce compromis : l'interruption en temps réel améliore réussite, collisions et latence, mais augmente la replanification, un arbitrage que les intégrateurs devront calibrer selon leur budget de calcul embarqué. WAVE-Go s'inscrit dans la lignée des world models appliqués à la navigation robotique, une approche qui anticipe les conséquences d'une action avant de l'exécuter. Les auteurs comparent leur méthode à un modèle sans interruption et à une variante interruptible limitée à quatre commandes fixes, signe que l'interruptibilité était déjà explorée sans être couplée à un choix adaptatif de préfixe ni à un budget de risque cumulé. Publié comme nouvelle soumission arXiv sans affiliation industrielle ni partenaire annoncés, le projet met son code à disposition sur GitHub, ce qui le situe au stade de la recherche méthodologique plutôt que du produit prêt à déployer.

RecherchePaper
1 source
RopeFormer : adaptation inter-essais à partir de l'historique d'interaction pour la manipulation dynamique de corde
3arXiv cs.RO 

RopeFormer : adaptation inter-essais à partir de l'historique d'interaction pour la manipulation dynamique de corde

Des chercheurs présentent RopeFormer, un système de contrôle robotique conditionné par l'historique d'interaction pour la manipulation dynamique de cordes, un problème classique de robotique où le même mouvement produit des réponses très différentes selon les propriétés physiques de l'objet manipulé, difficiles à identifier explicitement. La politique conserve en mémoire l'historique des couples action-réponse d'un essai à l'autre sans modifier ses poids ni estimer en ligne les paramètres de la corde. En simulation, sur des scénarios de rotation mono-bras soutenue, de rotation bimanuelle et de fouettement transitoire, conserver ce contexte améliore le contrôle par rapport à une remise à zéro du même point de contrôle, avec un bénéfice qui varie selon la dynamique de la corde et les conditions d'observation. Les chercheurs ont ensuite déployé ces politiques figées sur un robot humanoïde Unitree H1-2 confronté à des cordes physiques inédites. Entre le premier et le troisième essai, le temps d'acquisition de cible chute de 30,9% pour l'exercice "Rope Swing" et de 33,9% pour "Rope Twirl", tandis que le nombre moyen de cibles touchées lors du "Rope Whip" passe de 0,2 à 2,3 sur trois. Code, données et vidéos sont publiés sur ropeformer.github.io. Ce résultat intéresse la manipulation d'objets déformables en général, câbles, tissus, cordages, un domaine où l'identification explicite des paramètres physiques reste un goulot d'étranglement pour l'industrie. En s'appuyant sur un mécanisme d'adaptation en contexte, à la manière d'un grand modèle de langage qui ajuste son comportement sans réentraînement, plutôt que sur une estimation de paramètres physiques ou un réentraînement en ligne, l'approche suggère qu'une politique unique et figée peut s'ajuster à des objets jamais vus simplement en accumulant de l'expérience au sein d'une session. Pour les intégrateurs travaillant sur la manipulation fine ou les tâches impliquant des matériaux souples, cela ouvre une piste pour réduire la recalibration par objet, un coût récurrent en déploiement industriel. Le travail s'inscrit dans la lignée des recherches sur l'adaptation rapide par contexte plutôt que par identification de système explicite, un axe qui gagne en traction face aux limites des méthodes classiques de modélisation physique des objets déformables. Les auteurs restent prudents: les gains varient selon la dynamique de la corde et les conditions d'observation, et le déploiement réel reste limité à un seul robot humanoïde et des essais contrôlés. La publication complète du code et des données ouvre la voie à des réplications et extensions par d'autres équipes de recherche en manipulation robotique.

UEAucun acteur français ou européen implique dans ces travaux, mais le code et les données publies en open source pourraient intéresser les équipes de recherche européennes travaillant sur la manipulation d'objets déformables.

RecherchePaper
1 source
Génération et adaptation dynamique pour manipulation robotique par imitation d'exemples inédits
4arXiv cs.RO 

Génération et adaptation dynamique pour manipulation robotique par imitation d'exemples inédits

Cette annonce technique concerne DAMI (Dynamics-Aware Meta-Imitation), un nouveau framework de recherche pour l'apprentissage par imitation en robotique, publié le 20 juillet 2026 sur arXiv (référence 2607.15880v1). L'apprentissage par imitation permet aux robots d'acquérir des compétences à partir de démonstrations, mais souffre traditionnellement d'un manque de données et de difficultés à généraliser à de nouvelles tâches non vues à l'entraînement. Pour résoudre ce problème, les chercheurs combinent le meta-learning avec plusieurs modules techniques : un module Visual-Motor Trajectory (VMT) qui capture les dynamiques spatio-temporelles complexes dans l'espace latent de la tâche, un bloc Unpaired Unified Task (U2T) qui fusionne des observations multimodales non structurées, et un mécanisme de Task-Conditioned Feature Modulation (TCFM) qui module les caractéristiques 3D de bas niveau. Le système apprend la logique sous-jacente d'une tâche à partir d'une seule démonstration de référence complète, plutôt que de mémoriser des indices statiques figés. Des expériences en simulation et en conditions réelles montrent que DAMI surpasse les approches de référence existantes, aussi bien en inférence directe sur des tâches connues qu'en adaptation à des tâches inédites via du few-shot fine-tuning. L'enjeu ici dépasse la simple performance sur benchmark : c'est le fossé entre démonstration et généralisation réelle qui reste le principal obstacle à la commercialisation des robots manipulateurs et humanoïdes. La plupart des systèmes actuels performent bien sur les tâches pour lesquelles ils ont été entraînés, mais s'effondrent dès qu'un intégrateur change légèrement l'environnement, l'objet ou la disposition de la cellule de production. Si les résultats de généralisation few-shot se confirment au-delà du papier, cela réduirait le coût de redéploiement d'un robot manipulateur sur une nouvelle tâche industrielle, un frein économique majeur actuellement pour les intégrateurs et les décideurs B2B qui hésitent à investir dans des cellules robotisées rigides. Ce travail s'inscrit dans la lignée des architectures VLA (Vision-Language-Action) et des approches de meta-learning déjà explorées par des acteurs comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T N2), qui cherchent tous à résoudre le même problème de transfert sim-to-real et de généralisation inter-tâches. Contrairement à ces produits commerciaux, DAMI reste à ce stade une contribution académique publiée sur arXiv, sans indication de partenaire industriel ni de déploiement prévu. Les prochaines étapes attendues seraient une validation sur des plateformes robotiques tierces et une comparaison directe avec les frameworks VLA propriétaires pour juger de sa maturité réelle.

RecherchePaper
1 source