Aller au contenu principal
ThorArena : évaluation de l'interaction physique humanoïde à partir de démonstrations humaines de mouvement et de force
RecherchearXiv cs.RO 

ThorArena : évaluation de l'interaction physique humanoïde à partir de démonstrations humaines de mouvement et de force

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent sur arXiv (2607.06052) ThorArena, un nouveau benchmark pour évaluer l'interaction physique des robots humanoïdes en tenant compte des forces de contact, et non plus seulement du mouvement. L'équipe a constitué un jeu de données réel synchronisant le mouvement corporel complet d'un humain et les forces exercées par ses deux mains, sur six tâches d'interaction physique représentatives. À partir de ces démonstrations, elle propose le Force-Aware Tracking Score (FATS), une métrique qui évalue conjointement la précision du suivi corps entier, la robustesse à différents niveaux de force, l'effort de contrôle et la survie de l'épisode (le robot garde-t-il son équilibre sans échouer). Le protocole rejoue ensuite en simulation les forces d'interaction enregistrées, offrant une interface d'évaluation standardisée pour comparer différentes politiques de contrôle whole-body.

Jusqu'ici, les jeux de données et benchmarks d'imitation de mouvement humanoïde se concentraient presque exclusivement sur la cinématique, laissant de côté les forces d'interaction synchronisées. Résultat : les évaluations existantes ne captaient pas comment les forces externes affectent la précision du suivi, la stabilité et la robustesse du contrôle, un angle mort critique dès qu'un robot humanoïde doit manipuler un objet, ouvrir une porte ou interagir physiquement avec un humain. Les expériences menées sur des politiques de contrôle whole-body représentatives montrent que l'évaluation sensible aux forces révèle des écarts de performance substantiels, invisibles dans les évaluations classiques sans force. Autrement dit, des politiques qui paraissent solides sur des métriques purement cinématiques peuvent s'avérer fragiles dès qu'elles rencontrent une résistance physique réelle, ce qui interroge la fiabilité des benchmarks actuels pour juger de la maturité réelle des humanoïdes destinés aux tâches à fort contact.

ThorArena s'inscrit dans la lignée des travaux récents sur l'imitation de mouvement humanoïde et le contrôle corps entier, un domaine qui a rapidement progressé sur la précision du tracking mais restait largement évalué hors contexte de contact physique. En proposant un protocole unifié et reproductible, appuyé sur des démonstrations humaines synchronisant mouvement et force sur six tâches, les auteurs visent un standard d'évaluation partagé par la communauté robotique, à l'image de ce que les benchmarks de manipulation ont apporté à l'apprentissage par renforcement. Le travail ouvre la voie à des comparaisons plus rigoureuses entre politiques de contrôle issues de différents laboratoires, et pourrait orienter les prochaines générations de robots humanoïdes vers une robustesse accrue en interaction physique réelle, un prérequis pour des déploiements industriels ou domestiques crédibles.

Dans nos dossiers

À lire aussi

ForceTwin : jumeaux numériques physiques pour la manipulation robotique à partir d'interactions humaines instrumentées
1arXiv cs.RO 

ForceTwin : jumeaux numériques physiques pour la manipulation robotique à partir d'interactions humaines instrumentées

Des chercheurs ont publié le 21 septembre 2026 sur arXiv (référence 2609.21751) un système baptisé ForceTwin, conçu pour créer des jumeaux numériques d'objets articulés, portes, tiroirs, mécanismes à ressort, intégrant leurs propriétés physiques réelles plutôt que de simples données visuelles. La méthode repose sur une pince instrumentée à capteur de force, manipulée par un humain, qui enregistre simultanément positions et forces d'interaction. Ces données permettent d'estimer l'articulation de l'objet et ses paramètres dynamiques : inertie, friction de Coulomb, amortissement visqueux, plus un résidu neuronal structuré capturant les forces de mécanisme dépendantes de l'état, comme un ressort ou un ferme-porte. ForceTwin réduit de près de moitié l'erreur d'estimation des paramètres inertiels par rapport à une méthode s'appuyant sur un modèle vision-langage (VLM) comme a priori. Intégré comme modèle dynamique feedforward dans un contrôle en impédance, le système a été testé sur un robot quadrupède Spot (Boston Dynamics) et un bras Franka FR3 (Franka Robotics, Allemagne), atteignant 87% de réussite sur neuf paires objet-robot, contre 60% pour l'approche VLM et 57% pour un jumeau purement cinématique. Les jumeaux identifiés ont ensuite servi à entraîner des politiques de franchissement de porte en corps entier, déployées en conditions réelles. Cette approche cible un angle mort des pipelines actuels de jumeaux numériques, qui se contentent souvent d'inférer la géométrie et d'assigner des paramètres physiques statiques à partir d'a priori visuels ou textuels, une méthode pouvant produire des estimations physiquement incohérentes : deux portes visuellement identiques peuvent demander un effort de manipulation très différent, une nuance invisible pour un modèle vision-langage mais critique pour un robot devant réellement pousser, tirer ou tourner un mécanisme. Pour les intégrateurs et les équipes R&D en manipulation robotique, l'écart de performance observé, particulièrement marqué sur les objets à mécanisme fort où les deux méthodes de référence calent, indique que la modélisation physique fine reste un verrou plus contraignant que la perception ou la planification pour la manipulation d'objets articulés en environnement réel. Cela nuance l'idée selon laquelle les modèles vision-langage-action suffiraient à généraliser la manipulation sans modèle physique explicite du mécanisme manipulé. ForceTwin s'inscrit dans la lignée des travaux sur les jumeaux numériques articulés en robotique, où la difficulté centrale est de capturer la dynamique sans instrumenter lourdement chaque objet du monde réel. Le système se positionne explicitement contre deux références répandues dans la littérature et les pipelines industriels de simulation : l'estimation par a priori vision-langage et les jumeaux purement cinématiques. La validation a été menée sur du matériel commercial existant, Spot et Franka FR3, plutôt que sur des plateformes propriétaires fermées, ce qui facilite une reproductibilité potentielle par d'autres laboratoires. La suite annoncée porte sur le déploiement de politiques de franchissement de porte en corps entier, une tâche souvent citée comme test de référence pour la mobilité et la manipulation combinées chez les robots humanoïdes et quadrupèdes équipés de bras.

UELe bras robotique Franka FR3 utilisé pour valider le système est produit par l'entreprise allemande Franka Robotics, seul lien concret de cette recherche avec l'écosystème européen.

RecherchePaper
1 source
Générer des mains robotiques à partir de démonstrations humaines
2arXiv cs.RO 

Générer des mains robotiques à partir de démonstrations humaines

Des chercheurs ont publié un framework de co-conception de mains robotiques guidé par les données (arXiv:2506.20549, juin 2025). Le problème visé est le co-design corps/contrôleur: optimiser simultanément la morphologie d'un effecteur et son contrôleur crée un espace combinatoire difficilement tractable. La solution exploite plus de 4 millions de frames de mouvements de bouts de doigts humains issus de manipulations quotidiennes pour optimiser des mains à structure arborescente, en utilisant une politique de contrôle minimale commune à la phase de recherche et à la phase opérationnelle: le suivi de position des fingertips par cinématique inverse (IK). Deux catégories de designs ont été produites: une main à 6 degrés de liberté (DoF) à usage général, et des mains spécialisées à 3 DoF équipées de joints "mimic" à quadrilatère articulé (four-bar spatial). Un acteur entraîné par apprentissage par renforcement (RL) accélère la recherche morphologique, réduisant le temps de calcul de plusieurs heures à quelques minutes; les structures finales sont fabriquées en impression 3D print-in-place, en une seule pièce articulée sans assemblage. En expériences réelles, la main 6-DoF dépasse des mains robotiques commerciales non identifiées sur la précision de suivi télé-opéré, tandis que les mains 3-DoF reproduisent des trajectoires structurées avec une complexité mécanique réduite. L'apport principal est la résolution d'un verrou de fond en co-design: en imposant la même politique IK simple pendant l'optimisation et après fabrication, les auteurs découplent la recherche morphologique de l'apprentissage d'un contrôleur complexe, rendant l'exploration de l'espace de design tractable à grande échelle. Ce résultat soutient une hypothèse émergente: des données massives de mouvement humain non conçues pour la robotique peuvent informer l'optimisation de l'embodiment physique d'un robot, et pas seulement son contrôleur. La comparaison avec des mains commerciales reste difficile à évaluer, le preprint ne précisant ni les références comparées ni les conditions d'évaluation; prudence sur ce point en l'absence de benchmark standardisé. Ce travail prolonge une tendance croissante qui vise à utiliser des données humaines non seulement pour entraîner des politiques robotiques (VLA, imitation learning), mais pour co-générer le hardware lui-même. Les approches concurrentes en evolutionary robotics et en simulation différentiable existent depuis des années mais restent coûteuses en calcul ou peu généralisables; l'originalité de cette contribution réside dans la décorrélation design/contrôle et dans l'usage du RL comme heuristique de recherche morphologique efficace. À ce stade, il s'agit d'un preprint non encore peer-reviewed, sans déploiement industriel ni partenaire commercial annoncé; les suites naturelles seraient une validation sur un spectre plus large de tâches de manipulation et une comparaison rigoureuse avec des benchmarks établis. Aucun acteur européen n'est impliqué dans ces travaux.

RecherchePaper
1 source
Modélisation unifiée vision-toucher-action à partir de démonstrations humaines pour la manipulation dextérique
3arXiv cs.RO 

Modélisation unifiée vision-toucher-action à partir de démonstrations humaines pour la manipulation dextérique

Des chercheurs proposent UVTA, un cadre qui exploite des démonstrations humaines enregistrées avec retour tactile pour améliorer les politiques de manipulation dextre des robots. L'équipe a d'abord construit un système de capture de mouvement tactile, qui enregistre de façon synchrone les images, les signaux tactiles et les mouvements de la main. Avec cet outil, elle a constitué le jeu de données UVTA, qui couvre cinq tâches riches en contacts. Il comprend 1 000 démonstrations humaines et 150 démonstrations robot par tâche. Le modèle associé, un Unified Visual-Tactile-Action Model, projette l'humain et le robot dans des représentations tactiles et d'action alignées. Il prédit conjointement les trajectoires futures d'action et de toucher. Les démonstrations humaines supervisent ainsi l'apprentissage de représentations sensibles au contact, et seules les actions du robot sont exécutées au déploiement. Lors d'évaluations sur robot réel, sur les cinq tâches, la méthode atteint 70 % de réussite moyenne. La meilleure base de comparaison visuo-tactile plafonne à 29 %, et une ablation d'architecture à 42 %. L'enjeu tient au goulot d'étranglement des données tactiles. La téléopération de mains dextres ne renvoie à l'opérateur qu'un retour tactile limité, ce qui rend les démonstrations robot riches en toucher difficiles à collecter à grande échelle. Les auteurs contournent le problème avec l'hypothèse que la main change mais que la physique de l'interaction reste la même. Les données humaines deviennent alors une source de supervision plus abondante et plus variée. Les performances progressent avec le nombre de démonstrations humaines et ne saturent pas à 1 000 par tâche. Cela suggère qu'une montée en volume pourrait encore améliorer les résultats, sans que le papier le démontre au-delà. Pour les intégrateurs et les équipes qui développent des politiques de préhension fine, l'idée est de déplacer l'effort de collecte du robot vers l'humain, moins coûteux. Elle vise les tâches où la vision seule échoue, comme l'insertion, la manipulation en occlusion ou le contrôle de force. Il s'agit d'un travail académique, pas d'un produit, et il faut lire les chiffres avec prudence. Le score de 70 % porte sur seulement cinq tâches, avec 150 démonstrations robot par tâche, dans un cadre de laboratoire. Le résumé ne précise ni la main utilisée, ni les capteurs tactiles, ni le nombre d'essais, ni la nature exacte des tâches. L'écart avec les bases de comparaison (29 % et 42 %) est net, mais il dépend de choix de baselines que seul le texte complet permet d'apprécier. Le papier s'inscrit dans un courant de recherche qui cherche à apprendre la manipulation à partir de vidéos et de gants de capture humains, pour dépasser la téléopération. Il ajoute ici la modalité tactile, encore peu présente dans les grands modèles vision-langage-action (VLA). La version 2 de l'article sur arXiv et une page projet (uni-vta.github.io) sont disponibles. Aucun déploiement industriel ni calendrier n'est annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
ViTacPhys : préhension consciente des propriétés physiques à partir de démonstrations visuo-tactiles humaines
4arXiv cs.RO 

ViTacPhys : préhension consciente des propriétés physiques à partir de démonstrations visuo-tactiles humaines

Publiée le 24 août 2026 sur arXiv (2608.21355), l'étude ViTacPhys présente un système visuo-tactile qui estime la masse, la classe de frottement et la rigidité continue d'un objet à partir de démonstrations de manipulation humaines. Entraîné sur 60 objets rigides et déformables, le modèle combine modélisation temporelle visuo-tactile, fusion multimodale par cross-attention et a priori sémantique issu d'un modèle vision-langage. Sur des objets déjà vus, il atteint 97,2% de précision pour la masse, 98,8% pour le frottement et une erreur de 5,51% sur la rigidité; sur des objets inédits de catégories connues, ces scores tombent à 87,5%, 97,5% et 9,08%. Transféré vers un bras robotique via peu de données de téléopération, une augmentation vidéo au style robot et des démonstrations humaines aux gestes appariés, il pilote une préhension adaptative qui réussit 95,0% des prises sur objets connus et 83,4% hors distribution, avec des profils de force plus proches de la téléopération humaine que ceux de la référence ACT. La plupart des modèles d'action vision-robot restent appris de bout en bout sans ancrage explicite sur les propriétés physiques de l'objet saisi, limitant l'adaptation de la force de préhension face à un objet glissant, lourd ou fragile. En conditionnant la prise sur masse, frottement et rigidité estimés, ViTacPhys produit des profils de force plus cohérents avec la téléopération humaine qu'une politique par imitation classique comme ACT, un signal utile pour la logistique, le tri de colis ou la manipulation d'objets déformables. Il reste toutefois un travail de recherche en prépublication, évalué en laboratoire sur 60 objets, sans déploiement industriel annoncé. Le travail s'inscrit dans une tendance de la recherche en manipulation robotique visant à exploiter des démonstrations humaines équipées de capteurs tactiles pour amorcer l'apprentissage, en complément des modèles vision-langage-action comme Pi-0, GR00T N2 ou Helix, plutôt calibrés sur la vision et la proprioception. ViTacPhys ne propose pas un nouveau VLA mais un module d'estimation physique conçu pour s'y greffer. L'abstract ne mentionne ni laboratoire ni entreprise partenaire ni calendrier de pilote: il s'agit d'une preuve de concept académique dont la suite logique serait une validation sur davantage d'objets et hors environnement contrôlé.

RecherchePaper
1 source