Aller au contenu principal
RecherchearXiv cs.RO 

KPI : un noyau pilotable par instructions pour l'interaction physique des robots humanoïdes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent KPI, un « noyau promptable » d'interaction physique qui s'insère entre la source de trajectoire et un tracker de corps entier non modifié sur robot humanoïde (preprint arXiv 2609.36151v1). Le principe : la source de trajectoire, qu'il s'agisse d'un humain en téléopération ou d'une politique de bout en bout, n'envoie plus seulement une référence de mouvement. Elle y joint un « contrat » qui précise, pour chaque direction, s'il faut suivre la référence, se laisser fléchir (comply) ou maintenir une plage d'effort. À partir de l'erreur de suivi et d'une estimation du torseur d'efforts (wrench), le noyau ajuste en continu la raideur, l'amortissement, la référence et le feedforward des bras, à la cadence du contact. Les auteurs l'illustrent avec un cadre agentique : à partir d'une seule instruction, un agent vision-langage écrit à la fois la trajectoire et le contrat, sans code spécifique à la tâche. Les démonstrations portent sur la manœuvre d'un treuil, l'ouverture d'une porte et le transport d'une boîte, complétées par des essais scriptés d'interaction avec des surfaces. Dans la démonstration la plus marquante, l'humanoïde actionne une manivelle pour hisser un second robot entièrement au-dessus du sol. Le résumé ne donne ni modèle de robot, ni taux de réussite, ni nombre d'essais.

L'enjeu est un maillon souvent négligé de la pile logicielle des humanoïdes. Les trackers de corps entier généralistes suivent bien des trajectoires, mais une trajectoire dit peu de la force à produire : au contact, c'est le contrôleur qui décide du comportement réel. Jusqu'ici, deux approches dominent. Les politiques mono-tâche optimisent trajectoire et contrôleur ensemble en simulation, ce qui donne de bons résultats sur des interactions difficiles mais ne se généralise pas. Les architectures généralistes supposent un contrôleur prédéfini ou réglé à la main. KPI vise à séparer ces deux niveaux, ce qui permettrait de réutiliser un tracker existant pour des tâches riches en contact. Pour un intégrateur, c'est un levier potentiel sur les tâches de manipulation où la raideur et la gestion de l'effort décident du succès, comme les portes, les charges ou les outils. Il faut toutefois rester prudent : il s'agit d'un preprint, sans métriques chiffrées dans le résumé, et des démonstrations choisies par les auteurs ne prouvent ni la robustesse ni la répétabilité. La délégation à un agent VLM de la rédaction du contrat reste à valider hors des scénarios présentés.

Ce travail s'inscrit dans la course aux modèles généralistes de corps entier et aux politiques vision-langage-action (VLA), où l'effort est traité en parent pauvre face à la perception et au suivi de mouvement. Il rejoint l'idée de commande en impédance et en admittance, ancienne en robotique, qu'il adapte à une interface pilotable par le langage. Le résumé ne cite ni plateforme, ni concurrent, ni calendrier de suite. Les prochaines étapes à surveiller sont la publication du code, des résultats quantitatifs sur plusieurs humanoïdes, et une éventuelle intégration dans les piles des acteurs industriels.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

ForceTwin : jumeaux numériques physiques pour la manipulation robotique à partir d'interactions humaines instrumentées
1arXiv cs.RO 

ForceTwin : jumeaux numériques physiques pour la manipulation robotique à partir d'interactions humaines instrumentées

Des chercheurs ont publié le 21 septembre 2026 sur arXiv (référence 2609.21751) un système baptisé ForceTwin, conçu pour créer des jumeaux numériques d'objets articulés, portes, tiroirs, mécanismes à ressort, intégrant leurs propriétés physiques réelles plutôt que de simples données visuelles. La méthode repose sur une pince instrumentée à capteur de force, manipulée par un humain, qui enregistre simultanément positions et forces d'interaction. Ces données permettent d'estimer l'articulation de l'objet et ses paramètres dynamiques : inertie, friction de Coulomb, amortissement visqueux, plus un résidu neuronal structuré capturant les forces de mécanisme dépendantes de l'état, comme un ressort ou un ferme-porte. ForceTwin réduit de près de moitié l'erreur d'estimation des paramètres inertiels par rapport à une méthode s'appuyant sur un modèle vision-langage (VLM) comme a priori. Intégré comme modèle dynamique feedforward dans un contrôle en impédance, le système a été testé sur un robot quadrupède Spot (Boston Dynamics) et un bras Franka FR3 (Franka Robotics, Allemagne), atteignant 87% de réussite sur neuf paires objet-robot, contre 60% pour l'approche VLM et 57% pour un jumeau purement cinématique. Les jumeaux identifiés ont ensuite servi à entraîner des politiques de franchissement de porte en corps entier, déployées en conditions réelles. Cette approche cible un angle mort des pipelines actuels de jumeaux numériques, qui se contentent souvent d'inférer la géométrie et d'assigner des paramètres physiques statiques à partir d'a priori visuels ou textuels, une méthode pouvant produire des estimations physiquement incohérentes : deux portes visuellement identiques peuvent demander un effort de manipulation très différent, une nuance invisible pour un modèle vision-langage mais critique pour un robot devant réellement pousser, tirer ou tourner un mécanisme. Pour les intégrateurs et les équipes R&D en manipulation robotique, l'écart de performance observé, particulièrement marqué sur les objets à mécanisme fort où les deux méthodes de référence calent, indique que la modélisation physique fine reste un verrou plus contraignant que la perception ou la planification pour la manipulation d'objets articulés en environnement réel. Cela nuance l'idée selon laquelle les modèles vision-langage-action suffiraient à généraliser la manipulation sans modèle physique explicite du mécanisme manipulé. ForceTwin s'inscrit dans la lignée des travaux sur les jumeaux numériques articulés en robotique, où la difficulté centrale est de capturer la dynamique sans instrumenter lourdement chaque objet du monde réel. Le système se positionne explicitement contre deux références répandues dans la littérature et les pipelines industriels de simulation : l'estimation par a priori vision-langage et les jumeaux purement cinématiques. La validation a été menée sur du matériel commercial existant, Spot et Franka FR3, plutôt que sur des plateformes propriétaires fermées, ce qui facilite une reproductibilité potentielle par d'autres laboratoires. La suite annoncée porte sur le déploiement de politiques de franchissement de porte en corps entier, une tâche souvent citée comme test de référence pour la mobilité et la manipulation combinées chez les robots humanoïdes et quadrupèdes équipés de bras.

UELe bras robotique Franka FR3 utilisé pour valider le système est produit par l'entreprise allemande Franka Robotics, seul lien concret de cette recherche avec l'écosystème européen.

RecherchePaper
1 source
IA incarnée : perception et action pour l'exécution de tâches par un robot humanoïde en construction
2arXiv cs.RO 

IA incarnée : perception et action pour l'exécution de tâches par un robot humanoïde en construction

Des chercheurs publient sur arXiv (référence 2608.01600v1, soumis début août 2026) un système de perception et d'action destiné aux robots humanoïdes pour l'exécution de tâches de construction. L'architecture combine deux réseaux de neurones profonds : Humanoid-PoseNet, qui capture les postures d'un ouvrier lors d'une démonstration et les traduit en poses mécaniquement réalisables pour un robot humanoïde, puis Humanoid-ActionNet, qui apprend à partir de ces poses traduites les actions que le robot peut réellement exécuter. Testé sur huit tâches liées au chantier, le système atteint une erreur moyenne de suivi de mouvement de 82,45 mm en MPJPE (Mean Per Joint Position Error, l'écart moyen par articulation entre le geste de référence et celui reproduit par le robot). L'abstract ne cite aucun modèle de robot précis, aucun site de déploiement ni partenaire industriel : il s'agit d'un travail de recherche méthodologique et non d'un produit commercialisé. L'enjeu porte sur un goulot d'étranglement bien identifié de l'apprentissage par démonstration chez les humanoïdes : la différence de morphologie et de degrés de liberté (DOF) entre un corps humain et un robot rend la traduction directe des mouvements captés souvent instable ou irréalisable mécaniquement. En séparant explicitement l'étape de retargeting des poses (PoseNet) de l'apprentissage de l'action (ActionNet), l'étude propose une réponse ciblée à ce problème, potentiellement transposable à d'autres tâches physiques répétitives et dangereuses en environnement non structuré, un terrain bien plus exigeant pour un humanoïde que l'entrepôt logistique. Le chiffre de 82,45 mm reste toutefois difficile à juger sans point de comparaison ni contexte sur la difficulté relative des huit tâches testées. Le secteur de la construction, confronté à une pénurie de main-d'œuvre et à des tâches physiquement éprouvantes, est régulièrement cité comme débouché naturel pour les humanoïdes, aux côtés des usines et entrepôts déjà ciblés par Figure, Agility Robotics ou Unitree. Ce travail se positionne en amont de tout déploiement commercial : les auteurs le présentent eux-mêmes comme une « étape précoce » vers des collaborateurs humanoïdes de chantier, sans calendrier de pilotes ni annonce industrielle à ce stade.

RecherchePaper
1 source
ContactMimic : interaction avec des objets par un robot humanoïde grâce au contrôle des contacts
3arXiv cs.RO 

ContactMimic : interaction avec des objets par un robot humanoïde grâce au contrôle des contacts

Wiping a board, sitting on a chair ou pousser un meuble : ces tâches semblent réussies dès que le robot atteint la bonne posture, mais sans contact physique réel avec l'objet, elles échouent en pratique. C'est le constat de départ de CONTACTMIMIC, un framework d'apprentissage présenté dans un article publié le 10 juillet sur arXiv (2607.08742). L'équipe y ajoute aux trajectoires de points-clés classiques (keypoint tracking) des commandes de contact binaires, définies au niveau de chaque partie du corps. La politique résultante s'appuie sur deux ingrédients : des récompenses qui suivent explicitement le contact et un schéma d'augmentation de trajectoires conçu pour casser la corrélation entre géométrie des points-clés et étiquettes de contact. Résultat, le robot peut produire ou supprimer un contact à la demande, indépendamment de sa pose. Sur 10 mouvements d'interaction homme-objet testés en simulation, CONTACTMIMIC dépasse les trackers uniquement basés sur les points-clés, sans recourir à des récompenses spécifiques à chaque tâche. Le transfert sim-to-real a été validé sur 5 mouvements réels. L'enjeu dépasse la démonstration technique : la plupart des pipelines d'imitation de mouvement pour humanoïdes optimisent la fidélité cinématique, pas l'interaction physique effective, un angle mort qui limite l'utilité pratique des politiques de manipulation whole-body déployées sur des plateformes comme Figure 03, Optimus ou des architectures VLA type GR00T N2, Pi-0 ou Helix. Découpler contact et géométrie ouvre la voie à des contrôleurs capables d'exécuter des tâches ménagères ou industrielles réelles (essuyer, pousser, s'asseoir) sans réentraînement par tâche, un prérequis pour que les humanoïdes sortent de la démonstration scriptée. Le travail s'inscrit dans la lignée des méthodes de suivi de points-clés pour le contrôle corps entier des humanoïdes, dont il expose les limites via des ablations confirmant la nécessité de l'augmentation de trajectoires. Aucun partenaire industriel n'est mentionné : il s'agit pour l'instant d'une contribution de recherche en simulation et validation restreinte en réel, dont les vidéos sont disponibles en ligne, sans calendrier de déploiement annoncé.

RecherchePaper
1 source
Apprentissage en une démonstration pour la manipulation robotique à contacts riches, par identification des interactions physiques
4arXiv cs.RO 

Apprentissage en une démonstration pour la manipulation robotique à contacts riches, par identification des interactions physiques

Un preprint publié sur arXiv (arXiv:2608.24741v1, août 2026) présente une méthode de Learning from Demonstration (LfD) qui modélise explicitement les interactions physiques entre un robot et son environnement, notamment la création et la rupture de contact pendant une manipulation. Un contrôleur hybride position-force suit la trajectoire démontrée par un humain jusqu'à ce que les conditions de transition liées au contact, identifiées durant cette démonstration, soient atteintes. La méthode a été validée sur un robot réel via quatre tâches riches en contacts, ouverture de portes et de serrures, prise et vissage de boulons, dégagement d'objets coincés et suivi de contour de surface, chacune apprise à partir d'une seule démonstration et sans connaissance préalable de la tâche. Cette approche tranche avec la tendance dominante de la manipulation robotique, où les modèles vision-langage-action (VLA) à grande échelle exigent des milliers de démonstrations pour généraliser. En rendant explicite la physique du contact plutôt que de la confier à un réseau de neurones opaque, les auteurs visent une interprétabilité rare dans la littérature du LfD, où l'on sait précisément pourquoi et quand le robot change de comportement. Pour des intégrateurs industriels confrontés à des tâches d'assemblage ou de maintenance à forte variabilité géométrique, comme le boulonnage ou le verrouillage, l'intérêt tient à une programmation par démonstration unique, robuste aux variations imprévues et généralisable quand ces variations sont connues à l'avance, ce qui contredit l'idée que seule l'échelle des données garantit une manipulation fiable. Le travail s'inscrit dans un courant du LfD qui, selon les auteurs, néglige généralement la modélisation explicite du contact physique, alors que celui-ci est central dans la plupart des tâches de manipulation réelles. Ils présentent leur contribution comme un moyen de combler cette lacune d'interprétabilité en apprentissage à partir de très peu d'exemples, en détaillant comment robustesse, généralisation et adaptabilité peuvent être implémentées explicitement plutôt que laissées à l'apprentissage statistique. Publié comme preprint non encore évalué par les pairs, sans indication d'institution ni de calendrier de valorisation industrielle, il se positionne comme une contribution méthodologique plutôt qu'un produit, dans un paysage de la manipulation robotique dominé par des modèles fondationnels de type VLA entraînés sur de vastes corpus de démonstrations.

RecherchePaper
1 source