Aller au contenu principal
RecherchearXiv cs.RO 

De solo à l'ensemble : un cadre hiérarchique pour l'interaction composable entre humains et objets avec plusieurs agents

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent, dans un preprint arXiv (2610.11722v1), un cadre hiérarchique qui transforme une politique d'interaction humain-objet (HOI) mono-agent en une compétence réutilisable, baptisée Object-oriented Motion Skill. La méthode réinterprète les trajectoires exécutées par des politiques « enseignantes » spécialisées : elle en extrait des mouvements de proxy d'objet à courte portée, qui servent de supervision d'actions centrées sur l'objet. Ces enseignants sont ensuite distillés dans une compétence bas niveau qui opère dans un « espace d'action orienté objet ». Pour les tâches en aval, cette compétence est figée et sert d'exécuteur. Une politique haut niveau coordonne les agents en générant des actions par région de l'objet. Elle se conditionne sur l'objet partagé, l'objectif, les états des agents et les zones de manipulation locales. Le résumé ne donne aucun chiffre de performance, aucun taux de succès et aucun nom de benchmark.

L'enjeu est de séparer deux problèmes que les approches actuelles mélangent. Aujourd'hui, on adapte généralement les politiques HOI aux tâches coopératives par un fine-tuning propre à chaque tâche. Cela lie l'exécution fine des contacts à la coordination de haut niveau, et cela freine la réutilisation d'une géométrie d'objet, d'un type d'interaction ou d'une taille d'équipe à l'autre. Ici, l'apprentissage multi-agent ne passe plus par un contrôle du corps entier riche en contacts. Il porte sur la coordination de mouvements de proxy au niveau de l'objet, un espace d'action bien plus compact. Si cela tient à l'échelle, le coût d'entraînement d'un travail d'équipe devrait baisser, et les compétences pourraient se composer sans repartir de zéro. Les auteurs affirment que la compétence distillée permet une exécution robuste et un apprentissage composable selon les types d'interaction, les géométries et les tailles d'équipe. Cette affirmation repose uniquement sur le résumé, sans résultat chiffré visible. Il s'agit d'un travail de simulation sur personnages à base physique. Rien n'indique de transfert vers des robots réels, donc le fossé sim-to-real reste entier.

Ce travail s'inscrit dans la lignée de l'animation et du contrôle physique de personnages, où les politiques mono-agent de manipulation d'objets sont désormais assez robustes. Le passage au multi-agent coopératif, comme porter ou déplacer ensemble un objet volumineux, reste le point dur. Ce type de coordination intéresse aussi la robotique humanoïde, notamment pour la manutention à plusieurs et les flottes de robots collaboratifs. Le résumé ne cite ni laboratoire, ni code, ni plan de publication, et ne compare pas son approche à des méthodes concurrentes. La suite logique serait la publication des résultats détaillés, des comparaisons avec les approches par fine-tuning, puis une validation sur du matériel réel, ce que l'article n'annonce pas.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

HiPHI : un benchmark à grande échelle pour le mouvement humain de haute précision et l'interaction avec les objets
1arXiv cs.RO 

HiPHI : un benchmark à grande échelle pour le mouvement humain de haute précision et l'interaction avec les objets

Des chercheurs ont publié HiPHI, un jeu de données de mouvement humain corps entier et d'interaction avec des objets, dépassant les 600 heures d'enregistrement, décrit dans un article déposé sur arXiv en août 2026 sous la référence 2608.16222. Construit à partir d'un pipeline de capture de mouvement optique, HiPHI atteint une précision de suivi des marqueurs spatiaux inférieure au millimètre pour le mouvement corps entier, ainsi que des trajectoires d'objets au niveau du maillage (mesh-level). Le dataset s'appuie théoriquement sur FrameNet, un cadre linguistique qui organise les primitives du mouvement humain. Les auteurs publient aussi une suite de benchmarks évaluant quatre axes : la diversité de l'espace des mouvements, l'ancrage des interactions (interaction grounding), la cohérence des objets manipulés, et les applications d'IA physique. Selon les analyses présentées, HiPHI élargit sensiblement la couverture des mouvements par rapport aux jeux de données existants, tout en conservant une fidélité élevée dans la qualité des interactions capturées. Ce travail cible un goulot d'étranglement jugé critique pour l'apprentissage de politiques robotiques humanoïdes à grande échelle : les vidéos issues d'internet, bien qu'abondantes, manquent d'états physiques précis et d'ancrage réel des interactions, tandis que les jeux de données de capture en laboratoire offrent une haute fidélité mais une couverture comportementale trop étroite. Pour les intégrateurs et laboratoires qui entraînent des modèles vision-langage-action à l'image de Pi-0 ou GR00T N2, ce type de fondation de données conditionne directement la capacité à généraliser des politiques apprises vers des tâches réelles incarnées, autrement dit le passage du simulateur au monde physique. Le papier revendique une amélioration mesurable de la diversité de mouvement, mais il s'agit à ce stade d'un benchmark académique évalué par ses propres auteurs, sans déploiement industriel ni adoption confirmée par un fabricant de robots humanoïdes. HiPHI s'inscrit dans une lignée de travaux cherchant à combler l'écart entre les grands corpus vidéo génériques et les datasets de mouvement capturés en studio, un problème documenté depuis plusieurs années dans la littérature sur l'apprentissage par imitation pour humanoïdes. Les auteurs positionnent leur contribution face aux jeux de données de mouvement existants, jugés soit trop limités en diversité soit insuffisamment ancrés physiquement, sans nommer de concurrent unique. Le texte souligne une application transversale au-delà de la robotique : les mêmes extensions de couverture pourraient aussi nourrir des modèles de prior de mouvement en infographie, utilisés notamment pour l'animation de personnages. Publié comme preprint arXiv, HiPHI demeure pour l'instant une ressource de recherche ouverte plutôt qu'un produit commercial ; sa valeur pour l'industrie dépendra de la publication effective du dataset et du code, de comparaisons indépendantes, et d'une éventuelle intégration dans des pipelines d'entraînement de robots humanoïdes commerciaux.

RecherchePaper
1 source
iGPC : priors de mouvement génératifs pour l'interaction humanoïde sensible aux objets
2arXiv cs.RO 

iGPC : priors de mouvement génératifs pour l'interaction humanoïde sensible aux objets

Des chercheurs proposent iGPC, un cadre qui étend le Generative Pretrained Controller (GPC), un contrôleur humanoïde préentraîné sur de larges corpus de mouvements humains, à l'interaction corps entier avec des objets. Le travail, publié sur arXiv (2610.08120v1), procède en deux étapes. D'abord, GPC est adapté en « experts d'interaction » conditionnés par des indices d'affordance de la scène et par des informations d'état privilégiées (accessibles en simulation, mais pas sur un robot réel). Ces experts conservent le prior de mouvement humain tout en apprenant des comportements de contact propres à chaque tâche : atteindre un objet, s'agripper à un support de l'environnement pour se stabiliser, pousser un objet mobile. Ensuite, un « étudiant » piloté par la perception reprend la politique GPC préentraînée et distille les compétences des experts à partir des seules observations de capteurs embarqués. Deux objectifs d'entraînement complémentaires comblent l'écart entre observations privilégiées et signaux sensoriels. Les auteurs annoncent des résultats concluants sur plusieurs tâches corps entier. Le résumé ne donne ni plateforme matérielle, ni taux de réussite, ni nombre de degrés de liberté, ni validation chiffrée en conditions réelles. L'enjeu est le passage du mouvement naturel à l'interaction physique guidée par la perception, point de blocage récurrent pour les humanoïdes. Les priors issus de données humaines donnent des mouvements fluides et variés, mais ils sont rarement exploités pour des contacts riches avec l'environnement, où la perception bruitée et l'absence d'information privilégiée fragilisent les politiques. Si les résultats tiennent, ils plaident pour un modèle de fond de mouvement réutilisable, adapté ensuite à des tâches de manipulation et de stabilisation, plutôt qu'une politique entraînée de zéro pour chaque scénario. Pour un intégrateur, la capacité à s'appuyer sur un support ou à pousser une charge sans cartographie parfaite de la scène serait pertinente en logistique ou en maintenance. Il faut toutefois rester prudent : il s'agit d'un préprint non évalué par des pairs, sans chiffres publics dans le résumé. Il ne permet donc pas d'évaluer l'écart entre démonstration et fiabilité en production. Ce travail s'inscrit dans la lignée des approches de distillation enseignant-étudiant, devenues standard pour le transfert simulation-réel en locomotion et en contrôle corps entier. Il prolonge GPC, proposé récemment pour le contrôle humanoïde général à partir de mouvements humains à grande échelle. Il rejoint aussi les efforts sur les politiques généralistes corps entier des acteurs industriels et académiques, comme GR00T chez NVIDIA, sans rapport de performance direct démontré ici. La suite logique serait une validation sur un robot physique, avec des métriques de robustesse et des comparaisons à des méthodes de référence. Aucune échéance de déploiement ni partenaire industriel n'est mentionné à ce stade.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
VAIC : contrôle humanoïde agile d'interaction avec des objets par vision et commandes découplées
3arXiv cs.RO 

VAIC : contrôle humanoïde agile d'interaction avec des objets par vision et commandes découplées

Des chercheurs ont publié en juin 2026 sur arXiv (référence 2606.09286) VAIC, un cadre de contrôle unifié pour robots humanoïdes capable d'interagir avec des objets en milieu non structuré. La contribution principale est l'élimination de deux hypothèses restrictives qui limitent la transposition terrain des contrôleurs existants : les trajectoires de référence denses et l'observabilité complète de l'état. VAIC opère exclusivement à partir d'un flux de profondeur embarqué et de la proprioception historique, via une interface de commandes découplées composée de cibles de vitesse multi-axes et d'un indicateur d'interaction par segment corporel. L'apprentissage suit un paradigme de distillation en deux étapes : une politique "enseignant" privilégiée, entraînée avec accès complet à la cinématique des objets et à l'état environnemental exact, transfère ses compétences à une politique "étudiant" déployable qui reconstruit implicitement la dynamique des objets depuis le flux de profondeur brut via un module d'adaptation récurrent. Sur robot humanoïde (non nommé dans le preprint), cette politique unique exécute en conditions réelles trois familles de tâches dynamiques : transport de carton, interaction avec un chariot, et skateboard, surpassant selon les auteurs les approches baseline comparées. Ce résultat, s'il se confirme à plus grande échelle, adresse directement le "deployment gap" qui freine la commercialisation des humanoïdes : la quasi-totalité des démos publiques repose encore sur des systèmes de capture de mouvement externe ou sur des objets instrumentés avec tracking précis. Proposer une politique unique généraliste, sans trajectoires de référence et fonctionnant sur capteurs embarqués bas coût, réduirait significativement la friction d'intégration pour les opérateurs industriels et les intégrateurs robotiques. La distillation enseignant-étudiant avec module d'adaptation récurrent n'est pas une architecture inédite, mais son application à des tâches aussi hétérogènes sur un humanoïde réel constitue un pas mesurable vers la généralisation. À noter que le preprint ne fournit ni métriques de cycle time par tâche, ni taux de succès quantifiés, ni spécification du robot utilisé, ce qui limite l'évaluation indépendante des performances annoncées. Ce travail s'inscrit dans une course aux contrôleurs généralisés qui oppose des équipes académiques (Berkeley, CMU, ETH Zurich) aux acteurs commerciaux : Figure Robotics avec son pipeline VLA sur Figure 02/03, Physical Intelligence et sa politique Pi-0, 1X Technologies et Unitree, tous actifs simultanément sur le sim-to-real et les architectures polyvalentes. L'approche de VAIC, centrée sur la profondeur et la proprioception plutôt que sur les vision-language models à grande échelle, constitue un positionnement différenciant en termes de coût de calcul embarqué et de simplicité sensorielle. Aucun partenariat industriel ni calendrier de déploiement n'est annoncé dans ce preprint : il s'agit à ce stade d'une démonstration de recherche, dont la validation sur plusieurs plateformes robotiques et environnements variés reste entièrement à mener.

RecherchePaper
1 source
HODAgent : vers des humanoïdes réactifs et disponibles à la demande pour l'interaction physique avec l'humain
4arXiv cs.RO 

HODAgent : vers des humanoïdes réactifs et disponibles à la demande pour l'interaction physique avec l'humain

Un preprint déposé sur arXiv en août 2026 (arXiv:2608.17584v1) présente HODAgent, un agent de raisonnement « System-2 » pour robots humanoïdes de service interagissant directement avec des humains. Son architecture semi-duplex combine un Env-Interactor, un Planner, un Executor et une mémoire hiérarchique afin de suivre l'état de la tâche pendant tout l'épisode : le robot accepte une nouvelle requête en pleine action, garde sa progression, révise son plan et vérifie le résultat avant de clôturer. Une interface commune relie simulation et robot physique, un Unitree G1, en isolant le contrôle bas niveau. Sur 164 cas en simulation, HODAgent atteint 84,8% et 91,5% de succès conjoint selon le VLM utilisé, soit 9,8 et 18,9 points de plus que les références. Sur le robot réel, les taux vont de 92% pour les tâches atomiques à 72% pour les tâches composites et 63,3% pour les tâches complètes, avec un gain de 0,7 à 9,0 points sur plusieurs benchmarks d'IA incarnée. Ces résultats ciblent l'écart persistant entre démonstrations et usage réel des humanoïdes : interrompre une action en cours pour intégrer une nouvelle consigne, puis vérifier concrètement si la tâche est accomplie plutôt que de suivre un plan figé, reste rarement démontré à cette échelle hors laboratoire. Pour les intégrateurs, l'intérêt tient surtout à la portabilité : une même couche de décision opérant en simulation et sur robot physique, avec le contrôle bas niveau isolé derrière une interface partagée, réduit le travail de réimplémentation entre prototype et pilote. La chute des taux de réussite entre tâches atomiques (92%) et tâches complètes (63,3%) confirme néanmoins que l'enchaînement de sous-tâches demeure le principal facteur d'échec, un repère utile face aux annonces plus promotionnelles du secteur. Le travail s'inscrit dans la mouvance des agents « System 2 », conçus pour planifier et corriger leur action plutôt que réagir de manière réflexe, un axe distinct des modèles vision-langage-action génératifs de type Pi-0, GR00T N2 ou Helix qui occupent la communication du secteur humanoïde. Le choix du Unitree G1 comme plateforme de test reflète sa large adoption par la recherche académique, faute d'accès aux humanoïdes propriétaires de Figure AI, Tesla ou Agility Robotics. Publié comme preprint non encore relu par les pairs, sans partenaire industriel ni date de déploiement pilote annoncée, HODAgent reste pour l'instant une contribution de recherche destinée à être reproduite et comparée par d'autres équipes.

RecherchePaper
1 source