Aller au contenu principal
RecherchearXiv cs.RO 

Modèle du monde humanoïde avec génération conjointe des états et des actions

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent HWAM (Humanoid World Action Model), une politique pour robots humanoïdes qui génère conjointement les actions de référence et l'état corporel réellement atteint après exécution, c'est-à-dire l'état proprioceptif post-exécution. L'entraînement repose sur trois chemins conditionnels complémentaires. Le chemin « Policy » débruite conjointement des trajectoires état-action à partir des seules observations courantes, ce qui correspond aux conditions de déploiement. Le chemin de modélisation dynamique directe (FDM) prédit les observations visuelles futures à partir des actions et des états post-exécution. Le chemin de modélisation dynamique inverse (IDM) reconstruit la trajectoire conjointe à partir des transitions visuelles. L'évaluation porte sur trois tâches réelles avec l'humanoïde LimX OLI. HWAM obtient le meilleur taux de réussite parmi les références comparées. Sur la tâche « Candy Picking », il atteint 70,6 %, contre 43,3 % pour Fast-WAM. Les résultats des deux autres tâches ne sont pas détaillés dans le résumé disponible.

Le travail s'attaque à un problème peu visible dans les démonstrations : l'écart entre action et exécution. Dans les systèmes humanoïdes hiérarchiques, la politique (VLA ou WAM) sort des actions de référence que le contrôle du corps entier met ensuite en œuvre, avec la dynamique du robot, l'équilibre et les contacts. Le mouvement réellement réalisé peut donc différer de la consigne. Sans modéliser cet état réalisé, la prédiction visuelle du futur doit expliquer à la fois l'évolution de la scène et ces écarts, ce qui brouille le lien entre une action et son résultat physique. En faisant de l'état post-exécution une cible explicite, HWAM injecte directement dans l'apprentissage une supervision du mouvement exécuté. Pour les intégrateurs, l'enseignement est que le goulot d'étranglement des manipulateurs humanoïdes se situe aussi dans la couche de contrôle bas niveau, et pas seulement dans la perception ou le langage. Il faut toutefois rester prudent. Le gain de plus de 27 points sur Candy Picking provient d'une seule tâche, d'un seul robot et d'un nombre d'essais non précisé dans le résumé. Il s'agit d'un résultat de laboratoire publié en préprint sur arXiv, sans déploiement industriel ni produit associé.

Ce travail s'inscrit dans l'évolution des politiques VLA, qui apprennent les actions directement depuis des observations multimodales, vers les World Action Models, qui ajoutent la prédiction visuelle du futur pour mieux générer les actions. Fast-WAM, la référence directe citée, représente cette seconde famille. La comparaison avec d'autres approches de la catégorie, comme Pi-0 ou GR00T, n'est pas mentionnée dans le résumé. Le choix du LimX OLI, humanoïde de la société LimX, indique aussi que la recherche sur la manipulation humanoïde s'appuie de plus en plus sur des plateformes de fabricants chinois. Les prochaines étapes naturelles seraient une validation sur davantage de tâches et de morphologies, ainsi qu'une comparaison avec les modèles de fondation généralistes. Aucun calendrier de pilote ni de publication de code n'est annoncé dans le texte disponible.

Dans nos dossiers

À lire aussi

1arXiv cs.RO 

Being-M0.7 : un modèle du monde et de l'action latent pour robots humanoïdes

Being-M0.7 est un modèle monde-action latent pour robots humanoïdes, présenté dans un preprint arXiv (2610.11283v1). Il vise la loco-manipulation, c'est-à-dire la coordination de la marche et de la manipulation en anticipant l'évolution de la scène et les mouvements du corps entier. Ses auteurs s'appuient sur un corpus constitué à partir de plus de 10 000 heures de données brutes centrées sur l'humain. Ce corpus mêle trois types de flux: vidéo seule, mouvement seul, et paires vidéo-mouvement. L'entraînement se fait en trois temps. Un pré-entraînement apprend la dynamique visuelle et la structure cinématique du corps entier. Un « mid-training » robot adapte ensuite ce prior aux points de vue et à la dynamique corporelle des robots. Enfin, un post-entraînement d'action greffe un « action expert » qui combine les représentations prédictives du prior figé avec les images courantes et la proprioception, par attention croisée à portes (gated cross-attention), pour produire des commandes corps entier exécutables. Les auteurs annoncent le meilleur taux de succès agrégé parmi les baselines comparées sur le benchmark SIMPLE. Sur des tâches réelles de loco-manipulation avec un Unitree G1, le modèle égale la meilleure baseline sans la dépasser. Le résumé ne donne ni chiffres de succès, ni liste des tâches, ni nombre d'essais. L'intérêt tient à l'attaque d'un goulot d'étranglement connu: les démonstrations robot sont rares et coûteuses, alors que la vidéo et la capture de mouvement humaines abondent. Leur exploitation se heurte à deux obstacles. Beaucoup de jeux de données n'ont qu'une modalité, et le mouvement humain ne se traduit pas directement en actions robot. Prédire conjointement les états visuels latents futurs et le mouvement pousse les représentations visuelles à encoder la cinématique à venir. L'étape intermédiaire robot et l'action expert servent de pont vers l'exécution. Le résultat réel reste nuancé. L'avantage est net en simulation, mais il disparaît sur le matériel: la parité avec la meilleure baseline sur G1 suggère que l'écart simulation-réel n'est pas résolu et que le gain du pré-entraînement sur données humaines reste à démontrer au-delà de benchmarks maîtrisés. Les intégrateurs doivent y voir une piste de recherche prometteuse pour réduire la dépendance à la téléopération, et non une capacité prête pour le déploiement. Il s'agit d'une publication académique, sans produit, sans pilote industriel ni calendrier de commercialisation. Ce travail s'inscrit dans la vague des modèles monde-action et des VLA (vision-langage-action) appliqués aux humanoïdes, où plusieurs acteurs cherchent à exploiter la vidéo humaine à grande échelle. On y trouve des modèles généralistes de type Pi-0, GR00T ou Helix, et des approches qui prédisent le futur visuel pour guider l'action. Le Unitree G1, humanoïde abordable très répandu dans les laboratoires, sert de plateforme de validation commune, ce qui facilite la comparaison entre équipes. La version «0.7» laisse penser à une série de modèles Being, dont les itérations précédentes ne sont pas détaillées ici. Les suites à surveiller sont la publication du code, des poids et des protocoles d'évaluation, ainsi que des tests sur des plateformes plus variées et des tâches plus longues. Une confirmation indépendante sur matériel réel dira si l'avantage observé en simulation se maintient.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Modèle de cognition du monde pour l'interaction humain-robot généralisable
2arXiv cs.RO 

Modèle de cognition du monde pour l'interaction humain-robot généralisable

Un article scientifique publié sur arXiv (référence 2607.22999v1) présente WCM, pour World-Cognition Model, un agent robotique conçu pour rendre l'interaction homme-robot aussi fluide que celle qu'offrent déjà les agents conversationnels dans le logiciel. Le système repose sur une architecture baptisée SLAK, acronyme de Sensing, Logic, Action et Knowledge, qui sépare explicitement la perception, le raisonnement, le contrôle moteur et la mémoire. Cette séparation s'appuie sur un runtime asynchrone permettant au raisonnement, au dialogue et à l'exécution de se dérouler en parallèle plutôt que séquentiellement. WCM ajoute un mode d'apprentissage supervisé par l'humain, où l'utilisateur peut enseigner interactivement au robot des tâches longues ou complexes ; ces épisodes d'enseignement, combinés aux exécutions autonomes, sont ensuite convertis en données de supervision par chaîne de raisonnement (chain-of-thought) pour affiner le modèle en continu. Sur neuf tâches réelles d'interaction homme-robot, le système atteint un taux de réussite moyen de 73,8 %, y compris sur des tâches exclues de l'entraînement par chaîne de raisonnement et sur une tâche longue apprise uniquement par démonstration humaine. L'enjeu dépassé ici n'est pas tant la performance brute que la question de la contrôlabilité. Les approches dominantes actuelles, qu'il s'agisse des politiques vision-langage-action (VLA) ou des planificateurs fondés sur des modèles du monde, sont optimisées pour exécuter une instruction, mais laissent peu de visibilité à l'utilisateur sur les raisons d'une action donnée et peu de moyens de corriger ou réorienter le robot en cours de tâche. En proposant un mécanisme explicite de correction et d'enseignement en temps réel, WCM répond à un point de friction identifié par les intégrateurs industriels : un robot qui exécute bien mais s'explique mal reste difficile à déployer et à faire confiance sur des tâches non anticipées. Le travail s'inscrit dans la lignée des recherches récentes sur les modèles de fondation pour la robotique, où des architectures comme les VLA ont cherché à généraliser l'exécution de tâches à partir de démonstrations massives. WCM se positionne en complément plutôt qu'en rupture, en ajoutant une couche cognitive et interactive au-dessus du contrôle bas niveau. Les auteurs ne précisent pas de calendrier de déploiement industriel ni de partenaire commercial ; il s'agit à ce stade d'une publication de recherche, dont la prochaine étape logique serait l'extension à un plus grand nombre de tâches et de plateformes robotiques.

RecherchePaper
1 source
Long-WAM : étendre le contexte des modèles monde-action
3arXiv cs.RO 

Long-WAM : étendre le contexte des modèles monde-action

Des chercheurs publient Long-WAM, un cadre modèle-système conçu pour étendre le contexte visuel des world-action models (WAM) causaux, ces architectures qui prédisent à la fois les futures images et les actions d'un robot. Le travail, déposé sur arXiv, repose sur un constat central : disposer d'un historique n'implique pas de s'en servir. Les historiques longs ne rapportent beaucoup que si le modèle vidéo de base a été préentraîné de façon autorégressive (AR). Les auteurs apprennent d'abord la prédiction causale sur des vidéos de robots et des vidéos égocentriques sans étiquettes d'action, puis préservent cette structure historique-futur lors de l'adaptation aux actions. Sur RoboCasa GR-1, passer de 0,0 à 19,2 secondes de contexte fait grimper le taux de succès de 63,3 % à 78,7 %. Une initialisation préentraînée de manière bidirectionnelle n'en tire aucun gain net. Long-WAM affiche aussi les meilleurs résultats parmi les méthodes comparées sur LIBERO-Long, RoboTwin 2.0 et DOMINO. L'intérêt tient à deux points. D'abord, le résultat contredit l'idée répandue qu'il suffit d'allonger la fenêtre de contexte pour obtenir de la mémoire utile : le mode de préentraînement vidéo pèse davantage que la longueur brute de l'historique. Ensuite, la contrainte temps réel est traitée de front. L'encodage des observations en flux continu, l'exécution asynchrone et l'accélération spécifique à chaque matériel permettent un déploiement sur RTX 5090, DGX Spark et Jetson AGX Thor, sans supprimer la prédiction du futur. Sur RTX 5090, chaque bloc d'actions, prédiction du latent vidéo futur comprise, demande 107,4 ms. Sur robots réels, Unitree G1 et YAM, le système gère des tâches dynamiques et à long horizon. Il atteint 95 % de réussite à l'empilement dynamique de gobelets, là où Pi0.5 et Fast-WAM échouent sur les 20 essais. Ces chiffres viennent des auteurs, sur un jeu de 20 essais et une tâche choisie par eux. Ils méritent donc une réplication indépendante avant d'être généralisés. Ce travail s'inscrit dans la montée des WAM, qui concurrencent les politiques vision-langage-action (VLA) comme Pi0.5 en exploitant la vidéo comme signal d'apprentissage dense. Fast-WAM, l'autre référence directe de l'article, cherchait déjà à rendre ces modèles assez rapides pour le contrôle. Long-WAM ajoute la mémoire à cette équation, avec des benchmarks surtout simulés, et le pilotage de robots d'Unitree et de YAM, plateformes accessibles aux laboratoires. Les auteurs indiquent que le modèle sert aussi d'exécuteur doté de mémoire, complémentaire d'une planification de plus haut niveau dans des tâches composites. Il s'agit d'une publication de recherche, sans produit ni déploiement industriel annoncé. La suite dépendra de la publication éventuelle du code et des poids, et de la tenue des résultats hors des tâches de démonstration.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
UniWAM : modèle unifié du monde et de l'action
4arXiv cs.RO 

UniWAM : modèle unifié du monde et de l'action

UniWAM, présenté sur arXiv (2610.02054, première version), est une architecture unifiée qui combine trois blocs : un « raisonneur physique » issu d'un modèle vision-langage préentraîné, un générateur de monde (vidéo) et un prédicteur d'actions. L'ensemble apprend conjointement la compréhension sémantique du monde physique, la génération visuelle et la prédiction d'actions. Les auteurs ont construit un pipeline de nettoyage et d'annotation pour les données égocentriques humaines et les données robot. Les actions bas niveau sont exprimées en langage naturel, afin de préserver les capacités linguistiques du modèle de base. Le préentraînement répartit les supervisions entre composants : VQA (questions-réponses visuelles), vidéos égocentriques humaines et démonstrations robot. Au post-entraînement, une augmentation par bruit visuel sur le futur réduit la dépendance à des prédictions précises, et un flow matching conditionné par l'historique d'actions initialise la génération d'actions. Selon les auteurs, cela réduit nettement le nombre d'étapes de débruitage sans perte de performance. Ils revendiquent l'état de l'art en performance in-distribution, robustesse, généralisation, suivi d'instructions et tâches longues. Le résumé ne donne ni chiffres ni noms de benchmarks. L'intérêt est de s'attaquer à un compromis connu. Les modèles VLA (vision-langage-action) héritent du raisonnement des VLM, mais une supervision limitée aux actions leur donne peu d'ancrage dans la dynamique physique. À l'inverse, les modèles monde-action, bâtis sur la génération vidéo, captent bien les régularités spatio-temporelles mais comprennent et raisonnent moins bien hors distribution. Unifier les deux dans un seul modèle est une réponse directe à ce problème de robustesse, qui compte pour les intégrateurs confrontés au fossé entre démo et déploiement. La réduction des étapes de débruitage compte aussi pour la latence de contrôle, point faible des approches fondées sur la vidéo. Le résultat le plus transposable est la loi d'échelle log-linéaire du co-entraînement humain-robot. Si elle se confirme, elle soutient l'idée que les vidéos humaines, bien moins chères que la téléopération, peuvent servir de levier de données. Prudence toutefois : il s'agit d'un préprint non évalué par les pairs, sans test annoncé sur robot en production. Ce travail s'inscrit dans la course entre VLA (Pi-0 de Physical Intelligence, GR00T de NVIDIA, Helix de Figure) et modèles monde-action, qui exploitent la génération vidéo pour la planification. Il prolonge aussi la tendance à exploiter les données égocentriques humaines pour pallier la rareté des démonstrations robot. Le résumé ne cite ni équipe, ni plateforme robotique, ni calendrier de publication du code ou des poids. Il faudra donc attendre le texte complet pour juger du protocole, de la comparaison avec les références et de la validation sur matériel réel.

RecherchePaper
1 source