Aller au contenu principal
RecherchearXiv cs.RO 

Being-M0.7 : un modèle du monde et de l'action latent pour robots humanoïdes

2 sources couvrent ce sujet·Source originale ↗·
Résumé IASources croisées · 2Impact UE
Egalement couvert par :Robotics & Automation News ↗

Being-M0.7 est un modèle monde-action latent pour robots humanoïdes, présenté dans un preprint arXiv (2610.11283v1). Il vise la loco-manipulation, c'est-à-dire la coordination de la marche et de la manipulation en anticipant l'évolution de la scène et les mouvements du corps entier. Ses auteurs s'appuient sur un corpus constitué à partir de plus de 10 000 heures de données brutes centrées sur l'humain. Ce corpus mêle trois types de flux: vidéo seule, mouvement seul, et paires vidéo-mouvement. L'entraînement se fait en trois temps. Un pré-entraînement apprend la dynamique visuelle et la structure cinématique du corps entier. Un « mid-training » robot adapte ensuite ce prior aux points de vue et à la dynamique corporelle des robots. Enfin, un post-entraînement d'action greffe un « action expert » qui combine les représentations prédictives du prior figé avec les images courantes et la proprioception, par attention croisée à portes (gated cross-attention), pour produire des commandes corps entier exécutables. Les auteurs annoncent le meilleur taux de succès agrégé parmi les baselines comparées sur le benchmark SIMPLE. Sur des tâches réelles de loco-manipulation avec un Unitree G1, le modèle égale la meilleure baseline sans la dépasser. Le résumé ne donne ni chiffres de succès, ni liste des tâches, ni nombre d'essais.

L'intérêt tient à l'attaque d'un goulot d'étranglement connu: les démonstrations robot sont rares et coûteuses, alors que la vidéo et la capture de mouvement humaines abondent. Leur exploitation se heurte à deux obstacles. Beaucoup de jeux de données n'ont qu'une modalité, et le mouvement humain ne se traduit pas directement en actions robot. Prédire conjointement les états visuels latents futurs et le mouvement pousse les représentations visuelles à encoder la cinématique à venir. L'étape intermédiaire robot et l'action expert servent de pont vers l'exécution. Le résultat réel reste nuancé. L'avantage est net en simulation, mais il disparaît sur le matériel: la parité avec la meilleure baseline sur G1 suggère que l'écart simulation-réel n'est pas résolu et que le gain du pré-entraînement sur données humaines reste à démontrer au-delà de benchmarks maîtrisés. Les intégrateurs doivent y voir une piste de recherche prometteuse pour réduire la dépendance à la téléopération, et non une capacité prête pour le déploiement. Il s'agit d'une publication académique, sans produit, sans pilote industriel ni calendrier de commercialisation.

Ce travail s'inscrit dans la vague des modèles monde-action et des VLA (vision-langage-action) appliqués aux humanoïdes, où plusieurs acteurs cherchent à exploiter la vidéo humaine à grande échelle. On y trouve des modèles généralistes de type Pi-0, GR00T ou Helix, et des approches qui prédisent le futur visuel pour guider l'action. Le Unitree G1, humanoïde abordable très répandu dans les laboratoires, sert de plateforme de validation commune, ce qui facilite la comparaison entre équipes. La version «0.7» laisse penser à une série de modèles Being, dont les itérations précédentes ne sont pas détaillées ici. Les suites à surveiller sont la publication du code, des poids et des protocoles d'évaluation, ainsi que des tests sur des plateformes plus variées et des tâches plus longues. Une confirmation indépendante sur matériel réel dira si l'avantage observé en simulation se maintient.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Modèle fondation à l'échelle pour robots humanoïdes
1arXiv cs.RO 

Modèle fondation à l'échelle pour robots humanoïdes

Une nouvelle publication arXiv (2607.15163v1, soumission de type "new") propose un modèle de fondation comportemental (Behavior Foundation Model, BFM) pour le contrôle de robots humanoïdes, baptisé Humanoid Transformer. Les auteurs affirment avoir identifié la recette manquante pour faire monter en puissance ces modèles, en coordonnant trois leviers : un nouveau paradigme d'apprentissage qui reformule le contrôle humanoïde comme la reproduction de comportements corporels intégrés dans le référentiel global plutôt que local ; un équilibrage stratégique entre le volume de déploiements en ligne (on-policy rollouts) et la diversité des mouvements de référence utilisés à l'entraînement ; et l'architecture Humanoid Transformer elle-même, conçue pour faire émerger naturellement des représentations structurées du comportement. Testée à la fois en simulation et en conditions réelles, l'approche réduit l'erreur moyenne par point clé (Mean Per-Keypoint Position Error, MPKPE) de plus de 10% en mode local et de 82% en mode global par rapport aux contrôleurs humanoïdes existants. Ce travail répond à un flou méthodologique réel du secteur : malgré l'engouement croissant pour les BFM comme brique de base des agents incarnés généralistes, personne n'avait jusqu'ici établi de façon rigoureuse comment coordonner données, architecture et paradigme d'entraînement pour obtenir un gain de performance qui tienne la route au passage à l'échelle. Le saut de 82% en mode global est le chiffre qui compte vraiment pour les intégrateurs : c'est la capacité à maintenir une cohérence corporelle dans le référentiel monde, condition nécessaire pour des tâches où le robot doit coordonner déplacement et manipulation sans dérive, un point faible classique des contrôleurs entraînés uniquement en référentiel local. Si les résultats se confirment à plus grande échelle, ils renforcent l'hypothèse que le contrôle humanoïde généraliste peut suivre une trajectoire de scaling comparable à celle des grands modèles de langage, plutôt que de rester cantonné à des politiques spécialisées par tâche. L'article s'inscrit dans la vague de recherche académique qui a suivi l'essor des politiques vision-langage-action (VLA) et des BFM ces deux dernières années, sans rattacher la méthode à un robot ou un laboratoire commercial précis : il s'agit d'une contribution méthodologique comparée à des "contrôleurs humanoïdes existants" pris comme référence, sans nommer de plateforme physique spécifique. La suite logique serait une validation sur du matériel humanoïde tiers et à plus grande échelle de données, pour confirmer que le gain en mode global se maintient hors du cadre expérimental des auteurs.

RechercheActu
1 source
IA humanoïde : PFM-HR, un modèle de flow matching pour la posture des robots
2arXiv cs.RO 

IA humanoïde : PFM-HR, un modèle de flow matching pour la posture des robots

Des chercheurs publient sur arXiv (arXiv:2608.03227, 3 août 2026) PFM-HR, Pose Flow Matching for Humanoid Robots, un nouveau prior de mouvement pour l'apprentissage par renforcement appliqué au suivi de mouvement de robots humanoïdes basé sur la physique. Contrairement aux priors temporels classiques, qui exigent des clips de mouvement ordonnés, PFM-HR entraîne un flow matching réutilisable directement sur de grands volumes de données de poses non ordonnées. Les auteurs introduisent le Pose Geometry Score (PGS), une métrique qui vérifie si les changements de coordonnées articulaires observés pendant l'entraînement suivent la géométrie locale de variation de pose apprise par le prior, et l'utilisent pour moduler la récompense de suivi tout en gardant le prior figé. Résultat : des gains sur le suivi d'un mouvement isolé comme sur le suivi général, plus marqués sur les mouvements très dynamiques. Pour la recherche en robotique humanoïde, ce travail cible un vrai goulot d'étranglement de l'apprentissage par renforcement : le choix actuel entre un guidage temporel rigide, peu adapté aux imprévus, et un guidage de pose statique qui ne dit rien sur la façon de passer d'une posture à l'autre. Un prior réutilisable, découplé des clips séquencés et des tâches d'entraînement, faciliterait la conception de contrôleurs plus robustes pour des mouvements rapides (course, sauts, réactions à un déséquilibre), un point faible récurrent des démonstrations de robots humanoïdes, où l'écart entre vidéo soignée et comportement stable en conditions réelles reste important. Il s'agit ici d'une contribution méthodologique destinée aux équipes qui développent des politiques de contrôle bas niveau, pas d'un produit ou d'un déploiement commercial. PFM-HR s'inscrit dans une lignée de recherches sur les priors de mouvement pour le contrôle physique de personnages et de robots, un champ qui s'appuie largement sur des données de capture de mouvement humain pour guider l'apprentissage de politiques réalistes. Le recours au flow matching, technique de génération continue déjà adoptée par plusieurs modèles de politiques robotiques généralistes de type VLA (Pi-0, GR00T N2), traduit un rapprochement entre les outils de génération d'images et vidéo et le contrôle de robots humanoïdes. Le papier ne fournit ni comparaison chiffrée à des méthodes nommées ni calendrier de test sur robot physique : à ce stade, PFM-HR reste validé en simulation, et son intérêt pour l'industrie dépendra de sa reproduction sur du matériel réel et de son intégration dans des pipelines d'entraînement existants.

RecherchePaper
1 source
3arXiv cs.RO 

Modèles du monde fondation pour la robotique multi-embodiment, fondés sur des actions latentes

Des chercheurs proposent LAC-WM (Latent Action-Conditioned Robot World Model), un modèle du monde robotique qui fonctionne dans un espace d'actions latent unifié, appris et partagé entre embodiments très différents. Il est comparé à une variante de référence, EAC-WM (Explicit Action-Conditioned World Model), conditionnée par des étiquettes de mouvement explicites propres à chaque robot. Les deux modèles sont évalués sur des tâches de manipulation dextre et sur une version modifiée du benchmark LIBERO. Lors de l'adaptation à des robots absents du pré-entraînement, LAC-WM améliore la performance aval jusqu'à 46,7 % sur la manipulation dextre et 11,7 % sur LIBERO. Le travail, publié sur arXiv (2610.10846v1), s'accompagne d'un site de projet (lacwm.github.io). Le résumé ne précise ni les robots testés, ni la taille des modèles, ni les volumes de données de pré-entraînement. Le résultat le plus significatif concerne le passage à l'échelle. La performance de LAC-WM augmente avec le nombre d'embodiments vus au pré-entraînement. À l'inverse, celle d'EAC-WM diminue quand ce nombre croît. Selon les auteurs, des étiquettes d'action explicites produisent des représentations disjointes d'un robot à l'autre, et ajouter des plateformes crée alors de l'interférence plutôt que du transfert. Pour les équipes qui construisent des modèles fondations robotiques, cela remet en cause l'idée qu'agréger davantage de données hétérogènes améliore mécaniquement la généralisation. L'espace d'action serait un goulot d'étranglement central, et pas seulement le volume de données. Pour un intégrateur, l'enjeu est concret : si ce principe se confirme, un modèle du monde pré-entraîné pourrait être adapté à une nouvelle plateforme avec moins de données propriétaires. Les gains annoncés sont toutefois mesurés sur des benchmarks, dont un LIBERO modifié, et non sur des déploiements industriels. Le gain de 11,7 % sur LIBERO est modeste, et l'écart de 46,7 % dépend de la base de comparaison choisie par les auteurs. On parle ici de résultats de recherche, pas d'un produit livré. Ce travail s'inscrit dans la course aux modèles généralistes cross-embodiment, où les approches VLA (vision-langage-action) comme Pi-0 ou GR00T se heurtent à la diversité des espaces d'action, entre bras à 6 ou 7 DOF, mains dextres et humanoïdes. Les modèles du monde, qui prédisent l'évolution de la scène en fonction des actions, sont devenus un axe parallèle pour la planification et l'évaluation des politiques. Les actions latentes, apprises à partir des seules transitions visuelles, offrent une voie pour exploiter de grandes quantités de vidéos sans étiquettes d'action. Le papier est une prépublication v1, sans relecture par les pairs. Il faudra surveiller la publication du code et des poids, des tests sur du matériel réel, ainsi que des comparaisons directes avec d'autres modèles du monde cross-embodiment pour savoir si l'effet de passage à l'échelle se maintient avec des dizaines de plateformes.

RecherchePaper
1 source
DECOWAM : un modèle monde-action pour la manipulation mobile de robots à pattes
4arXiv cs.RO 

DECOWAM : un modèle monde-action pour la manipulation mobile de robots à pattes

Des chercheurs présentent DECOWAM (Decoupled Whole-Body World-Action Model), un modèle monde-action conçu pour la manipulation mobile sur robots à pattes équipés d'un bras, décrit dans une prépublication arXiv (2608.20114v1) mise en ligne fin août 2026. Le système part d'un backbone FastWAM adapté et gelé, sur lequel sont entraînés uniquement des adaptateurs résiduels, soit 25,95 millions de paramètres entraînables. L'architecture ajoute un goulot d'étranglement futur équivalent-action distillé à partir d'observations privilégiées, des représentations latentes de la base et du bras séparées de manière adversariale, ainsi qu'un conditionnement par la vitesse de la base pour la prédiction vidéo. Les auteurs introduisent également ARMDOG, un nouveau jeu de données collecté sur robot réel qui synchronise vidéo, état corps entier, actions et instructions en langage naturel. Sur un protocole de rejeu fixe, DECOWAM réduit l'erreur quadratique moyenne de prédiction d'action de 21,7% par rapport à FastWAM. Sur 79 essais en boucle fermée par méthode, il obtient la meilleure coordination corps entier et la meilleure robustesse au déplacement de la base parmi les systèmes comparés, tandis que le taux de complétion des tâches reste comparable au meilleur système de référence, sans amélioration nette sur ce critère précis. L'apport principal tient à la séparation explicite du mouvement propre de la caméra (lié au déplacement de la base) des actions du bras, un problème que les modèles monde-action existants, conçus pour des plateformes à base fixe, ignorent largement. Pour les intégrateurs travaillant sur des robots mobiles à bras (quadrupèdes ou plateformes à roues), cela suggère qu'un modèle de prédiction vidéo pré-entraîné peut être adapté à moindre coût, via peu de paramètres, plutôt que réentraîné intégralement pour gérer un point de vue mobile. Le résultat reste toutefois nuancé: les gains portent sur la coordination et la robustesse mesurées en simulation de rejeu, pas sur un saut de performance en complétion de tâche réelle. Le travail se positionne comme une extension aux plateformes mobiles des modèles monde-action initialement développés pour bras fixes, sans nommer de backbone concurrent autre que FastWAM ni d'entreprise partenaire. Il s'agit d'une contribution académique publiée en prépublication, sans annonce de déploiement commercial ni de calendrier de mise en production; le jeu de données ARMDOG pourrait toutefois servir de futur benchmark pour la manipulation mobile corps entier.

RecherchePaper
1 source