Aller au contenu principal
RecherchearXiv cs.RO 

Modèles du monde fondation pour la robotique multi-embodiment, fondés sur des actions latentes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent LAC-WM (Latent Action-Conditioned Robot World Model), un modèle du monde robotique qui fonctionne dans un espace d'actions latent unifié, appris et partagé entre embodiments très différents. Il est comparé à une variante de référence, EAC-WM (Explicit Action-Conditioned World Model), conditionnée par des étiquettes de mouvement explicites propres à chaque robot. Les deux modèles sont évalués sur des tâches de manipulation dextre et sur une version modifiée du benchmark LIBERO. Lors de l'adaptation à des robots absents du pré-entraînement, LAC-WM améliore la performance aval jusqu'à 46,7 % sur la manipulation dextre et 11,7 % sur LIBERO. Le travail, publié sur arXiv (2610.10846v1), s'accompagne d'un site de projet (lacwm.github.io). Le résumé ne précise ni les robots testés, ni la taille des modèles, ni les volumes de données de pré-entraînement.

Le résultat le plus significatif concerne le passage à l'échelle. La performance de LAC-WM augmente avec le nombre d'embodiments vus au pré-entraînement. À l'inverse, celle d'EAC-WM diminue quand ce nombre croît. Selon les auteurs, des étiquettes d'action explicites produisent des représentations disjointes d'un robot à l'autre, et ajouter des plateformes crée alors de l'interférence plutôt que du transfert. Pour les équipes qui construisent des modèles fondations robotiques, cela remet en cause l'idée qu'agréger davantage de données hétérogènes améliore mécaniquement la généralisation. L'espace d'action serait un goulot d'étranglement central, et pas seulement le volume de données. Pour un intégrateur, l'enjeu est concret : si ce principe se confirme, un modèle du monde pré-entraîné pourrait être adapté à une nouvelle plateforme avec moins de données propriétaires. Les gains annoncés sont toutefois mesurés sur des benchmarks, dont un LIBERO modifié, et non sur des déploiements industriels. Le gain de 11,7 % sur LIBERO est modeste, et l'écart de 46,7 % dépend de la base de comparaison choisie par les auteurs. On parle ici de résultats de recherche, pas d'un produit livré.

Ce travail s'inscrit dans la course aux modèles généralistes cross-embodiment, où les approches VLA (vision-langage-action) comme Pi-0 ou GR00T se heurtent à la diversité des espaces d'action, entre bras à 6 ou 7 DOF, mains dextres et humanoïdes. Les modèles du monde, qui prédisent l'évolution de la scène en fonction des actions, sont devenus un axe parallèle pour la planification et l'évaluation des politiques. Les actions latentes, apprises à partir des seules transitions visuelles, offrent une voie pour exploiter de grandes quantités de vidéos sans étiquettes d'action. Le papier est une prépublication v1, sans relecture par les pairs. Il faudra surveiller la publication du code et des poids, des tests sur du matériel réel, ainsi que des comparaisons directes avec d'autres modèles du monde cross-embodiment pour savoir si l'effet de passage à l'échelle se maintient avec des dizaines de plateformes.

À lire aussi

Modèles du monde pour la manipulation robotique
1arXiv cs.RO 

Modèles du monde pour la manipulation robotique

Des chercheurs ont publié en juin 2026 sur arXiv (2606.24742) un modèle généraliste de valeur pour la manipulation robotique, le WVM (World Value Model). La proposition centrale consiste à substituer les backbones VLM (Vision-Language Model) habituellement utilisés par un modèle de monde, nativement mieux adapté à la modélisation temporelle nécessaire pour évaluer la progression d'une tâche. Sur les benchmarks standards, WVM atteint les meilleures performances connues en Value-Order Correlation (VOC), la métrique de référence pour les modèles de valeur robotiques. L'équipe introduit également Suboptimal-Value-Bench, un benchmark multi-embodiment composé de 800 trajectoires sous-optimales annotées frame par frame par des humains, comblant un angle mort des évaluations existantes qui ne contenaient que des données expertes. L'enjeu est directement opérationnel pour quiconque entraîne des systèmes de manipulation à grande échelle : les données collectées en conditions réelles sont rarement uniformément expertes. Un modèle de valeur précis permet de pondérer ou filtrer ces trajectoires hétérogènes, améliorant la qualité de l'entraînement sans nettoyage manuel coûteux. WVM démontre des gains de performance sur plusieurs approches d'extraction de politique, en simulation comme en déploiement réel, ce qui renforce la thèse que l'estimation de valeur est un composant orthogonal et complémentaire au choix d'architecture de politique. La robustesse maintenue sur données sous-optimales est l'aspect le plus significatif : c'est précisément dans ce régime que les VLMs classiques décrochent, leurs préentraînements sur observations visuelles statiques ne suffisant pas à capturer les dynamiques temporelles longues. La montée en puissance des VLA comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA a rendu critique la question de la qualité des données d'entraînement à grande échelle. L'approche WVM s'inscrit dans une tendance émergente qui consiste à spécialiser les composants : un backbone temporel dédié pour l'évaluation de la valeur, distinct du modèle d'action. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans cet article purement académique. Les prochaines étapes naturelles incluent l'intégration du WVM dans des pipelines d'imitation à grande échelle ou en combinaison avec du reinforcement learning offline (IQL, CQL), et une extension à des environnements multi-tâches plus complexes.

RechercheOpinion
1 source
2arXiv cs.RO 

ARC : une méthode de raisonnement pour les modèles fondation en robotique

Des chercheurs proposent ARC, une méthode de raisonnement qui améliore sensiblement les performances « zero-shot » de modèles de fondation robotiques (RFM) existants, sans nouvelles démonstrations robot ni entraînement à grande échelle. Elle repose sur trois éléments. Le premier est une trace de raisonnement ancrée dans la prochaine action du robot, qui explique pourquoi l'action est appropriée et quel effet elle doit produire. Le deuxième est un pipeline d'étiquetage automatique, qui a permis de construire ARC-Trace-DROID à partir du jeu de données DROID existant, sans collecte de données robot supplémentaire. Le troisième est une stratégie d'adaptation propre à chaque architecture. Les auteurs l'appliquent au VLA π0.5 et au WAM (modèle d'action-monde) Cosmos3-Nano-Policy, avec un fine-tuning et une inférence ajustés à chacun. Les modèles adaptés établissent un nouvel état de l'art sur RoboLab-120 et MolmoSpaces, avec jusqu'à 50 points de pourcentage de gain sur RoboLab-Reasoning-50. Sur robots réels, le taux de succès de π0.5 progresse de 82,2 points de pourcentage. Ces résultats remettent en cause l'idée dominante selon laquelle la performance des RFM ne progresse qu'avec des modèles plus gros, davantage de démonstrations téléopérées et des budgets d'entraînement élevés. Si les chiffres tiennent, le raisonnement devient un levier complémentaire et bon marché pour les équipes qui disposent déjà d'un VLA, car il réutilise des données existantes au lieu d'en collecter de nouvelles. C'est un argument fort pour les intégrateurs et les décideurs B2B, pour qui le coût de la donnée robot reste le principal frein au passage à l'échelle. L'approche touche aussi un point faible des VLA actuels, leur faible généralisation à des tâches nouvelles décrites en langage. Quelques précautions s'imposent. Le gain de 82,2 points sur robots réels est mesuré sur la base de départ de π0.5, et l'article ne détaille pas ici le nombre de tâches, de plateformes ni d'essais. Le terme « sans précédent » vient des auteurs eux-mêmes. Le gain de 50 points concerne un benchmark de raisonnement conçu pour ce type d'évaluation, donc probablement favorable à la méthode. Enfin, on ne sait pas encore ce que la génération de traces ajoute en latence d'inférence, un paramètre décisif pour le contrôle en boucle fermée. ARC s'inscrit dans la tendance des VLA « avec raisonnement », qui font générer au modèle des étapes intermédiaires (sous-tâches, trajectoires, texte) avant d'agir. Elle prolonge les travaux autour de π0.5 de Physical Intelligence, entraîné sur de larges corpus hétérogènes, et du jeu de données DROID, devenu une base de référence en manipulation. L'usage d'un modèle d'action-monde comme Cosmos3-Nano-Policy, issu de l'écosystème Cosmos de NVIDIA, montre que la méthode vise plusieurs familles d'architectures et pas un seul modèle. Elle se positionne face aux approches qui misent sur l'échelle de données, comme GR00T chez NVIDIA ou Helix chez Figure. Il s'agit d'un travail académique publié sur arXiv (2610.12386v1), accompagné d'un site de projet. Il ne s'agit ni d'un produit ni d'un déploiement industriel. La suite logique serait une réplication indépendante, une évaluation sur d'autres robots et tâches longues, puis une mesure du coût en temps de calcul avant toute intégration dans des piles commerciales.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
3arXiv cs.RO 

Being-M0.7 : un modèle du monde et de l'action latent pour robots humanoïdes

Being-M0.7 est un modèle monde-action latent pour robots humanoïdes, présenté dans un preprint arXiv (2610.11283v1). Il vise la loco-manipulation, c'est-à-dire la coordination de la marche et de la manipulation en anticipant l'évolution de la scène et les mouvements du corps entier. Ses auteurs s'appuient sur un corpus constitué à partir de plus de 10 000 heures de données brutes centrées sur l'humain. Ce corpus mêle trois types de flux: vidéo seule, mouvement seul, et paires vidéo-mouvement. L'entraînement se fait en trois temps. Un pré-entraînement apprend la dynamique visuelle et la structure cinématique du corps entier. Un « mid-training » robot adapte ensuite ce prior aux points de vue et à la dynamique corporelle des robots. Enfin, un post-entraînement d'action greffe un « action expert » qui combine les représentations prédictives du prior figé avec les images courantes et la proprioception, par attention croisée à portes (gated cross-attention), pour produire des commandes corps entier exécutables. Les auteurs annoncent le meilleur taux de succès agrégé parmi les baselines comparées sur le benchmark SIMPLE. Sur des tâches réelles de loco-manipulation avec un Unitree G1, le modèle égale la meilleure baseline sans la dépasser. Le résumé ne donne ni chiffres de succès, ni liste des tâches, ni nombre d'essais. L'intérêt tient à l'attaque d'un goulot d'étranglement connu: les démonstrations robot sont rares et coûteuses, alors que la vidéo et la capture de mouvement humaines abondent. Leur exploitation se heurte à deux obstacles. Beaucoup de jeux de données n'ont qu'une modalité, et le mouvement humain ne se traduit pas directement en actions robot. Prédire conjointement les états visuels latents futurs et le mouvement pousse les représentations visuelles à encoder la cinématique à venir. L'étape intermédiaire robot et l'action expert servent de pont vers l'exécution. Le résultat réel reste nuancé. L'avantage est net en simulation, mais il disparaît sur le matériel: la parité avec la meilleure baseline sur G1 suggère que l'écart simulation-réel n'est pas résolu et que le gain du pré-entraînement sur données humaines reste à démontrer au-delà de benchmarks maîtrisés. Les intégrateurs doivent y voir une piste de recherche prometteuse pour réduire la dépendance à la téléopération, et non une capacité prête pour le déploiement. Il s'agit d'une publication académique, sans produit, sans pilote industriel ni calendrier de commercialisation. Ce travail s'inscrit dans la vague des modèles monde-action et des VLA (vision-langage-action) appliqués aux humanoïdes, où plusieurs acteurs cherchent à exploiter la vidéo humaine à grande échelle. On y trouve des modèles généralistes de type Pi-0, GR00T ou Helix, et des approches qui prédisent le futur visuel pour guider l'action. Le Unitree G1, humanoïde abordable très répandu dans les laboratoires, sert de plateforme de validation commune, ce qui facilite la comparaison entre équipes. La version «0.7» laisse penser à une série de modèles Being, dont les itérations précédentes ne sont pas détaillées ici. Les suites à surveiller sont la publication du code, des poids et des protocoles d'évaluation, ainsi que des tests sur des plateformes plus variées et des tâches plus longues. Une confirmation indépendante sur matériel réel dira si l'avantage observé en simulation se maintient.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
PointWAM : modélisation d'actions du monde en 3D pour la manipulation robotique dextre
4arXiv cs.RO 

PointWAM : modélisation d'actions du monde en 3D pour la manipulation robotique dextre

Des chercheurs publient sur arXiv (2610.02840) PointWAM, un « Point World Action Model » qui prédit conjointement l'évolution du monde et les actions d'un robot sous forme de trajectoires de points 3D. Le modèle décompose la scène en deux entités, l'environnement et les mains (l'acteur). Les deux sont prévus dans un même repère espace-temps. À partir d'un nuage de points coloré et d'une instruction en langage naturel, il anticipe comment la scène et les mains évoluent ensemble. Il retranspose ensuite le mouvement de main prévu en commandes robot. Les résultats sont ceux des auteurs, sur le benchmark DexJoCo et sur un robot réel. Le pré-entraînement sur des vidéos de démonstrations humaines améliore le taux de succès moyen sur DexJoCo de 56,9 points de pourcentage. Ajouter la supervision des trajectoires de la scène, et pas seulement celles des mains, apporte 10,9 points de plus. Avec les deux ingrédients, PointWAM dépasse de 11,7 points l'état de l'art précédent sur dix tâches DexJoCo et surpasse de « solides » VLA (modèles vision-langage-action) sur un robot physique. L'article ne précise pas dans cet extrait les modèles de référence, le robot ou le nombre d'essais. L'enjeu est la manipulation dextre, où les approches courantes montrent leurs limites. Les world action models habituels représentent le monde en images RGB ou en espaces latents, et les actions en poses d'effecteur ou en angles articulaires. Ces représentations capturent mal la structure spatiale 3D et la géométrie des contacts, qui décident pourtant du succès d'une saisie ou d'une manipulation en main. Une représentation explicite en points 3D évite aussi de choisir à la main les objets ou points-clés propres à chaque tâche. Elle permet ainsi un pré-entraînement à grande échelle sur des vidéos humaines, une source de données bien moins coûteuse que la téléopération robotique. Le gain de 56,9 points suggère que le transfert humain vers robot dépend beaucoup du choix de représentation. Ces chiffres viennent d'un preprint non évalué par les pairs, sur un benchmark très probablement en grande partie simulé. Le résultat sur robot réel reste à qualifier, notamment sur la diversité des tâches et la robustesse hors laboratoire. Ce travail s'inscrit dans la montée des world action models, qui fusionnent prédiction de dynamique et génération d'actions, en réaction aux VLA purement réactifs. Ces derniers, comme Pi-0 ou Helix, s'appuient sur des représentations 2D et des données robot coûteuses. PointWAM se place sur le créneau de l'apprentissage à partir de vidéos humaines et de la 3D explicite, face aux approches par images ou latents. La suite dépendra de la reproduction des résultats, d'une éventuelle publication du code et des poids, et de tests sur des mains robotiques multi-doigts variées. Aucune application industrielle ni calendrier de déploiement n'est annoncé à ce stade.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source