Aller au contenu principal
Robot-Factored World Models via le rendu de robots
RecherchearXiv cs.RO 

Robot-Factored World Models via le rendu de robots

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article de recherche publié sur arXiv (2607.22535) propose une nouvelle architecture pour les "world models" en robotique, ces systèmes qui prédisent les observations futures d'une scène à partir d'une image initiale et d'un signal d'action. L'équipe identifie un problème structurel dans les approches existantes : conditionner le modèle directement sur les commandes d'action l'oblige à apprendre lui-même comment le corps du robot et son contrôleur traduisent ces commandes en mouvement réel, tandis que le conditionner sur les états futurs enregistrés revient à lui donner d'avance le résultat qu'il est censé prédire. La solution proposée, baptisée "robot-factored world model", sépare deux facteurs propres au robot en amont du modèle. D'abord, la trajectoire nominale : chaque commande est passée par le contrôleur et la cinématique du robot pour produire un signal intermédiaire disponible au déploiement. Ensuite, le rendu robotique : cette trajectoire est rendue via le fichier URDF du robot, extrayant sa géométrie et son apparence du modèle d'apprentissage. Pour lever l'ambiguïté de profondeur, les chercheurs associent la profondeur de l'effecteur terminal à celle de la scène.

Cette approche cible un angle mort connu des modèles vidéo conditionnés par l'action utilisés en planification et simulation robotique, à savoir leur difficulté à généraliser au-delà du robot sur lequel ils ont été entraînés. Les résultats montrent que l'interface de rendu surpasse les méthodes de référence conditionnées par vecteurs d'action et généralise à des embodiments robotiques inédits au moment de l'inférence, un point sensible pour l'industrie alors que les modèles vision-langage-action (VLA) cherchent à s'affranchir de la dépendance à une plateforme matérielle unique. Le modèle parvient aussi à générer des vidéos de manipulation robotique à partir de démonstrations humaines, en retargetant le mouvement de la main vers une géométrie de robot.

Ces travaux s'inscrivent dans une compétition plus large autour des world models et des politiques VLA à grande échelle, un terrain où Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix) investissent massivement pour rendre leurs systèmes transférables d'un robot à l'autre. La piste du rendu explicite de la géométrie robotique, plutôt que son encodage implicite dans des vecteurs d'action, pourrait devenir un standard méthodologique si elle se confirme sur des déploiements réels au-delà des benchmarks académiques.

À lire aussi

Le fossé de l'incarnation dans les modèles fondation pour robots
1arXiv cs.RO 

Le fossé de l'incarnation dans les modèles fondation pour robots

Une étude publiée sur arXiv sous la référence 2608.18433v1, intitulée « The Embodiment Gap in Robot Foundation Models », dresse un état des lieux critique des modèles de fondation pour la robotique (RFM), dont les politiques vision-langage-action (VLA). Le papier part d'un constat simple : un modèle peut généraliser sur le papier tout en nécessitant un travail d'adaptation important avant de tourner sur un robot physique donné. Les auteurs baptisent cet écart le « embodiment gap », soit le fossé entre des modèles, représentations ou jeux de données réutilisables et leur mise en œuvre effective sur le robot cible. La contribution centrale est une cartographie à deux axes qui classe les méthodes existantes selon le type de structure partagée et le stade d'adaptation requis avant exécution. L'étude passe ensuite en revue trois axes de recherche qui se recoupent : le partage de sémantique et de perception, le partage de données et d'interfaces robotiques, et l'apprentissage de correspondances entre différents types de corps robotiques. Elle propose enfin un cadre de reporting destiné à documenter ce travail d'adaptation, jugé invisible si l'on ne regarde que le taux de réussite final. Pour les intégrateurs et décideurs B2B du secteur, ce travail vient nuancer le récit dominant selon lequel la simple mise à l'échelle (plus de données, plus de paramètres, plus de benchmarks) suffirait à résoudre le transfert d'un modèle d'un robot à un autre. En creux, l'étude interroge la promesse d'un VLA générique qui s'appliquerait tel quel à n'importe quelle plateforme, qu'il s'agisse d'un bras industriel, d'un robot mobile ou d'un humanoïde. Elle rappelle qu'un taux de réussite affiché sur une démonstration ne dit rien du travail d'ingénierie (recalibrage, réentraînement partiel, adaptation d'interface) nécessaire pour porter un modèle d'un embodiment à un autre. Pour une industrie où plusieurs politiques VLA sont présentées comme quasi prêtes à l'emploi, ce cadre offre une grille de lecture plus rigoureuse pour distinguer généralisation en laboratoire et déploiement réel sur une nouvelle chaîne robotique. Ce travail s'inscrit dans la vague de modèles de fondation robotiques apparue dans le sillage des grands modèles de langage, portée par des acteurs comme Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2 ou Figure AI avec Helix, qui revendiquent tous une forme de généralisation entre tâches et parfois entre robots. En pointant l'absence de cadre commun pour mesurer ce qui reste réellement à faire lors d'un transfert d'embodiment, les auteurs comblent un vide méthodologique plutôt qu'ils ne proposent un nouveau modèle concurrent. La suite logique consisterait en une adoption de ce cadre de reporting par la communauté pour comparer les futures publications sur une base homogène, ainsi qu'en des études de cas documentant le coût d'adaptation d'un même modèle sur plusieurs corps robotiques distincts, question que les auteurs identifient explicitement comme ouverte pour de futurs travaux.

RecherchePaper
1 source
VIA : agent d'interface visuelle pour le contrôle de robots
2arXiv cs.RO 

VIA : agent d'interface visuelle pour le contrôle de robots

Le laboratoire d'IA publie sur arXiv (référence 2607.11119v1) un framework baptisé VIA, pour Visual Interface Agent, qui aborde le contrôle robotique sous un angle radicalement différent des approches dominantes. Plutôt que d'entraîner un modèle vision-langage-action (VLA) spécialisé sur des données robotiques, VIA fait piloter un bras manipulateur par un agent génériste (Claude Code ou Codex) via une interface 3D dans un navigateur : l'agent prend des captures d'écran, envoie des commandes simples, observe le résultat et ajuste sa trajectoire en boucle fermée. Aucun fine-tuning spécifique au robot, aucun accès à des données d'état privilégiées : seulement de la perception visuelle et un petit ensemble d'outils génériques. Avec le modèle le plus performant testé, Fable 5, VIA atteint 96,7% de réussite sur trois tâches de la suite LIBERO-Goal et 100% sur une tâche complexe d'assemblage séquentiel ("rainbow assembly"). L'enjeu dépasse la simple prouesse technique. Les modèles VLA actuels (dérivés de familles comme pi-0 ou GR00T N2) restent des ordres de grandeur plus petits que les modèles généralistes de pointe, faute de données et de calcul disponibles pour le fine-tuning robotique, ce qui plafonne mécaniquement leurs capacités de raisonnement. VIA suggère au contraire que les capacités générales des agents de codage ou d'usage d'ordinateur se transfèrent directement au contrôle physique, à condition de leur fournir la bonne interface. Autre signal notable : la performance de VIA progresse avec l'échelle et la puissance du modèle sous-jacent, ce qui laisserait entrevoir des gains automatiques à mesure que les modèles génériques s'améliorent, sans réentraînement robotique dédié. Pour les intégrateurs et décideurs du secteur, cela questionne la nécessité de collecter des données robotiques coûteuses pour chaque nouvelle tâche. Le travail s'inscrit dans la vague de recherche sur les VLA (RT-2, OpenVLA, Helix et consorts), qui reste aujourd'hui le paradigme dominant pour la robotique généraliste. VIA en propose une alternative agentique, sans fine-tuning, testée pour l'instant uniquement sur des tâches de manipulation de table en environnement contrôlé. Il s'agit d'un préprint arXiv, non encore validé par les pairs, et les auteurs eux-mêmes présentent leurs résultats comme des indices de transférabilité plutôt que comme une solution de déploiement industriel : les prochaines étapes attendues porteront sur l'élargissement à des tâches plus diverses et des environnements réels au-delà du tabletop.

RechercheActu
1 source
Vision robotique : cartes de points centrées sur le robot pour les modèles vision-langage-action
3arXiv cs.RO 

Vision robotique : cartes de points centrées sur le robot pour les modèles vision-langage-action

Des chercheurs proposent dans un article arXiv (2607.11498v1, soumis en juillet 2026) une méthode baptisée "pointmaps robot-centriques" pour résoudre un problème structurel des modèles vision-langage-action (VLA). Ces modèles prédisent des actions robotiques à partir d'observations visuelles et d'instructions en langage naturel, mais les actions sont définies dans le repère 3D propre au robot, alors que la caméra observe la scène dans son propre repère. Ce décalage reste sans conséquence quand le point de vue de la caméra est fixe, la politique pouvant alors mémoriser une correspondance unique observation-action, mais il devient problématique à mesure que les jeux de données agrègent des démonstrations issues de configurations caméra variées. La solution proposée encode les coordonnées 3D des points de la scène, exprimées dans le repère du robot, directement dans une grille dense H x W, format identique à celui attendu par les VLA 2D pré-entraînés, ce qui permet une intégration avec un minimum de modifications architecturales. Testée sur le benchmark RoboCasa, cette approche améliore les performances de deux modèles existants, pi0.5 et SmolVLA, et surpasse des méthodes de référence basées sur le point de vue caméra ou sur une conscience 3D classique. Cette avancée touche un point sensible pour l'industrialisation des VLA à grande échelle: la généralisation à des configurations caméra non standardisées est un frein connu au déploiement sur des cellules robotiques hétérogènes, où chaque intégrateur positionne ses capteurs différemment. Les expériences sur robot réel confirment que l'avantage par rapport à une politique RGB classique s'accentue justement quand la caméra est déplacée vers un emplacement absent de l'entraînement, ce qui va dans le sens d'une meilleure robustesse au changement de point de vue, condition nécessaire pour des flottes de robots déployées avec des configurations non uniformisées, plutôt qu'un simple gain de performance en conditions contrôlées. Le travail s'inscrit dans la lignée des modèles VLA récents tels que pi-0, GR00T N2 ou Helix, qui cherchent à généraliser l'apprentissage de politiques robotiques à partir de larges corpus de démonstrations multi-plateformes. En comparant explicitement leur méthode à des approches de conditionnement par point de vue caméra et à des baselines 3D-aware, les auteurs positionnent les pointmaps comme une alternative légère à des architectures 3D plus lourdes, ouvrant la voie à des validations plus larges sur des flottes robotiques aux configurations caméra diverses.

RechercheActu
1 source
XEWorld : les modèles du monde conditionnés par l'action se généralisent-ils à des robots inédits ?
4arXiv cs.RO 

XEWorld : les modèles du monde conditionnés par l'action se généralisent-ils à des robots inédits ?

XEWorld, un banc d'essai contrôle présente par une équipe de recherche, évalué si les modèles du monde conditionnes par l'action, des simulateurs appris pour la manipulation robotique, généralisent a des robots jamais vus pendant l'entrainement. Le protocole isole la variable embodiment en testant des robots non vus dans des scènes physiquement identiques a celles de l'entrainement. Le constat est net: les modèles actuels se comportent avant tout comme des systèmes d'appariement visuel en 2D, dont la généralisation dépend de la similarité visuelle avec les robots déjà vus, et non de la similarité cinématique réelle. Consequence directe, ils peinent a traduire une commande articulaire numérique en trajectoire visuelle cohérente et échouent a prédire une évolution dynamique de la scene a partir d'une simple image statique de départ. Pour rendre correctement un embodiment inédit en zero-shot, il faut leur fournir des actions déjà projetées dans l'espace des pixels et un alignement spatio-temporel explicite, ce qui contourne le problème plutôt que de le résoudre. Meme quand l'adaptation few-shot permet de récupérer l'apparence du nouveau robot, elle declenche un oubli catastrophique des embodiments déjà appris. Ce résultat pèse directement sur l'industrie robotique: les modèles du monde sont promus comme des simulateurs bon marche pour entrainer des politiques VLA telles que Pi-0, GR00T N2 ou Helix, en complément ou en remplacement de la collecte de données réelles et des moteurs physiques classiques. Si ces simulateurs appris ne généralisent pas au-delà des robots vus a l'entrainement, chaque nouvel humanoïde, bras industriel ou plateforme mobile nécessiterait son propre modèle reentraine, ce qui fragilise la promesse d'un simulateur généraliste réutilisable d'un intégrateur a l'autre. L'étude agit aussi comme un correctif face a l'enthousiasme autour des architectures cross-embodiment: la généralisation apparente de certaines démonstrations tiendrait davantage a une ressemblance d'aspect entre robots qu'a une compréhension de la physique sous-jacente, un signal d'alerte pour quiconque évalué des annonces de transfert zero-shot entre plateformes. Cette limite s'inscrit dans une course plus large ou des laboratoires comme Google DeepMind, NVIDIA ou Physical Intelligence développent des modèles du monde et des politiques généralistes censées piloter des robots très différents avec un seul réseau, une démarche destinée a réduire le cout de la collecte de données robot par robot. XEWorld, publie en preprint sur arXiv début aout 2026, ne remet pas en cause l'utilité des modèles du monde en soi mais isole précisément le point de blocage actuel: la confusion entre apparence visuelle et dynamique physique. Les auteurs appellent a des innovations architecturales qui découplent explicitement ces deux dimensions, une piste qui conditionnera la capacité des prochaines générations de simulateurs appris a soutenir un entrainement véritablement cross-embodiment plutôt qu'un simple recyclage visuel de robots déjà connus.

RecherchePaper
1 source