Aller au contenu principal
RecherchearXiv cs.RO 

Unifier l'apprentissage de politiques et la prédiction d'états grâce à la modélisation spatiale du langage

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent, dans un preprint arXiv (2610.12172), le « Spatial Language Modeling », une approche qui fait apprendre à un seul Transformer autorégressif à la fois la génération d'actions et la prédiction des états futurs d'une scène. Le principe consiste à représenter les contours de la scène, les objectifs, les cibles d'action et les états futurs avec un vocabulaire commun de coordonnées discrètes et de tokens sémantiques. Une grammaire propre à chaque tâche organise ces éléments en séquences spatiales, de sorte qu'un même objectif de prédiction du token suivant couvre le contrôle et la modélisation de l'état. Le modèle est entraîné de zéro en deux temps : un pré-entraînement sur des transitions issues de jeu aléatoire, puis un entraînement conjoint actions et états sur des démonstrations expertes. Pendant le pré-entraînement, les coordonnées d'action enregistrées servent de condition aux prédictions d'état suivantes, mais sont exclues de la perte. En phase de contrôle, le modèle ne décode que les cibles d'action exécutables et met à jour son historique avec les états réellement observés. L'évaluation porte sur la tâche Push-T, en simulation et sur un robot réel. Les auteurs annoncent des performances compétitives en simulation, et un taux de réussite ainsi qu'une couverture de la cible supérieurs à ceux des politiques de référence testées sur robot réel.

Pour les équipes qui travaillent sur les politiques de manipulation, l'intérêt tient à la supervision complémentaire apportée par l'apprentissage des effets géométriques des actions. Les ablations indiquent que l'entraînement sur des séquences conjointes action-état améliore le contrôle, et que le pré-entraînement sur du jeu aléatoire apporte un gain supplémentaire. Ce dernier point est pertinent en pratique : ces données sont bon marché à collecter, sans téléopérateur expert. Le même modèle, alimenté avec des trajectoires d'actions fournies, prédit aussi les états successifs de la scène et reproduit les effets du poussage. Il joue donc à la fois le rôle de politique et de modèle du monde léger. Il faut toutefois rester prudent sur la portée de ces résultats. Push-T est un benchmark de poussage planaire d'un objet en forme de T, relativement simple, et le texte ne chiffre pas, dans son résumé, l'écart avec les baselines ni la taille de l'échantillon d'essais réels. La généralisation à des tâches à contacts riches, à de la 3D ou à des préhenseurs multi-doigts reste à démontrer, de même que le passage à l'échelle d'un vocabulaire de coordonnées discrètes.

Ce travail s'inscrit dans un mouvement plus large visant à unifier perception, action et prédiction dans des architectures de type langage. Il se distingue des approches VLA (vision-langage-action) dominantes, qui reposent sur de grands modèles pré-entraînés, par un entraînement de zéro, sans pré-entraînement web, et par une représentation entièrement spatiale. Parmi les références habituelles de Push-T figurent les politiques de diffusion, qui servent souvent de base de comparaison, ainsi que les modèles du monde appris pour la planification. Le résumé ne précise ni l'équipe, ni le code, ni d'éventuelles extensions annoncées. Il s'agit à ce stade d'un preprint non évalué par des pairs, sans déploiement industriel associé. La suite logique sera de tester la méthode sur des tâches plus longues, sur des scènes 3D et sur des manipulations avec contacts complexes.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

1arXiv cs.RO 

PLaW-VLA : modélisation prédictive d'un modèle du monde latent pour les politiques vision-langage-action

PLaW-VLA, une politique vision-langage-action (VLA) décrite dans un preprint arXiv (2610.12285), propose de donner aux robots une capacité d'anticipation sans payer le coût habituel des modèles du monde génératifs. Les auteurs modélisent les états futurs pertinents pour la tâche dans un espace de représentation latent pré-entraîné, orienté prédiction, au lieu de reconstruire les pixels. L'architecture repose sur un Mixture-of-Transformers. L'action est générée à partir de l'historique d'observations, de la sémantique de la tâche en cours et des états futurs prédits, via une attention causale structurée. Les résultats annoncés sont un gain de 11,8 points de pourcentage sur le benchmark RoboTwin Hard Horizon III par rapport à des politiques purement réactives, et un gain de 1,77 point sur LIBERO-Plus en zéro-shot par rapport à une prédiction latente fondée sur la reconstruction. Le modèle du monde est léger et prédit les états futurs en parallèle. Sa latence d'inférence est environ 19 fois inférieure à celle d'une modélisation générative monde-action, pour une performance de politique comparable. L'intérêt pour l'industrie tient à l'inférence. Les VLA augmentés d'un modèle du monde génératif sont difficiles à embarquer, car la génération d'images futures ajoute une latence incompatible avec le contrôle en boucle fermée sur du matériel réel. Un facteur 19 sur la latence, à performance égale, indique que l'essentiel de l'information utile à la planification longue se loge dans une représentation compacte, et que la fidélité visuelle des prédictions n'est pas nécessaire. Le résultat contredit l'idée que prévoir le futur exige de le dessiner. Il faut toutefois relativiser. Ces chiffres viennent de benchmarks simulés (RoboTwin, LIBERO-Plus), sans validation sur robot physique mentionnée. Le gain de 1,77 point en généralisation est modeste et sa significativité statistique n'est pas précisée. Pour un intégrateur, c'est une piste d'architecture à surveiller, pas un produit ni un déploiement. Ce travail s'inscrit dans la course aux VLA dotés de capacités prédictives, après la première génération de politiques réactives (de type Pi-0 ou OpenVLA), qui mappent directement l'observation courante vers l'action et échouent sur les tâches à long horizon. Une seconde famille, qui intègre des modèles du monde génératifs pour imaginer le futur en pixels, a montré des gains mais au prix d'un calcul élevé. PLaW-VLA se positionne entre les deux, avec une prédiction latente allégée. Il s'agit d'un preprint en version 1, sans revue par les pairs. Aucun code, calendrier de publication ni test sur robot réel n'est annoncé. La suite logique serait une validation sur plateformes physiques et des comparaisons directes avec les VLA généralistes industriels sur des tâches de manipulation longues, où la latence reste le critère décisif.

RecherchePaper
1 source
2arXiv cs.RO 

La modélisation résiduelle comble l'écart entre politiques de régression et génératives en apprentissage robotique

Des chercheurs proposent une alternative à la diffusion et au flow matching pour entraîner des politiques robotiques à partir de démonstrations (arXiv:2610.12231). Baptisée HT-Policies (heteroscedastic Student-t action régression), la méthode reste une régression directe : elle prédit un « chunk » d'actions en une seule passe avant, sans les étapes itératives de débruitage des modèles génératifs. Les auteurs l'ont évaluée sur quatre benchmarks de simulation et lors de tests sur robot réel. Elle atteint des taux de réussite comparables aux politiques génératives (Flow-Policies), aussi bien entraînée de zéro qu'à partir de modèles vision-langage-action (VLA) et de world-action models préentraînés. L'entraînement et l'inférence sont plus rapides, et le réseau de neurones d'une politique flow matching préentraînée peut être réutilisé comme backbone. Les auteurs ne donnent pas, dans le résumé, de chiffres de vitesse ni de taux de succès précis, ce qui oblige à attendre le papier complet pour juger de l'ampleur réelle du gain. Le travail s'attaque à une explication largement admise : si les politiques de diffusion ou de flow matching surpassent la régression directe par erreur quadratique moyenne (MSE-Policies), ce serait parce que les démonstrations humaines sont multimodales, c'est-à-dire que plusieurs actions valides existent pour une même observation. L'analyse de données de démonstration réelles suggère une autre cause. Les résidus de prédiction d'action ont une échelle qui varie fortement selon l'état, et des queues plus lourdes qu'une gaussienne. Or la MSE alloue davantage de magnitude de gradient aux observations dont les résidus sont les plus grands, ce qui dégrade l'optimisation. Les politiques génératives ne seraient donc pas avantagées surtout par leur capacité à représenter plusieurs modes, mais par un comportement de gradient plus favorable. Si le résultat se confirme à grande échelle, il compte pour les intégrateurs et les équipes de déploiement : une politique mono-passe réduit la latence de contrôle et le coût de calcul embarqué, deux contraintes concrètes sur des robots à haute fréquence ou à ressources limitées. L'article s'inscrit dans le débat sur l'apprentissage par imitation, dominé depuis plusieurs années par Diffusion Policy et les approches flow matching, qui équipent désormais de nombreux VLA de fondation, tels que Pi-0. L'idée proposée reste simple : une loi de Student-t avec échelle prédite en fonction de l'entrée, qui limite l'influence des valeurs extrêmes. Plusieurs réserves s'imposent. Il s'agit d'un préprint non évalué par des pairs, les benchmarks précis ne sont pas détaillés dans le résumé, et « compétitif » ne signifie pas supérieur. Une vérification sur des tâches fortement multimodales ou à long horizon reste nécessaire. Les prochaines étapes dépendront de la reproduction des résultats par d'autres laboratoires et de l'éventuelle adoption de cet objectif dans des VLA de grande taille. Une page de projet est annoncée pour le code et les démonstrations.

RecherchePaper
1 source
Vers un apprentissage robotique unifié : relier représentation, modèles vision-langage-action et modèles du monde
3arXiv cs.RO 

Vers un apprentissage robotique unifié : relier représentation, modèles vision-langage-action et modèles du monde

Un article publié sur arXiv sous la référence 2609.03927v1 propose une synthèse unifiée de l'apprentissage robotique, en organisant les travaux existants autour de trois axes complémentaires : la compréhension via l'apprentissage de représentation, l'action via les modèles vision-langage-action (VLA), et le raisonnement via les modèles du monde. Les auteurs introduisent une taxonomie structurée qui capture les choix de conception clés en matière de représentation de l'environnement, d'apprentissage de politiques et de modélisation prédictive, et dressent un état des lieux des avancées récentes dans ces trois domaines de recherche. Le papier pointe un problème central pour le secteur : ces trois paradigmes progressent rapidement mais restent développés de façon cloisonnée, ce qui produit des systèmes fragmentés, peu capables de généraliser, de raisonner sur des horizons temporels longs ou de planifier dans des environnements non structurés. C'est un signal utile pour les intégrateurs et décideurs B2B qui misent tout sur un seul bloc technologique, qu'il s'agisse d'un VLA pour l'action ou d'un modèle du monde pour la prédiction. Les auteurs soutiennent que les limites observées sur le terrain, quantification insuffisante de l'incertitude, mauvaise généralisation hors distribution, transfert difficile d'une plateforme robotique à une autre, compréhension limitée du contexte long, planification longue portée fragile, ne viennent pas seulement des composants pris isolément mais du manque d'intégration entre perception, action et raisonnement. Cela nuance l'hypothèse répandue selon laquelle il suffirait de faire grossir un seul type de modèle pour résoudre l'autonomie robotique générale. Cette synthèse arrive alors que les trois courants qu'elle croise, apprentissage de représentation pour la perception, modèles VLA pour le contrôle d'action, modèles du monde pour la prédiction des conséquences, ont chacun connu des avancées rapides ces dernières années dans la recherche robotique sans converger vers une architecture commune. Plutôt que de comparer des produits ou des laboratoires concurrents, l'article se positionne comme une carte du terrain de recherche à destination de la communauté scientifique. Les auteurs esquissent des directions futures vers des systèmes d'apprentissage robotique unifiés, physiquement ancrés et probabilistes, capables de maintenir des représentations internes cohérentes et de soutenir la prise de décision sur des interactions prolongées en conditions réelles, sans toutefois annoncer de calendrier de mise en œuvre ni de prototype déployé.

RecherchePaper
1 source
JEPA-WAM : des politiques vision-langage-action apprises par modélisation du monde à embarquement conjoint
4arXiv cs.RO 

JEPA-WAM : des politiques vision-langage-action apprises par modélisation du monde à embarquement conjoint

JEPA-WAM, un nouveau modèle de monde latent (world action model, WAM) pour le contrôle robotique, est présenté dans un article publié le 11 août 2026 sur arXiv (2608.09381v1). Le système s'appuie sur l'espace latent pré-entraîné V-JEPA, l'architecture d'auto-supervision vidéo développée par Meta AI, et couple prédiction de transition et génération d'action continue via un prédicteur partagé, plutôt que de générer explicitement des vidéos futures comme le font les WAM à base vidéo, coûteux à déployer. Sur le benchmark LIBERO-Plus, JEPA-WAM atteint 79,2 % de réussite, le meilleur score parmi les méthodes sans pré-entraînement à grande échelle sur des politiques robotiques. Instancié sur le modèle pi0.5 déjà pré-entraîné, il grimpe à 86,3 %, la meilleure performance globale rapportée dans l'article. Des expériences complémentaires sur le simulateur RoboTwin 2.0 et sur des tâches de manipulation bimanuelle en conditions réelles confirment une bonne généralisation face aux variations visuelles et spatiales. Ce travail s'attaque à un compromis central dans l'apprentissage de politiques vision-langage-action (VLA) : les modèles de monde générant explicitement des vidéos futures sont coûteux en calcul et en latence, tandis que les approches latentes existantes sacrifient souvent la richesse de la représentation prédictive ou la séparent du chemin utilisé pour générer l'action. En démontrant qu'un même prédicteur partagé peut porter à la fois la supervision de transition et la prédiction d'action sans déconnecter représentation et politique, JEPA-WAM fournit un argument empirique en faveur de l'unification des deux tâches dans une même colonne vertébrale visuelle. Pour les équipes de recherche et les intégrateurs en robotique, l'intérêt pratique tient au fait que la méthode s'applique aussi à des politiques VLA déjà pré-entraînées, comme pi0.5, sans modifier leurs chemins de perception et d'action d'origine, ce qui laisse entrevoir un gain applicable à des systèmes existants plutôt qu'une architecture entièrement nouvelle à réentraîner. Il s'agit d'un article de recherche publié sur arXiv, sans annonce de produit ni de déploiement commercial : les résultats reposent sur des benchmarks de simulation (LIBERO-Plus, RoboTwin 2.0) complétés par des essais réels limités en manipulation bimanuelle, sans précision sur le nombre de robots ou les sites concernés. JEPA-WAM s'inscrit dans la lignée des architectures d'apprentissage par prédiction latente issues de V-JEPA, et se positionne face à l'écosystème grandissant des politiques VLA telles que pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. Les auteurs ne précisent aucun calendrier de suite, pilote industriel ou partenariat, ce qui situe cette publication au stade de la recherche fondamentale plutôt qu'à une étape de déploiement à court terme.

RechercheActu
1 source