Aller au contenu principal
RecherchearXiv cs.RO 

Spotter : le modèle incarné mène, le VLM réfléchit pour lui

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent Spotter, un cadre logiciel qui donne à un modèle incarné (une politique VLA pilotant un robot) la capacité de corriger ses propres échecs grâce à un modèle vision-langage (VLM) qui tourne en parallèle. Les auteurs ont d'abord testé si les modèles actuels savent réparer une erreur connue. Arrêtés au moment d'un échec et autorisés à réessayer, ils y parviennent rarement, que ce soit par leur aléa interne ou à partir d'une description textuelle de l'erreur. La sélection « best-of-N » ne permet pas non plus d'identifier la bonne tentative après un échec. Avec GPT comme VLM, Spotter améliore Cosmos Policy de 5,6 points et π0.5 de 7,5 points sur le benchmark RoboCasa. Sur la configuration Hard de RoboTwin 2.0, π0.5 passe de 47,2 % à 57,0 %. Sur un robot réel, le taux de réussite grimpe de 53 % à 83 %. Le système a aussi été testé avec Qwen, avec des gains similaires selon les auteurs. Le code est publié sur GitHub.

L'intérêt tient à l'architecture. Les approches existantes confient au VLM la planification de chaque étape, le modèle incarné n'étant qu'un outil appelé à la demande. Le VLM se retrouve alors sur le chemin critique, ce qui ajoute de la latence à chaque action. Spotter inverse les rôles : la politique motrice s'exécute en continu, un filtre local léger surveille le déroulement, et le VLM n'intervient que lorsqu'une erreur est détectée. Il l'analyse, propose une correction, puis rend la main. Avec Qwen, un épisode réussi n'est ralenti que de 13 à 16 secondes par rapport à la politique seule, et dddure environ 70 % de moins qu'avec une base de référence pilotée par le VLM, à modèle identique. Pour un intégrateur, c'est un argument concret : la robustesse par raisonnement de haut niveau devient compatible avec des contraintes de temps de cycle. Les résultats contredisent aussi l'idée que l'aléa ou le simple retour textuel suffisent à récupérer d'un échec.

Le contexte est celui de politiques comme π0.5 (Physical Intelligence) ou Cosmos Policy (NVIDIA), entraînées presque uniquement sur des démonstrations réussies. Les auteurs y voient la cause de leur incapacité à se corriger : elles n'ont jamais vu d'échec, et leurs entrées sont trop étroites pour montrer ce qui a mal tourné. Des précautions s'imposent. Il s'agit d'un préprint (arXiv, v1), non relu par des pairs. Les gains les plus nets viennent de GPT, un modèle propriétaire, ce qui soulève des questions de coût et de dépendance au cloud. Le résultat sur robot réel, plus marqué que ceux des simulations, ne précise pas dans le résumé le nombre d'essais ni les tâches. Les suites logiques sont des validations sur davantage de tâches et de plateformes, et une intégration dans les piles VLA industrielles. Aucun acteur français ou européen n'est mentionné dans ce travail.

À lire aussi

1arXiv cs.RO 

CST-WM : un modèle du monde à structure causale pour le suivi visuel incarné

Des chercheurs proposent CST-WM, un modèle du monde à structure causale pour le suivi visuel incarné (embodied visual tracking), publié sur arXiv (2609.06302v2). La tâche consiste à choisir des actions qui gardent une cible mobile visible à bonne distance, puis à la retrouver après une occlusion, une sortie de champ ou le croisement d'un élément distracteur. Le suivi est formulé comme une planification sur les preuves futures de présence de la cible, à l'aide d'un modèle du monde conditionné par l'action. L'état du modèle est scindé en trois branches (preuve de la cible, robot, observation). La transition supprime le lien direct, au même pas de temps, entre l'action et la preuve de la cible, mais conserve le chemin passant par le mouvement du robot et les vues qui en résultent. Couplé à un contrôle prédictif par rollouts (MPC), un modèle unique gère le suivi stable et la réacquisition après perte. Sur EVT-Bench et Habitat 3.0, il est évalué en suivi standard, en récupération après perte et en transfert entre jeux de données. Sur un quadrupède Unitree Go2, il réussit 20 essais réels sur 30 (occlusion, croisement de distracteurs, mouvements rapides), contre 14 sur 30 pour TrackVLA. L'intérêt tient au diagnostic d'un défaut discret mais répandu. Dans les données de suivi enregistrées, les actions de la politique de collecte sont corrélées à la position de la cible. Un prédicteur générique apprend alors un raccourci, où l'action courante est écrite directement dans la prédiction de la cible. Les auteurs appellent cela l'hallucination causale. Les rollouts semblent plausibles, mais le classement des actions candidates repose sur une mauvaise raison, ce qui dégrade précisément la planification. Les résultats vont dans ce sens : retirer le masque d'action provoque la plus forte baisse de réacquisition parmi les ablations. Hors ligne, l'erreur de rollout multi-pas est plus faible et le classement des actions s'accorde mieux avec celui du simulateur. Pour les intégrateurs, le message est qu'un modèle du monde entraîné sur des logs opérationnels peut être trompé par des biais de collecte, et que l'ajout d'une structure causale se montre plus utile que davantage de données. Les limites sont claires : 30 essais par méthode sur un seul robot restent un échantillon réduit, et l'écart de 20 contre 14 sur 30 demande confirmation à plus grande échelle. Ces travaux se positionnent face aux suiveurs réactifs et aux approches VLA (vision-langage-action) comme TrackVLA, qui mappent directement les observations vers les actions sans anticiper les conséquences. Ils s'ajoutent aux modèles du monde utilisés en planification robotique, en y injectant une contrainte causale explicite. Le Go2, plateforme de recherche courante, sert de banc d'essai réaliste, mais aucun déploiement industriel ni produit n'est annoncé : il s'agit d'une publication académique. Les prochaines étapes probables sont des validations sur d'autres morphologies, des environnements plus denses et des mesures de latence de planification, que le résumé ne précise pas.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Le fossé de l'incarnation dans les modèles fondation pour robots
2arXiv cs.RO 

Le fossé de l'incarnation dans les modèles fondation pour robots

Une étude publiée sur arXiv sous la référence 2608.18433v1, intitulée « The Embodiment Gap in Robot Foundation Models », dresse un état des lieux critique des modèles de fondation pour la robotique (RFM), dont les politiques vision-langage-action (VLA). Le papier part d'un constat simple : un modèle peut généraliser sur le papier tout en nécessitant un travail d'adaptation important avant de tourner sur un robot physique donné. Les auteurs baptisent cet écart le « embodiment gap », soit le fossé entre des modèles, représentations ou jeux de données réutilisables et leur mise en œuvre effective sur le robot cible. La contribution centrale est une cartographie à deux axes qui classe les méthodes existantes selon le type de structure partagée et le stade d'adaptation requis avant exécution. L'étude passe ensuite en revue trois axes de recherche qui se recoupent : le partage de sémantique et de perception, le partage de données et d'interfaces robotiques, et l'apprentissage de correspondances entre différents types de corps robotiques. Elle propose enfin un cadre de reporting destiné à documenter ce travail d'adaptation, jugé invisible si l'on ne regarde que le taux de réussite final. Pour les intégrateurs et décideurs B2B du secteur, ce travail vient nuancer le récit dominant selon lequel la simple mise à l'échelle (plus de données, plus de paramètres, plus de benchmarks) suffirait à résoudre le transfert d'un modèle d'un robot à un autre. En creux, l'étude interroge la promesse d'un VLA générique qui s'appliquerait tel quel à n'importe quelle plateforme, qu'il s'agisse d'un bras industriel, d'un robot mobile ou d'un humanoïde. Elle rappelle qu'un taux de réussite affiché sur une démonstration ne dit rien du travail d'ingénierie (recalibrage, réentraînement partiel, adaptation d'interface) nécessaire pour porter un modèle d'un embodiment à un autre. Pour une industrie où plusieurs politiques VLA sont présentées comme quasi prêtes à l'emploi, ce cadre offre une grille de lecture plus rigoureuse pour distinguer généralisation en laboratoire et déploiement réel sur une nouvelle chaîne robotique. Ce travail s'inscrit dans la vague de modèles de fondation robotiques apparue dans le sillage des grands modèles de langage, portée par des acteurs comme Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2 ou Figure AI avec Helix, qui revendiquent tous une forme de généralisation entre tâches et parfois entre robots. En pointant l'absence de cadre commun pour mesurer ce qui reste réellement à faire lors d'un transfert d'embodiment, les auteurs comblent un vide méthodologique plutôt qu'ils ne proposent un nouveau modèle concurrent. La suite logique consisterait en une adoption de ce cadre de reporting par la communauté pour comparer les futures publications sur une base homogène, ainsi qu'en des études de cas documentant le coût d'adaptation d'un même modèle sur plusieurs corps robotiques distincts, question que les auteurs identifient explicitement comme ouverte pour de futurs travaux.

RecherchePaper
1 source
ReferTrack, référencer avant de suivre pour le suivi visuel incarné
3arXiv cs.RO 

ReferTrack, référencer avant de suivre pour le suivi visuel incarné

Le suivi visuel incarné (embodied visual tracking, EVT) demande à un robot mobile de suivre en continu une cible décrite en langage naturel, en s'appuyant uniquement sur sa caméra embarquée. Des chercheurs présentent ReferTrack, un modèle qui découpe la tâche en deux étapes explicites : d'abord désigner la cible parmi un ensemble indexé de boîtes englobantes détectées dans l'image, puis générer les points de trajectoire pour la suivre, en conditionnant cette planification sur la décision de désignation. Pour conserver la trace du mouvement de la cible dans le temps, le système maintient une fenêtre glissante des boîtes précédemment sélectionnées et injecte leurs caractéristiques géométriques via des tokens appelés TVBI (temporal-viewpoint-bbox indicator). L'identification de cible est renforcée par un co-entraînement sur un jeu de données maison, Refer-QA. Sur le benchmark EVT-Bench, ReferTrack atteint des taux de réussite de 89,4 %, 73,3 % et 74,1 % respectivement sur les scénarios cible unique, cible parmi des distracteurs, et cible ambiguë. Des tests réels sur robots à pattes et humanoïdes confirment un transfert simulation-vers-réel fonctionnel. Le code est publié sur GitHub (MedlarTea/referTrack). L'intérêt principal tient à la manière dont ReferTrack contourne un défaut connu des politiques vision-langage-action (VLA) actuelles : leur raisonnement en chaîne de pensée s'appuie souvent sur des représentations spatiales abstraites, difficiles à superviser et mal alignées avec les détections réelles dans l'image. En ancrant explicitement la décision d'identification sur des boîtes englobantes visibles avant de planifier la trajectoire, le modèle devient plus interprétable et plus facile à corriger. Fait notable pour les intégrateurs : avec une seule caméra frontale, ReferTrack égale voire dépasse des méthodes multi-caméras sur les tâches où l'identification est le point dur, ce qui suggère une simplification matérielle possible sans perte de robustesse sur ce type de tâche. Le travail s'inscrit dans la vague actuelle de politiques VLA généralistes (à l'image de GR00T N2, Pi-0 ou Helix) qui cherchent à unifier perception et action dans un seul modèle. Il s'agit ici d'une publication de recherche accompagnée d'un dépôt de code ouvert, pas d'un produit commercial ni d'un déploiement industriel annoncé ; la validation sur robots à pattes et humanoïdes reste à ce stade une démonstration de faisabilité plutôt qu'un déploiement à grande échelle.

RecherchePaper
1 source
Repenser les modèles du monde pour les systèmes incarnés à sécurité critique
4arXiv cs.RO 

Repenser les modèles du monde pour les systèmes incarnés à sécurité critique

Un article de perspective mis en ligne sur arXiv (référence 2609.03774v1, cross-listing) remet en cause l'approche dominante de construction des "world models", ces modèles qui simulent l'environnement d'un système embarqué. Passés de représentations latentes compactes à des simulateurs génératifs interactifs produisant des vidéos photoréalistes, ces modèles sont aujourd'hui jugés sur leur vraisemblance statistique et leur fidélité visuelle, deux critères insuffisants pour garantir une décision sûre. Les auteurs identifient trois décalages structurels: vraisemblance contre risque, prédiction contre intervention, et horizon de prédiction fini contre conséquences accumulées dans le temps. Ils proposent le Risk-Informed World Model (RIWM), une architecture organisée autour des conséquences, de l'intervention, de l'incertitude épistémique et de la récupérabilité, qui combine quatre capacités interdépendantes: une représentation orientée décision, un raisonnement contrefactuel, une mémoire épisodique dédiée à la sécurité, et une assurance de sécurité au moment de l'exécution. Le constat vise directement les modèles de fondation robotique et les simulateurs utilisés pour entraîner des systèmes autonomes, véhicules, robots humanoïdes ou bras industriels, où une vidéo prédite plausible peut masquer une erreur dangereuse sur les conséquences réelles d'une action. En distinguant conséquences physiques, sociales et opérationnelles, et en conditionnant chaque prédiction à un niveau d'incertitude épistémique, RIWM conteste l'hypothèse implicite selon laquelle une meilleure fidélité perceptuelle garantit une meilleure sécurité de décision, un point sensible pour les intégrateurs qui évaluent aujourd'hui les modèles VLA et les simulateurs génératifs sur la qualité visuelle plutôt que sur leur capacité réelle à prévenir un incident. Ce travail s'inscrit dans l'évolution récente des world models, passés de modèles de dynamique latente de type Dreamer à des simulateurs génératifs interactifs capables de produire des environnements explorables en temps réel. Plutôt qu'un produit ou un pilote déployé, les auteurs posent un programme de recherche ouvert: identifier quels futurs sont réellement critiques pour la sécurité, valider empiriquement le raisonnement contrefactuel, maintenir des mémoires de sécurité révisables dans le temps, traduire des conséquences apprises en contraintes exécutables par un système embarqué, et déterminer à quel niveau de preuve un agent peut agir plutôt que devoir détecter, différer ou s'abstenir. Aucun acteur industriel ni calendrier de déploiement n'est mentionné, ce travail relevant du positionnement académique et non d'une annonce commerciale.

RecherchePaper
1 source