Aller au contenu principal
RecherchearXiv cs.RO 

Ancrage visuel pour le contrôle vision-langage en zero-shot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a testé des modèles vision-langage (VLM) utilisés comme contrôleurs zero-shot via une batterie d'ablations : images aveugles, entrées répétées à l'identique, réflexion en miroir de la voie, lignes de base non visuelles et contrôles d'intégrité du pipeline. L'étude couvre neuf modèles à action directe, six VLM locaux structurés et une architecture hybride VLM-MPC, sur 32 874 appels notés, deux embodiments et trois simulateurs. Résultats majoritairement négatifs : une politique constante "SLOW" bat un contrôleur géométrique scripté, plusieurs modèles restent quasi insensibles à l'image, et ceux qui détectent bien les dangers longitudinaux échouent à inverser leurs décisions gauche/droite en miroir. Aucun VLM local ne remplit les deux critères de fondement visuel à la fois. Un contrôle positif purement visuel estime pourtant l'écart avec le véhicule précédent à 0,090 m d'erreur près, preuve que l'image contient bien l'information nécessaire.

Ce travail questionne un postulat central des politiques vision-langage-action (VLA) en robotique et conduite autonome : qu'un modèle généraliste puisse piloter un système physique sans entraînement spécifique du simple fait qu'il "voit" l'image. Le test miroir est révélateur : un modèle vraiment fondé sur la perception inverserait sa décision quand l'image l'est, ce qui n'est presque jamais observé. Pour les intégrateurs tentés par un VLM prêt à l'emploi comme contrôleur direct, l'étude illustre un écart concret entre score en simulation et perception réelle. Un usage plus restreint fonctionne en revanche : un comité figé de deux modèles, votant entre vue originale et vue miroir, atteint 0,954 de précision équilibrée sur données tenues à l'écart, confirmé par validation croisée. Les VLM ressortent utilisables comme assistants de détection ciblés et calibrés, pas comme contrôleurs bout en bout.

Cette étude s'inscrit dans un scepticisme méthodologique croissant envers les politiques VLA type Pi-0, GR00T N2 ou Helix, promues pour piloter bras robotiques et humanoïdes après entraînement à grande échelle. En privilégiant une batterie d'ablations rigoureuse plutôt que des scores de réussite en simulation, les auteurs proposent une méthode reproductible pour auditer ces systèmes avant déploiement, une démarche encore rare face aux annonces commerciales du secteur où vidéos sélectionnées et métriques de cycle mal contextualisées restent fréquentes. La suite logique serait d'étendre ces tests à des environnements réels, à d'autres familles de VLM propriétaires, et de valider le comité de consensus symétrique sur des flottes en conditions réelles.

À lire aussi

Modèle vision-langage-action partagé et modulaire pour le contrôle universel de la morphologie en MDP contextuels
1arXiv cs.RO 

Modèle vision-langage-action partagé et modulaire pour le contrôle universel de la morphologie en MDP contextuels

Une équipe de recherche propose une nouvelle architecture pour piloter des robots de morphologies très différentes avec un seul contrôleur, dans un article intitulé "Shared Modular Recurrence in Contextual MDPs for Universal Morphology Control" (arXiv:2506.08630, version 3, republiée en cross-listing début juillet 2026). Le système repose sur une architecture transformer combinée à une récurrence modulaire partagée entre les composants du robot (bras, jambes, articulations), conçue pour reconstruire des informations contextuelles sur les propriétés physiques d'un robot même quand ces données ne sont que partiellement disponibles au départ. Les chercheurs l'ont testé sur un large ensemble de robots simulés dans MuJoCo, le moteur physique open source largement utilisé en apprentissage par renforcement, à travers quatre environnements distincts. Résultat clé: le modèle affiche un gain net en généralisation zero-shot, c'est-à-dire sa capacité à piloter correctement des robots aux dynamiques, cinématiques et topologies jamais rencontrées pendant l'entraînement, sans réglage additionnel. Cette avancée s'inscrit dans un enjeu central pour l'industrie robotique: réduire le coût d'entraînement et de déploiement de contrôleurs spécifiques à chaque morphologie de robot. Un contrôleur universel capable de généraliser à de nouveaux designs mécaniques réduirait drastiquement les besoins en données et en calcul pour chaque nouveau modèle de robot, un problème que rencontrent aujourd'hui les fabricants de robots humanoïdes et de bras manipulateurs multiples. C'est aussi une contribution au débat sur la viabilité des architectures de type VLA (vision-language-action) et des politiques génériques à grande échelle: ici, la généralisation ne vient pas d'un volume massif de données mais d'une architecture qui exploite explicitement la structure modulaire du robot. L'approche s'inscrit dans une lignée de travaux en RL contextuel et en contrôle multi-robots qui exploitent déjà des informations sur la morphologie pour entraîner des agents partagés, mais qui peinaient jusqu'ici à généraliser à des morphologies fortement dissimilaires. Le fait que cet article soit republié en tant que "replace-cross" sur arXiv suggère une révision après retours de la communauté, un signe que le sujet suscite un intérêt actif en apprentissage par renforcement appliqué à la robotique. Les prochaines étapes attendues concernent une validation sur robots physiques réels, au-delà des simulations MuJoCo, pour confirmer le transfert sim-to-real.

RecherchePaper
1 source
VIA : agent d'interface visuelle pour le contrôle de robots
2arXiv cs.RO 

VIA : agent d'interface visuelle pour le contrôle de robots

Le laboratoire d'IA publie sur arXiv (référence 2607.11119v1) un framework baptisé VIA, pour Visual Interface Agent, qui aborde le contrôle robotique sous un angle radicalement différent des approches dominantes. Plutôt que d'entraîner un modèle vision-langage-action (VLA) spécialisé sur des données robotiques, VIA fait piloter un bras manipulateur par un agent génériste (Claude Code ou Codex) via une interface 3D dans un navigateur : l'agent prend des captures d'écran, envoie des commandes simples, observe le résultat et ajuste sa trajectoire en boucle fermée. Aucun fine-tuning spécifique au robot, aucun accès à des données d'état privilégiées : seulement de la perception visuelle et un petit ensemble d'outils génériques. Avec le modèle le plus performant testé, Fable 5, VIA atteint 96,7% de réussite sur trois tâches de la suite LIBERO-Goal et 100% sur une tâche complexe d'assemblage séquentiel ("rainbow assembly"). L'enjeu dépasse la simple prouesse technique. Les modèles VLA actuels (dérivés de familles comme pi-0 ou GR00T N2) restent des ordres de grandeur plus petits que les modèles généralistes de pointe, faute de données et de calcul disponibles pour le fine-tuning robotique, ce qui plafonne mécaniquement leurs capacités de raisonnement. VIA suggère au contraire que les capacités générales des agents de codage ou d'usage d'ordinateur se transfèrent directement au contrôle physique, à condition de leur fournir la bonne interface. Autre signal notable : la performance de VIA progresse avec l'échelle et la puissance du modèle sous-jacent, ce qui laisserait entrevoir des gains automatiques à mesure que les modèles génériques s'améliorent, sans réentraînement robotique dédié. Pour les intégrateurs et décideurs du secteur, cela questionne la nécessité de collecter des données robotiques coûteuses pour chaque nouvelle tâche. Le travail s'inscrit dans la vague de recherche sur les VLA (RT-2, OpenVLA, Helix et consorts), qui reste aujourd'hui le paradigme dominant pour la robotique généraliste. VIA en propose une alternative agentique, sans fine-tuning, testée pour l'instant uniquement sur des tâches de manipulation de table en environnement contrôlé. Il s'agit d'un préprint arXiv, non encore validé par les pairs, et les auteurs eux-mêmes présentent leurs résultats comme des indices de transférabilité plutôt que comme une solution de déploiement industriel : les prochaines étapes attendues porteront sur l'élargissement à des tâches plus diverses et des environnements réels au-delà du tabletop.

RechercheActu
1 source
HiMe : mémoire incarnée hiérarchique pour le contrôle vision-langage-action à long terme
3arXiv cs.RO 

HiMe : mémoire incarnée hiérarchique pour le contrôle vision-langage-action à long terme

Un article publié le 7 juillet 2026 sur arXiv présente HiMe, un cadre de mémoire hiérarchique pour les modèles Vision-Language-Action (VLA), ces systèmes qui pilotent robots et bras manipulateurs en combinant vision, langage et commande motrice. Les auteurs identifient ce qu'ils appellent le paradoxe fréquence-compétence : les modèles de raisonnement les plus capables sont trop lents pour le contrôle temps réel, tandis que les modèles rapides manquent de capacité de raisonnement pour les tâches longues et non markoviennes, où l'action dépend de tout l'historique et pas seulement de l'observation immédiate. HiMe répond en découplant l'intelligence du robot en trois couches : un Executor haute fréquence pour l'exécution, un Sentry pour la mémoire de travail, et un Planner pour la stratégie long terme, le tout appuyé par une base de connaissances dynamique capable de s'ajouter, se mettre à jour et se supprimer elle même. Pour l'industrie robotique, cette architecture cible un point faible documenté des VLA actuels, à l'image de Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure : leur dépendance à l'observation instantanée, qui les fragilise sur des tâches longues ou nécessitant de se souvenir d'une consigne donnée bien plus tôt. Beaucoup de démonstrations spectaculaires de robots humanoïdes reposent sur des séquences courtes et scriptées ; HiMe s'attaque explicitement à l'écart entre ces démonstrations et des tâches réelles multi-étapes, un angle mort souvent pointé par les intégrateurs. Si la séparation entre réactivité et raisonnement tient à l'échelle, elle offrirait une piste concrète pour concilier les deux sans sacrifier l'un pour l'autre. Le travail s'inscrit dans la lignée des recherches sur la mémoire des agents robotiques, qui cherchent à dépasser les architectures VLA à plat où toute l'information transite par une seule fenêtre de contexte. Les auteurs rapportent de meilleurs taux de réussite que ces références plates sur des tâches à horizon long, ainsi qu'une capacité inédite à corriger ses propres connaissances internes selon les préférences exprimées par un humain. Publié sans affiliation industrielle mise en avant, ce travail reste à ce stade une contribution académique : reste à voir si des laboratoires ou fournisseurs de VLA commerciaux comme Physical Intelligence, Nvidia ou Figure s'en inspireront pour des robots déployés en usine ou en entrepôt.

RechercheActu
1 source
Raisonnement continu pour les modèles vision-langage-action (VLA)
4arXiv cs.RO 

Raisonnement continu pour les modèles vision-langage-action (VLA)

Des chercheurs ont publié sur arXiv (2606.00229) une architecture appelée Continuous Reasoning for VLA, qui remplace le langage naturel comme médium de raisonnement pour les politiques robotiques par un espace latent gaussien continu. Le problème est fondamental : le texte opère à la granularité d'une tâche entière, tandis qu'une politique VLA (Vision-Language-Action) doit sélectionner des actions à une échelle temporelle bien plus fine. Le modèle génère d'abord un ensemble structuré de "pensées continues" sous forme de vecteurs gaussiens, puis les réutilise comme contexte partagé pour la génération d'actions par chunks. L'entraînement repose sur un objectif de vérification croisée : un teacher EMA (exponential moving average) doit consommer le raisonnement du modèle étudiant pour prédire les actions cibles, forçant le latent à rester transférable et vérifiable entre instances. Sur robots réels, l'architecture améliore le taux de succès moyen par sous-tâche de 40,4 % sur TX-G2 (variante compatible AgiBot G2) et de 26,3 % sur HSR (Human Support Robot de Toyota), comparé à π0.5 de Physical Intelligence. Ces résultats contredisent une hypothèse répandue : ajouter des tokens de raisonnement textuel via chain-of-thought ou sous-objectifs explicites améliore le contrôle robotique. Les auteurs montrent que ce raisonnement textuel devient facilement un raccourci interne au modèle, efficace sur les comportements vus en entraînement mais peu généralisable. Un médium de raisonnement utile doit être partageable entre instances de modèle et vérifiable via l'amélioration du contrôle aval, deux propriétés que le texte satisfait mal à l'échelle de l'action. La comparaison directe avec π0.5 positionne ce travail en réponse à Physical Intelligence, acteur de référence dans l'espace VLA. Les plateformes testées (AgiBot G2 et HSR) couvrent la robotique de service et industrielle légère, pas uniquement les humanoïdes à fort investissement comme Figure 03 ou Optimus Gen 3. D'autres architectures concurrentes, dont GR00T N2 de NVIDIA et Helix de Figure AI, misent sur des représentations latentes pour améliorer le transfert sim-to-real, mais restent davantage orientées production que recherche fondamentale. Il s'agit pour l'instant d'un résultat académique, sans annonce de pilote commercial ni de déploiement industriel.

RechercheOpinion
1 source