Aller au contenu principal
Ancrage visuel pour le contrôle vision-langage en zero-shot
RecherchearXiv cs.RO 

Ancrage visuel pour le contrôle vision-langage en zero-shot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a testé des modèles vision-langage (VLM) utilisés comme contrôleurs zero-shot via une batterie d'ablations : images aveugles, entrées répétées à l'identique, réflexion en miroir de la voie, lignes de base non visuelles et contrôles d'intégrité du pipeline. L'étude couvre neuf modèles à action directe, six VLM locaux structurés et une architecture hybride VLM-MPC, sur 32 874 appels notés, deux embodiments et trois simulateurs. Résultats majoritairement négatifs : une politique constante "SLOW" bat un contrôleur géométrique scripté, plusieurs modèles restent quasi insensibles à l'image, et ceux qui détectent bien les dangers longitudinaux échouent à inverser leurs décisions gauche/droite en miroir. Aucun VLM local ne remplit les deux critères de fondement visuel à la fois. Un contrôle positif purement visuel estime pourtant l'écart avec le véhicule précédent à 0,090 m d'erreur près, preuve que l'image contient bien l'information nécessaire.

Ce travail questionne un postulat central des politiques vision-langage-action (VLA) en robotique et conduite autonome : qu'un modèle généraliste puisse piloter un système physique sans entraînement spécifique du simple fait qu'il "voit" l'image. Le test miroir est révélateur : un modèle vraiment fondé sur la perception inverserait sa décision quand l'image l'est, ce qui n'est presque jamais observé. Pour les intégrateurs tentés par un VLM prêt à l'emploi comme contrôleur direct, l'étude illustre un écart concret entre score en simulation et perception réelle. Un usage plus restreint fonctionne en revanche : un comité figé de deux modèles, votant entre vue originale et vue miroir, atteint 0,954 de précision équilibrée sur données tenues à l'écart, confirmé par validation croisée. Les VLM ressortent utilisables comme assistants de détection ciblés et calibrés, pas comme contrôleurs bout en bout.

Cette étude s'inscrit dans un scepticisme méthodologique croissant envers les politiques VLA type Pi-0, GR00T N2 ou Helix, promues pour piloter bras robotiques et humanoïdes après entraînement à grande échelle. En privilégiant une batterie d'ablations rigoureuse plutôt que des scores de réussite en simulation, les auteurs proposent une méthode reproductible pour auditer ces systèmes avant déploiement, une démarche encore rare face aux annonces commerciales du secteur où vidéos sélectionnées et métriques de cycle mal contextualisées restent fréquentes. La suite logique serait d'étendre ces tests à des environnements réels, à d'autres familles de VLM propriétaires, et de valider le comité de consensus symétrique sur des flottes en conditions réelles.

À lire aussi

C²Nav : comparer avant de s'engager, pour la navigation vision-langage en zero-shot
1arXiv cs.RO 

C²Nav : comparer avant de s'engager, pour la navigation vision-langage en zero-shot

Publié sur arXiv le 15 septembre 2026 (2609.15142), C2Nav est un framework de navigation vision-langage zero-shot pour environnements continus (VLN-CE), sans entraînement supplémentaire. Trois modules le composent : Seeing élit par comparaison ordinale une vue parmi des candidates validées physiquement ; Remembering maintient un croquis de route et compare les hypothèses d'étapes d'instruction voisines ; Arriving combine une échelle d'hésitation, une comparaison rétrospective et un retour en arrière révocable pour décider l'arrêt. Sur le protocole public OpenNav R2R-CE 100, C2Nav avec Qwen3-VL-8B-Instruct obtient 41,0% de taux de réussite oracle (OSR), 31,0% de taux de réussite (SR) et 16,7% de SPL, le taux pondéré par la longueur du trajet ; avec GPT-5.5, ces scores montent à 54,0%, 44,0% et 29,0%. Sans Seeing, Remembering ou Arriving, le SR tombe respectivement à 14,0%, 25,0% et 29,0% ; remplacer les réponses comparatives par des questions cardinales le réduit à entre 12,0% et 28,0% selon l'étape du trajet. L'apport tient à l'interface entre modèle et robot plutôt qu'au modèle seul. La plupart des systèmes VLN-CE font produire au VLM des sorties cardinales, points de passage, pixels, caps, décisions d'arrivée absolues, couplant une réponse générative incertaine à une magnitude géométrique ou à un engagement irréversible. C2Nav inverse cette logique : le VLM compare des alternatives déjà construites par le contrôleur, tandis que géométrie, seuils et exécution restent du côté physique du robot. Les résultats montrent qu'une interface décisionnelle contrainte et un raisonnement de VLM plus puissant sont complémentaires et non substituables, ce qui suggère aux intégrateurs un gain de fiabilité accessible sans fine-tuning, par simple reformulation des questions posées au modèle. Le travail s'inscrit dans la navigation vision-langage en environnement continu, où l'essor des VLM généralistes pousse les chercheurs à les insérer directement dans la boucle de commande, souvent en zero-shot pour éviter un entraînement dédié à chaque environnement. C2Nav se positionne face aux architectures existantes exigeant des sorties géométriques directes, en s'appuyant sur deux VLM distincts, Qwen3-VL-8B-Instruct en version compacte et GPT-5.5 en référence plus puissante, évalués sur le protocole public OpenNav R2R-CE 100. Il s'agit à ce stade d'un article de recherche déposé sur arXiv, sans intégration dans un robot commercial ni déploiement réel, et sans suite annoncée par les auteurs.

RecherchePaper
1 source
CounterAlign : supervision contrefactuelle pour les modèles vision-langage-action
2arXiv cs.RO 

CounterAlign : supervision contrefactuelle pour les modèles vision-langage-action

Publié le 25 août 2026 sur arXiv sous la référence 2608.21740, l'article intitulé "CounterAlign: Counterfactual Supervision for Vision-Language-Action Models" propose une nouvelle méthode d'entraînement pour les modèles vision-langage-action (VLA), la brique logicielle qui traduit instructions textuelles et images en commandes motrices pour les robots. Le constat de départ est que l'apprentissage par clonage comportemental (behavior cloning), standard du secteur, n'expose le modèle qu'à des démonstrations d'expert réussies, sans jamais lui montrer quelles actions seraient incorrectes ou hors instruction. Les auteurs contournent le coût de collecte de trajectoires négatives ou de récompenses annotées en générant des tuples contrefactuels: chaque action d'expert est associée à une instruction différente et volontairement incompatible, puis un discriminateur adversarial apprend à partir de ces paires un modèle de récompense ancré dans l'instruction, utilisable pour du RL hors ligne, sans rollouts ni annotations supplémentaires. Testée sur le benchmark LIBERO-PRO, conçu pour mesurer la robustesse face aux changements de position d'objets et de tâches, la méthode améliore les performances par rapport à une référence récente jugée état de l'art. Des essais sur robot réel, menés sur la plateforme TX-G2 compatible AGIBot G2, confirment l'avantage face à d'autres approches concurrentes, sans que l'article ne publie de chiffres précis de taux de réussite. L'enjeu dépasse le simple gain de benchmark: il touche au goulot d'étranglement central de l'apprentissage VLA, la rareté des données négatives ou des récompenses annotées, coûteuses à produire en robotique réelle. En montrant qu'une supervision plus dense peut être extraite des démonstrations déjà collectées plutôt que d'exiger une collecte additionnelle, les auteurs offrent une piste concrète aux équipes qui entraînent des modèles VLA à grande échelle, dans la lignée de Pi-0 chez Physical Intelligence, GR00T N2 chez Nvidia ou Helix chez Figure. La méthode s'attaque à un défaut connu des politiques entraînées par simple clonage: leur fragilité face à de petites perturbations, comme un objet déplacé, un écart fréquemment cité entre démonstrations filmées et comportement réel sur le terrain. Il s'agit néanmoins d'un résultat de recherche en préprint, validé sur un benchmark et un nombre limité d'essais réels, et non d'un produit déployé en production. Le clonage comportemental s'est imposé comme paradigme dominant à mesure que les VLA passaient à l'échelle, mais ses limites en matière de supervision négative sont documentées depuis plusieurs années, tandis que le renforcement classique bute sur le coût de l'ingénierie de récompense ou de la collecte de données non expertes. CounterAlign s'inscrit dans une famille de techniques d'alignement par modélisation de récompense et discrimination adversariale, proches par l'esprit des méthodes de RLHF développées pour les grands modèles de langage, mais adaptées ici aux contraintes de la robotique physique. Le résumé ne détaille ni les baselines concurrentes précises ni de calendrier de déploiement industriel, et aucun acteur français ou européen n'apparaît dans les expériences décrites. La suite logique, non confirmée par les auteurs, serait une extension à davantage de plateformes robotiques et une comparaison plus large face aux modèles VLA commercialisés.

RechercheActu
1 source
Video Assessment Conditionnée par l'Action et le Langage pour le Contrôle Incarné
3arXiv cs.RO 

Video Assessment Conditionnée par l'Action et le Langage pour le Contrôle Incarné

ALVA, pour Action- and Language-Conditioned Video Assessment, est une méthode d'évaluation de trajectoires présentée dans une prépublication arXiv d'août 2026 (référence 2608.08273), qui vérifie si un agent robotique a réellement exécuté une instruction en langage naturel donnée en plusieurs étapes. Le système s'appuie sur un modèle vision-langage pré-entraîné en deux temps : il résume d'abord les transitions visuelles conditionnées sur les actions exécutées, puis confronte ce résumé à l'instruction pour produire un score discret de progression sur la trajectoire. Testé dans des environnements domestiques 3D simulés, ALVA se montre conservateur, avec un taux de faux positifs proche de zéro, et utilisé comme récompense terminale pour l'optimisation de politiques, il surpasse les références fondées sur l'image finale ou la similarité d'embeddings et réduit l'écart avec un oracle de vérité terrain. Ce travail s'attaque à un point faible connu de l'apprentissage par renforcement pour agents suivant des instructions : concevoir une récompense fiable capable de détecter si une tâche multi-étapes est vraiment accomplie, sans se laisser tromper par des états visuellement proches mais fonctionnellement incorrects. Pour les équipes qui entraînent des politiques VLA (vision-language-action), un évaluateur conservateur, quitte à sous-noter certaines réussites, limite le risque qu'un agent apprenne à exploiter les failles d'une récompense trop permissive et conforte l'idée que des VLM généralistes peuvent servir de juges interprétables pour le contrôle robotique. Ces résultats restent toutefois circonscrits à des environnements simulés, sans validation sur robot physique, ce qui limite pour l'instant leur portée industrielle directe. La démarche s'inscrit dans un courant de recherche plus large visant à remplacer les récompenses figées, fondées sur l'appariement de l'image finale ou la distance d'embedding, par des juges basés sur des modèles de fondation capables de raisonner sur une trajectoire complète et le langage de la consigne. Cette prépublication arXiv n'a pas encore été relue par les pairs et ne compare pas ALVA à des systèmes commerciaux. Les auteurs le présentent comme un mécanisme de feedback interprétable pour les tâches de contrôle robotique simulées étudiées, laissant ouverte son extension à des tâches plus complexes ou à des robots réels, étape logique mais non annoncée à ce stade.

RecherchePaper
1 source
UniMem : mémoire et contrôle multimodaux unifiés pour les modèles vision-langage-action
4arXiv cs.RO 

UniMem : mémoire et contrôle multimodaux unifiés pour les modèles vision-langage-action

UniMem, un framework qui unifie mémoire multimodale de haut niveau et contrôle bas niveau dans une seule architecture pour les modèles Vision-Language-Action (VLA), est décrit dans une preprint arXiv publiée fin aout 2026 (arXiv:2608.22869v1). Le système combine trois composants: un classificateur d'événements qui déclenche les mises a jour mémoire, un encodeur de keyframes pour construire une mémoire spatiale dense, et une technique de mise en cache des keyframes destinée a limiter la surcharge de calcul pendant l'exécution des politiques. Les auteurs ont teste UniMem sur neuf taches au total, cinq en simulation et quatre sur matériel physique, toutes conçues pour solliciter la mémoire séquentielle et spatiale du robot. Les résultats annonces montrent un taux de réussite de 93,4% contre 68,2% pour une base de référence a échantillonnage d'images a intervalles fixes en simulation, et 80,0% contre 43,5% face a une architecture hiérarchique classique sur matériel réel, avec en prime une inférence plus rapide. Ce travail cible un point de friction reconnu dans le déploiement de VLA sur des taches longues et non markoviennes, celles ou l'action a prendre dépend d'événements passes et pas seulement de l'observation courante. Les approches existantes ajoutent généralement un second modèle vision-langage charge de gérer la mémoire long terme en amont du VLA, ce qui créé un goulot d'étranglement et un pipeline d'entrainement fragmente en deux étapes distinctes. Conditionner le modèle sur plusieurs images historiques choisies a intervalles arbitraires dégradé aussi souvent la performance. En proposant un backbone unique entrainable de bout en bout, UniMem promet une adoption plus simple pour les intégrateurs et laboratoires qui construisent des politiques robotiques a long horizon, sans empiler des modules de mémoire externes couteux en latence. Le problème de la mémoire dans les VLA s'inscrit dans la même trajectoire de recherche que des systèmes généralistes comme Pi-0, GR00T N2 ou Helix, qui ont déjà démontre la capacité des architectures VLA a généraliser sur des taches manipulatoires variées mais restent généralement limites a des comportements réactifs de courte durée. UniMem se positionne explicitement contre les architectures hiérarchiques a deux modèles, qu'il compare directement dans ses benchmarks matériels, avec seulement quatre taches physiques testées et des chiffres qui restent auto-rapportes par les auteurs. Le site du projet (losterberg3.github.io/unimem-vla) met a disposition les démonstrations vidéo associées; aucun calendrier de mise en open source du code ni partenariat industriel n'est communique a ce stade, le travail restant au niveau de la publication de recherche.

RechercheActu
1 source