Aller au contenu principal
VOTE : optimisation vision-langage-action par vote d'ensemble de trajectoires
IA physiquearXiv cs.RO 

VOTE : optimisation vision-langage-action par vote d'ensemble de trajectoires

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Le papier VOTE ("Vision-Language-Action Optimization with Trajectory Ensemble Voting"), publié sur arXiv sous la référence 2507.05116, propose une nouvelle méthode d'entraînement pour les modèles Vision-Language-Action (VLA) utilisés en robotique manipulatrice. Les auteurs, dont le code est disponible sur GitHub (LukeLIN-web/VOTE), s'attaquent à deux limites des VLA actuels : la génération de tokens d'action très nombreux, qui alourdit la latence d'inférence et le coût d'entraînement, et une exploitation insuffisante des actions déjà générées, qui dégrade les performances. Leur framework finetune les modèles pour produire beaucoup moins de tokens d'action, en parallélisant fortement le décodage, puis combine les prédictions courantes et passées via une stratégie de vote d'ensemble au moment de l'inférence. Résultat annoncé : des taux de réussite supérieurs à l'état de l'art, avec une inférence 39 fois plus rapide qu'OpenVLA et un débit de 46 Hz sur plateformes embarquées.

Ce gain de vitesse cible directement le principal frein au déploiement réel des VLA : leur latence, souvent incompatible avec un contrôle robotique en temps réel sur du matériel embarqué à ressources limitées. Si les chiffres se confirment en dehors des benchmarks propriétaires des auteurs, cela renforcerait l'idée qu'on peut réduire drastiquement la latence sans changer d'architecture ni ajouter de puissance de calcul, simplement en repensant le nombre de tokens générés et leur exploitation post-inférence. C'est un argument concret pour les intégrateurs qui cherchent à faire tourner des politiques VLA sur des bras robotiques ou plateformes mobiles sans GPU serveur.

Le travail s'inscrit dans une course plus large à l'efficacité des VLA, où OpenVLA sert de référence open source largement citée, aux côtés d'approches comme Pi-0 (Physical Intelligence), GR00T (NVIDIA) ou Helix (Figure), toutes confrontées au même compromis entre richesse de représentation et vitesse d'exécution. VOTE se positionne comme une optimisation d'inférence complémentaire à ces modèles plutôt qu'un concurrent direct, avec pour prochaine étape l'adoption par la communauté via son code publié.

À lire aussi

RePO-VLA : l'optimisation de politique guidée par la récupération pour les modèles vision-langage-action (VLA)
1arXiv cs.RO 

RePO-VLA : l'optimisation de politique guidée par la récupération pour les modèles vision-langage-action (VLA)

Des chercheurs publient sur arXiv (arXiv:2605.09410) RePO-VLA, un framework d'optimisation de politique pour modèles VLA (Vision-Language-Action) conçu pour améliorer la robustesse en manipulation bimanuelle sur des tâches longues et à fort contact. Le problème central identifié: les pipelines d'entraînement classiques exploitent uniquement les trajectoires réussies, abandonnant les épisodes ratés et rendant les modèles fragiles à la moindre perturbation d'exécution. RePO-VLA introduit trois mécanismes distincts: la Recovery-Aware Initialization (RAI), qui isole les segments de récupération et réinitialise l'historique d'état pour que les actions correctives s'ancrent dans l'état adverse courant plutôt que dans l'enchaînement d'erreurs précédent; la Progress-Aware Semantic Value Function (PAS-VF), qui attribue une valeur aux préfixes utiles des trajectoires échouées via un mécanisme de "reliability decay"; et le Value-Conditioned Refinement (VCR), qui entraîne la politique à sélectionner les actions à haute progression. Les auteurs introduisent également FRBench, un benchmark standardisé d'injection d'erreurs orienté récupération. Sur des tâches bimanuelle simulées et réelles, le taux de succès en conditions adverses passe de 20% à 75% en moyenne, et jusqu'à 80% lors d'essais réels à grande échelle. Ce résultat marque une rupture avec les pipelines dominants. Physical Intelligence (Pi-0, Pi-0.5), Figure AI et la quasi-totalité des approches VLA académiques s'entraînent exclusivement sur des trajectoires réussies, sacrifiant l'information contenue dans les épisodes ratés. RePO-VLA démontre que ces données sont exploitables à condition d'être labélisées en fonction de leur degré de progression vers l'objectif. Autre avantage pour le déploiement industriel: à l'inférence, aucun détecteur de défaillance en ligne n'est requis. Un simple paramètre fixe (v=1.0) suffit à biaiser les actions vers le manifold de succès appris, ce qui simplifie considérablement l'intégration en production sur des tâches de manipulation répétitive longue durée. Les VLA sont en 2025-2026 l'un des axes de recherche les plus actifs en robotique manipulatrice, portés par Physical Intelligence, Figure AI, et des laboratoires comme Berkeley, Stanford et CMU. La manipulation bimanuelle en contact représente l'échelon de difficulté le plus élevé: elle concentre les problèmes de sim-to-real gap, de gestion du contact imprédictible et de dérive d'exécution sur de longues séquences. RePO-VLA reste pour l'instant un article arXiv sans annonce de déploiement ni partenariat industriel associé. FRBench pourrait toutefois s'imposer comme référence communautaire pour évaluer la robustesse en récupération d'erreur, critère aujourd'hui absent des benchmarks standards comme LIBERO ou RoboSuite.

IA physiqueOpinion
1 source
Xiaomi-Robotics-1 : passage à l'échelle des modèles vision-langage-action avec plus de 100 000 heures de trajectoires réelles
2arXiv cs.RO 

Xiaomi-Robotics-1 : passage à l'échelle des modèles vision-langage-action avec plus de 100 000 heures de trajectoires réelles

Xiaomi a dévoilé Xiaomi-Robotics-1, un modèle vision-langage-action (VLA) fondation entraîné sur plus de 100 000 heures de trajectoires de manipulation collectées en conditions réelles via des dispositifs UMI (Universal Manipulation Interface). L'entraînement se déroule en deux temps : une phase de pré-entraînement qui dote le modèle de capacités générales de génération d'actions, appuyée sur un pipeline d'auto-annotation générant des descriptions en langage naturel des transitions d'état de la scène, puis une phase de post-entraînement qui aligne ces capacités sur des instructions impératives et sur des embodiments robotiques spécifiques. Sur les benchmarks de simulation, le modèle établit un nouvel état de l'art avec 57,6% de taux de réussite sur RoboCasa365 (contre 46,6% précédemment) et un score moyen de 20,07 sur RoboDojo (contre 13,07 pour le meilleur résultat antérieur). Xiaomi annonce la publication future du code et des poids du modèle. L'intérêt principal tient au comportement de scaling observé : les performances progressent de façon cohérente avec la taille des données et du modèle en pré-entraînement, et ce gain se transfère directement au post-entraînement, avec de meilleures performances hors distribution sur robot réel. C'est un signal notable pour l'industrie, qui cherche à valider l'hypothèse que les modèles VLA généralistes, entraînés à grande échelle sur données réelles plutôt que simulées, peuvent servir de politique de base robuste, adaptable à des tâches dextres complexes avec peu de données de fine-tuning. Pour les intégrateurs et décideurs robotique, cela renforce la piste des foundation models comme alternative viable aux pipelines spécialisés tâche par tâche. Ce travail s'inscrit dans une compétition intense entre grands acteurs sur les modèles VLA fondation, aux côtés de Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. L'usage de dispositifs UMI, portables et peu coûteux pour collecter des données de manipulation sans robot physique, s'inscrit dans une tendance à contourner le goulot d'étranglement de la téléopération classique. Reste à voir si la publication effective du code et des checkpoints, promise mais non encore livrée, confirmera la reproductibilité des résultats annoncés.

IA physiqueActu
1 source
Bridge3D : permettre aux modèles vision-langage-action de voir et d'agir en 3D
3arXiv cs.RO 

Bridge3D : permettre aux modèles vision-langage-action de voir et d'agir en 3D

Des chercheurs présentent Bridge3D, décrit dans un article publié sur arXiv sous la référence 2609.24525v1 (numérotation qui situe la soumission en septembre 2026). La méthode ajoute une guidance géométrique 3D, à la fois implicite et explicite, à des modèles vision-langage-action (VLA) pré-entraînés uniquement sur des observations 2D. Deux mécanismes sont combinés : l'Implicit Fusion, qui enrichit les tokens visuels avec des caractéristiques issues de modèles de fondation 3D pour améliorer la perception spatiale, et l'Explicit Conditioning, qui couple le débruitage des actions à un champ sémantique 3D explicite pour guider l'exécution des gestes. Les auteurs ajoutent une technique de "layer-wise linear probing" pour accélérer l'apprentissage. Sur le benchmark de simulation RoboTwin 2.0, Bridge3D dépasse le modèle Pi-0 de 14,0 points de pourcentage ; en expériences réelles, il surpasse une méthode concurrente nommée Spatial Forcing de 11,7 points de pourcentage sur des tâches de manipulation. Les VLA actuels, entraînés majoritairement sur des données 2D, peinent souvent sur les tâches de manipulation exigeant une précision spatiale fine, comme l'insertion de pièces ou la saisie d'objets à géométrie complexe, un point faible connu d'architectures comme Pi-0, GR00T N2 (NVIDIA) ou Helix (Figure). Bridge3D suggère qu'ajouter une guidance géométrique 3D explicite, en complément des priors implicites déjà testés par d'autres travaux, améliore mesurablement la précision sans nécessiter un ré-entraînement 3D natif coûteux. Pour les équipes robotique et les intégrateurs, cela ouvre une voie de post-entraînement ciblé pour renforcer des VLA existants sur des tâches industrielles sensibles à la géométrie, plutôt que de miser uniquement sur davantage de données 2D à l'échelle. Ces résultats nuancent l'hypothèse selon laquelle le simple passage à l'échelle des VLA 2D suffirait à résoudre la manipulation de précision. Bridge3D s'inscrit dans une lignée de recherches cherchant à doter les VLA d'une conscience spatiale 3D ; les auteurs pointent que les approches précédentes se limitaient à des priors implicites sans guidage géométrique explicite, lacune que leur méthode comble en associant les deux approches. Les comparaisons retenues portent sur Pi-0 en simulation via RoboTwin 2.0, un benchmark de manipulation robotique reconnu, et sur Spatial Forcing en conditions réelles. À ce stade, Bridge3D reste un travail de recherche publié sur arXiv, sans code source mentionné, sans partenaire industriel identifié et sans déploiement hors du cadre expérimental décrit. Les suites attendues pour ce type de travaux incluent généralement la publication du code, l'extension à d'autres plateformes robotiques et tâches réelles, ainsi que des comparaisons élargies à d'autres VLA de référence comme GR00T N2 ou Helix.

IA physiqueActu
1 source
Guidance stable par le langage pour les modèles vision-langage-action (VLA)
4arXiv cs.RO 

Guidance stable par le langage pour les modèles vision-langage-action (VLA)

Des chercheurs ont publié sur arXiv (réf. 2601.04052v2) une méthode baptisée Residual Semantic Steering (RSS), conçue pour corriger un défaut structurel des modèles Vision-Language-Action (VLA) utilisés en robotique manipulation : leur fragilité face aux variations de formulation des instructions textuelles. Le problème identifié, nommé "effondrement de modalité" (modality collapse), survient lorsque les signaux visuels, très denses, écrasent les signaux linguistiques, plus rares, forçant le modèle à mémoriser des tournures de phrases spécifiques plutôt qu'à comprendre l'intention sous-jacente. RSS propose deux mécanismes complémentaires : la Monte Carlo Syntactic Integration, qui génère un ensemble distribué de reformulations d'une même instruction via un LLM afin d'approximer le vrai postérieur sémantique, et le Residual Affordance Steering, un décodage à double flux qui isole explicitement la contribution causale du langage en soustrayant l'a priori visuel des affordances physiques. Les résultats publiés indiquent des performances state-of-the-art en robustesse sur plusieurs benchmarks de manipulation, y compris sous perturbations linguistiques adversariales. Le code est disponible en open source. Ce travail pointe un angle mort concret du pipeline VLA : un robot entraîné avec π0 (Physical Intelligence), OpenVLA ou GR00T N2 (NVIDIA) peut échouer à exécuter une tâche simplement parce que l'opérateur reformule l'ordre différemment, ce qui est rédhibitoire pour tout déploiement industriel réel. RSS apporte une réponse architecturale sans nécessiter de réentraînement complet du modèle de base, ce qui le rend potentiellement compatible avec les VLA existants. La démonstration sur benchmarks adversariaux est un signal positif, même si les benchmarks de manipulation académiques restent éloignés des conditions d'atelier réelles : cycles courts, éclairage variable, instructions opérateur non normalisées. Les VLA ont émergé comme paradigme dominant depuis les travaux de RT-2 (Google DeepMind, 2023), suivis par OpenVLA, π0 de Physical Intelligence et GR00T N2 de NVIDIA, tous confrontés au même sim-to-real gap linguistique. RSS s'inscrit dans une vague de travaux tentant de rendre ces modèles plus robustes sans sacrifier leur généralité. L'approche concurrente la plus proche est le data augmentation sémantique (paraphrase augmentation), moins élégante théoriquement mais déjà intégrée dans certains pipelines de fine-tuning. Les prochaines étapes logiques seraient une validation sur robot physique en environnement non contrôlé et une intégration dans un framework VLA open source comme OpenVLA, ce que les auteurs n'ont pas encore annoncé.

IA physiqueOpinion
1 source