Aller au contenu principal
Modèles vision-langage-action bimanuels robustes grâce au masquage de modalité, une méthode étonnamment simple
RecherchearXiv cs.RO 

Modèles vision-langage-action bimanuels robustes grâce au masquage de modalité, une méthode étonnamment simple

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un nouveau papier de recherche publié sur arXiv (arXiv:2608.22419, août 2026) présente une méthode baptisée Modality Masking Mechanism (M3), destinée à rendre plus robustes les politiques de manipulation robotique bimanuelle. Le point de départ est un constat sur les modèles Vision-Language-Action (VLA) de type "query-based", appréciés pour leur faible latence d'inférence : ils produisent encore des actions discontinues et des échecs d'exécution sur des tâches complexes à deux bras, notamment à cause d'une fusion instable entre plusieurs vues caméra et les instructions en langage, l'attention du modèle dérivant vers des zones non pertinentes de la scène. M3 ne modifie ni l'architecture ni ne nécessite de pré-entraînement robotique à grande échelle : c'est une intervention purement liée à l'entraînement, qui masque aléatoirement des sous-ensembles de canaux de modalités pendant l'apprentissage, forçant la politique à s'appuyer sur des signaux fiables plutôt que sur des indices trompeurs. Testée sur dix tâches bimanuelles du benchmark de simulation RoboTwin 2.0 et sur trois tâches réelles à horizon long, M3 améliore le taux de réussite moyen de 21,7 points par rapport à une base "Adapter" en conditions propres (Clean), de 11,4 points quand le modèle est entraîné sur des démonstrations propres mais testé sur des scènes randomisées (Clean2Rand), et de plus de 30 points sur la réussite complète en conditions réelles.

Ce travail s'attaque à un problème très concret pour qui cherche à déployer des robots humanoïdes ou bimanuels hors des conditions de démonstration en laboratoire : l'écart entre une politique qui fonctionne en démo et une exécution robuste en conditions réelles. Le fait qu'une régularisation d'entraînement aussi simple qu'un masquage aléatoire produise des gains de robustesse à deux chiffres, sans nouveau matériel, nouvelle architecture ni collecte de données coûteuse, est significatif pour les intégrateurs : une partie de l'écart de robustesse face à la randomisation ou au transfert simulation-réel peut être comblée à moindre coût par une meilleure discipline d'entraînement plutôt que par plus de paramètres ou de pré-entraînement. C'est aussi un rappel que les chiffres de réussite affichés par les papiers VLA peuvent masquer une fragilité au changement de distribution, et que la comparaison entre conditions propres et conditions randomisées devient une manière plus honnête de rapporter la robustesse qu'une démonstration en conditions uniques.

Le papier compare M3 à une base "Adapter", une méthode courante pour injecter de nouvelles capacités dans une politique VLA sans réentraînement complet, et l'évalue sur RoboTwin 2.0, un benchmark de simulation pour la manipulation bimanuelle. Il s'agit d'un preprint arXiv tout juste annoncé, non encore relu par les pairs, et aucun pilote commercial, intégration produit ou soutien d'entreprise n'est mentionné dans la publication : ce travail reste donc au stade de la recherche, pas d'un déploiement réel. Sa portée pratique dépendra de la capacité de cette stratégie de masquage à se généraliser au-delà des tâches simulées de RoboTwin 2.0 et des trois tâches réelles testées, et de sa reproduction par d'autres laboratoires sur d'autres architectures VLA et d'autres plateformes robotiques.

À lire aussi

RobustVLA : robustesse d'un modèle vision-langage-action face aux perturbations multimodales
1arXiv cs.RO 

RobustVLA : robustesse d'un modèle vision-langage-action face aux perturbations multimodales

RobustVLA s'attaque à un angle mort des modèles Vision-Language-Action (VLA) : leur fragilité face aux perturbations réelles. Une équipe de recherche a d'abord testé les principaux VLA sous 17 types de perturbations réparties sur quatre modalités (actions, instructions, environnement, observations visuelles). Résultat : les actions constituent la modalité la plus fragile, les modèles réputés robustes visuellement (comme BYOVLA) ne conservent aucun gain sur les autres modalités, et pi0 se distingue par une robustesse supérieure aux autres backbones testés. Pour corriger ces faiblesses, les chercheurs proposent RobustVLA, qui combine une optimisation robuste hors ligne contre le pire cas de bruit sur les actions (via l'objectif de flow matching) et un mécanisme forçant des actions cohérentes malgré les variations d'entrée. La sélection automatique des perturbations les plus nuisibles est traitée comme un problème de bandit multi-bras, résolu par un algorithme d'upper confidence bound. Sur le benchmark LIBERO, RobustVLA gagne 12,6% de réussite absolue sur backbone pi0 et 10,4% sur OpenVLA face aux 17 perturbations combinées, avec une inférence 50,6 fois plus rapide que BYOVLA, qui dépend de LLM externes. Cette avancée touche un point sensible pour l'industrie robotique : la plupart des démonstrations de VLA impressionnent en conditions contrôlées mais s'effondrent face au bruit réel (mauvaise calibration caméra, instructions ambiguës, occlusions, dérive capteurs). En identifiant les actions comme le maillon le plus faible, l'étude remet en question l'hypothèse répandue selon laquelle la robustesse visuelle suffirait à garantir un déploiement fiable. Sur robot réel FR5, RobustVLA dépasse pi0 de 65,6% de taux de réussite avec seulement 25 démonstrations, un résultat clé pour les intégrateurs qui manquent de données d'entraînement en environnement industriel. Même avec des données abondantes, le gain reste de 30%, ce qui suggère que la méthode n'est pas qu'un palliatif pour le few-shot mais une amélioration structurelle. Le papier s'inscrit dans la lignée des travaux récents sur pi0 (Physical Intelligence) et OpenVLA, deux architectures de référence dans la course aux modèles génériques de manipulation robotique. Il répond directement aux limites de BYOVLA, une approche antérieure de robustesse visuelle jugée coûteuse en calcul car dépendante de LLM externes. Les auteurs positionnent RobustVLA comme une alternative légère et généralisable, testée à la fois en simulation (LIBERO) et en conditions réelles. Le code et des vidéos de démonstration sont disponibles sur GitHub, ce qui permettra une validation indépendante par la communauté avant une adoption plus large en environnement industriel.

RecherchePaper
1 source
LIBERO-PRO : vers une évaluation robuste et équitable des modèles vision-langage-action (VLA) au-delà de la mémorisation
2arXiv cs.RO 

LIBERO-PRO : vers une évaluation robuste et équitable des modèles vision-langage-action (VLA) au-delà de la mémorisation

Des chercheurs ont publié LIBERO-PRO, une extension critique du benchmark LIBERO largement utilisé pour évaluer les modèles Vision-Language-Action (VLA). Disponible sur GitHub (Zxy-MLlab/LIBERO-PRO), le travail, présenté sous forme d'arXiv preprint (arXiv:2510.03827v2), soumet les VLA à des perturbations systématiques selon quatre axes : substitution des objets manipulés, variation des états initiaux, modification des instructions de tâche, et changement d'environnement. Résultat sans appel : les modèles actuels qui atteignent plus de 90 % de succès sur l'évaluation LIBERO standard s'effondrent à 0,0 % dans le cadre généralisé de LIBERO-PRO. Concrètement, un modèle continue d'exécuter une séquence de saisie même lorsque l'objet cible est remplacé par un objet sans rapport, et ses sorties restent inchangées face à des instructions corrompues ou composées de tokens aléatoires. Ce résultat est un signal d'alarme direct pour les équipes qui fondent leurs décisions de recherche ou de déploiement sur les classements LIBERO. Il démontre que les modèles VLA n'ont pas acquis de compréhension générale des tâches ni de perception réelle de l'environnement : ils mémorisent des séquences d'actions et des configurations spatiales vues à l'entraînement. Autrement dit, le gap sim-to-real et le problème de généralisation restent entiers, quelle que soit la performance affichée sur le benchmark. Pour les intégrateurs industriels ou les équipes robotique qui envisagent de déployer des politiques basées sur des VLA, cela signifie que les scores publiés ne sont pas des indicateurs fiables de robustesse opérationnelle. LIBERO, introduit pour standardiser l'évaluation des politiques manipulatrices en langage naturel, est devenu une référence de facto dans la communauté. Mais comme tout benchmark sur-exploité, il a progressivement favorisé l'overfitting plutôt que la généralisation. LIBERO-PRO s'inscrit dans une tendance plus large de remise en question des protocoles d'évaluation VLA, aux côtés d'initiatives comparables sur les benchmarks de navigation et de saisie. La prochaine étape logique serait l'adoption de LIBERO-PRO comme standard par les principaux groupes travaillant sur des modèles comme OpenVLA, Octo ou pi0 (Physical Intelligence), afin de permettre des comparaisons réellement équitables et de pousser le secteur vers des politiques robustes en conditions réelles.

RechercheOpinion
1 source
RoboHarness : robustesse des modèles vision-langage-action via une adaptation en contexte augmentée par mémoire
3arXiv cs.RO 

RoboHarness : robustesse des modèles vision-langage-action via une adaptation en contexte augmentée par mémoire

Des chercheurs présentent RoboHarness, un dispositif logiciel qui se greffe sur des modèles vision-langage-action (VLA) déjà entraines pour améliorer leur robustesse face au bruit perceptif et aux variations d'environnement, sans reentrainer les poids du réseau. L'architecture combine trois briques opérant en ligne, une récupération contrastive a double mémoire (RAG), un orchestrateur vision-langage pilote par un grand modèle de langage multimodal capable d'attribuer causalement les échecs d'exécution, et des interventions extensibles via le Model Context Protocol (MCP), auxquelles s'ajoute un module hors ligne de consolidation mémoire qui distille les traces d'exécution en connaissances a priori réutilisables. Les auteurs ont teste ce système sur trois modèles VLA de base, Pi-0, Pi-0.5 et SmolVLA, sur les benchmarks LIBERO-PRO et sur LIBERO-RoboHarness, un nouveau benchmark qu'ils ont eux-mêmes conçu. Resultat annonce: un gain moyen de taux de réussite absolu de 56,6%, avec une amélioration de 89,1% sur les taches longues enchaînées (long-horizon task chaining). Le code source et la page projet sont publies sur GitHub, sous le compte LZY-1021. Le papier, publie sur arXiv, en est a sa troisième version révisée. Cette approche cible une faiblesse connue des modèles VLA généralistes: leur fragilité des qu'ils sortent de la distribution de données d'entrainement, un écart souvent masque dans les démonstrations mais critique pour un déploiement industriel réel. En proposant une couche additive et sans fine-tuning, applicable a plusieurs backbones existants, RoboHarness s'inscrit dans une tendance émergente consistant a traiter la robustesse comme un problème d'orchestration et de mémoire en contexte plutôt que de seul entrainement. Pour les intégrateurs, cela laisse entrevoir la possibilité de renforcer des politiques VLA déjà déployées sans refaire les couteux cycles de collecte de données et de reentrainement, un argument potentiellement déterminant pour l'adoption en environnement industriel variable. Les modèles VLA généralistes, tels Pi-0 développe par Physical Intelligence, occupent une place croissante dans la robotique manipulatrice, aux cotes d'autres approches généralistes du secteur. RoboHarness ne constitue pas un nouveau modèle mais un harnais complémentaire, positionne comme correctif a la faiblesse structurelle de mémoire et d'attribution causale des VLA figes. Les benchmarks utilises restant majoritairement simules (suite LIBERO), la validation sur robot physique et en conditions industrielles reste l'étape a surveiller pour juger de la portée réelle de ces gains annonces.

RechercheActu
1 source
Grands modèles vision-langage-action (VLA) pour la manipulation robotique : une revue
4arXiv cs.RO 

Grands modèles vision-langage-action (VLA) pour la manipulation robotique : une revue

Une équipe de chercheurs publie sur arXiv (référence 2508.13073, troisième version) une revue systématique consacrée aux modèles Vision-Language-Action (VLA) construits sur de grands modèles vision-langage (VLM) pour la manipulation robotique. Le travail propose une taxonomie en deux familles d'architectures : les modèles monolithiques, déclinés en conception à système unique ou à double système selon le degré d'intégration entre perception et action, et les modèles hiérarchiques, qui séparent explicitement la planification de l'exécution via des représentations intermédiaires interprétables. La revue couvre l'articulation de ces modèles avec l'apprentissage par renforcement, l'optimisation sans réentraînement, l'apprentissage à partir de vidéos humaines et les modèles du monde, et recense les jeux de données et benchmarks du domaine. Les auteurs publient une page de projet mise à jour en continu sur GitHub, sous le compte JiuTian-VL. Contrairement aux annonces produits qui rythment l'actualité de la robotique humanoïde, ce travail ne présente ni déploiement ni chiffre de performance vérifié : c'est un effort de mise en ordre académique, justifié par la fragmentation et les incohérences de taxonomie qui caractérisent aujourd'hui le champ des VLA. Pour les intégrateurs et décideurs B2B, l'intérêt est méthodologique plutôt qu'opérationnel : la distinction entre architectures monolithiques et hiérarchiques donne une grille pour décrypter des offres commerciales qui se réclament du "VLA" sans détailler leur conception interne. La revue rappelle aussi que plusieurs briques restent des chantiers ouverts, mémoire, perception 4D, adaptation efficace, coopération multi-agents, ce qui tempère l'idée qu'un modèle vision-langage-action généraliste serait déjà un problème résolu à l'échelle industrielle. Les VLA se sont imposés ces dernières années comme alternative aux méthodes robotiques à base de règles, jugées incapables de généraliser à des environnements non structurés, en s'appuyant sur des VLM pré-entraînés sur de vastes corpus image-texte. Cette revue s'inscrit dans une production académique croissante qui tente de cartographier un champ où de nombreux laboratoires publient des architectures concurrentes sans convention de classification commune, d'où l'objectif affiché de résoudre les incohérences des taxonomies existantes. Le document ne cite aucun système commercial ni partenaire industriel précis ; il est pensé comme une ressource vivante, régulièrement actualisée, utile pour situer les futures annonces de VLA propriétaires, qu'elles viennent de laboratoires de recherche ou de fabricants de robots humanoïdes, par rapport à l'état de l'art académique.

RecherchePaper
1 source