Aller au contenu principal
RecherchearXiv cs.RO 

MixVLA : mélange adaptatif des informations non invariantes pour des modèles vision-langage-action (VLA) généralisables

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.02898) MixVLA, un cadre d'entraînement pour modèles Vision-Language-Action (VLA) qui vise à améliorer la généralisation zéro-shot en conditions hors distribution (OOD). Le principe repose sur un module baptisé Adaptive Mixing of Non-Invariant Information (AMI). Celui-ci mélange de façon stochastique les représentations « non invariantes », c'est-à-dire les facteurs propres à un environnement comme l'apparence, l'éclairage ou la texture. Les représentations mélangées sont ensuite fusionnées avec les représentations invariantes, liées à la structure de la tâche, pour prédire l'action finale. La méthode est dite agnostique au modèle : elle ne demande ni donnée OOD supplémentaire ni modification d'architecture. Les auteurs l'évaluent sur LIBERO, LIBERO-Plus, la suite de perturbations de RoboTwin et des tâches réelles, et affirment une meilleure robustesse zéro-shot sans perte de performance en domaine. Le résumé ne donne aucun chiffre, ni gain, ni nom de modèle de base, ni nombre d'essais réels.

L'enjeu touche l'un des points faibles les mieux identifiés des VLA : leur fragilité dès que la scène s'écarte des données d'entraînement. Ces politiques tendent à s'appuyer sur des indices visuels parasites (fond, couleur, position de caméra) plutôt que sur la structure de la tâche, ce qui explique une part de l'écart entre démonstration et déploiement. Pour un intégrateur ou un responsable industriel, un gain obtenu par simple recette d'entraînement, sans nouvelle collecte de données ni changement d'architecture, serait précieux, car la collecte de téléopération reste l'un des postes de coût les plus lourds. Il faut toutefois rester prudent : sans résultats chiffrés, il est impossible de juger l'ampleur du gain, et les benchmarks de simulation, même perturbés, ne garantissent pas la robustesse en atelier. Le volet réel, dont l'ampleur n'est pas précisée, devra être examiné dans l'article complet.

Ce travail s'inscrit dans une série de recherches sur la robustesse des VLA. LIBERO-Plus et la suite de perturbations de RoboTwin ont été conçus pour exposer la sensibilité de ces modèles aux variations de caméra, d'éclairage, d'objets ou de langage, après que les scores quasi saturés sur LIBERO standard ont montré leurs limites. MixVLA se rapproche des techniques de régularisation et d'augmentation de représentations issues de la généralisation de domaine, ici transposées aux VLA. Il reste à voir s'il se montre complémentaire des grands modèles généralistes comme Pi-0 ou GR00T, et si le code et les poids sont publiés pour permettre une reproduction indépendante. Il s'agit d'une prépublication v1, non évaluée par des pairs, qui relève de la recherche et non d'un produit livré ou d'un déploiement.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

FAN : normalisation d'action anticipative pour l'adaptation continue des modèles vision-langage-action
1arXiv cs.RO 

FAN : normalisation d'action anticipative pour l'adaptation continue des modèles vision-langage-action

Un article de recherche publié sur arXiv en septembre 2026 (arXiv:2609.21358, un preprint non encore relu par les pairs) s'attaque à un aspect négligé de l'adaptation continue des modèles Vision-Language-Action (VLA) : la normalisation des actions, c'est à dire le système de coordonnées dans lequel une politique perçoit et exécute ses mouvements. Les auteurs testent cinq stratégies de normalisation sur quatre flux de tâches robotiques réelles, en manipulation à bras unique et bimanuelle, et montrent que les protocoles existants provoquent des échecs récurrents : dérive des coordonnées d'une tâche à l'autre, couverture de mouvement insuffisante, ou décalage entre coordonnées d'entraînement et de test. Ils en tirent trois principes de conception, cohérence, couverture et causalité (3C), qui donnent naissance à FAN (Foresight Action Normalization), une méthode qui calcule une seule fois des statistiques de normalisation sur un petit jeu de calibration indépendant des tâches, puis les fige pour toute la durée de l'apprentissage continu qui suit. FAN obtient les meilleurs résultats sur l'ensemble des flux testés. Cette découverte concerne directement les acteurs qui déploient des politiques VLA généralistes, du type Pi-0, GR00T N2 ou Helix, sur des flottes de robots censées apprendre de nouvelles compétences sans oublier les précédentes. La plupart des travaux sur l'apprentissage continu en robotique misent sur le rejeu d'expérience ou le fine-tuning par renforcement, en traitant la normalisation des actions comme un simple détail d'ingénierie ; cet article montre qu'un choix mal calibré à ce niveau suffit à faire échouer l'adaptation continue, quel que soit l'algorithme d'apprentissage retenu. Pour les intégrateurs, le message est clair : avant d'empiler des techniques d'apprentissage sophistiquées, la représentation d'action sous-jacente doit rester stable d'une tâche à l'autre. Ce travail s'inscrit dans la vague des modèles VLA pré-entraînés sur de vastes jeux de données fermés puis adaptés à des robots et tâches spécifiques, une tendance portée par des laboratoires comme Physical Intelligence, NVIDIA ou Figure AI avec leurs politiques généralistes respectives. Contrairement à une annonce produit, il s'agit ici d'une contribution académique testée en laboratoire sur quatre flux de tâches, sans précision sur la plateforme robotique utilisée, la disponibilité du code ou un calendrier de reprise industrielle. FAN se présente comme une brique de base destinée à de futurs pipelines d'apprentissage continu, plutôt que comme un système prêt à déployer sur le terrain.

RecherchePaper
1 source
Colosseum V2 : benchmark de généralisation pour les modèles vision-langage-action (VLA)
2arXiv cs.RO 

Colosseum V2 : benchmark de généralisation pour les modèles vision-langage-action (VLA)

Une équipe de chercheurs a publié Colosseum V2, un benchmark de simulation à grande échelle conçu pour évaluer la capacité de généralisation des modèles VLA (Vision-Language-Action) en manipulation robotique. Le benchmark intègre 28 tâches réparties en 13 catégories et couvre deux morphologies de robots distinctes, allant de primitives de manipulation élémentaires à des comportements long-horizon complexes. Construit sur le simulateur ManiSkill, il exploite la parallélisation GPU pour des évaluations massives et prend en charge les tests en domaine connu (in-domain) comme hors domaine d'entraînement (out-of-domain). Les auteurs ont évalué deux architectures de référence : les Action Chunking Transformers (ACT) et Pi0.5, le modèle de la startup Physical Intelligence. Les résultats exposent une tension centrale dans le domaine : les VLAs affichent des capacités de perception et de compréhension du langage en zéro-shot héritées de leur pré-entraînement sur de larges corpus, mais leurs performances se dégradent significativement dès que la distribution des données change, qu'il s'agisse de variations d'éclairage, de textures d'objets ou de configurations inédites. Ce fossé entre compréhension sémantique de haut niveau et comportement moteur robuste reste l'un des blocages majeurs à la commercialisation de politiques robotiques générales. Point notable : les auteurs documentent une forte corrélation entre métriques en simulation et métriques réelles, ce qui valide l'utilité écologique du benchmark et réduit la dépendance aux cycles d'évaluation physique, coûteux et peu reproductibles. Colosseum V2 est l'extension d'un premier benchmark Colosseum publié en 2024, centré sur la robustesse aux perturbations contrôlées. Le domaine manquait jusqu'ici d'un protocole unifié : RoboVQA, OpenVLA-OFT et les évaluations internes de Physical Intelligence ont chacun proposé des métriques partielles, rendant les comparaisons entre systèmes quasi impossibles. Colosseum V2 ambitionne de jouer le rôle fédérateur qu'ImageNet a tenu pour la vision par ordinateur. Les auteurs annoncent l'intégration prochaine de nouvelles morphologies et de tâches bimanuelles, des axes sur lesquels Figure (Figure 03), Apptronik, et dans une moindre mesure des acteurs européens comme Enchanted Tools, commencent à capitaliser avec des données de déploiement réel.

UELe benchmark offre un protocole d'évaluation standardisé que les équipes R&D françaises et européennes, dont Enchanted Tools, citée pour ses travaux sur les tâches bimanuelles, pourront utiliser pour comparer objectivement leurs modèles VLA face aux acteurs américains et asiatiques.

RechercheOpinion
1 source
IMLE-VLA : génération d'actions en une seule étape pour les modèles vision-langage-action
3arXiv cs.RO 

IMLE-VLA : génération d'actions en une seule étape pour les modèles vision-langage-action

Publié sur arXiv (2609.10915), IMLE-VLA remplace la tête d'action itérative des politiques vision-langage-action (VLA) par un générateur en une seule étape, entraîné via l'estimation conditionnelle du maximum de vraisemblance implicite (cIMLE). Appliqué au modèle π0.5, il fait passer la fréquence d'inférence de 15 Hz à 55 Hz, soit un facteur 3,67, et jusqu'à 11 fois le débit d'action. Sur le benchmark LIBERO, qui couvre 40 tâches, IMLE-VLA atteint 98,0% de réussite moyenne, le meilleur score et la plus haute fréquence d'inférence parmi les méthodes comparées. Sous les perturbations du test LIBERO-plus, il conserve la robustesse de π0.5 alors que les autres approches se dégradent nettement. Sur un bras Franka Emika Panda, quatre tâches en conditions réelles montrent un jerk réduit de 2,2 à 3,0 fois et un temps d'inférence par épisode divisé par 3,9 à 6,6 par rapport à π0.5 seul. Le problème visé est bien identifié dans le secteur: les têtes d'action entraînées par diffusion ou flow matching, comme celle de π0.5, exigent un échantillonnage multi-étapes (jusqu'à 10 pas d'Euler), ce qui produit un mouvement saccadé du robot et ralentit l'exécution des tâches. Pour les intégrateurs et équipes robotique qui déploient des bras ou des humanoïdes pilotés par des modèles de fondation, la latence d'inférence conditionne directement la fluidité et la sécurité du contrôle en temps réel. En montrant qu'un générateur à étape unique peut couvrir la multimodalité de l'action sans tomber dans l'effondrement de mode des têtes de régression classiques, IMLE-VLA remet en cause l'idée reçue selon laquelle l'échantillonnage itératif serait indispensable pour préserver la généralisation des politiques VLA à grande échelle. Ce travail s'inscrit dans la lignée des VLA construits sur des backbones vision-langage préentraînés, avec π0.5 comme base de comparaison. Il s'agit d'une contribution académique et non d'un produit commercial: code et vidéos de démonstration sont publiés sur le site du projet à des fins de reproductibilité, sans annonce de déploiement industriel ni de pilote client. Présentée comme générique, la méthode cIMLE pourrait en principe s'appliquer à d'autres têtes d'action par diffusion ou flow matching utilisées ailleurs dans le secteur, ce qui ouvre la voie à des tests sur d'autres politiques VLA et d'autres plateformes robotiques, au-delà du seul bras Franka Emika Panda utilisé pour cette validation.

RechercheActu
1 source
LIRA : routage local d'informations inter-couches pour le décodage des modèles vision-langage-action
4arXiv cs.RO 

LIRA : routage local d'informations inter-couches pour le décodage des modèles vision-langage-action

Des chercheurs présentent LIRA (Local cross-layer Information Routing for Action decoding), un nouveau mécanisme de connexion entre les modèles vision-langage (VLM) preentraines et les décodeurs d'action robotique au sein des architectures Vision-Language-Action (VLA), décrit dans un article publie sur arXiv en aout 2026 (arXiv:2608.07596v1). Le problème cible: les interfaces existantes n'exploitent qu'une partie restreinte de la hiérarchie de représentations du VLM, ou associent rigidement chaque bloc du décodeur a une seule couche du VLM, limitant l'accès a des indices de tache complémentaires selon la profondeur du réseau. LIRA travaille sur des features de task-tokens et des "LIRA Query features" extraites d'états intermédiaires du VLM, puis attribue a chaque Parallel Fusion Block une fenêtre locale centrée sur la couche VLM correspondante, sans modifier le backbone, le décodeur ni la recette d'entrainement. Teste sur les benchmarks LIBERO, LIBERO-Plus, CALVIN ABC vers D et sur des taches de manipulation réelle, LIRA surpasse la baseline VLA-Adapter a configuration identique de 0,5 milliard de paramètres, avec un gain de 18,9 points en transfert zero-shot sur LIBERO-Plus, ou le taux de succès moyen passe de 59,1% a 78,0%. Ce résultat cible un maillon jusque-la peu étudie des architectures VLA, l'interface de routage entre VLM et décodeur d'action, souvent traitée comme un détail d'implémentation face aux choix de backbone ou de données d'entrainement. En montrant qu'un routage plus fin de l'information, sans toucher au reste du pipeline, améliore nettement la robustesse aux changements de distribution, l'étude suggère que la généralisation des modèles VLA ne dépend pas seulement de leur taille ou du volume de données, mais aussi de la circulation de l'information entre couches. Pour les équipes qui construisent des politiques robotiques sur des VLM preentraines, ce travail pointe une optimisation peu couteuse, sans collecte de données supplémentaire ni refonte d'architecture, un argument utile pour fiabiliser des politiques VLA sur du matériel a calcul embarque limite. L'article s'inscrit dans la lignée des travaux récents sur les modèles VLA, popularises par des systèmes comme Pi-0 ou OpenVLA, qui transforment des représentations de VLM preentraines en commandes motrices pour bras manipulateurs ou robots mobiles. LIRA est positionne comme une amélioration directe de VLA-Adapter, pris comme référence de comparaison plutôt que concurrent indépendant. L'évaluation combine bancs d'essai en simulation, LIBERO, LIBERO-Plus et CALVIN en transfert ABC vers D, et manipulation réelle, une combinaison classique pour distinguer performance en distribution et robustesse hors distribution. L'article ne mentionne ni calendrier de publication de code ni partenariat industriel: il s'agit pour l'instant d'une contribution académique.

RechercheActu
1 source