Aller au contenu principal
MA-VLA : un modèle vision-langage-action multi-bras pour la collaboration et la généralisation compositionnelle
RecherchearXiv cs.RO 

MA-VLA : un modèle vision-langage-action multi-bras pour la collaboration et la généralisation compositionnelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

La recherche en robotique manipulative s'attaque à un problème précis: coordonner plusieurs bras robotiques qui doivent collaborer sur une même tâche sans être limités aux schémas de coopération vus pendant l'entraînement. Un article publié sur arXiv (identifiant 2608.25864v1) présente MA-VLA, un modèle vision-langage-action (VLA) conçu pour la collaboration multi-bras. Contrairement aux VLA récents qui traitent l'instruction comme une consigne globale unique appliquée à l'ensemble du système, MA-VLA découpe le comportement coopératif en "prompts atomiques" de niveau intermédiaire, chacun assigné à un bras spécifique. L'équipe introduit aussi une technique d'entraînement baptisée Arm Shuffle: elle permute aléatoirement, pour chaque bras, les observations, les états et les prompts atomiques assignés, ce qui force le modèle à suivre les instructions indépendamment du rôle fixe attribué à un bras donné. Les auteurs ont construit un benchmark dédié où les configurations de collaboration testées sont absentes de l'ensemble d'entraînement, et ont évalué le système en simulation comme en conditions réelles. Le code, les modèles et les données sont publiés sur GitHub (zhangzaibin/future-robots).

Ce travail cible un angle mort connu des VLA actuels: leur capacité de généralisation s'effondre dès que la répartition des rôles entre bras change par rapport aux schémas mémorisés à l'entraînement. Selon les résultats rapportés, les VLA de référence échouent largement sur ces collaborations inédites, alors que MA-VLA maintient des performances stables. Pour les intégrateurs travaillant sur des cellules robotiques multi-bras ou des plateformes bimanuelles, c'est un signal utile: la généralisation compositionnelle, plutôt que la simple mémorisation de trajectoires coopératives, pourrait devenir un critère de sélection des architectures VLA pour des lignes de production où la configuration des tâches varie.

Cette contribution s'inscrit dans la vague plus large des modèles VLA qui cherchent à unifier perception, langage et contrôle pour la manipulation robotique, un axe de recherche porté ces dernières années par plusieurs laboratoires académiques et industriels. MA-VLA se positionne explicitement contre les architectures à instruction globale unique, en misant sur une assignation explicite et recomposable de sous-objectifs par bras. Il s'agit à ce stade d'une publication de recherche avec code ouvert, sans annonce de déploiement industriel ni de partenaire commercial identifié.

À lire aussi

Colosseum V2 : benchmark de généralisation pour les modèles vision-langage-action (VLA)
1arXiv cs.RO 

Colosseum V2 : benchmark de généralisation pour les modèles vision-langage-action (VLA)

Une équipe de chercheurs a publié Colosseum V2, un benchmark de simulation à grande échelle conçu pour évaluer la capacité de généralisation des modèles VLA (Vision-Language-Action) en manipulation robotique. Le benchmark intègre 28 tâches réparties en 13 catégories et couvre deux morphologies de robots distinctes, allant de primitives de manipulation élémentaires à des comportements long-horizon complexes. Construit sur le simulateur ManiSkill, il exploite la parallélisation GPU pour des évaluations massives et prend en charge les tests en domaine connu (in-domain) comme hors domaine d'entraînement (out-of-domain). Les auteurs ont évalué deux architectures de référence : les Action Chunking Transformers (ACT) et Pi0.5, le modèle de la startup Physical Intelligence. Les résultats exposent une tension centrale dans le domaine : les VLAs affichent des capacités de perception et de compréhension du langage en zéro-shot héritées de leur pré-entraînement sur de larges corpus, mais leurs performances se dégradent significativement dès que la distribution des données change, qu'il s'agisse de variations d'éclairage, de textures d'objets ou de configurations inédites. Ce fossé entre compréhension sémantique de haut niveau et comportement moteur robuste reste l'un des blocages majeurs à la commercialisation de politiques robotiques générales. Point notable : les auteurs documentent une forte corrélation entre métriques en simulation et métriques réelles, ce qui valide l'utilité écologique du benchmark et réduit la dépendance aux cycles d'évaluation physique, coûteux et peu reproductibles. Colosseum V2 est l'extension d'un premier benchmark Colosseum publié en 2024, centré sur la robustesse aux perturbations contrôlées. Le domaine manquait jusqu'ici d'un protocole unifié : RoboVQA, OpenVLA-OFT et les évaluations internes de Physical Intelligence ont chacun proposé des métriques partielles, rendant les comparaisons entre systèmes quasi impossibles. Colosseum V2 ambitionne de jouer le rôle fédérateur qu'ImageNet a tenu pour la vision par ordinateur. Les auteurs annoncent l'intégration prochaine de nouvelles morphologies et de tâches bimanuelles, des axes sur lesquels Figure (Figure 03), Apptronik, et dans une moindre mesure des acteurs européens comme Enchanted Tools, commencent à capitaliser avec des données de déploiement réel.

UELe benchmark offre un protocole d'évaluation standardisé que les équipes R&D françaises et européennes, dont Enchanted Tools, citée pour ses travaux sur les tâches bimanuelles, pourront utiliser pour comparer objectivement leurs modèles VLA face aux acteurs américains et asiatiques.

RechercheOpinion
1 source
Corriger le OÙ, préserver le COMMENT : généralisation compositionnelle des modèles vision-langage-action (VLA) par guidage référentiel
2arXiv cs.RO 

Corriger le OÙ, préserver le COMMENT : généralisation compositionnelle des modèles vision-langage-action (VLA) par guidage référentiel

Des chercheurs proposent ReGuide (Referential Guidance), un module d'enrobage « training-free » qui s'ajoute à des politiques Vision-Language-Action (VLA) déjà entraînées, sans toucher à leurs poids ni à leur architecture. À partir des poses d'objets fournies par un module de grounding externe, il combine un « rebinding » sémantique et un « rebinding » géométrique. Il guide l'effecteur terminal vers des configurations couvertes par les démonstrations d'entraînement, centrées sur le référent désigné par l'instruction. La politique gelée reprend alors le contrôle et termine la tâche. Les tests en simulation ont porté sur plusieurs architectures VLA, puis sur un robot réel. Les gains de taux de réussite sous décalage compositionnel atteignent jusqu'à 56,8 points de pourcentage en simulation et 75,0 points sur le robot physique. Les performances sur les tâches standard sont préservées. L'article est un préprint arXiv (v1), donc non évalué par les pairs. Il ne précise pas, dans son résumé, les noms des modèles testés, le robot utilisé ni le nombre d'essais. Ces résultats visent un point faible connu des VLA. Entraînés de bout en bout sur des jeux de données robotiques peu variés, ces modèles exploitent des raccourcis visuels : ils associent une action à des éléments sans rapport avec la tâche (arrière-plan, disposition de la scène) plutôt qu'à la sémantique de l'instruction. Un objet, une destination ou un décor déjà vus séparément ne peuvent alors pas être recombinés dans une configuration nouvelle. Les auteurs observent que, dans ce cas, le VLA échoue surtout à se localiser globalement (WHERE), tout en conservant ses compétences de manipulation locale (HOW). Corriger la cible plutôt que réapprendre le geste évite le recours à de nouvelles données ou à un réentraînement par backbone. Pour un intégrateur, c'est une piste pratique pour fiabiliser une politique déjà déployée. Le revers est la dépendance à un module de perception qui fournit des poses d'objets fiables. Les gains les plus élevés correspondent aussi à des scénarios de décalage choisis par les auteurs, et non à des conditions d'usine. Les approches existantes reposent sur une perception centrée sur la tâche ou sur une diversification ciblée des données. Elles n'offrent pas de mécanisme explicite pour la recomposition d'éléments inédits et exigent des modifications spécifiques à chaque architecture, avec réentraînement. ReGuide se positionne comme un correctif extérieur, compatible avec différents backbones. Sa validité à grande échelle reste à démontrer : le résumé ne mentionne ni tâches longues, ni scènes encombrées, ni déploiement industriel. Les prochaines étapes à surveiller sont la publication du code et des détails expérimentaux, la comparaison avec des politiques réentraînées sur des données plus diversifiées, et la robustesse face aux erreurs du module de grounding.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
IMLE-VLA : génération d'actions en une seule étape pour les modèles vision-langage-action
3arXiv cs.RO 

IMLE-VLA : génération d'actions en une seule étape pour les modèles vision-langage-action

Publié sur arXiv (2609.10915), IMLE-VLA remplace la tête d'action itérative des politiques vision-langage-action (VLA) par un générateur en une seule étape, entraîné via l'estimation conditionnelle du maximum de vraisemblance implicite (cIMLE). Appliqué au modèle π0.5, il fait passer la fréquence d'inférence de 15 Hz à 55 Hz, soit un facteur 3,67, et jusqu'à 11 fois le débit d'action. Sur le benchmark LIBERO, qui couvre 40 tâches, IMLE-VLA atteint 98,0% de réussite moyenne, le meilleur score et la plus haute fréquence d'inférence parmi les méthodes comparées. Sous les perturbations du test LIBERO-plus, il conserve la robustesse de π0.5 alors que les autres approches se dégradent nettement. Sur un bras Franka Emika Panda, quatre tâches en conditions réelles montrent un jerk réduit de 2,2 à 3,0 fois et un temps d'inférence par épisode divisé par 3,9 à 6,6 par rapport à π0.5 seul. Le problème visé est bien identifié dans le secteur: les têtes d'action entraînées par diffusion ou flow matching, comme celle de π0.5, exigent un échantillonnage multi-étapes (jusqu'à 10 pas d'Euler), ce qui produit un mouvement saccadé du robot et ralentit l'exécution des tâches. Pour les intégrateurs et équipes robotique qui déploient des bras ou des humanoïdes pilotés par des modèles de fondation, la latence d'inférence conditionne directement la fluidité et la sécurité du contrôle en temps réel. En montrant qu'un générateur à étape unique peut couvrir la multimodalité de l'action sans tomber dans l'effondrement de mode des têtes de régression classiques, IMLE-VLA remet en cause l'idée reçue selon laquelle l'échantillonnage itératif serait indispensable pour préserver la généralisation des politiques VLA à grande échelle. Ce travail s'inscrit dans la lignée des VLA construits sur des backbones vision-langage préentraînés, avec π0.5 comme base de comparaison. Il s'agit d'une contribution académique et non d'un produit commercial: code et vidéos de démonstration sont publiés sur le site du projet à des fins de reproductibilité, sans annonce de déploiement industriel ni de pilote client. Présentée comme générique, la méthode cIMLE pourrait en principe s'appliquer à d'autres têtes d'action par diffusion ou flow matching utilisées ailleurs dans le secteur, ce qui ouvre la voie à des tests sur d'autres politiques VLA et d'autres plateformes robotiques, au-delà du seul bras Franka Emika Panda utilisé pour cette validation.

RechercheActu
1 source
BridgeVLA++ : un cadre vision-langage-action économe en données, généralisable et à mémoire augmentée pour la manipulation en 3D
4arXiv cs.RO 

BridgeVLA++ : un cadre vision-langage-action économe en données, généralisable et à mémoire augmentée pour la manipulation en 3D

BridgeVLA++, une évolution du framework vision-langage-action (VLA) BridgeVLA pour la manipulation robotique en 3D, fait l'objet d'un nouveau papier de recherche publié sur arXiv (référence 2608.05042v1). La méthode d'origine projette les nuages de points en images multi-vues et prédit des cartes de chaleur intermédiaires avant de générer les actions du robot, en préservant l'alignement entrée-sortie d'un modèle vision-langage pré-entraîné afin de limiter le besoin en données d'entraînement. BridgeVLA++ y ajoute une architecture de mémoire spatio-temporelle unifiée, combinant contexte spatial persistant et historique des interactions, permettant au système de raisonner sur des séquences d'observations. Le framework a été testé en manipulation bimanuelle et validé sur une plateforme robotique réelle supplémentaire, en plus des benchmarks de simulation. Ni les auteurs, ni le laboratoire ou l'entreprise à l'origine des travaux, ni de chiffres de performance précis ne figurent dans le résumé ; les détails quantitatifs sont renvoyés vers le site du projet, bridgevla-plus.github.io. Ce travail cible un point faible connu des modèles VLA en manipulation 3D : ils restent gourmands en données, généralisent mal face aux changements de distribution, et surtout n'ont aucune mémoire explicite des observations passées, un manque bloquant pour toute tâche multi-étapes comme éviter de re-saisir un objet déjà placé ou retrouver un objet temporairement occulté. Pour un intégrateur industriel évaluant une pile VLA sur des tâches séquentielles, suivre un état dans le temps sans reconstruire l'intégralité des données d'entraînement est un prérequis pratique plus qu'un raffinement académique. BridgeVLA++ ne démontre pas de déploiement en production, mais suggère qu'une mémoire structurée reste compatible avec l'efficacité en données déjà obtenue par les architectures VLA bâties sur des VLM pré-entraînés, un compromis rarement tenu dans la littérature récente. Le framework prolonge directement les travaux antérieurs sur BridgeVLA, en conservant son passage par des cartes de chaleur intermédiaires plutôt qu'une régression directe d'actions. Il s'inscrit dans un paysage VLA de plus en plus dense, aux côtés de familles comme Pi-0 de Physical Intelligence, GR00T de Nvidia ou Helix de Figure, qui visent chacune à leur manière une politique généraliste robuste aux changements de contexte. Le résumé ne mentionne aucun calendrier de commercialisation ni de partenariat industriel : il s'agit à ce stade d'un travail de recherche, code et résultats détaillés étant promis sur le site dédié du projet. Reste à voir si les benchmarks memory-dépendent utilisés pour la validation seront repris par d'autres équipes pour vérifier objectivement les gains de généralisation annoncés.

RechercheActu
1 source