Aller au contenu principal
MA-VLA : un modèle vision-langage-action multi-bras pour la collaboration et la généralisation compositionnelle
RecherchearXiv cs.RO 

MA-VLA : un modèle vision-langage-action multi-bras pour la collaboration et la généralisation compositionnelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

La recherche en robotique manipulative s'attaque à un problème précis: coordonner plusieurs bras robotiques qui doivent collaborer sur une même tâche sans être limités aux schémas de coopération vus pendant l'entraînement. Un article publié sur arXiv (identifiant 2608.25864v1) présente MA-VLA, un modèle vision-langage-action (VLA) conçu pour la collaboration multi-bras. Contrairement aux VLA récents qui traitent l'instruction comme une consigne globale unique appliquée à l'ensemble du système, MA-VLA découpe le comportement coopératif en "prompts atomiques" de niveau intermédiaire, chacun assigné à un bras spécifique. L'équipe introduit aussi une technique d'entraînement baptisée Arm Shuffle: elle permute aléatoirement, pour chaque bras, les observations, les états et les prompts atomiques assignés, ce qui force le modèle à suivre les instructions indépendamment du rôle fixe attribué à un bras donné. Les auteurs ont construit un benchmark dédié où les configurations de collaboration testées sont absentes de l'ensemble d'entraînement, et ont évalué le système en simulation comme en conditions réelles. Le code, les modèles et les données sont publiés sur GitHub (zhangzaibin/future-robots).

Ce travail cible un angle mort connu des VLA actuels: leur capacité de généralisation s'effondre dès que la répartition des rôles entre bras change par rapport aux schémas mémorisés à l'entraînement. Selon les résultats rapportés, les VLA de référence échouent largement sur ces collaborations inédites, alors que MA-VLA maintient des performances stables. Pour les intégrateurs travaillant sur des cellules robotiques multi-bras ou des plateformes bimanuelles, c'est un signal utile: la généralisation compositionnelle, plutôt que la simple mémorisation de trajectoires coopératives, pourrait devenir un critère de sélection des architectures VLA pour des lignes de production où la configuration des tâches varie.

Cette contribution s'inscrit dans la vague plus large des modèles VLA qui cherchent à unifier perception, langage et contrôle pour la manipulation robotique, un axe de recherche porté ces dernières années par plusieurs laboratoires académiques et industriels. MA-VLA se positionne explicitement contre les architectures à instruction globale unique, en misant sur une assignation explicite et recomposable de sous-objectifs par bras. Il s'agit à ce stade d'une publication de recherche avec code ouvert, sans annonce de déploiement industriel ni de partenaire commercial identifié.

À lire aussi

Colosseum V2 : benchmark de généralisation pour les modèles vision-langage-action (VLA)
1arXiv cs.RO 

Colosseum V2 : benchmark de généralisation pour les modèles vision-langage-action (VLA)

Une équipe de chercheurs a publié Colosseum V2, un benchmark de simulation à grande échelle conçu pour évaluer la capacité de généralisation des modèles VLA (Vision-Language-Action) en manipulation robotique. Le benchmark intègre 28 tâches réparties en 13 catégories et couvre deux morphologies de robots distinctes, allant de primitives de manipulation élémentaires à des comportements long-horizon complexes. Construit sur le simulateur ManiSkill, il exploite la parallélisation GPU pour des évaluations massives et prend en charge les tests en domaine connu (in-domain) comme hors domaine d'entraînement (out-of-domain). Les auteurs ont évalué deux architectures de référence : les Action Chunking Transformers (ACT) et Pi0.5, le modèle de la startup Physical Intelligence. Les résultats exposent une tension centrale dans le domaine : les VLAs affichent des capacités de perception et de compréhension du langage en zéro-shot héritées de leur pré-entraînement sur de larges corpus, mais leurs performances se dégradent significativement dès que la distribution des données change, qu'il s'agisse de variations d'éclairage, de textures d'objets ou de configurations inédites. Ce fossé entre compréhension sémantique de haut niveau et comportement moteur robuste reste l'un des blocages majeurs à la commercialisation de politiques robotiques générales. Point notable : les auteurs documentent une forte corrélation entre métriques en simulation et métriques réelles, ce qui valide l'utilité écologique du benchmark et réduit la dépendance aux cycles d'évaluation physique, coûteux et peu reproductibles. Colosseum V2 est l'extension d'un premier benchmark Colosseum publié en 2024, centré sur la robustesse aux perturbations contrôlées. Le domaine manquait jusqu'ici d'un protocole unifié : RoboVQA, OpenVLA-OFT et les évaluations internes de Physical Intelligence ont chacun proposé des métriques partielles, rendant les comparaisons entre systèmes quasi impossibles. Colosseum V2 ambitionne de jouer le rôle fédérateur qu'ImageNet a tenu pour la vision par ordinateur. Les auteurs annoncent l'intégration prochaine de nouvelles morphologies et de tâches bimanuelles, des axes sur lesquels Figure (Figure 03), Apptronik, et dans une moindre mesure des acteurs européens comme Enchanted Tools, commencent à capitaliser avec des données de déploiement réel.

UELe benchmark offre un protocole d'évaluation standardisé que les équipes R&D françaises et européennes, dont Enchanted Tools, citée pour ses travaux sur les tâches bimanuelles, pourront utiliser pour comparer objectivement leurs modèles VLA face aux acteurs américains et asiatiques.

RechercheOpinion
1 source
BridgeVLA++ : un cadre vision-langage-action économe en données, généralisable et à mémoire augmentée pour la manipulation en 3D
2arXiv cs.RO 

BridgeVLA++ : un cadre vision-langage-action économe en données, généralisable et à mémoire augmentée pour la manipulation en 3D

BridgeVLA++, une évolution du framework vision-langage-action (VLA) BridgeVLA pour la manipulation robotique en 3D, fait l'objet d'un nouveau papier de recherche publié sur arXiv (référence 2608.05042v1). La méthode d'origine projette les nuages de points en images multi-vues et prédit des cartes de chaleur intermédiaires avant de générer les actions du robot, en préservant l'alignement entrée-sortie d'un modèle vision-langage pré-entraîné afin de limiter le besoin en données d'entraînement. BridgeVLA++ y ajoute une architecture de mémoire spatio-temporelle unifiée, combinant contexte spatial persistant et historique des interactions, permettant au système de raisonner sur des séquences d'observations. Le framework a été testé en manipulation bimanuelle et validé sur une plateforme robotique réelle supplémentaire, en plus des benchmarks de simulation. Ni les auteurs, ni le laboratoire ou l'entreprise à l'origine des travaux, ni de chiffres de performance précis ne figurent dans le résumé ; les détails quantitatifs sont renvoyés vers le site du projet, bridgevla-plus.github.io. Ce travail cible un point faible connu des modèles VLA en manipulation 3D : ils restent gourmands en données, généralisent mal face aux changements de distribution, et surtout n'ont aucune mémoire explicite des observations passées, un manque bloquant pour toute tâche multi-étapes comme éviter de re-saisir un objet déjà placé ou retrouver un objet temporairement occulté. Pour un intégrateur industriel évaluant une pile VLA sur des tâches séquentielles, suivre un état dans le temps sans reconstruire l'intégralité des données d'entraînement est un prérequis pratique plus qu'un raffinement académique. BridgeVLA++ ne démontre pas de déploiement en production, mais suggère qu'une mémoire structurée reste compatible avec l'efficacité en données déjà obtenue par les architectures VLA bâties sur des VLM pré-entraînés, un compromis rarement tenu dans la littérature récente. Le framework prolonge directement les travaux antérieurs sur BridgeVLA, en conservant son passage par des cartes de chaleur intermédiaires plutôt qu'une régression directe d'actions. Il s'inscrit dans un paysage VLA de plus en plus dense, aux côtés de familles comme Pi-0 de Physical Intelligence, GR00T de Nvidia ou Helix de Figure, qui visent chacune à leur manière une politique généraliste robuste aux changements de contexte. Le résumé ne mentionne aucun calendrier de commercialisation ni de partenariat industriel : il s'agit à ce stade d'un travail de recherche, code et résultats détaillés étant promis sur le site dédié du projet. Reste à voir si les benchmarks memory-dépendent utilisés pour la validation seront repris par d'autres équipes pour vérifier objectivement les gains de généralisation annoncés.

RechercheActu
1 source
MANGO : génération automatisée d'oracles de test multi-agents pour les modèles vision-langage-action
3arXiv cs.RO 

MANGO : génération automatisée d'oracles de test multi-agents pour les modèles vision-langage-action

Des chercheurs ont publié fin juin 2026 sur arXiv (2606.24815) un framework nommé MANGO, pour Multi-Agent test oracle GENeration for Vision-Language-Action models. Les modèles VLA constituent la nouvelle génération de systèmes de contrôle robotique : ils intègrent dans une architecture unifiée la perception visuelle, la compréhension du langage naturel et la génération d'actions motrices. L'approche dominante pour les tester repose sur des oracles symboliques écrits manuellement, des fonctions qui évaluent si un robot a accompli sa tâche à partir de l'état final de l'environnement. MANGO automatise cette étape via un pipeline de trois agents LLM collaboratifs : un Generator qui produit une bibliothèque d'actions atomiques réutilisables, un Assessor qui ancre ces définitions dans le simulateur, et un Judge qui arbitre et affine les artefacts par feedback itératif. Le système a été évalué sur les benchmarks LIBERO_10 et RoboCasa Humanoid Tabletop. L'intérêt principal est de supprimer le goulot d'étranglement humain dans la qualification des robots VLA. Les oracles symboliques actuels exigent une expertise domaine significative et restent couplés à une tâche précise, ce qui limite fortement leur réutilisation dès qu'on change de scénario ou de cellule de travail. MANGO génère des oracles à grain fin capables d'évaluer des étapes intermédiaires, pas seulement l'état final, ce qui améliore la localisation des pannes : au lieu de constater qu'un robot a échoué, on identifie quelle action atomique a dévié. Les résultats montrent une détection de défauts comparable aux oracles symboliques manuels avec une couverture diagnostique plus riche, un levier direct pour les équipes QA qui valident des flottes de robots VLA en production. Les modèles VLA ont connu une accélération marquée depuis 2024 avec Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, Helix de Figure AI et plusieurs variantes issues des laboratoires académiques. Tous partagent le même point faible : leur validation reste artisanale, peu reproductible, et difficile à passer à l'échelle. MANGO s'inscrit dans un effort croissant pour combler le fossé entre démos en laboratoire et déploiement industriel, en dotant les pipelines CI/CD robotiques d'outils d'évaluation automatisés. L'article demeure un preprint non relu par les pairs et le code n'est pas encore publié, ce qui invite à nuancer les résultats avant toute adoption. La prochaine étape naturelle serait une validation sur environnements physiques réels, au-delà des scénarios de manipulation sur table couverts par les benchmarks actuels.

RechercheOpinion
1 source
UniMem : mémoire et contrôle multimodaux unifiés pour les modèles vision-langage-action
4arXiv cs.RO 

UniMem : mémoire et contrôle multimodaux unifiés pour les modèles vision-langage-action

UniMem, un framework qui unifie mémoire multimodale de haut niveau et contrôle bas niveau dans une seule architecture pour les modèles Vision-Language-Action (VLA), est décrit dans une preprint arXiv publiée fin aout 2026 (arXiv:2608.22869v1). Le système combine trois composants: un classificateur d'événements qui déclenche les mises a jour mémoire, un encodeur de keyframes pour construire une mémoire spatiale dense, et une technique de mise en cache des keyframes destinée a limiter la surcharge de calcul pendant l'exécution des politiques. Les auteurs ont teste UniMem sur neuf taches au total, cinq en simulation et quatre sur matériel physique, toutes conçues pour solliciter la mémoire séquentielle et spatiale du robot. Les résultats annonces montrent un taux de réussite de 93,4% contre 68,2% pour une base de référence a échantillonnage d'images a intervalles fixes en simulation, et 80,0% contre 43,5% face a une architecture hiérarchique classique sur matériel réel, avec en prime une inférence plus rapide. Ce travail cible un point de friction reconnu dans le déploiement de VLA sur des taches longues et non markoviennes, celles ou l'action a prendre dépend d'événements passes et pas seulement de l'observation courante. Les approches existantes ajoutent généralement un second modèle vision-langage charge de gérer la mémoire long terme en amont du VLA, ce qui créé un goulot d'étranglement et un pipeline d'entrainement fragmente en deux étapes distinctes. Conditionner le modèle sur plusieurs images historiques choisies a intervalles arbitraires dégradé aussi souvent la performance. En proposant un backbone unique entrainable de bout en bout, UniMem promet une adoption plus simple pour les intégrateurs et laboratoires qui construisent des politiques robotiques a long horizon, sans empiler des modules de mémoire externes couteux en latence. Le problème de la mémoire dans les VLA s'inscrit dans la même trajectoire de recherche que des systèmes généralistes comme Pi-0, GR00T N2 ou Helix, qui ont déjà démontre la capacité des architectures VLA a généraliser sur des taches manipulatoires variées mais restent généralement limites a des comportements réactifs de courte durée. UniMem se positionne explicitement contre les architectures hiérarchiques a deux modèles, qu'il compare directement dans ses benchmarks matériels, avec seulement quatre taches physiques testées et des chiffres qui restent auto-rapportes par les auteurs. Le site du projet (losterberg3.github.io/unimem-vla) met a disposition les démonstrations vidéo associées; aucun calendrier de mise en open source du code ni partenariat industriel n'est communique a ce stade, le travail restant au niveau de la publication de recherche.

RechercheActu
1 source