
MA-VLA : un modèle vision-langage-action multi-bras pour la collaboration et la généralisation compositionnelle
La recherche en robotique manipulative s'attaque à un problème précis: coordonner plusieurs bras robotiques qui doivent collaborer sur une même tâche sans être limités aux schémas de coopération vus pendant l'entraînement. Un article publié sur arXiv (identifiant 2608.25864v1) présente MA-VLA, un modèle vision-langage-action (VLA) conçu pour la collaboration multi-bras. Contrairement aux VLA récents qui traitent l'instruction comme une consigne globale unique appliquée à l'ensemble du système, MA-VLA découpe le comportement coopératif en "prompts atomiques" de niveau intermédiaire, chacun assigné à un bras spécifique. L'équipe introduit aussi une technique d'entraînement baptisée Arm Shuffle: elle permute aléatoirement, pour chaque bras, les observations, les états et les prompts atomiques assignés, ce qui force le modèle à suivre les instructions indépendamment du rôle fixe attribué à un bras donné. Les auteurs ont construit un benchmark dédié où les configurations de collaboration testées sont absentes de l'ensemble d'entraînement, et ont évalué le système en simulation comme en conditions réelles. Le code, les modèles et les données sont publiés sur GitHub (zhangzaibin/future-robots).
Ce travail cible un angle mort connu des VLA actuels: leur capacité de généralisation s'effondre dès que la répartition des rôles entre bras change par rapport aux schémas mémorisés à l'entraînement. Selon les résultats rapportés, les VLA de référence échouent largement sur ces collaborations inédites, alors que MA-VLA maintient des performances stables. Pour les intégrateurs travaillant sur des cellules robotiques multi-bras ou des plateformes bimanuelles, c'est un signal utile: la généralisation compositionnelle, plutôt que la simple mémorisation de trajectoires coopératives, pourrait devenir un critère de sélection des architectures VLA pour des lignes de production où la configuration des tâches varie.
Cette contribution s'inscrit dans la vague plus large des modèles VLA qui cherchent à unifier perception, langage et contrôle pour la manipulation robotique, un axe de recherche porté ces dernières années par plusieurs laboratoires académiques et industriels. MA-VLA se positionne explicitement contre les architectures à instruction globale unique, en misant sur une assignation explicite et recomposable de sous-objectifs par bras. Il s'agit à ce stade d'une publication de recherche avec code ouvert, sans annonce de déploiement industriel ni de partenaire commercial identifié.
Dans nos dossiers




