MMaDA-VLA : un grand modèle vision-langage-action à diffusion, avec instruction et génération multimodales unifiées
Un groupe de chercheurs a mis en ligne une troisième version révisée de MMaDA-VLA, un modèle Vision-Language-Action (VLA) qui convertit observations visuelles et instructions en langage naturel en actions robotiques. À la différence des architectures hiérarchiques ou autorégressives habituelles, ce modèle repose sur une diffusion discrète native et préentraînée, qui unifie compréhension et génération multimodales dans un espace de tokens partagé. Il débruite conjointement une image d'objectif futur et un segment d'actions, ancrant ainsi les décisions du robot dans un résultat visuel prédit, sans passer par un modèle du monde auxiliaire séparé. Ce raffinement parallèle et non ordonné viserait à limiter l'accumulation d'erreurs sur les tâches longues. Sur le benchmark de simulation LIBERO, MMaDA-VLA atteint 98,0% de réussite moyenne ; sur CALVIN, une longueur moyenne de séquence réussie de 4,78. Les auteurs annoncent aussi de bons résultats en conditions réelles, sans détailler la plateforme robotique utilisée.
Ce travail répond à un problème connu des VLA : les pipelines hiérarchiques (planificateur puis contrôleur) ou autorégressifs accumulent des erreurs sur les séquences longues et nécessitent souvent des modules annexes pour modéliser la dynamique de l'environnement. En intégrant prédiction visuelle et génération d'actions dans un seul processus de diffusion, MMaDA-VLA supprime ce module séparé et propose une architecture plus compacte. Un score de 98% sur LIBERO est élevé, mais reste un résultat de simulation : il ne garantit pas, à lui seul, un transfert direct vers la manipulation industrielle en environnement réel, même si les auteurs revendiquent des essais physiques concluants. Pour la recherche en robotique, l'apport est avant tout méthodologique.
MMaDA-VLA prolonge les travaux sur la diffusion multimodale unifiée de la famille MMaDA, appliqués ici au contrôle robotique. Le champ des VLA s'est structuré ces dernières années autour de modèles comme RT-2, Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, majoritairement autorégressifs ou hiérarchiques, une lignée que ce travail cherche justement à dépasser. Le fait qu'il s'agisse d'une troisième révision arXiv suggère un affinement continu plutôt qu'un résultat figé. Code et démonstrations sont accessibles via la page projet des auteurs, mais rien n'indique de calendrier de déploiement industriel ni de partenariat avec un fabricant de robots : cette publication relève clairement de la recherche académique, pas du produit commercial.




