MIGU : ancrage d'instructions multimodales en contexte incertain pour la planification de manipulation
L'équipe de recherche à l'origine de MIGU (Multimodal Instruction Grounding under Uncertainty) a publié sur arXiv, sous la référence 2609.24995, une nouvelle soumission datée du 22 septembre 2026, un framework destiné à interpréter des instructions humaines combinant langage et gestes pour la manipulation robotique. Le système construit une vraisemblance géométrique en 3D en propageant l'incertitude de direction du regard et de profondeur à travers la géométrie œil-doigt, en tenant compte de l'erreur d'estimation de la direction de la main. En parallèle, un modèle vision-langage (VLM) fournit des a priori sémantiques sur les objets et régions candidats. Ces deux sources sont fusionnées par une approche inspirée de l'inférence bayésienne pour produire une croyance unifiée de désignation. Cette croyance alimente un planificateur de comportement qui décide soit de passer directement à la planification d'action, soit de demander une clarification si l'ambiguïté reste trop forte. Les cibles ainsi désignées définissent les objectifs pour la manipulation mobile et pour la planification tâche-et-mouvement sur table. Sur un benchmark réel, MIGU dépasse toutes les méthodes de référence testées, et les études d'ablation confirment l'apport de la modélisation explicite de l'incertitude multimodale. Le projet est documenté sur multimodal-instruction.github.io.
L'enjeu dépasse l'exercice académique: dans un entrepôt, un domicile ou un établissement de soin, une instruction vague accompagnée d'un geste imprécis reste une source majeure d'échec pour un bras ou un robot mobile chargé de manipulation. La plupart des systèmes de désignation fondés sur des VLM ou des architectures VLA traitent le langage ou le geste isolément, ou supposent un signal propre et non ambigu. L'apport de MIGU est de quantifier explicitement l'incertitude de chaque canal et de prévoir une option de clarification plutôt que de forcer une décision hasardeuse, ce qui réduit le risque de saisir le mauvais objet, un défaut coûteux en conditions réelles pour les intégrateurs. La validation sur un benchmark physique, et non en simulation seule, distingue ce travail des démonstrations vidéo sélectives fréquentes dans le secteur.
Le travail s'inscrit dans une recherche plus large sur la fiabilité des interfaces homme-robot fondées sur des modèles de fondation multimodaux, alors que des architectures VLA comme GR00T N2, Pi-0 ou Helix se généralisent pour piloter manipulateurs et humanoïdes. Contrairement à un produit commercial, MIGU reste à ce stade une contribution de recherche en prépublication, sans acteur industriel ni calendrier de déploiement annoncés dans l'article. Les suites évoquées portent sur l'intégration de cette brique de désignation dans des chaînes complètes de manipulation mobile et de planification tâche-et-mouvement, sans détail chiffré sur un passage à l'échelle.
Dans nos dossiers




