
Modèles vision-langage-action tenant compte du système de préhension
Une équipe de recherche publie sur arXiv, sous la référence 2608.24603, une étude introduisant MiGA, un jeu de données pour la manipulation robotique par modèles vision-langage-action (VLA), et GVLA, le modèle associé. MiGA couvre cinq types de pinces distincts répartis sur plusieurs robots, pour un total de 103 000 démonstrations capturant la divergence des stratégies de préhension selon l'effecteur pour un même objectif. GVLA combine un tokenizer multi-gripper et un routage de politique par adaptateurs, avec des représentations internes conditionnées par le type de pince. En simulation comme sur robots réels, GVLA surpasse les modèles de référence, avec une meilleure généralisation à des objets et tâches inédits et une adaptation plus rapide entre pinces.
L'apport tient surtout au diagnostic : la plupart des VLA actuels supposent implicitement une invariance au type de pince, alors que la stratégie de préhension dépend de l'effecteur terminal, une pince parallèle et une ventouse exigeant des interactions distinctes pour saisir un même objet. Or les jeux de données d'entraînement existants reposent presque exclusivement sur des pinces parallèles, limitant la généralisation vers les ventouses ou pinces adaptatives utilisées en logistique et en manipulation industrielle. Pour les intégrateurs exploitant des flottes hétérogènes d'effecteurs, un modèle entraîné sur pince parallèle ne transfère pas trivialement à un bras équipé de ventouse. L'étude montre ainsi que le passage à l'échelle des VLA doit intégrer l'hétérogénéité matérielle des effecteurs, pas seulement celle des tâches ou des objets.
Cette publication s'inscrit dans la vague de recherche sur les modèles vision-langage-action, qui ont démontré ces dernières années leur capacité à traduire des instructions en langage naturel en séquences d'actions robotiques, en se concentrant surtout sur la diversité des tâches et des scènes plutôt que sur celle des effecteurs. Il s'agit ici d'une contribution de recherche déposée sur arXiv, sans annonce de déploiement industriel : MiGA et GVLA sont pour l'instant validés en simulation et sur essais robots en laboratoire, sans précision sur une mise à disposition publique du code ou du dataset. La suite attendue est leur publication effective et une éventuelle reprise par des laboratoires confrontés, sur le terrain, à la diversité réelle des effecteurs de préhension.
Dans nos dossiers




