ManiSkillFormer : manipulation compositionnelle sans démonstration via des contrats géométriques liés à la tâche
Une équipe de recherche a publié le 16 septembre 2026 sur arXiv (référence 2609.16331) une étude décrivant ManiSkillFormer, un système de manipulation robotique neuro-symbolique qui se passe entièrement de démonstrations humaines et d'entraînement de politique visuomotrice de bout en bout par objet. Le procédé repose sur des « contrats géométriques conditionnés par la tâche » : pour chaque compétence (saisir, verser, dévisser, plier), un agent basé sur un grand modèle de langage génère, à partir de structures définies par des humains, la liste des primitives 3D nécessaires (points clés d'un objet, normales de surface) et les modèles de mouvement associés. Un module de perception ancre ensuite ces primitives dans les observations du robot pour instancier des mouvements réutilisables issus d'une bibliothèque de compétences. Le système a été testé sur le bras bimanuel Galaxea R1-Lite selon trois protocoles : prise et dépose zero-shot sur 8 catégories d'objets et 30 instances, manipulation fonctionnelle (dévissage, versement, pression, pliage) et trois tâches à long horizon, avec des taux de réussite rapportés de 88,24%, 75,00% en moyenne et 50 à 80% de complétion respectivement, devant les bases de comparaison et deux versions ablationnées.
Pour l'industrie, ce travail vise le goulot d'étranglement le plus coûteux des politiques de manipulation actuelles : la collecte de démonstrations et le réentraînement par objet. Si l'approche tient à plus grande échelle, elle offrirait aux intégrateurs un moyen d'ajouter objets et tâches sans nouvelle collecte de données, un argument frontal contre les modèles vision-langage-action entraînés de bout en bout. Les résultats restent toutefois obtenus sur un seul bras robotique et un jeu d'objets limité en laboratoire, sans confrontation à un déploiement industriel réel, ce qui invite à la prudence avant toute extrapolation.
Ce travail s'inscrit dans le débat entre modèles VLA de bout en bout, tels Pi-0 ou GR00T N2, et approches structurées combinant perception symbolique et bibliothèques de compétences. En confiant à des LLM la génération automatique des contrats géométriques et des modèles de mouvement plutôt que leur codage manuel, les auteurs cherchent à marier flexibilité du langage naturel et fiabilité d'un pipeline géométrique explicite. Publié comme préprint arXiv sans affiliation industrielle ni calendrier de déploiement annoncé, ManiSkillFormer demeure à ce stade une contribution de recherche à valider sur d'autres plateformes et à plus grande échelle.
Dans nos dossiers




