Opt2VLA : modèle vision-langage-action sensible à la force pour la manipulation humanoïde à corps entier avec contacts
Un preprint arXiv publié le 22 septembre 2026 (2609.23968v1) présente Opt2VLA, un framework vision-language-action (VLA) pour la manipulation corps-entier de robots humanoïdes dans des tâches à contact riche. Le système introduit des commandes de force explicites à l'interface entre la politique VLA et les contrôleurs bas niveau : une seule politique multi-tâches prédit à la fois des objectifs de mouvement géométriques et des références de force de contact continues, suivies par des contrôleurs entraînés par apprentissage par renforcement. Les données d'entraînement sont générées par optimisation de trajectoire avec références de force explicites, garantissant des trajectoires dynamiquement réalisables. Le système a été testé sur trois tâches humanoïdes à contact riche, en simulation et sur matériel robotique réel.
L'enjeu dépasse la démonstration académique. La plupart des modèles VLA actuels pour humanoïdes, à l'image de Pi-0, GR00T N2 ou Helix, représentent les actions uniquement par des objectifs de mouvement géométriques, sans raisonnement explicite sur les forces d'interaction, une limite critique dans les tâches où des mouvements similaires exigent des régimes de force différents, ou où la vision devient peu fiable après contact. Les auteurs montrent que le conditionnement explicite par la force améliore la précision et la stabilité de la régulation, et que la supervision physique issue de l'optimisation de trajectoire renforce encore ce suivi. Pour les intégrateurs industriels, cela suggère qu'une politique VLA unique peut arbitrer entre précision géométrique et contrôle de force sans multiplier les contrôleurs ad hoc, un prérequis pour des tâches fines comme le vissage ou l'insertion de connecteurs.
Opt2VLA s'inscrit dans la vague de modèles VLA pour humanoïdes portée par des acteurs comme Physical Intelligence, NVIDIA ou Figure AI, jusqu'ici centrés sur la sémantique visuelle et le suivi de mouvement plutôt que sur la dynamique de contact. L'abstract ne précise ni l'affiliation des auteurs ni le modèle de robot utilisé pour les essais matériels, et les résultats restent ceux d'un preprint non encore relu par les pairs, validé sur trois tâches expérimentales. Les prochaines étapes attendues portent sur l'extension à davantage de tâches à contact riche et la validation de la génération de données par optimisation de trajectoire sur d'autres plateformes matérielles.
Dans nos dossiers




