FineART : jeu de données de trajectoires robotiques annotées finement et modèle vision-langage-action (VLA) pour la manipulation bimanuelle
FineART est un jeu de données de manipulation bimanuelle annotée finement, présenté sur arXiv (2609.36416v1) avec un modèle associé, FineART-VLA. Le corpus compte 40 543 épisodes, soit 1 718 heures de démonstrations, couvrant 151 tâches et 533 913 sous-tâches annotées individuellement. FineART-VLA est une politique vision-langage-action (VLA) qui prédit elle-même sa prochaine sous-tâche avant d'agir. Selon les auteurs, ce pré-entraînement intermédiaire (mid-training) fait passer le taux de réussite d'une tâche de désambiguïsation spatiale de 32,0 % à 100,0 %. Avec un guidage humain sous-tâche par sous-tâche, une tâche longue jamais vue passe de 16,0 % à 76,0 %. Après un fine-tuning minimal sur un nouveau robot, la politique demande dix fois moins de données que des références sans mid-training et généralise en zéro-shot à des tâches inédites sur ce matériel. Le jeu de données, les poids du modèle et le code d'entraînement sont publiés en open source.
L'enjeu tient à la granularité des annotations plus qu'au volume. Les grands corpus mono-bras atteignent des centaines de milliers de trajectoires, mais n'associent en général qu'une instruction de haut niveau à chaque épisode. Les rares efforts bimanuels qui annotent des sous-tâches n'en couvrent qu'une fraction des heures. Or les tâches d'assemblage, de logistique ou de préparation, qui intéressent intégrateurs et industriels, sont longues, à plusieurs étapes et exigent la coordination de deux bras. Si les résultats se confirment, l'apprentissage d'un raisonnement explicite sur les sous-tâches améliore la robustesse sur les longs horizons, point faible connu des VLA. Le gain d'un facteur dix en efficacité de données lors du transfert vers un nouveau robot compte aussi pour un intégrateur : il réduit le coût de collecte de démonstrations par site ou par plateforme. Il faut toutefois rester prudent. Les chiffres viennent d'un préprint non évalué par des pairs, les 100 % portent sur une seule tâche, et les tests d'inédit reposent sur des protocoles propres aux auteurs. La part du succès due au guidage humain, sur la tâche à 76 %, est significative.
Ce travail s'inscrit dans la lignée des grands jeux de données de démonstrations et des politiques généralistes de type Pi-0 ou GR00T, qui ont surtout misé sur l'échelle et les instructions globales. La tendance actuelle va vers des architectures hiérarchiques, comme Helix chez Figure, où un niveau planifie et un autre exécute. FineART propose ici un équivalent ouvert, entraînable et reproductible, ce qui le distingue des systèmes propriétaires. La suite dépendra de la reprise du jeu de données par d'autres laboratoires, de validations sur davantage de plateformes et de tâches industrielles réelles, et d'une évaluation indépendante des résultats en zéro-shot.
Dans nos dossiers




