SCULPT-VLA : apprentissage d'un contrôle structuré par ancrage d'actions en étapes
Un nouveau papier publié sur arXiv (identifiant 2609.23275, soumis fin septembre 2026) présente SCULPT-VLA, une architecture de politique vision-langage-action entraînée par ancrage d'actions en plusieurs étapes. Le système construit un état de conditionnement des actions à partir de trois facteurs complémentaires : progression de la tâche, dynamique de la scène et ancrage spatial. L'entraînement forme d'abord ces facteurs à l'aide de scaffolds enseignants, avant d'ancrer une prédiction d'action grossière sur leur composition à mesure que ces scaffolds sont retirés, puis de restaurer l'accès perceptif direct pour un affinage continu. Sur les bancs d'essai en simulation LIBERO, SimplerEnv-WidowX et RoboTwin 2.0 Full, SCULPT-VLA dépasse des références à backbone partagé. Sur SimplerEnv-WidowX précisément, le taux de succès final atteint 83,5 %, contre 71,3 % lorsque l'apprentissage d'action de la deuxième étape accède directement à la vision et au langage sans passer par l'état structuré. Sur quatre tâches réalisées avec un robot physique soumis à des changements de distribution, le taux de succès moyen atteint 58,1 %, contre 45,6 % pour le modèle de référence Pi-0.5.
Ce travail s'inscrit dans un débat technique central pour les VLA actuels : au-delà des labels d'action bruts, comment structurer une supervision intermédiaire pour que la prédiction d'action en dépende réellement, sans que cette dépendance s'effondre dès que les données annotées par un enseignant disparaissent au déploiement. En séparant explicitement l'apprentissage du conditionnement structurel de l'affinage du contrôle continu, SCULPT-VLA répond à un problème pratique pour les intégrateurs : au déploiement, aucune donnée d'enseignant ni autorégression discrète n'est nécessaire, ce qui simplifie l'inférence embarquée. Les gains rapportés en conditions de changement de distribution, un scénario proche des conditions réelles d'usine ou d'entrepôt, suggèrent une meilleure robustesse que les architectures VLA à accès perceptif direct, un point sensible pour les décideurs qui évaluent l'écart entre démonstrations en simulation et performance terrain.
Le papier ne précise ni affiliation d'auteurs ni date de publication de conférence, ce qui correspond au format d'un preprint arXiv récent, probablement en soumission anonyme. Il se positionne par comparaison directe avec Pi-0.5 comme référence de politique VLA généraliste, sans mention d'un partenariat industriel ou d'un déploiement commercial. Les auteurs annoncent des ablations sur les facteurs d'état et des interventions ciblées confirmant que l'état appris continue de contribuer au contrôle même après le retour de l'accès perceptif direct, sans toutefois indiquer de calendrier de suite ni de portage vers d'autres plateformes robotiques.
Dans nos dossiers




