SARI : entraînement conjoint simulation-réel en deux phases pour la manipulation riche en contacts
Des chercheurs proposent SARI (Simulated Approach, Real Interaction), un cadre de co-entraînement simulation-réel « à phases séparées » destiné à adapter des modèles vision-langage-action (VLA) à des tâches de manipulation riches en contacts. Le principe : générer les trajectoires d'approche, en espace libre, dans un jumeau numérique photoréaliste, et ne collecter en conditions réelles que les phases de contact, sur un petit nombre de positions d'objets. Une seule politique est ensuite post-entraînée sur ces démonstrations segmentées par phase. Elle enchaîne approche simulée et interaction réelle grâce à un alignement de l'apparence visuelle et à une représentation d'action partagée, exprimée par rapport à la caméra. Elle n'utilise ni étiquettes de phase explicites ni commutateurs codés à la main. Testé sur cinq tâches de manipulation réelles, SARI réduit de 34,3 % le temps de collecte de données réelles et atteint 27,5 % de réussite sur des positions jamais vues, là où toutes les approches de référence sim-réel entraînées sur la tâche complète échouent totalement (0 %). Le travail est publié sur arXiv (2610.02804).
Ces résultats comptent pour les équipes qui adaptent des VLA à des tâches d'assemblage ou d'insertion, où le coût des démonstrations téléopérées est le principal frein. L'intérêt tient à la répartition du travail : la diversité spatiale, gourmande en données mais tolérante aux écarts de simulation, est confiée à la synthèse. La physique du contact, sensible aux erreurs de modèle mais peu dépendante de la position de l'objet, reste réelle. Cela nuance l'idée d'un transfert sim-vers-réel de bout en bout et suggère qu'un découpage par phase est plus rentable. Il faut toutefois relativiser les chiffres. Un taux de 27,5 % sur positions inédites reste très loin d'un seuil industriel, et un gain de 34,3 % sur le temps de collecte est modeste. Les résultats portent sur cinq tâches, avec un échantillon et des conditions de laboratoire dont l'article ne détaille pas ici la variabilité. Le contraste avec les références à 0 % est parlant, mais il dépend du choix de ces références.
L'article s'inscrit dans la série de travaux sur le co-entraînement sim-réel pour les politiques VLA, qui cherchent à réduire la dépendance aux démonstrations réelles, aujourd'hui l'un des principaux postes de coût du déploiement de modèles généralistes. Les approches concurrentes, qui mélangent simulation et réel sur la tâche entière, se heurtent à l'écart de réalité dès que le contact intervient, ce que SARI cherche à contourner. Il s'agit ici d'un résultat de recherche et non d'un produit ni d'un déploiement : aucun partenaire industriel, calendrier de pilote ni code disponible n'est mentionné dans le résumé. Les suites probables sont des validations sur davantage de tâches, de robots et de géométries d'objets, ainsi que des comparaisons avec les VLA généralistes actuels, afin de vérifier si le gain tient hors du cadre expérimental initial.
Pas d\'impact direct sur la France/UE
Dans nos dossiers


