
Amélioration du transfert inter-incarnations dans les modèles d'action latente par supervision de similarité d'action
Une équipe de chercheurs propose une nouvelle méthode d'entraînement pour les modèles d'actions latentes (latent action models, LAM), décrite dans un article publié le 18 septembre 2026 sur arXiv (référence 2609.19846v1) et intitulé "Improving Cross-embodiment Transfer in Latent Action Models with Action-Similarity Supervision". Les LAM apprennent des représentations d'actions à partir de vidéos sans étiquette de commande motrice, ce qui permettrait en théorie de partager des données d'entraînement entre robots différents. Problème identifié: ces modèles restent sensibles au bruit visuel de l'arrière-plan et encodent souvent un même mouvement physique avec des latents différents selon le robot qui l'exécute. Plutôt que d'ajouter une perte auxiliaire qui prédit directement l'action réelle du robot à partir du latent (méthode existante), les auteurs entraînent la similarité entre deux actions latentes à correspondre à la similarité entre les séquences d'actions réelles correspondantes, sans jamais faire prédire ces actions par le modèle. Testée sur le benchmark de simulation RoboTwin 2.0, avec deux robots bimanuels démontrant des tâches disjointes et une politique unique évaluée en boucle fermée sur les tâches que seul l'autre robot a démontrées, cette approche double plus que le taux de succès en transfert cross-embodiment par rapport à une politique entraînée sur les actions réelles. La supervision par similarité surpasse aussi la perte auxiliaire classique à données égales, et calculer les similarités sur le mouvement de l'effecteur terminal plutôt que dans l'espace articulaire donne les meilleurs résultats.
Ce résultat vise un goulot d'étranglement central des politiques vision-language-action (VLA): la démonstration téléopérée reste coûteuse et généralement liée à une plateforme robotique précise, ce qui freine le passage à l'échelle des politiques génériques face à des flottes hétérogènes (bras industriels, humanoïdes, robots mobiles). En montrant qu'un signal de similarité, plutôt qu'une prédiction directe d'action, réduit la fuite d'informations spécifiques au robot dans l'espace latent, l'étude apporte une preuve de concept utile aux équipes de recherche travaillant sur le transfert de compétences entre embodiments, sans prétendre résoudre le problème en conditions réelles.
Il s'agit à ce stade d'un résultat de recherche en simulation, non d'un produit ou d'un déploiement industriel: RoboTwin 2.0 est un environnement de test standardisé pour robots bimanuels, et l'évaluation porte sur deux plateformes simulées avec des tâches contrôlées, un cadre plus restreint que des conditions de terrain réelles. Le travail s'inscrit dans la lignée des efforts récents sur les LAM entraînés à partir de vidéos non annotées (dans la veine de travaux comme Genie ou LAPA côté recherche), une piste explorée en parallèle par des laboratoires développant des modèles VLA à grande échelle tels que Pi-0 ou GR00T. Les auteurs ne annoncent pas de suite commerciale ni de calendrier de transfert vers du matériel physique.
Dans nos dossiers




