GALA : modélisation d'actions latentes tenant compte de la géométrie pour le pré-entraînement de modèles VLA multi-robots
Une équipe de recherche présente GALA (Geometry-Aware Latent Action modeling), un nouveau cadre de pré-entraînement pour les modèles vision-langage-action (VLA), détaillé dans un article publié sur arXiv sous la référence 2609.21948. Le travail s'attaque à une limite connue des modèles à actions latentes (LAM), qui apprennent des représentations d'actions indépendantes de la forme du robot à partir de vidéos hétérogènes, mais échouent à capter les mouvements fins des doigts sur des mains humaines ou robotiques dextres. GALA introduit une représentation appelée UEMR (Unified End-effector Motion Representation), qui combine des actions latentes visuelles classiques, tirées des pixels, avec des actions latentes géométriques calculées à partir de nuages de points 3D de l'effecteur terminal. Cette double supervision permet d'exploiter aussi bien des vidéos robotiques annotées que des vidéos humaines filmées à la première personne, dépourvues d'étiquettes d'action. Les auteurs rapportent un taux de réussite de 68,3% sur le benchmark simulé RoboCasa-GR1 et de 75,5% en conditions réelles, sur des tâches de sondage de mouvement fin et de récupération cross-embodiment. Code, annexe technique et démonstrations vidéo sont publiés sur un site dédié.
L'enjeu dépasse la performance chiffrée: la pénurie de données robotiques annotées reste le principal frein à l'entraînement de VLA généralistes, et la capacité de GALA à exploiter des vidéos humaines non annotées comme source de supervision élargit le réservoir de données exploitables. Le papier pointe aussi une faiblesse des LAM purement basés image, l'approche utilisée jusqu'ici par des familles de modèles comme Pi-0 ou GR00T N2: elles diluent l'information sur l'articulation fine des mains dans une représentation de scène trop globale, ce qui pénalise la manipulation dextre précise. En montrant qu'une composante géométrique 3D améliore le transfert entre embodiments sans nuire à la généralisation, GALA apporte un argument empirique pour un socle VLA unique couvrant bras industriels, mains dextres et démonstrations humaines filmées, plutôt qu'un modèle par plateforme.
Ce travail prolonge la lignée des modèles à actions latentes apparus pour contourner l'hétérogénéité des espaces d'action robotiques, jusqu'ici construits sur la seule base d'images 2D. En y ajoutant la géométrie 3D de l'effecteur terminal, les auteurs se positionnent face aux grandes familles de VLA cross-embodiment en compétition, telles que Pi-0, GR00T N2 ou Helix, sans toutefois publier de comparatif chiffré direct avec ces systèmes. À ce stade, GALA reste une contribution de recherche accompagnée de code ouvert et de démonstrations, non un produit ni un pilote industriel: aucun calendrier de déploiement ni partenariat n'est communiqué, et la validation "réelle" citée correspond à des essais en laboratoire plutôt qu'à un déploiement en usine ou en entrepôt.
Dans nos dossiers




