
GDLAM : un modèle d'action latente désenchevêtrée par groupes pour le pré-entraînement incarné
Des chercheurs présentent GDLAM (Group-Disentangled Latent Action Model), décrit dans un preprint arXiv publié le 23 septembre 2026 (arXiv:2609.26118v1, non encore relu par les pairs). Le modèle s'attaque à un défaut connu des latent action models (LAM), ces systèmes qui apprennent des représentations d'action à partir de simples vidéos sans étiquette d'action, par prédiction auto-supervisée du futur. Les LAM classiques compressent dans un seul vecteur latent des sources de changement visuel très différentes (mouvement de caméra, dynamique des objets, événements d'interaction), ce qui produit des représentations mêlées et peu structurées. GDLAM factorise au contraire le code en N groupes distincts, chacun doté de son propre goulot d'étranglement variationnel et d'un routage spatial à porte, entraînés avec des objectifs d'information géométrique : exclusivité mutuelle, sparsité de groupe et de porte, orthogonalité statique-dynamique. Résultat mesuré : intervenir sur un seul groupe ne modifie que ce groupe, et GDLAM améliore nettement les métriques de désentrelacement sans supervision (Modularity, MIG, DCI) face à un LAM non structuré pris comme référence forte, tout en restant plus informatif que les modèles monolithiques sur trois estimateurs d'information mutuelle et une sonde linéaire, y compris hors distribution.
L'enjeu dépasse la métrique académique : les LAM servent de brique de pré-entraînement aux world models et aux politiques VLA (vision-langage-action) qui pilotent la plupart des humanoïdes et bras manipulateurs généralistes actuels. Un code d'action mêlé limite la contrôlabilité des world models et la généralisation des politiques VLA entraînées dessus, un frein direct pour les intégrateurs qui veulent exploiter des vidéos sans annotation d'action, bien plus abondantes et moins coûteuses que la téléopération. Les auteurs montrent que la structuration ne coûte pas d'information : transféré à des world models, GDLAM améliore la fidélité des simulations et le suivi des commandes d'action ; transféré à des politiques VLA, il augmente les taux de réussite sur plusieurs bancs d'essai en simulation et sur des tâches réelles de manipulation. L'abstract ne précise ni plateforme robotique ni nombre de tâches réelles testées, ce qui invite à lire ces résultats comme une preuve de concept plutôt qu'une validation industrielle à grande échelle.
GDLAM prolonge les travaux récents sur le pré-entraînement vidéo auto-supervisé pour la robotique généraliste, un terrain où les pipelines VLA commerciaux, du type de ceux derrière Pi-0, GR00T N2 ou Helix, cherchent justement à réduire leur dépendance aux données téléopérées coûteuses. Le résumé ne mentionne ni affiliation institutionnelle, ni partenaire industriel, ni mise à disposition de code ou de modèles pré-entraînés : il s'agit pour l'instant d'une contribution méthodologique, pas d'un produit ni d'un pilote déployé. Les suites logiques, non détaillées dans l'article, seraient la publication du code, l'extension à davantage de bancs d'essai réels et une comparaison directe avec les LAM utilisés dans les pipelines VLA commerciaux existants.
Dans nos dossiers




