Aller au contenu principal
IA physiquearXiv cs.RO 

GALA : modélisation d'actions latentes tenant compte de la géométrie pour le pré-entraînement de modèles VLA multi-robots

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente GALA (Geometry-Aware Latent Action modeling), un nouveau cadre de pré-entraînement pour les modèles vision-langage-action (VLA), détaillé dans un article publié sur arXiv sous la référence 2609.21948. Le travail s'attaque à une limite connue des modèles à actions latentes (LAM), qui apprennent des représentations d'actions indépendantes de la forme du robot à partir de vidéos hétérogènes, mais échouent à capter les mouvements fins des doigts sur des mains humaines ou robotiques dextres. GALA introduit une représentation appelée UEMR (Unified End-effector Motion Representation), qui combine des actions latentes visuelles classiques, tirées des pixels, avec des actions latentes géométriques calculées à partir de nuages de points 3D de l'effecteur terminal. Cette double supervision permet d'exploiter aussi bien des vidéos robotiques annotées que des vidéos humaines filmées à la première personne, dépourvues d'étiquettes d'action. Les auteurs rapportent un taux de réussite de 68,3% sur le benchmark simulé RoboCasa-GR1 et de 75,5% en conditions réelles, sur des tâches de sondage de mouvement fin et de récupération cross-embodiment. Code, annexe technique et démonstrations vidéo sont publiés sur un site dédié.

L'enjeu dépasse la performance chiffrée: la pénurie de données robotiques annotées reste le principal frein à l'entraînement de VLA généralistes, et la capacité de GALA à exploiter des vidéos humaines non annotées comme source de supervision élargit le réservoir de données exploitables. Le papier pointe aussi une faiblesse des LAM purement basés image, l'approche utilisée jusqu'ici par des familles de modèles comme Pi-0 ou GR00T N2: elles diluent l'information sur l'articulation fine des mains dans une représentation de scène trop globale, ce qui pénalise la manipulation dextre précise. En montrant qu'une composante géométrique 3D améliore le transfert entre embodiments sans nuire à la généralisation, GALA apporte un argument empirique pour un socle VLA unique couvrant bras industriels, mains dextres et démonstrations humaines filmées, plutôt qu'un modèle par plateforme.

Ce travail prolonge la lignée des modèles à actions latentes apparus pour contourner l'hétérogénéité des espaces d'action robotiques, jusqu'ici construits sur la seule base d'images 2D. En y ajoutant la géométrie 3D de l'effecteur terminal, les auteurs se positionnent face aux grandes familles de VLA cross-embodiment en compétition, telles que Pi-0, GR00T N2 ou Helix, sans toutefois publier de comparatif chiffré direct avec ces systèmes. À ce stade, GALA reste une contribution de recherche accompagnée de code ouvert et de démonstrations, non un produit ni un pilote industriel: aucun calendrier de déploiement ni partenariat n'est communiqué, et la validation "réelle" citée correspond à des essais en laboratoire plutôt qu'à un déploiement en usine ou en entrepôt.

À lire aussi

X-Tokenizer : tokenizer d'actions multimodal pour le pré-entraînement VLA
1arXiv cs.RO 

X-Tokenizer : tokenizer d'actions multimodal pour le pré-entraînement VLA

Des chercheurs ont publié fin juin 2026 sur arXiv (2606.14752) les résultats de X-Tokenizer, une architecture légère de type encodeur-SRQ-décodeur conçue pour améliorer la couche d'interface entre le raisonnement visio-linguistique et le contrôle moteur continu des bras robotiques. Le système introduit une technique appelée Semantic Residual Quantization (SRQ), une variante asymétrique de la quantification vectorielle résiduelle classique : le premier niveau est entraîné via un mécanisme de Masked Action Modeling (MAM) pour former un "langage d'actions" discret capturant l'intention de mouvement à gros grain, tandis que les niveaux suivants restent orientés reconstruction pour préserver les détails fins. X-Tokenizer a été pré-entraîné sur 2,4 millions de trajectoires, soit 2,0 milliards de frames d'actions, couvrant des bras robotiques d'embodiments variés. Une fois gelé, il se branche comme signal de supervision dans un VLA hybride discret-continu. Les résultats rapportés sur RoboTwin 2.0 et sur des benchmarks réels montrent des performances de premier rang en agrégat, avec +13,5 % de grounding multimodal et +8,25 points sur les tâches long-horizon par rapport au tokenizer FAST, référence actuelle du domaine. L'enjeu central est ce qu'on appelle le "demo-to-deployment gap" dans les modèles Vision-Language-Action : des VLA comme pi-0, GR00T N2 ou OpenVLA apprennent à raisonner en langage naturel mais peinent à traduire ce raisonnement en commandes motrices précises et stables. Les tokenizers d'action existants se contentent de comprimer les trajectoires pour les reconstruire fidèlement, sans ancrer les codes discrets dans la sémantique du backbone visio-linguistique. Ce que démontre X-Tokenizer, c'est qu'il est possible de faire des tokens d'action des objets sémantiquement cohérents avec le reste du modèle, en ajoutant un alignement contrastif vers l'espace de représentation d'un modèle fondationnel et une prédiction de features visio-linguistiques sur la frame suivante. L'impact pour les intégrateurs et les chercheurs est direct : un tokenizer partagé, gelé et interchangeable entre embodiments réduit le coût de fine-tuning par robot tout en améliorant la robustesse sur les tâches multi-étapes. Du côté du contexte compétitif, la tokenisation d'actions est devenue un verrou clé dans la course aux VLA généralistes depuis 2024. FAST (Fourier Action Sequence Tokenizer, DeepMind) s'est imposé comme baseline de référence en représentation fréquentielle des trajectoires. Des approches comme ACT (Action Chunking with Transformers) ou GROOT ont montré des gains sur des tâches courtes, mais les tâches longues restent difficiles faute de supervision sémantique cohérente. X-Tokenizer se positionne explicitement comme une alternative à FAST sur ce point précis. À noter que les gains annoncés (+13,5 %, +8,25) sont mesurés sur des benchmarks spécifiques et sur une sélection de tâches ; la généralisation à des environnements industriels non structurés reste à démontrer. Aucune timeline de déploiement ni partenaire industriel n'est mentionné dans le papier, ce qui situe ce travail clairement dans la phase recherche, non dans celle du produit expédié.

IA physiqueOpinion
1 source
Dépasser le raccourci vision-action : entraînement par interface latente pour des modèles fondation robotiques généralisables
2arXiv cs.RO 

Dépasser le raccourci vision-action : entraînement par interface latente pour des modèles fondation robotiques généralisables

Un preprint arXiv publié en septembre 2026 (arXiv:2609.12641) présente Latent Interface Training (LIT), méthode en deux étapes pour corriger un biais fréquent des modèles robotiques vision-langage-action. La première étape entraîne l'expert d'action à produire des séquences de gestes à partir du langage, de l'état du robot et de la pose terminale SE(3) de l'effecteur, sans image, pour ancrer l'objectif dans l'espace plutôt que dans le pixel. La seconde étape ajoute une interface latente, unique canal de conditionnement visuel du modèle, entraînée à reconstruire cette même pose terminale. Appliqué à quatre architectures, Pi0.5, MolmoAct2, FAST-WAM et ImageWAM, LIT améliore le taux de réussite de 3,87 à 10,70 points sur le benchmark simulé LIBERO-Plus, et de 13,30 à 16,70 points en conditions réelles sur trois tâches testées avec caméra, éclairage et distracteurs modifiés. Ce biais, dit raccourci vision-action, survient quand un modèle entraîné par imitation s'appuie sur des indices visuels fortuits corrélés aux actions démontrées plutôt que sur la logique spatiale réelle de la tâche, ce qui explique en partie l'écart entre les démonstrations en laboratoire de modèles comme Pi-0, GR00T N2 ou Helix et leurs performances une fois la caméra, l'éclairage ou le décor changés. Agnostique au framework, LIT s'applique sans refonte à quatre architectures distinctes, offrant une piste de correction générique pour les intégrateurs qui déploient ces modèles hors des conditions de collecte des données d'entraînement. Le fait que les gains réels dépassent les gains simulés confirme aussi que des benchmarks comme LIBERO tendent à sous-estimer la fragilité de ces politiques face aux changements de scène. Le travail s'inscrit dans la vague des modèles de fondation robotiques préentraînés à grande échelle, aux côtés de la lignée Pi-0/Pi0.5 chez Physical Intelligence, de GR00T N2 chez NVIDIA ou de Helix chez Figure AI, tous confrontés au même problème de généralisation hors distribution une fois sortis du laboratoire. LIT se présente comme une correction méthodologique applicable par-dessus des architectures existantes, dont MolmoAct2, plutôt que comme un nouveau modèle autonome. Il s'agit pour l'instant d'un preprint non revu par les pairs, validé sur un seul benchmark simulé et trois tâches réelles, sans calendrier de déploiement industriel annoncé à ce stade.

IA physiqueActu
1 source
Déploiement d'actions accru grâce à l'entraînement compositionnel pour les modèles VLA
3arXiv cs.RO 

Déploiement d'actions accru grâce à l'entraînement compositionnel pour les modèles VLA

Une équipe de chercheurs propose ACT-VLA (Action Compositional Training for VLA Models), un nouveau cadre d'entraînement présenté dans un article publié sur arXiv (2607.00351v1) début juillet 2026. Le problème visé est bien connu des équipes travaillant sur les modèles Vision-Language-Action (VLA) pour la manipulation robotique : ces modèles, entraînés sur de larges jeux de démonstrations, généralisent mal dès qu'une tâche exige de recombiner des sous-compétences déjà apprises individuellement, même sans réel changement de contexte physique. ACT-VLA s'attaque à ce défaut de généralisation compositionnelle sans collecter de nouvelles données humaines : la méthode exploite les représentations latentes de tâches déjà apprises par le modèle pour synthétiser hors ligne de nouvelles démonstrations, physiquement valides, à partir de tâches existantes. Les auteurs valident l'approche sur des tâches de manipulation complexes en simulation, où les politiques entraînées avec les données augmentées obtiennent des taux de réussite nettement supérieurs à ceux des modèles de référence en situation hors distribution. L'enjeu dépasse le simple exercice académique : la collecte de données robotiques réelles, via téléopération humaine, reste le goulot d'étranglement majeur pour les VLA, coûteux en temps comme en main-d'œuvre. Une méthode capable d'étendre automatiquement la distribution d'entraînement, sans supervision additionnelle, offrirait une voie de mise à l'échelle bien moins coûteuse que celle suivie par les modèles généralistes actuels type Pi-0, GR00T N2 ou Helix, qui misent avant tout sur le volume brut de démonstrations collectées. Reste que la validation s'arrête ici à la simulation : aucun déploiement sur robot physique n'est rapporté, ce qui laisse ouverte la question du transfert sim-to-real. ACT-VLA s'inscrit dans la lignée des travaux cherchant à corriger les limites de généralisation des architectures VLA de type RT-2 ou OpenVLA. L'article ne précise ni l'institution porteuse ni de calendrier de suite ; la prochaine étape logique consisterait à tester la méthode sur du matériel réel pour confirmer que les gains observés en simulation résistent au bruit et aux imprécisions du monde physique.

IA physiqueActu
1 source
CLAP : pré-entraînement contrastif par actions latentes pour l'apprentissage de modèles VLA à partir de vidéos humaines
4arXiv cs.RO 

CLAP : pré-entraînement contrastif par actions latentes pour l'apprentissage de modèles VLA à partir de vidéos humaines

Des chercheurs ont soumis sur arXiv (2601.04061v2, janvier 2026) un framework appelé CLAP, pour Contrastive Latent Action Pretraining, conçu pour entraîner des modèles Vision-Language-Action (VLA) généralistes à partir de vidéos humaines non étiquetées. Le pipeline repose sur deux étapes: un module Act-VAE construit d'abord un vocabulaire d'actions exécutables à partir de trajectoires robotiques existantes, puis un apprentissage contrastif aligne les transitions visuelles extraites de vidéos humaines sur ce vocabulaire latent, pseudo-étiquetant ainsi ces vidéos sans collecte téléopérée supplémentaire. Sur cette base, CLAP-NTP est entraîné comme VLA autorégressif combinant démonstrations robotiques réelles et vidéos humaines étiquetées. Pour le déploiement, CLAP-RF ajoute une tête à flux rectifié (Rectified Flow) permettant la prédiction de chunks d'actions continus à faible latence, couplée à une régularisation dite Knowledge Matching qui préserve les connaissances sémantiques préentraînées lors du fine-tuning sur domaine cible. L'obstacle central des VLA généralistes reste la rareté des données robotiques étiquetées face à l'abondance de vidéos humaines disponibles en ligne. Les approches antérieures de type Latent Action Models tentaient d'exploiter ces vidéos mais encodaient du bruit visuel plutôt que des compétences de manipulation réelles, un problème qualifié d'enchevêtrement visuel (visual entanglement). CLAP contourne cette limitation en ancrant l'espace latent sur des trajectoires physiquement fondées via l'apprentissage contrastif, sans reconstruire l'apparence. Pour les intégrateurs industriels, la promesse concrète est de réduire le coût de collecte téléopérée, estimé à plusieurs milliers de dollars par heure, tout en améliorant la généralisation à de nouveaux objets sans démonstrations robotiques exhaustives. Les résultats expérimentaux rapportés montrent de bonnes performances face aux baselines comparatives, mais la validation externe reste à confirmer. Le domaine des VLA est en pleine effervescence depuis l'émergence de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA), OpenVLA et Helix (Figure AI), tous confrontés à la même pénurie de données étiquetées exploitables. Google DeepMind a exploré des voies similaires avec des travaux comme UniSim. CLAP se distingue en proposant une approche plus physiquement ancrée que les méthodes purement génératives ou reconstructrices. Ce preprint n'a pas encore été évalué par les pairs et n'annonce aucun déploiement en production. Les prochaines étapes naturelles seraient une validation sur un éventail plus large de plateformes robotiques ainsi qu'une comparaison systématique avec les Diffusion Policies, méthodes actuellement dominantes sur les benchmarks Open X-Embodiment.

IA physiqueActu
1 source