Aller au contenu principal
Déploiement d'actions accru grâce à l'entraînement compositionnel pour les modèles VLA
IA physiquearXiv cs.RO 

Déploiement d'actions accru grâce à l'entraînement compositionnel pour les modèles VLA

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs propose ACT-VLA (Action Compositional Training for VLA Models), un nouveau cadre d'entraînement présenté dans un article publié sur arXiv (2607.00351v1) début juillet 2026. Le problème visé est bien connu des équipes travaillant sur les modèles Vision-Language-Action (VLA) pour la manipulation robotique : ces modèles, entraînés sur de larges jeux de démonstrations, généralisent mal dès qu'une tâche exige de recombiner des sous-compétences déjà apprises individuellement, même sans réel changement de contexte physique. ACT-VLA s'attaque à ce défaut de généralisation compositionnelle sans collecter de nouvelles données humaines : la méthode exploite les représentations latentes de tâches déjà apprises par le modèle pour synthétiser hors ligne de nouvelles démonstrations, physiquement valides, à partir de tâches existantes. Les auteurs valident l'approche sur des tâches de manipulation complexes en simulation, où les politiques entraînées avec les données augmentées obtiennent des taux de réussite nettement supérieurs à ceux des modèles de référence en situation hors distribution.

L'enjeu dépasse le simple exercice académique : la collecte de données robotiques réelles, via téléopération humaine, reste le goulot d'étranglement majeur pour les VLA, coûteux en temps comme en main-d'œuvre. Une méthode capable d'étendre automatiquement la distribution d'entraînement, sans supervision additionnelle, offrirait une voie de mise à l'échelle bien moins coûteuse que celle suivie par les modèles généralistes actuels type Pi-0, GR00T N2 ou Helix, qui misent avant tout sur le volume brut de démonstrations collectées. Reste que la validation s'arrête ici à la simulation : aucun déploiement sur robot physique n'est rapporté, ce qui laisse ouverte la question du transfert sim-to-real.

ACT-VLA s'inscrit dans la lignée des travaux cherchant à corriger les limites de généralisation des architectures VLA de type RT-2 ou OpenVLA. L'article ne précise ni l'institution porteuse ni de calendrier de suite ; la prochaine étape logique consisterait à tester la méthode sur du matériel réel pour confirmer que les gains observés en simulation résistent au bruit et aux imprécisions du monde physique.

À lire aussi

GALA : modélisation d'actions latentes tenant compte de la géométrie pour le pré-entraînement de modèles VLA multi-robots
1arXiv cs.RO 

GALA : modélisation d'actions latentes tenant compte de la géométrie pour le pré-entraînement de modèles VLA multi-robots

Une équipe de recherche présente GALA (Geometry-Aware Latent Action modeling), un nouveau cadre de pré-entraînement pour les modèles vision-langage-action (VLA), détaillé dans un article publié sur arXiv sous la référence 2609.21948. Le travail s'attaque à une limite connue des modèles à actions latentes (LAM), qui apprennent des représentations d'actions indépendantes de la forme du robot à partir de vidéos hétérogènes, mais échouent à capter les mouvements fins des doigts sur des mains humaines ou robotiques dextres. GALA introduit une représentation appelée UEMR (Unified End-effector Motion Representation), qui combine des actions latentes visuelles classiques, tirées des pixels, avec des actions latentes géométriques calculées à partir de nuages de points 3D de l'effecteur terminal. Cette double supervision permet d'exploiter aussi bien des vidéos robotiques annotées que des vidéos humaines filmées à la première personne, dépourvues d'étiquettes d'action. Les auteurs rapportent un taux de réussite de 68,3% sur le benchmark simulé RoboCasa-GR1 et de 75,5% en conditions réelles, sur des tâches de sondage de mouvement fin et de récupération cross-embodiment. Code, annexe technique et démonstrations vidéo sont publiés sur un site dédié. L'enjeu dépasse la performance chiffrée: la pénurie de données robotiques annotées reste le principal frein à l'entraînement de VLA généralistes, et la capacité de GALA à exploiter des vidéos humaines non annotées comme source de supervision élargit le réservoir de données exploitables. Le papier pointe aussi une faiblesse des LAM purement basés image, l'approche utilisée jusqu'ici par des familles de modèles comme Pi-0 ou GR00T N2: elles diluent l'information sur l'articulation fine des mains dans une représentation de scène trop globale, ce qui pénalise la manipulation dextre précise. En montrant qu'une composante géométrique 3D améliore le transfert entre embodiments sans nuire à la généralisation, GALA apporte un argument empirique pour un socle VLA unique couvrant bras industriels, mains dextres et démonstrations humaines filmées, plutôt qu'un modèle par plateforme. Ce travail prolonge la lignée des modèles à actions latentes apparus pour contourner l'hétérogénéité des espaces d'action robotiques, jusqu'ici construits sur la seule base d'images 2D. En y ajoutant la géométrie 3D de l'effecteur terminal, les auteurs se positionnent face aux grandes familles de VLA cross-embodiment en compétition, telles que Pi-0, GR00T N2 ou Helix, sans toutefois publier de comparatif chiffré direct avec ces systèmes. À ce stade, GALA reste une contribution de recherche accompagnée de code ouvert et de démonstrations, non un produit ni un pilote industriel: aucun calendrier de déploiement ni partenariat n'est communiqué, et la validation "réelle" citée correspond à des essais en laboratoire plutôt qu'à un déploiement en usine ou en entrepôt.

IA physiqueActu
1 source
MolmoAct2 : un modèle de raisonnement d'action pour le déploiement réel
2arXiv cs.RO 

MolmoAct2 : un modèle de raisonnement d'action pour le déploiement réel

L'Allen Institute for Artificial Intelligence (AllenAI) a publié MolmoAct2 en mai 2025, un modèle VLA (Vision-Language-Action) entièrement open source conçu pour le déploiement robotique en conditions réelles. Cinq contributions structurent le système : MolmoER, un backbone visio-linguistique entraîné sur 3,3 millions d'exemples spécialisés en raisonnement spatial et incarné ; MolmoAct2-BimanualYAM, 720 heures de trajectoires de manipulation bimanuelle téléopérées sur plateformes à coût modéré (SO100/101 et sous-ensembles Franka DROID), le plus grand corpus bimanuel ouvert à ce jour ; OpenFAST, un tokeniseur d'actions open weight couvrant cinq types d'embodiments ; une architecture hybride couplant un expert à actions continues par flow-matching à un VLM à tokens discrets via conditionnement KV-cache couche par couche ; et MolmoThink, qui ne recalcule les tokens de profondeur géométrique que pour les zones de scène modifiées entre deux pas de temps, réduisant la latence d'inférence. Sur sept benchmarks mêlant simulation et environnements réels, MolmoAct2 surpasse Pi-0.5 de Physical Intelligence ; MolmoER dépasse GPT-5 et Gemini Robotics ER-1.5 d'Alphabet sur treize benchmarks de raisonnement incarné. Poids, code et données d'entraînement sont publiés intégralement. La publication s'attaque à quatre verrous concrets du déploiement des VLA : modèles frontier fermés, dépendance à du matériel onéreux, latence prohibitive des politiques augmentées par raisonnement, et taux de succès trop bas pour un usage fiable en production. La mise à disposition simultanée des poids, du code d'entraînement et des données complètes reste rare dans un domaine largement dominé par le propriétaire. Ces 720 heures de données sur plateformes abordables élargissent l'accès à un corpus bimanuel jusqu'ici réservé à des setups coûteux. MolmoThink représente une approche concrète pour rendre le raisonnement géométrique compatible avec les contraintes temps-réel des contrôleurs embarqués. Il faut cependant souligner que ces performances sont mesurées sur benchmarks académiques : aucun déploiement industriel validé n'est annoncé dans cet article. AllenAI, institut non lucratif cofondé par Paul Allen à Seattle, avait publié le modèle Molmo fin 2024 avant d'étendre ses travaux au contrôle robotique avec MolmoAct. MolmoAct2 s'inscrit dans un paysage VLA dominé par des acteurs fermés : Physical Intelligence (Pi-0, Pi-0.5), Google DeepMind (Gemini Robotics, RT-2) et des équipes d'OpenAI dont les développements robotiques restent non publiés. Dans l'espace open source, il concurrence OpenVLA et Octo, avec l'avantage d'un corpus bimanuel inédit et d'un tokeniseur multi-embodiments standardisé. Aucun pilote commercial n'est annoncé ; la publication cible en priorité les équipes universitaires et les startups robotiques cherchant à s'affranchir de la dépendance aux modèles propriétaires.

UELa publication intégrale des poids, du code et des données réduit la dépendance des équipes universitaires et startups européennes aux modèles VLA propriétaires, offrant un accès immédiat au plus grand corpus bimanuel ouvert à ce jour.

💬 AllenAI publie les poids, le code et les données d'entraînement, et ça reste rarissime dans un domaine où les gros jouent à guichet fermé. 720 heures de manipulation bimanuelle sur du matériel accessible, un tokeniseur multi-embodiments open weight, et des scores au-dessus de Pi-0.5 et GPT-5 sur les benchmarks incarnés : les startups robotiques qui n'ont pas le budget Physical Intelligence vont s'en saisir. Bon, aucun déploiement industriel validé pour l'instant.

IA physiqueOpinion
1 source
CAC-VLA : un conditionnement d'action contrôlé par le contexte pour les modèles vision-langage-action
3arXiv cs.RO 

CAC-VLA : un conditionnement d'action contrôlé par le contexte pour les modèles vision-langage-action

Des chercheurs proposent CAC-VLA (Context-Gated Action Conditioning), une nouvelle architecture pour les modèles vision-langage-action (VLA), la famille de systèmes qui pilote de plus en plus de bras et robots humanoïdes generalistes. Le problème identifié: dans les VLA classiques, les représentations visuelles et langagières ne sont pas pensées pour guider directement le contrôle moteur, ce qui laisse à «l'expert action» (le module qui génère la trajectoire) la charge de combler cet écart. Des méthodes récentes tentent de corriger cela avec des modules de raisonnement d'action séparés, mais elles nécessitent des architectures dédiées supplémentaires. CAC-VLA prend une autre voie: il entraîne le modèle vision-langage lui-même à prédire des actions latentes, des représentations compactes encodées à partir de segments d'action futurs, du grossier au fin, puis utilise une «porte de contexte» pour doser en temps réel l'influence de ce signal sur l'expert d'action. Sur les bancs d'essai LIBERO et LIBERO-Plus, la méthode atteint respectivement 98,3% et 89,5% de taux de réussite moyen. Pour l'industrie robotique, l'enjeu dépasse le simple gain de quelques points de benchmark. Le goulot d'étranglement entre compréhension multimodale et motricité précise est l'un des obstacles centraux à la généralisation des VLA au-delà de tâches scriptées, un sujet suivi de près par les équipes qui travaillent sur des systèmes comme π0, GR00T N2 ou Helix. Une interface qui intègre le raisonnement d'action directement dans le VLM, sans framework de génération séparé, simplifierait l'entraînement et le déploiement de ces piles logicielles chez les intégrateurs, réduisant la complexité d'ingénierie souvent invoquée comme frein à la mise en production. Ces résultats restent toutefois obtenus en simulation, sur des suites de tâches standardisées et non sur du matériel réel en usine ou en entrepôt, une nuance importante alors que le secteur multiplie les annonces de percées en manipulation générale. LIBERO et sa variante LIBERO-Plus servent de référence commune pour comparer les approches d'action-conditioning, et la prochaine étape logique pour valider l'intérêt de CAC-VLA sera sa transposition sur des robots physiques et des tâches de manipulation en conditions réelles.

IA physiqueActu
1 source
CLAP : pré-entraînement contrastif par actions latentes pour l'apprentissage de modèles VLA à partir de vidéos humaines
4arXiv cs.RO 

CLAP : pré-entraînement contrastif par actions latentes pour l'apprentissage de modèles VLA à partir de vidéos humaines

Des chercheurs ont soumis sur arXiv (2601.04061v2, janvier 2026) un framework appelé CLAP, pour Contrastive Latent Action Pretraining, conçu pour entraîner des modèles Vision-Language-Action (VLA) généralistes à partir de vidéos humaines non étiquetées. Le pipeline repose sur deux étapes: un module Act-VAE construit d'abord un vocabulaire d'actions exécutables à partir de trajectoires robotiques existantes, puis un apprentissage contrastif aligne les transitions visuelles extraites de vidéos humaines sur ce vocabulaire latent, pseudo-étiquetant ainsi ces vidéos sans collecte téléopérée supplémentaire. Sur cette base, CLAP-NTP est entraîné comme VLA autorégressif combinant démonstrations robotiques réelles et vidéos humaines étiquetées. Pour le déploiement, CLAP-RF ajoute une tête à flux rectifié (Rectified Flow) permettant la prédiction de chunks d'actions continus à faible latence, couplée à une régularisation dite Knowledge Matching qui préserve les connaissances sémantiques préentraînées lors du fine-tuning sur domaine cible. L'obstacle central des VLA généralistes reste la rareté des données robotiques étiquetées face à l'abondance de vidéos humaines disponibles en ligne. Les approches antérieures de type Latent Action Models tentaient d'exploiter ces vidéos mais encodaient du bruit visuel plutôt que des compétences de manipulation réelles, un problème qualifié d'enchevêtrement visuel (visual entanglement). CLAP contourne cette limitation en ancrant l'espace latent sur des trajectoires physiquement fondées via l'apprentissage contrastif, sans reconstruire l'apparence. Pour les intégrateurs industriels, la promesse concrète est de réduire le coût de collecte téléopérée, estimé à plusieurs milliers de dollars par heure, tout en améliorant la généralisation à de nouveaux objets sans démonstrations robotiques exhaustives. Les résultats expérimentaux rapportés montrent de bonnes performances face aux baselines comparatives, mais la validation externe reste à confirmer. Le domaine des VLA est en pleine effervescence depuis l'émergence de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA), OpenVLA et Helix (Figure AI), tous confrontés à la même pénurie de données étiquetées exploitables. Google DeepMind a exploré des voies similaires avec des travaux comme UniSim. CLAP se distingue en proposant une approche plus physiquement ancrée que les méthodes purement génératives ou reconstructrices. Ce preprint n'a pas encore été évalué par les pairs et n'annonce aucun déploiement en production. Les prochaines étapes naturelles seraient une validation sur un éventail plus large de plateformes robotiques ainsi qu'une comparaison systématique avec les Diffusion Policies, méthodes actuellement dominantes sur les benchmarks Open X-Embodiment.

IA physiqueActu
1 source