Aller au contenu principal
IA physiquearXiv cs.RO 

Rapide et précis : un système d'inférence VLA adaptatif par sélection de modèle selon l'environnement

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié le 6 août 2026 sur arXiv (référence 2608.06434) EMS (Environment-aware Model Selection), un framework d'inférence pour modèles Vision-Language-Action (VLA). Son architecture combine deux systèmes découplés : un module délibératif de grande taille qui planifie des trajectoires globalement cohérentes pour garantir la réussite des tâches, et un module réactif léger assurant un contrôle en boucle fermée à haute fréquence. Une politique de commutation entraînée par apprentissage par renforcement choisit en temps réel, selon le retour capteur, quel module activer, limitant le recours au module lourd. Sur le benchmark de simulation LIBERO, EMS égale les taux de réussite d'un modèle de référence de grande taille tout en portant la fréquence de contrôle effective à 93,4 Hz, et accélère l'exécution de tâches réelles de manipulation bi-bras sans perte de robustesse.

Ce résultat s'attaque à un problème des VLA dits « dual-system », popularisés par des architectures comme Helix (Figure AI) ou π-0 (Physical Intelligence) : jusqu'ici, coupler un module rapide à un module lent imposait un entraînement conjoint de bout en bout qui figeait les deux composants, empêchant de remplacer l'un sans réentraîner l'autre. En rendant les deux systèmes interchangeables, EMS ouvre la voie à une approche modulaire où un intégrateur pourrait associer un planificateur générique à un contrôleur réactif propre à son robot. Pour les équipes qui déploient des VLA en usine ou en entrepôt, la fréquence de contrôle conditionne la fluidité des mouvements : EMS montre qu'il est possible de préserver le raisonnement d'un grand modèle en s'approchant des fréquences d'une boucle robotique classique, sans sacrifier la modularité.

L'approche prolonge les architectures VLA « System 1 / System 2 », déjà explorées par NVIDIA avec GR00T N1 ou par les frameworks hiérarchiques de Physical Intelligence et Figure. Contrairement à ces annonces commerciales, EMS reste une prépublication arXiv évaluée surtout en simulation et sur un nombre limité de tâches réelles à deux bras, sans indication sur l'institution des auteurs ni sur le matériel utilisé. Le chiffre de 93,4 Hz, mis en avant comme résultat phare, reste à confirmer sur des plateformes commerciales et face aux systèmes dual-system déjà déployés par les acteurs du secteur.

À lire aussi

LaST-R1 : renforcement de l'action par raisonnement latent physique adaptatif pour les modèles VLA
1arXiv cs.RO 

LaST-R1 : renforcement de l'action par raisonnement latent physique adaptatif pour les modèles VLA

Des chercheurs ont publié le 29 avril 2026 sur arXiv (2604.28192) un nouveau cadre pour les modèles Vision-Langage-Action (VLA) baptisé LaST-R1, accompagné d'un algorithme d'apprentissage par renforcement inédit appelé LAPO (Latent-to-Action Policy Optimization). Le système atteint un taux de succès moyen de 99,8 % sur le benchmark de manipulation robotique LIBERO, après un unique épisode d'imitation supervisée en guise d'amorçage. En déploiement réel sur quatre tâches complexes, dont des configurations monobranche et bras-double, LAPO améliore les performances de 44 % par rapport à la politique issue de cet amorçage initial. L'apport central de LaST-R1 est de relier explicitement le raisonnement sur la physique à la génération d'actions, là où les approches existantes traitaient ces deux étapes séparément. Les VLA actuels raisonnent soit en langage naturel (coûteux en latence et discret), soit dans un espace latent continu, mais dans les deux cas par imitation statique, sans capacité d'adaptation par essais-erreurs. LAPO co-optimise simultanément le processus de raisonnement latent et la production d'actions via du renforcement en ligne, ce qui améliore la modélisation du monde physique et la robustesse en environnement interactif. Un mécanisme de "latent Chain-of-Thought adaptatif" permet en outre au modèle d'ajuster dynamiquement son horizon de raisonnement selon la complexité de la situation, sans coût fixe à chaque pas. Il s'agit d'une annonce académique sous forme de preprint, pas encore d'un produit embarqué sur robot commercial. Ce travail s'inscrit dans la course à la généralisation des VLA, portée ces derniers mois par des modèles comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou OpenVLA. L'un des verrous récurrents du secteur est l'écart simulation-réalité (sim-to-real gap) et la difficulté à faire converger rapidement un modèle en conditions réelles sans millions d'épisodes supervisés. LaST-R1 revendique une convergence significativement accélérée grâce à l'optimisation jointe du raisonnement latent, une piste que suivent aussi des équipes européennes travaillant sur l'apprentissage par renforcement pour la manipulation, notamment dans l'orbite des laboratoires universitaires français. Les prochaines étapes naturelles seront la validation sur des benchmarks plus diversifiés (AgiBot World, RLBench) et l'intégration dans des plateformes matérielles commerciales.

UELes laboratoires français et européens travaillant sur la manipulation robotique par apprentissage par renforcement peuvent s'appuyer sur l'approche LAPO pour réduire leur dépendance aux grandes quantités de données supervisées, accélérant potentiellement leurs cycles de recherche.

IA physiqueOpinion
1 source
VLA-Corrector : inférence légère de détection-correction pour un horizon d'action adaptatif
2arXiv cs.RO 

VLA-Corrector : inférence légère de détection-correction pour un horizon d'action adaptatif

Des chercheurs présentent VLA-Corrector, un module de correction en ligne pour les modèles vision-langage-action (VLA) utilisés en robotique manipulatrice, décrit dans un article publié sur arXiv (2607.01804) début juillet 2026. Le problème visé est celui du "chunking" d'actions : pour limiter la fréquence d'appel au modèle, la plupart des politiques VLA génératives prédisent un bloc de plusieurs actions futures et les exécutent en boucle ouverte, sans réévaluation intermédiaire. Or dans les tâches à contact riche (préhension, insertion, manipulation fine), une simple perturbation locale peut s'amplifier pendant cette fenêtre "aveugle" et faire échouer la tâche par accumulation d'erreurs. VLA-Corrector ajoute deux briques légères sans toucher aux poids du modèle de base : un moniteur visuel en espace latent (LVM) qui compare en continu l'évolution visuelle prédite et réelle pour détecter les écarts de dynamique, et un mécanisme de replanification par gradient en ligne (OGG) qui, en cas de dérive persistante, tronque le bloc d'actions restant et recalcule une trajectoire corrective. L'intérêt pour les intégrateurs et décideurs robotique tient à l'horizon d'action adaptatif que ce système induit automatiquement : long horizon tant que l'exécution reste fiable, replanification courte dès que la dérive apparaît. Cela répond directement à un compromis connu du secteur entre robustesse d'exécution et fréquence d'appel au modèle, sans nécessiter de réentraînement du backbone. Si les résultats se confirment à plus grande échelle, ce type de correcteur "greffable" pourrait devenir un composant standard pour fiabiliser des VLA déployés en usine ou en logistique, là où les erreurs de contact restent le principal frein à la mise en production au-delà des démonstrations en laboratoire. Ce travail s'inscrit dans la lignée des efforts pour combler l'écart entre modèles VLA génériques (de type Pi-0 ou GR00T) et exigences de fiabilité industrielle, en ciblant spécifiquement les tâches manipulatrices longues et sensibles au contact. Les auteurs présentent VLA-Corrector comme compatible avec différents modèles VLA existants, sans détailler pour l'instant de déploiement matériel réel ni de partenariat industriel : il s'agit à ce stade d'une contribution de recherche méthodologique, dont la prochaine étape logique serait une validation sur des plateformes robotiques physiques variées plutôt que uniquement en simulation.

IA physiqueActu
1 source
Latent Bridge : prédiction de delta de caractéristiques pour une inférence efficace des modèles VLA à double système
3arXiv cs.RO 

Latent Bridge : prédiction de delta de caractéristiques pour une inférence efficace des modèles VLA à double système

Une équipe de recherche publie sur arXiv (2605.02739) une méthode baptisée Latent Bridge, conçue pour accélérer l'inférence des modèles Vision-Language-Action (VLA) à double système, architecture qui combine un backbone de grand modèle de vision-langage (VLM) lent avec une tête d'action rapide. Le problème identifié : dans ce paradigme, le VLM doit s'exécuter à chaque pas de contrôle, même lorsque la scène visuelle évolue peu entre deux timesteps, ce qui crée un goulot d'étranglement computationnel majeur. Latent Bridge est un modèle léger entraîné pour prédire le delta des sorties du VLM entre deux appels, permettant à la tête d'action de fonctionner sur des features interpolées pendant que le backbone coûteux ne tourne que périodiquement. La méthode est validée sur deux VLAs architecturalement distincts : GR00T-N1.6 de NVIDIA (pont dans l'espace des features) et π0.5 de Physical Intelligence (pont sur le KV-cache). Sur quatre suites LIBERO, 24 tâches cuisine RoboCasa et la tâche ALOHA sim transfer-cube, Latent Bridge conserve 95 à 100 % des performances initiales tout en réduisant les appels VLM de 50 à 75 %, pour un gain net de 1,65x à 1,73x en vitesse d'exécution par épisode. Ce résultat est structurellement important pour quiconque envisage de déployer des VLAs sur du matériel réel : jusqu'ici, la richesse sémantique des VLM se payait en latence, rendant difficile un contrôle à haute fréquence sur robots à ressources embarquées limitées. Le fait que la méthode fonctionne sur deux familles architecturales différentes, l'une opérant dans l'espace des features, l'autre sur le KV-cache, suggère une généralisation potentiellement large plutôt qu'une optimisation opportuniste. Le pipeline d'entraînement DAgger utilisé est task-agnostic et transfert sans modification entre benchmarks, ce qui réduit le coût d'adaptation. Il reste à noter que toutes les évaluations sont conduites en simulation ; l'écart sim-to-real n'est pas adressé dans ce travail, et les gains de vitesse annoncés restent à confirmer sur hardware physique. GR00T-N1.6 est le modèle humanoïde de NVIDIA issu de la roadmap GR00T, tandis que π0.5 est la dernière itération du VLA de Physical Intelligence (ex-pi0), entreprise fondée par Sergey Levine et Chelsea Finn qui a levé 400 millions de dollars en 2024. Ces deux modèles représentent l'état de l'art des VLA duaux, face à des concurrents comme OpenVLA (Berkeley), RoboFlamingo ou les approches ACT/Diffusion Policy. La pression sur l'efficacité computationnelle devient un axe de différenciation croissant à mesure que les déploiements industriels à grande échelle approchent ; des travaux parallèles explorent la distillation et la quantification des VLM, mais Latent Bridge propose une voie orthogonale en exploitant la redondance temporelle plutôt qu'en compressant le modèle. La prochaine étape logique serait une validation sur plateforme physique, idéalement sur des robots comme Fourier GR-1 ou Figure 02 dont les équipes utilisent des pipelines VLA similaires.

IA physiqueOpinion
1 source
VISTA : adaptation des données UMI fondée sur la vision et validée par la physique pour l'entraînement de modèles VLA
4arXiv cs.RO 

VISTA : adaptation des données UMI fondée sur la vision et validée par la physique pour l'entraînement de modèles VLA

Une équipe de chercheurs publie VISTA (Vision-grounded and Physics-Validated Adaptation), un framework visant à entraîner des modèles Vision-Language-Action (VLA) à partir de données collectées via l'Universal Manipulation Interface (UMI). L'UMI permet une collecte robotique à grande échelle sans téléopération hardware-spécifique, mais son exploitation pour les VLA bute sur deux incompatibilités identifiées par les auteurs : les caméras fisheye montées au poignet génèrent une distorsion radiale sévère, hors distribution pour les modèles de vision pré-entraînés ; et les trajectoires humaines enregistrées violent fréquemment les limites cinématiques du robot ou dépassent la bande passante du contrôleur, enseignant ainsi des actions physiquement irréalisables. VISTA répond avec trois composants : UMI-VQA, un premier dataset VQA à grande échelle conçu spécifiquement pour les vues fisheye au poignet ; un pipeline de validation physique scorant chaque trajectoire sur la continuité, le risque d'auto-collision et la fidélité d'exécution ; et une recette d'entraînement en deux étapes combinant ancrage vision-langage et prédiction d'actions. Le modèle, les données et le pipeline sont publiés en open source sous forme de preprint arXiv. L'enjeu est directement opérationnel : les VLA actuels souffrent d'un écart persistant entre démonstration et déploiement réel. VISTA apporte une réponse méthodologique en filtrant les trajectoires défectueuses avant l'entraînement, plutôt qu'en espérant que le modèle les absorbe. Les auteurs montrent que les scores de validation physique sont fortement prédictifs du succès en déploiement, ce qui plaide pour une approche data-quality-first plutôt que data-volume-first, un argument qui contredit la logique dominante du secteur. En simulation et sur des tâches réelles de manipulation, VISTA surpasse des baselines solides incluant π0.5 (Physical Intelligence), LingBot-VLA et Wall-X. Pour un intégrateur ou un décideur industriel, cela valide une voie vers des pipelines de collecte scalables via UMI, compatibles avec les VLA modernes, sans recourir à un hardware propriétaire coûteux. L'UMI avait été conçu initialement pour découpler la collecte de données du hardware robotique spécifique, mais son intégration aux VLA restait largement non documentée à grande échelle. Physical Intelligence a popularisé l'approche VLA avec π0 et π0.5 ; Figure AI, 1X et Apptronik misent sur des architectures concurrentes. VISTA s'attaque à un goulot d'étranglement rarement traité en publication : la qualité intrinsèque des données d'entraînement avant qu'elles n'entrent dans le pipeline. En libérant pipeline de validation, dataset UMI-VQA et modèle pré-entraîné, les auteurs positionnent VISTA comme un outil d'infrastructure pour la communauté robotique cherchant à industrialiser la collecte et le filtrage de données manipulation, en amont des choix d'architecture VLA.

IA physiqueOpinion
1 source