Aller au contenu principal
Rapide et précis : un système d'inférence VLA adaptatif par sélection de modèle selon l'environnement
IA physiquearXiv cs.RO 

Rapide et précis : un système d'inférence VLA adaptatif par sélection de modèle selon l'environnement

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié le 6 août 2026 sur arXiv (référence 2608.06434) EMS (Environment-aware Model Selection), un framework d'inférence pour modèles Vision-Language-Action (VLA). Son architecture combine deux systèmes découplés : un module délibératif de grande taille qui planifie des trajectoires globalement cohérentes pour garantir la réussite des tâches, et un module réactif léger assurant un contrôle en boucle fermée à haute fréquence. Une politique de commutation entraînée par apprentissage par renforcement choisit en temps réel, selon le retour capteur, quel module activer, limitant le recours au module lourd. Sur le benchmark de simulation LIBERO, EMS égale les taux de réussite d'un modèle de référence de grande taille tout en portant la fréquence de contrôle effective à 93,4 Hz, et accélère l'exécution de tâches réelles de manipulation bi-bras sans perte de robustesse.

Ce résultat s'attaque à un problème des VLA dits « dual-system », popularisés par des architectures comme Helix (Figure AI) ou π-0 (Physical Intelligence) : jusqu'ici, coupler un module rapide à un module lent imposait un entraînement conjoint de bout en bout qui figeait les deux composants, empêchant de remplacer l'un sans réentraîner l'autre. En rendant les deux systèmes interchangeables, EMS ouvre la voie à une approche modulaire où un intégrateur pourrait associer un planificateur générique à un contrôleur réactif propre à son robot. Pour les équipes qui déploient des VLA en usine ou en entrepôt, la fréquence de contrôle conditionne la fluidité des mouvements : EMS montre qu'il est possible de préserver le raisonnement d'un grand modèle en s'approchant des fréquences d'une boucle robotique classique, sans sacrifier la modularité.

L'approche prolonge les architectures VLA « System 1 / System 2 », déjà explorées par NVIDIA avec GR00T N1 ou par les frameworks hiérarchiques de Physical Intelligence et Figure. Contrairement à ces annonces commerciales, EMS reste une prépublication arXiv évaluée surtout en simulation et sur un nombre limité de tâches réelles à deux bras, sans indication sur l'institution des auteurs ni sur le matériel utilisé. Le chiffre de 93,4 Hz, mis en avant comme résultat phare, reste à confirmer sur des plateformes commerciales et face aux systèmes dual-system déjà déployés par les acteurs du secteur.

À lire aussi

LaST-R1 : renforcement de l'action par raisonnement latent physique adaptatif pour les modèles VLA
1arXiv cs.RO 

LaST-R1 : renforcement de l'action par raisonnement latent physique adaptatif pour les modèles VLA

Des chercheurs ont publié le 29 avril 2026 sur arXiv (2604.28192) un nouveau cadre pour les modèles Vision-Langage-Action (VLA) baptisé LaST-R1, accompagné d'un algorithme d'apprentissage par renforcement inédit appelé LAPO (Latent-to-Action Policy Optimization). Le système atteint un taux de succès moyen de 99,8 % sur le benchmark de manipulation robotique LIBERO, après un unique épisode d'imitation supervisée en guise d'amorçage. En déploiement réel sur quatre tâches complexes, dont des configurations monobranche et bras-double, LAPO améliore les performances de 44 % par rapport à la politique issue de cet amorçage initial. L'apport central de LaST-R1 est de relier explicitement le raisonnement sur la physique à la génération d'actions, là où les approches existantes traitaient ces deux étapes séparément. Les VLA actuels raisonnent soit en langage naturel (coûteux en latence et discret), soit dans un espace latent continu, mais dans les deux cas par imitation statique, sans capacité d'adaptation par essais-erreurs. LAPO co-optimise simultanément le processus de raisonnement latent et la production d'actions via du renforcement en ligne, ce qui améliore la modélisation du monde physique et la robustesse en environnement interactif. Un mécanisme de "latent Chain-of-Thought adaptatif" permet en outre au modèle d'ajuster dynamiquement son horizon de raisonnement selon la complexité de la situation, sans coût fixe à chaque pas. Il s'agit d'une annonce académique sous forme de preprint, pas encore d'un produit embarqué sur robot commercial. Ce travail s'inscrit dans la course à la généralisation des VLA, portée ces derniers mois par des modèles comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou OpenVLA. L'un des verrous récurrents du secteur est l'écart simulation-réalité (sim-to-real gap) et la difficulté à faire converger rapidement un modèle en conditions réelles sans millions d'épisodes supervisés. LaST-R1 revendique une convergence significativement accélérée grâce à l'optimisation jointe du raisonnement latent, une piste que suivent aussi des équipes européennes travaillant sur l'apprentissage par renforcement pour la manipulation, notamment dans l'orbite des laboratoires universitaires français. Les prochaines étapes naturelles seront la validation sur des benchmarks plus diversifiés (AgiBot World, RLBench) et l'intégration dans des plateformes matérielles commerciales.

UELes laboratoires français et européens travaillant sur la manipulation robotique par apprentissage par renforcement peuvent s'appuyer sur l'approche LAPO pour réduire leur dépendance aux grandes quantités de données supervisées, accélérant potentiellement leurs cycles de recherche.

IA physiqueOpinion
1 source
VLA-Corrector : inférence légère de détection-correction pour un horizon d'action adaptatif
2arXiv cs.RO 

VLA-Corrector : inférence légère de détection-correction pour un horizon d'action adaptatif

Des chercheurs présentent VLA-Corrector, un module de correction en ligne pour les modèles vision-langage-action (VLA) utilisés en robotique manipulatrice, décrit dans un article publié sur arXiv (2607.01804) début juillet 2026. Le problème visé est celui du "chunking" d'actions : pour limiter la fréquence d'appel au modèle, la plupart des politiques VLA génératives prédisent un bloc de plusieurs actions futures et les exécutent en boucle ouverte, sans réévaluation intermédiaire. Or dans les tâches à contact riche (préhension, insertion, manipulation fine), une simple perturbation locale peut s'amplifier pendant cette fenêtre "aveugle" et faire échouer la tâche par accumulation d'erreurs. VLA-Corrector ajoute deux briques légères sans toucher aux poids du modèle de base : un moniteur visuel en espace latent (LVM) qui compare en continu l'évolution visuelle prédite et réelle pour détecter les écarts de dynamique, et un mécanisme de replanification par gradient en ligne (OGG) qui, en cas de dérive persistante, tronque le bloc d'actions restant et recalcule une trajectoire corrective. L'intérêt pour les intégrateurs et décideurs robotique tient à l'horizon d'action adaptatif que ce système induit automatiquement : long horizon tant que l'exécution reste fiable, replanification courte dès que la dérive apparaît. Cela répond directement à un compromis connu du secteur entre robustesse d'exécution et fréquence d'appel au modèle, sans nécessiter de réentraînement du backbone. Si les résultats se confirment à plus grande échelle, ce type de correcteur "greffable" pourrait devenir un composant standard pour fiabiliser des VLA déployés en usine ou en logistique, là où les erreurs de contact restent le principal frein à la mise en production au-delà des démonstrations en laboratoire. Ce travail s'inscrit dans la lignée des efforts pour combler l'écart entre modèles VLA génériques (de type Pi-0 ou GR00T) et exigences de fiabilité industrielle, en ciblant spécifiquement les tâches manipulatrices longues et sensibles au contact. Les auteurs présentent VLA-Corrector comme compatible avec différents modèles VLA existants, sans détailler pour l'instant de déploiement matériel réel ni de partenariat industriel : il s'agit à ce stade d'une contribution de recherche méthodologique, dont la prochaine étape logique serait une validation sur des plateformes robotiques physiques variées plutôt que uniquement en simulation.

IA physiqueActu
1 source
Latent Bridge : prédiction de delta de caractéristiques pour une inférence efficace des modèles VLA à double système
3arXiv cs.RO 

Latent Bridge : prédiction de delta de caractéristiques pour une inférence efficace des modèles VLA à double système

Une équipe de recherche publie sur arXiv (2605.02739) une méthode baptisée Latent Bridge, conçue pour accélérer l'inférence des modèles Vision-Language-Action (VLA) à double système, architecture qui combine un backbone de grand modèle de vision-langage (VLM) lent avec une tête d'action rapide. Le problème identifié : dans ce paradigme, le VLM doit s'exécuter à chaque pas de contrôle, même lorsque la scène visuelle évolue peu entre deux timesteps, ce qui crée un goulot d'étranglement computationnel majeur. Latent Bridge est un modèle léger entraîné pour prédire le delta des sorties du VLM entre deux appels, permettant à la tête d'action de fonctionner sur des features interpolées pendant que le backbone coûteux ne tourne que périodiquement. La méthode est validée sur deux VLAs architecturalement distincts : GR00T-N1.6 de NVIDIA (pont dans l'espace des features) et π0.5 de Physical Intelligence (pont sur le KV-cache). Sur quatre suites LIBERO, 24 tâches cuisine RoboCasa et la tâche ALOHA sim transfer-cube, Latent Bridge conserve 95 à 100 % des performances initiales tout en réduisant les appels VLM de 50 à 75 %, pour un gain net de 1,65x à 1,73x en vitesse d'exécution par épisode. Ce résultat est structurellement important pour quiconque envisage de déployer des VLAs sur du matériel réel : jusqu'ici, la richesse sémantique des VLM se payait en latence, rendant difficile un contrôle à haute fréquence sur robots à ressources embarquées limitées. Le fait que la méthode fonctionne sur deux familles architecturales différentes, l'une opérant dans l'espace des features, l'autre sur le KV-cache, suggère une généralisation potentiellement large plutôt qu'une optimisation opportuniste. Le pipeline d'entraînement DAgger utilisé est task-agnostic et transfert sans modification entre benchmarks, ce qui réduit le coût d'adaptation. Il reste à noter que toutes les évaluations sont conduites en simulation ; l'écart sim-to-real n'est pas adressé dans ce travail, et les gains de vitesse annoncés restent à confirmer sur hardware physique. GR00T-N1.6 est le modèle humanoïde de NVIDIA issu de la roadmap GR00T, tandis que π0.5 est la dernière itération du VLA de Physical Intelligence (ex-pi0), entreprise fondée par Sergey Levine et Chelsea Finn qui a levé 400 millions de dollars en 2024. Ces deux modèles représentent l'état de l'art des VLA duaux, face à des concurrents comme OpenVLA (Berkeley), RoboFlamingo ou les approches ACT/Diffusion Policy. La pression sur l'efficacité computationnelle devient un axe de différenciation croissant à mesure que les déploiements industriels à grande échelle approchent ; des travaux parallèles explorent la distillation et la quantification des VLM, mais Latent Bridge propose une voie orthogonale en exploitant la redondance temporelle plutôt qu'en compressant le modèle. La prochaine étape logique serait une validation sur plateforme physique, idéalement sur des robots comme Fourier GR-1 ou Figure 02 dont les équipes utilisent des pipelines VLA similaires.

IA physiqueOpinion
1 source
τ0-VLA : un modèle fondation hiérarchique guidé par un modèle du monde en temps d'inférence
4arXiv cs.RO 

τ0-VLA : un modèle fondation hiérarchique guidé par un modèle du monde en temps d'inférence

Publié le 18 août 2026 sur arXiv sous la référence 2608.16885, τ0-VLA est un modèle de fondation robotique hiérarchique vision-langage-action (VLA) conçu pour la manipulation à long horizon, où un robot enchaîne plusieurs compétences de façon cohérente. Sa spécificité : une politique de haut niveau, guidée par un modèle du monde, génère la sous-tâche suivante à partir de la mémoire d'exécution et, si la décision est jugée difficile, explore plusieurs alternatives avant de trancher, plutôt que de décider en un seul passage avant comme la plupart des VLA hiérarchiques actuels. Une politique de bas niveau exécute ensuite cette sous-tâche, sur plusieurs types de robots. Le modèle a été entraîné sur 40 115 heures de données réelles hétérogènes avec co-entraînement multimodal. En conditions connues comme en décalage de distribution, allouer plus de calcul au moment du test améliore la prédiction de la sous-tâche suivante et le taux de réussite en boucle fermée sur des tâches longues. La plupart des VLA hiérarchiques décident chaque sous-tâche en un seul passage, sans pouvoir consacrer plus de calcul aux choix difficiles ou lourds de conséquences. τ0-VLA transpose à la planification robotique un principe déjà exploité par les modèles de raisonnement en langage : allouer davantage de calcul au moment du test face à l'incertitude. Pour les intégrateurs qui déploient des VLA en usine ou en entrepôt, la fiabilité des tâches longues reste le principal écart entre démonstrations et déploiement robuste ; réduire les échecs en cascade sur ces séquences serait un progrès concret. Ce résultat reste toutefois un préprint évalué en interne, pas un produit déployé chez un client. τ0-VLA s'inscrit dans la lignée des VLA généralistes récents, comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure, qui génèrent une action en un seul passage avant, sans délibération explicite ; son nom fait écho à Pi-0 tout en ajoutant une étape de recherche à l'inférence. Le résumé ne précise ni laboratoire porteur ni date de publication du code ou des poids. Il illustre une tendance émergente du secteur : après la course aux volumes de données, plusieurs équipes explorent désormais l'allocation dynamique de calcul comme nouveau levier d'amélioration des modèles de fondation robotique.

IA physiqueOpinion
1 source