Aller au contenu principal
Reflex : des modèles vision-langage-action rapides et prédictifs pour la manipulation critique en réaction
IA physiquearXiv cs.RO 

Reflex : des modèles vision-langage-action rapides et prédictifs pour la manipulation critique en réaction

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un preprint publie sur arXiv (référence 2608.14379v1) présente ReflexBench, un banc d'essai de six taches dynamiques pour la manipulation robotique réactive, et ReflexVLA, un modèle vision-langage-action (VLA) conçu pour y répondre sans pré-entrainement massif sur des données robotiques. ReflexBench découplé le pas de simulation du contrôle du robot et permet une latence configurable en inférence synchrone comme asynchrone. ReflexVLA améliore le raisonnement temporel par prédiction latente du futur et fusion multi-images dans son backbone visuel, et réduit sa latence via un encodage visuel par lots et le rejeu CUDA Graph. Les auteurs rapportent une amélioration en manipulation dynamique, une précision maintenue sur les benchmarks statiques classiques, et des validations en conditions réelles, avec un site de projet dédié (reflexvla.github.io).

La valeur tient surtout au constat de départ : la quasi-totalité des benchmarks VLA mesurent la généralisation sur des taches statiques et ignorent les scenarios ou le robot doit réagir en temps réel a un événement imprévu, objet qui chute, obstacle mobile, geste humain. Cette lacune pèse sur les intégrateurs qui envisagent des robots collaboratifs en environnement humain ou logistique, ou la réactivité conditionne la sécurité autant que l'efficacité. En attaquant conjointement la latence d'inférence et le raisonnement temporel plutôt que la seule taille du modèle, ce travail nuance l'hypothèse selon laquelle l'échelle des données suffirait a résoudre le temps de réaction des VLA : l'ingénierie de déploiement compte tout autant.

Ce travail s'inscrit dans la recherche sur les modèles VLA généralistes, qui unifient perception, langage et contrôle moteur, mais dont l'évaluation restait centrée sur des démonstrations statiques de pick-and-place en laboratoire. En proposant un banc d'essai dédié a la manipulation réaction-critique, avec une métrique de latence explicite et un protocole synchrone/asynchrone, les auteurs visent un standard que les futurs modèles VLA devront adresser. Le document est un preprint arXiv, sans partenaire industriel, site de déploiement ni calendrier commercial annonces : une contribution académique accompagnée d'un site de projet, non un produit expédie. Ses conclusions restent a confirmer par revue par les pairs et adoption du benchmark par la communauté.

À lire aussi

SAVLA : des modèles vision-langage-action sensibles à la symétrie pour la manipulation robotique
1arXiv cs.RO 

SAVLA : des modèles vision-langage-action sensibles à la symétrie pour la manipulation robotique

Un article publié le 16 septembre 2026 sur arXiv (2609.16641) présente SAVLA (Symmetry-Aware Vision-Language-Action), un modèle de manipulation robotique conditionnée par le langage. Contrairement aux modèles vision-langage-action classiques, qui n'apprennent leur compétence spatiale qu'à partir des démonstrations et échouent hors de la plage de poses couverte par celles-ci, SAVLA gèle un backbone vision-langage pré-entraîné et y ajoute une tête d'action équivariante par flow-matching ainsi qu'un module de canonicalisation qui ramène les vues obliques dans un repère de référence tout en faisant tourner les conditions géométriques en conséquence. Testé sur le benchmark simulé LIBERO face au modèle GR00T N1.5 de NVIDIA, SAVLA améliore de 5,1 points le taux de réussite moyen sur les quatre suites du benchmark, et fait passer le taux de réussite sous rotation sur LIBERO-Goal de 41,5% à 90,4%. Le résultat s'attaque à une faiblesse connue des VLA : leur généralisation géométrique limitée, qui oblige aujourd'hui les intégrateurs à multiplier les démonstrations pour couvrir chaque orientation possible d'objet ou de caméra sur une ligne de production. En codant la symétrie directement dans l'architecture plutôt qu'en la laissant émerger des données, SAVLA vise une robustesse aux changements de pose avec moins d'exemples, un argument pertinent pour réduire le coût de collecte de données avant tout déploiement industriel de bras ou d'humanoïdes pilotés par VLA. Le gain reste toutefois mesuré en simulation sur un benchmark académique, pas sur un robot physique en usine, ce qui en fait une preuve de concept méthodologique plutôt qu'une solution prête à l'emploi. SAVLA s'inscrit dans la vague des modèles VLA devenus le paradigme dominant du contrôle robotique par langage naturel, aux côtés de familles comme GR00T de NVIDIA, Pi-0 de Physical Intelligence ou Helix de Figure. Le choix de GR00T N1.5 comme référence positionne directement SAVLA face à l'un des modèles de fondation les plus utilisés du secteur. La méthode puise dans des travaux antérieurs sur l'apprentissage équivariant, une approche distincte du tout-données qui domine l'entraînement actuel des VLA. L'article ne mentionne ni partenariat industriel ni test sur robot physique, la validation en conditions réelles restant l'étape suivante logique pour ce type de travail académique.

IA physiqueActu
1 source
Latent Reasoning VLA : pensée latente et prédiction pour les modèles vision-langage-action
2arXiv cs.RO 

Latent Reasoning VLA : pensée latente et prédiction pour les modèles vision-langage-action

Une équipe de chercheurs a publié sur arXiv (arXiv:2602.01166) LaRA-VLA, un nouveau cadre de modèles Vision-Language-Action (VLA) qui internalise le raisonnement multi-modal directement dans un espace latent continu, plutôt que de générer explicitement des chaînes de pensée textuelles (chain-of-thought, CoT) à l'inférence. Concrètement, là où les VLA actuels produisent des tokens de raisonnement discrets avant chaque décision motrice, LaRA-VLA effectue raisonnement et prédiction d'action dans un même espace latent, sans étape de génération textuelle intermédiaire. Les auteurs rapportent une réduction de la latence d'inférence pouvant atteindre 90 % par rapport aux approches CoT explicites, tout en surpassant les méthodes VLA de référence sur des benchmarks en simulation et sur des tâches de manipulation réelle à longue portée. Deux jeux de données CoT structurés ont été construits pour l'entraînement. L'entraînement suit un curriculum progressif : supervision d'abord textuelle et visuelle, puis transition vers un raisonnement purement latent, avant adaptation de ces dynamiques latentes au conditionnement de la génération d'actions. Ce résultat est significatif pour les intégrateurs et décideurs industriels parce qu'il s'attaque directement au principal goulot d'étranglement des VLA raisonnants : le coût computationnel du CoT à l'inférence rendait ces modèles inutilisables en temps réel sur du matériel embarqué. Un gain de 90 % de latence sans dégradation de performance change le rapport entre qualité de raisonnement et contrainte temps-réel, rendant crédible le déploiement de politiques robotiques expressives sur des bras industriels ou des humanoïdes sans serveur dédié au raisonnement. Cela contredit partiellement l'hypothèse que le raisonnement symbolique explicite est nécessaire pour gérer des tâches longues et multi-étapes. Les VLA, popularisés par des travaux comme RT-2 (Google DeepMind, 2023) puis Pi-0 (Physical Intelligence, 2024) et GR00T N2 (NVIDIA, 2025), cherchent à combiner compréhension sémantique et contrôle moteur dans un seul modèle. La tension entre performance de raisonnement et latence d'inférence est un sujet actif : d'autres approches comme les modèles de diffusion d'actions (Pi-0) contournent le problème différemment. LaRA-VLA propose une troisième voie, en fusionnant les deux flux dans l'espace latent. Le code et la page projet sont disponibles publiquement ; les prochaines étapes attendues sont des évaluations sur robots humanoïdes et des tests de robustesse hors distribution, domaines où le gap simulation-réalité reste le critère déterminant pour une adoption industrielle.

UECette réduction de latence d'inférence de 90 % ouvre la voie au déploiement de politiques VLA expressives sur du matériel embarqué, ce qui pourrait bénéficier aux équipes R&D et intégrateurs européens travaillant sur des bras industriels ou des humanoïdes sans infrastructure de calcul dédiée.

💬 90 % de latence en moins sur les VLA, c'est le genre de résultat qu'on attendait pour débloquer l'embarqué. Passer le raisonnement dans l'espace latent plutôt que de cracher des tokens CoT, c'est élégant, et les benchmarks semblent tenir. Reste le gap simulation-réalité, qui est toujours l'épreuve de vérité, et là aucun papier arXiv ne peut te garantir grand chose avant les tests sur du vrai matériel.

IA physiqueOpinion
1 source
ForeTac-VLA : un modèle vision-langage-action tactile basé sur la prévision pour la manipulation robotique en contact riche
3arXiv cs.RO 

ForeTac-VLA : un modèle vision-langage-action tactile basé sur la prévision pour la manipulation robotique en contact riche

Publié en septembre 2026 sur arXiv sous la référence 2609.20980, ForeTac-VLA est un modèle vision-langage-action (VLA) qui ajoute une couche tactile prédictive pour la manipulation robotique en environnement riche en contacts physiques. Le système encode les observations tactiles récentes en représentations temporelles, les fusionne avec les caractéristiques vision-langage par attention croisée bidirectionnelle, puis un module de prévision fondé sur un transformeur anticipe l'état tactile sur plusieurs pas de temps futurs avant d'injecter ces prédictions dans le backbone VLA qui génère l'action. Un curriculum passant progressivement des données tactiles réelles aux données prédites stabilise l'entraînement lorsque les premières prévisions sont peu fiables. Sur quatre tâches de manipulation réelles à fort contact physique, ForeTac-VLA atteint un taux de réussite moyen de 95%, avec un gain de 36,25 points de pourcentage sur un VLA simplement affiné et de plus de 22 points sur les meilleures méthodes tactiles-VLA existantes, tout en maintenant ses performances en faible luminosité et en environnement visuellement encombré. Ce travail cible une faiblesse connue des modèles VLA, très dépendants de la vision, alors que des états physiques critiques comme le glissement d'un objet ou l'alignement lors d'une insertion ne sont pas observables visuellement. Les approches tactiles existantes se contentaient de réagir au contact déjà survenu; ForeTac-VLA propose de l'anticiper, ce qui change la nature du signal exploité par le modèle d'action. Pour les intégrateurs industriels, l'intérêt pratique tient à la robustesse démontrée en conditions dégradées, faible éclairage ou encombrement visuel, des situations fréquentes en usine ou en entrepôt où la vision seule échoue souvent. Si ces écarts se confirment au-delà des quatre tâches testées, cela conforterait l'idée qu'une fusion tactile prédictive, plutôt que purement réactive, est une piste sérieuse pour fiabiliser la manipulation en contact riche, un point faible récurrent des démonstrations VLA actuelles. ForeTac-VLA s'inscrit dans la lignée des modèles VLA génériques qui unifient perception, langage et contrôle moteur, et dans la sous-famille plus récente des VLA tactiles qui ajoutent un capteur de contact au pipeline vision-langage. Il se positionne explicitement contre ces baselines tactiles-VLA de l'état de l'art, qu'il dépasse de plus de 22 points, ainsi que contre un VLA classique simplement affiné sur les mêmes tâches. La publication reste un preprint arXiv, sans nom d'entreprise ni calendrier de déploiement industriel associé: il s'agit d'un résultat de recherche évalué sur quatre tâches choisies par les auteurs et illustré par des vidéos sélectionnées sur le site du projet, pas d'un produit commercialisé. Les suites attendues sont l'élargissement à davantage de tâches et de plateformes robotiques, ainsi qu'une évaluation indépendante confirmant que l'écart de performance tient face à des scénarios plus variés que le banc d'essai initial.

IA physiqueOpinion
1 source
World Action Agent : exploiter les modèles vision-langage pour la manipulation robotique via répétition d'actions simulées
4arXiv cs.RO 

World Action Agent : exploiter les modèles vision-langage pour la manipulation robotique via répétition d'actions simulées

World Action Agent (WAA) est un système multi-agents qui fait piloter des robots manipulateurs par des modèles vision-langage dans un espace de travail visuel, plutôt que via des contraintes déduites ou du code généré. Le système combine des vues de contact choisies automatiquement autour du point d'interaction, une « répétition d'action » qui rend chaque geste modifiable avant exécution, et une correction en vue qui élimine les décalages résiduels ; il apprend aussi des compétences via des vidéos d'experts et des démonstrations humaines validées. Sur le benchmark LIBERO-Pro, avec des compétences apprises uniquement sur LIBERO-90, WAA atteint 75,6 % de réussite moyenne, devançant les VLA de bout en bout et les agents « code-as-policy » ; le fine-tuning de Qwen3.5-9B sur ses traces d'interaction porte sa réussite hors domaine de 1,7 % à 43,3 %. Cette approche cible un angle mort du secteur : les VLM sont utilisés indirectement, pour déduire des contraintes ou écrire du code, sans agir dans une représentation modifiable de la scène. En rendant chaque geste corrigeable avant exécution, WAA répond à l'écart persistant entre démonstrations impressionnantes et fiabilité réelle en manipulation, un enjeu central pour les intégrateurs hésitant à déployer des VLA en production. Le résultat le plus parlant pour les décideurs B2B reste la distillation : entraîner un modèle plus petit sur les traces du système fait bondir sa réussite hors domaine de 1,7 % à 43,3 %, ouvrant une voie économique vers des politiques robotiques déployables à grande échelle sans VLM massif en boucle d'inférence. Le travail est publié comme prépublication arXiv non encore relue par les pairs, évalué uniquement en simulation sur les bancs d'essai LIBERO-Pro, LIBERO-90 et robosuite, sans déploiement sur robot physique ni site industriel mentionné. Aucune entreprise ni plateforme robotique n'est citée dans l'étude, WAA se positionnant comme une alternative architecturale aux VLA entraînés de bout en bout et aux approches « code-as-policy » qui dominent la recherche récente sur le pilotage de robots par modèles de fondation. Les auteurs ne précisent aucun calendrier de transfert vers du matériel réel, la validation sur capteurs bruités et environnements non contrôlés restant l'étape déterminante avant tout déploiement industriel.

IA physiqueActu
1 source