Aller au contenu principal
IA physiquearXiv cs.RO 

World Action Agent : exploiter les modèles vision-langage pour la manipulation robotique via répétition d'actions simulées

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

World Action Agent (WAA) est un système multi-agents qui fait piloter des robots manipulateurs par des modèles vision-langage dans un espace de travail visuel, plutôt que via des contraintes déduites ou du code généré. Le système combine des vues de contact choisies automatiquement autour du point d'interaction, une « répétition d'action » qui rend chaque geste modifiable avant exécution, et une correction en vue qui élimine les décalages résiduels ; il apprend aussi des compétences via des vidéos d'experts et des démonstrations humaines validées. Sur le benchmark LIBERO-Pro, avec des compétences apprises uniquement sur LIBERO-90, WAA atteint 75,6 % de réussite moyenne, devançant les VLA de bout en bout et les agents « code-as-policy » ; le fine-tuning de Qwen3.5-9B sur ses traces d'interaction porte sa réussite hors domaine de 1,7 % à 43,3 %.

Cette approche cible un angle mort du secteur : les VLM sont utilisés indirectement, pour déduire des contraintes ou écrire du code, sans agir dans une représentation modifiable de la scène. En rendant chaque geste corrigeable avant exécution, WAA répond à l'écart persistant entre démonstrations impressionnantes et fiabilité réelle en manipulation, un enjeu central pour les intégrateurs hésitant à déployer des VLA en production. Le résultat le plus parlant pour les décideurs B2B reste la distillation : entraîner un modèle plus petit sur les traces du système fait bondir sa réussite hors domaine de 1,7 % à 43,3 %, ouvrant une voie économique vers des politiques robotiques déployables à grande échelle sans VLM massif en boucle d'inférence.

Le travail est publié comme prépublication arXiv non encore relue par les pairs, évalué uniquement en simulation sur les bancs d'essai LIBERO-Pro, LIBERO-90 et robosuite, sans déploiement sur robot physique ni site industriel mentionné. Aucune entreprise ni plateforme robotique n'est citée dans l'étude, WAA se positionnant comme une alternative architecturale aux VLA entraînés de bout en bout et aux approches « code-as-policy » qui dominent la recherche récente sur le pilotage de robots par modèles de fondation. Les auteurs ne précisent aucun calendrier de transfert vers du matériel réel, la validation sur capteurs bruités et environnements non contrôlés restant l'étape déterminante avant tout déploiement industriel.

À lire aussi

SAVLA : des modèles vision-langage-action sensibles à la symétrie pour la manipulation robotique
1arXiv cs.RO 

SAVLA : des modèles vision-langage-action sensibles à la symétrie pour la manipulation robotique

Un article publié le 16 septembre 2026 sur arXiv (2609.16641) présente SAVLA (Symmetry-Aware Vision-Language-Action), un modèle de manipulation robotique conditionnée par le langage. Contrairement aux modèles vision-langage-action classiques, qui n'apprennent leur compétence spatiale qu'à partir des démonstrations et échouent hors de la plage de poses couverte par celles-ci, SAVLA gèle un backbone vision-langage pré-entraîné et y ajoute une tête d'action équivariante par flow-matching ainsi qu'un module de canonicalisation qui ramène les vues obliques dans un repère de référence tout en faisant tourner les conditions géométriques en conséquence. Testé sur le benchmark simulé LIBERO face au modèle GR00T N1.5 de NVIDIA, SAVLA améliore de 5,1 points le taux de réussite moyen sur les quatre suites du benchmark, et fait passer le taux de réussite sous rotation sur LIBERO-Goal de 41,5% à 90,4%. Le résultat s'attaque à une faiblesse connue des VLA : leur généralisation géométrique limitée, qui oblige aujourd'hui les intégrateurs à multiplier les démonstrations pour couvrir chaque orientation possible d'objet ou de caméra sur une ligne de production. En codant la symétrie directement dans l'architecture plutôt qu'en la laissant émerger des données, SAVLA vise une robustesse aux changements de pose avec moins d'exemples, un argument pertinent pour réduire le coût de collecte de données avant tout déploiement industriel de bras ou d'humanoïdes pilotés par VLA. Le gain reste toutefois mesuré en simulation sur un benchmark académique, pas sur un robot physique en usine, ce qui en fait une preuve de concept méthodologique plutôt qu'une solution prête à l'emploi. SAVLA s'inscrit dans la vague des modèles VLA devenus le paradigme dominant du contrôle robotique par langage naturel, aux côtés de familles comme GR00T de NVIDIA, Pi-0 de Physical Intelligence ou Helix de Figure. Le choix de GR00T N1.5 comme référence positionne directement SAVLA face à l'un des modèles de fondation les plus utilisés du secteur. La méthode puise dans des travaux antérieurs sur l'apprentissage équivariant, une approche distincte du tout-données qui domine l'entraînement actuel des VLA. L'article ne mentionne ni partenariat industriel ni test sur robot physique, la validation en conditions réelles restant l'étape suivante logique pour ce type de travail académique.

IA physiqueActu
1 source
AR-WAM : un modèle monde-action prêt pour les agents, conditionné par la vision, pour la manipulation robotique
2arXiv cs.RO 

AR-WAM : un modèle monde-action prêt pour les agents, conditionné par la vision, pour la manipulation robotique

Un article déposé le 22 septembre 2026 sur arXiv (2609.23578) présente AR-WAM, un modèle de manipulation robotique qui remplace les instructions en langage naturel par deux signaux visuels : une boîte englobante désignant l'objet cible et un jeton d'opération appris précisant la compétence à exécuter. Compact avec 0,5 milliard de paramètres et un encodeur visuel figé, sans encodeur de langage, il prédit l'évolution de la scène en espace latent tout en décodant les actions. Une couche de compatibilité à trois primitives, détecter, exécuter, interroger, permet à un VLM local ou une API d'agent de piloter la politique. Testé sur RoboTwin 2.0, RMBench et un robot réel bi-bras Astribot S1, il atteint 87,2% de succès en manipulation standard, gagne 5,9 points sur les tâches à mémoire et 36,7 points sur les tâches longues réelles, avec la latence la plus basse du comparatif, 14,1 millisecondes. Le choix cible un problème identifié par les auteurs : les VLA et les world action models dominants spécifient encore les tâches en langage naturel, une interface jugée ambiguë sur les références, imprécise spatialement et redondante avec la compréhension déjà portée par l'agent. En séparant le « quoi », décidé par l'agent, du « comment », exécuté par le robot via un grounding visuel explicite, AR-WAM offre une interface standardisée qui intéresse les intégrateurs cherchant à connecter des piles agentiques à des flottes de robots hétérogènes plutôt qu'à des prompts textuels ad hoc. Le bond de 36,7 points sur les tâches longues en conditions réelles suggère surtout que la faiblesse chronique des VLA sur l'horizon long peut être atténuée en délégant mémoire et récupération d'erreur à la couche agent, plutôt qu'en la faisant porter entièrement par un modèle d'action monolithique. Ces résultats restent ceux d'un article de recherche récent, validé en simulation et sur une seule plateforme robotique réelle, sans annonce de déploiement commercial ni de partenariat industriel. Astribot, dont le bras bi-bras S1 sert de banc d'essai réel, est une entreprise chinoise de manipulation robotique ; RoboTwin 2.0 et RMBench comptent parmi les bancs d'essai standards du secteur pour comparer des politiques de manipulation en simulation. L'article ne fournit ni échéancier de déploiement ni partenaire industriel identifié ; il se positionne comme une contribution méthodologique destinée à la prochaine génération de systèmes agent-robot, dans un secteur où l'exécution fiable de tâches longues sans supervision humaine reste l'un des principaux verrous avant une adoption industrielle à grande échelle.

IA physiqueOpinion
1 source
LACY : cycle langage-action à base de modèle vision-langage pour la manipulation robotique auto-améliorante
3arXiv cs.RO 

LACY : cycle langage-action à base de modèle vision-langage pour la manipulation robotique auto-améliorante

Des chercheurs ont publié sur arXiv (arXiv:2511.02239) LACY, un cadre unifié reposant sur un modèle vision-langage (VLM) qui introduit une cartographie bidirectionnelle entre instructions textuelles et actions robotiques. Contrairement aux architectures VLA classiques qui se limitent à traduire du langage vers des actions (L2A), LACY entraîne simultanément trois tâches complémentaires : la génération d'actions paramétrées à partir d'une instruction (L2A), l'explication en langage naturel d'une action observée (A2L), et la vérification de cohérence sémantique entre deux descriptions (L2C). Le système a été évalué sur des tâches de pick-and-place en simulation et en environnement réel, où il améliore le taux de succès de 56,46 % en moyenne par rapport aux baselines. Un mécanisme d'augmentation active cible les cas à faible confiance pour générer et filtrer automatiquement de nouvelles données d'entraînement, sans annotation humaine supplémentaire. L'intérêt principal de LACY pour les intégrateurs et les équipes R&D tient à sa boucle auto-améliorante : le robot ne se contente plus d'exécuter, il peut rationaliser ses propres gestes, ce qui enrichit les représentations internes et réduit la dépendance aux datasets labellisés manuellement. La capacité A2L constitue une avancée pour la supervision et le débogage en production, car un système capable d'expliquer ses actions facilite la validation humaine. Sur le plan de la généralisation, le signal L2C fonctionne comme un filtre de cohérence sémantique qui élimine les augmentations bruyantes, un problème récurrent dans l'entraînement sim-to-real. Cela dit, les expériences restent limitées au pick-and-place, tâche canonique mais peu représentative de la complexité des workflows industriels réels. LACY s'inscrit dans une vague de travaux VLA post-RT-2 qui cherchent à dépasser le paradigme unidirectionnel : Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou OpenVLA explorent des espaces proches mais n'intègrent pas de branche A2L explicite. La page projet (vla2026.github.io/LACY) laisse entrevoir des extensions vers des tâches de manipulation plus complexes. L'absence de données sur les temps de cycle, les charges utiles ou les plateformes matérielles testées rend difficile toute évaluation directe pour un déploiement industriel, et le saut de 56,46 % mérite d'être lu avec prudence tant que les conditions expérimentales complètes ne sont pas publiées.

💬 La boucle auto-améliorante, c'est le vrai truc ici : le robot cible ses propres points faibles et génère de nouvelles données sans qu'on ait à labelliser quoi que ce soit. Le +56% de succès sonne bien, bon, il faut lire les conditions expérimentales complètes avant de s'emballer. Et la capacité A2L (le robot qui explique ses propres gestes en langage naturel) va vraiment servir en prod, pas juste dans les démos.

IA physiqueOpinion
1 source
Reflex : des modèles vision-langage-action rapides et prédictifs pour la manipulation critique en réaction
4arXiv cs.RO 

Reflex : des modèles vision-langage-action rapides et prédictifs pour la manipulation critique en réaction

Un preprint publie sur arXiv (référence 2608.14379v1) présente ReflexBench, un banc d'essai de six taches dynamiques pour la manipulation robotique réactive, et ReflexVLA, un modèle vision-langage-action (VLA) conçu pour y répondre sans pré-entrainement massif sur des données robotiques. ReflexBench découplé le pas de simulation du contrôle du robot et permet une latence configurable en inférence synchrone comme asynchrone. ReflexVLA améliore le raisonnement temporel par prédiction latente du futur et fusion multi-images dans son backbone visuel, et réduit sa latence via un encodage visuel par lots et le rejeu CUDA Graph. Les auteurs rapportent une amélioration en manipulation dynamique, une précision maintenue sur les benchmarks statiques classiques, et des validations en conditions réelles, avec un site de projet dédié (reflexvla.github.io). La valeur tient surtout au constat de départ : la quasi-totalité des benchmarks VLA mesurent la généralisation sur des taches statiques et ignorent les scenarios ou le robot doit réagir en temps réel a un événement imprévu, objet qui chute, obstacle mobile, geste humain. Cette lacune pèse sur les intégrateurs qui envisagent des robots collaboratifs en environnement humain ou logistique, ou la réactivité conditionne la sécurité autant que l'efficacité. En attaquant conjointement la latence d'inférence et le raisonnement temporel plutôt que la seule taille du modèle, ce travail nuance l'hypothèse selon laquelle l'échelle des données suffirait a résoudre le temps de réaction des VLA : l'ingénierie de déploiement compte tout autant. Ce travail s'inscrit dans la recherche sur les modèles VLA généralistes, qui unifient perception, langage et contrôle moteur, mais dont l'évaluation restait centrée sur des démonstrations statiques de pick-and-place en laboratoire. En proposant un banc d'essai dédié a la manipulation réaction-critique, avec une métrique de latence explicite et un protocole synchrone/asynchrone, les auteurs visent un standard que les futurs modèles VLA devront adresser. Le document est un preprint arXiv, sans partenaire industriel, site de déploiement ni calendrier commercial annonces : une contribution académique accompagnée d'un site de projet, non un produit expédie. Ses conclusions restent a confirmer par revue par les pairs et adoption du benchmark par la communauté.

IA physiqueActu
1 source