Aller au contenu principal

Dossier NVIDIA GR00T — page 9

876 articles · page 9 sur 18

NVIDIA GR00T (Generalist Robot 00 Technology) : modèle fondation pour humanoïdes, intégration Isaac et Cosmos, partenariats Apptronik, Agility, 1X.

ObjRetarget : un cadre de retransfert de mouvement sensible aux objets, avec contraintes anthropomorphiques du bras et modélisation polyédrique de la main
401arXiv cs.RO RecherchePaper

ObjRetarget : un cadre de retransfert de mouvement sensible aux objets, avec contraintes anthropomorphiques du bras et modélisation polyédrique de la main

Une équipe de recherche présente ObjRetarget, un nouveau framework de retargeting de mouvement humain vers robot destiné à l'apprentissage de la manipulation dextre à partir de vidéos humaines, décrit dans un article publié sur arXiv (2607.03828v1). Le problème visé est classique en intelligence incarnée : transférer fidèlement l'intention humaine observée dans une vidéo vers des actions robotiques exécutables, tout en conservant un contact main-objet stable pendant la manipulation. La méthode combine deux briques. Pour le bras, des trajectoires de référence extraites des vidéos humaines servent de point de départ, affinées par des contraintes anthropomorphiques et une optimisation tenant compte de la redondance cinématique, afin de produire des mouvements naturels et précis. Pour la main, ObjRetarget modélise les contacts multi-doigts via des clusters polyédriques (polytopes) et préserve la structure de contact grâce à des invariants géométriques, ce qui améliore la stabilité du geste. Les tests sur robots réels montrent une amélioration des taux de réussite de manipulation et de la stabilité de contact sur plusieurs tâches dextres, avec une bonne généralisation à de nouvelles démonstrations, poses d'objets et configurations de tâche. Ce travail s'inscrit dans un enjeu central pour l'industrie robotique actuelle : faire fonctionner l'apprentissage par imitation à partir de vidéos humaines à grande échelle, un des piliers annoncés des modèles VLA (vision-language-action) comme GR00T N2, Pi-0 ou Helix. Le point faible historique de ces approches est justement le retargeting, l'étape où l'intention humaine capturée en vidéo doit être traduite en gestes robotiques exploitables sans perdre la qualité du contact physique. En modélisant explicitement le contact plutôt qu'en s'en remettant au reinforcement learning, souvent gourmand en données et peu généralisable, ObjRetarget répond à une limite concrète freinant le passage de la démonstration vidéo à une manipulation dextre fiable en conditions réelles, un enjeu direct pour les intégrateurs travaillant sur des mains robotiques multi-doigts. Le papier se positionne en creux face aux méthodes existantes de retargeting, jugées insuffisantes faute de modélisation de contact explicite. Il s'agit ici d'une contribution de recherche publiée sur arXiv, validée expérimentalement sur robots réels mais sans déploiement industriel ni partenaire commercial annoncé à ce stade, les suites logiques étant une intégration possible dans des pipelines d'apprentissage de politiques robotiques plus larges.

1 source
Vert pour avancer, rouge pour s'arrêter : ancrage visuel par segmentation sémantique pour la navigation VLA
402arXiv cs.RO 

Vert pour avancer, rouge pour s'arrêter : ancrage visuel par segmentation sémantique pour la navigation VLA

Une équipe de recherche propose une méthode pour améliorer la fiabilité des modèles vision-langage-action (VLA) utilisés en navigation robotique, en s'appuyant sur la segmentation sémantique en temps réel. Le système utilise SegFormer pour colorer l'image perçue par le robot: en vert les zones traversables, en rouge les zones à éviter, avant de transmettre cette image enrichie au modèle de navigation OmniVLA. Deux variantes ont été testées, une segmentation appliquée uniquement à l'observation courante, et une seconde appliquée conjointement à l'observation et à l'image ou l'instruction cible. Sur le jeu de données Grand Tour, cette technique de "grounding" visuel réduit l'erreur moyenne de trajectoire au point de passage le plus éloigné de 27 à 44%, un gain qui varie selon la longueur de l'instruction donnée au robot. Les auteurs montrent aussi, via une analyse d'erreur normalisée, que le bénéfice provient surtout d'un raccourcissement de 30% de la longueur de trajectoire prédite, plutôt que d'un raisonnement spatial réellement amélioré par unité de distance. Pour les intégrateurs et ingénieurs qui déploient des robots mobiles guidés par instructions en langage naturel, ce résultat est notable car il ne nécessite aucun réentraînement du modèle VLA existant, seulement une couche de traitement d'image ajoutée en amont, peu coûteuse en calcul. Les auteurs sont transparents sur les limites: le gain est quasi nul pour les instructions basées sur une image cible plutôt qu'un texte, et la méthode ne compense pas l'absence de signal d'entraînement pour des instructions hors distribution. Cela confirme un écart connu du secteur entre performance démonstrative et robustesse réelle des modèles de navigation par langage. OmniVLA s'inscrit dans la famille grandissante des modèles vision-langage-action pour la navigation, aux côtés d'approches comme Pi-0 ou GR00T N2 développées pour la manipulation et le déplacement robotique. Le travail présenté ici, une première évaluation empirique du grounding visuel appliqué spécifiquement à ces politiques de navigation, ouvre la voie à des ajouts similaires et légers sur d'autres architectures VLA sans passer par un réentraînement complet, une piste pratique pour fiabiliser des déploiements réels en environnement encombré ou ambigu.

IA physiqueActu
1 source
Coordination des tâches et exécution de trajectoires par démonstrations few-shot pour systèmes multi-robots
403arXiv cs.RO 

Coordination des tâches et exécution de trajectoires par démonstrations few-shot pour systèmes multi-robots

Des chercheurs proposent DDACE (Demonstration-Driven Action Coordination and Execution), un cadre d'apprentissage capable de coordonner plusieurs robots a partir d'un tres petit nombre de demonstrations seulement, selon un article publie sur arXiv (version revisee, v2). Le probleme cible est connu dans la robotique multi-agents : apprendre a la fois quand chaque robot doit agir (dependances temporelles entre taches) et comment il doit se deplacer (trajectoire spatiale) devient instable des que les donnees sont rares, car les deux aspects sont habituellement appris ensemble par des modeles bout-en-bout. DDACE separe explicitement ces deux problemes. Les demonstrations sont d'abord traitees par clustering spectral pour en extraire la structure de coordination et construire des graphes d'interaction entre robots. Un Temporal Graph Network se charge ensuite de predire les dependances d'actions et leur sequencement, pendant que des modeles de processus gaussiens generent les trajectoires geometriques, parametrees par la progression de la tache et capables de s'adapter a de nouvelles configurations de depart et d'arrivee. Les auteurs rapportent des tests en simulation ainsi que des experiences sur robots reels, avec une meilleure stabilite et une meilleure coherence des trajectoires que des approches d'imitation bout-en-bout classiques en regime de donnees limitees. L'enjeu depasse l'exercice academique : la coordination multi-robots a partir de peu d'exemples est un frein concret au deploiement de cellules industrielles collaboratives ou de flottes d'AMR, ou collecter des milliers de demonstrations par scenario reste couteux. En introduisant un biais structurel plutot qu'un apprentissage purement bout-en-bout, DDACE questionne l'hypothese dominante selon laquelle les architectures end-to-end massives suffisent a generaliser en data-scarce regime, une piste distincte de la tendance actuelle centree sur les gros modeles VLA mono-robot type Pi-0 ou GR00T N2. Le papier s'inscrit dans une litterature qui cherche des alternatives modulaires a l'imitation pure, combinant clustering, graphes temporels et processus gaussiens plutot qu'un unique reseau de bout en bout. Il s'agit a ce stade d'une publication de recherche avec validations simulees et reelles limitees, sans indication de partenaire industriel ni de calendrier de transfert vers un produit ; le materiel complementaire est disponible sur le site du projet associe.

RecherchePaper
1 source
Embodied.cpp : un moteur d'inférence portable pour modèles d'IA incarnée sur robots hétérogènes
404arXiv cs.RO 

Embodied.cpp : un moteur d'inférence portable pour modèles d'IA incarnée sur robots hétérogènes

Des chercheurs publient sur arXiv (référence 2607.02501v1) un runtime d'inférence baptisé Embodied.cpp, conçu pour exécuter des modèles d'IA incarnée directement sur des robots physiques. Écrit en C++, il cible spécifiquement les modèles vision-langage-action (VLA) et les modèles monde-action (WAM), deux familles d'architectures qui équipent aujourd'hui la plupart des humanoïdes et bras robotiques pilotés par apprentissage. Le système s'organise en cinq couches, des adaptateurs d'entrée jusqu'aux adaptateurs de déploiement, en passant par la construction de séquences, l'exécution du backbone et des modules de tête interchangeables. Les auteurs l'ont testé sur deux modèles VLA, HY-VLA et pi0.5, obtenant des taux de réussite de tâches en boucle fermée de 100,0% et 91,0% respectivement. Sur un benchmark préliminaire de modèle WAM utilisant un bloc Transformer LingBot-VA, la mémoire consommée par bloc chute de 312,2 MiB à 88,1 MiB. Cette publication s'attaque à un problème très concret pour les intégrateurs robotiques: le déploiement des modèles d'IA incarnée reste aujourd'hui fragmenté entre piles Python spécifiques à chaque modèle, hypothèses matérielles disparates et code de liaison écrit à la main pour chaque robot. Les runtimes d'inférence existants sont pensés pour du serving requête-réponse classique, pas pour les contraintes réelles du contrôle robotique: exécution multi-fréquence dans une boucle fermée, inférence batch-1 en priorité latence sur du matériel hétérogène, et interfaces au-delà du simple flux de tokens. Si les résultats se confirment à plus grande échelle, un runtime portable unique capable de faire tourner plusieurs familles de VLA et de WAM sur des appareils edge variés réduirait significativement le travail d'ingénierie nécessaire pour passer d'un prototype en simulation à un déploiement réel sur robot, un des goulots d'étranglement les plus cités du secteur. Le travail s'inscrit dans la course actuelle autour des modèles génériques de contrôle robotique, aux côtés d'architectures comme Pi-0 de Physical Intelligence ou GR00T N2 de Nvidia, qui cherchent toutes à unifier perception, langage et action dans un seul modèle déployable sur du matériel varié. En proposant une couche d'abstraction backend commune plutôt qu'un modèle de plus, Embodied.cpp se positionne comme brique d'infrastructure plutôt que comme concurrent direct, un signe que la standardisation de l'inférence embarquée devient un enjeu aussi important que la performance des modèles eux-mêmes.

InfrastructureActu
1 source
« Guidage de sécurité neuro-symbolique pour modèles vision-langage-action via appariement de flux contraint »
405arXiv cs.RO 

« Guidage de sécurité neuro-symbolique pour modèles vision-langage-action via appariement de flux contraint »

Des chercheurs proposent une nouvelle méthode de sécurité pour les modèles Vision-Language-Action (VLA), les systèmes d'IA qui pilotent de plus en plus de robots humanoïdes et bras manipulateurs. Publiée sur arXiv (référence 2607.01378), l'étude cible spécifiquement les VLA basés sur le flow matching, une technique qui prédit non pas une seule action mais une trajectoire complète via un processus itératif de débruitage neuronal, à l'image de Pi-0, GR00T N2 ou Helix. Le problème identifié: les garde-fous de sécurité actuels ne bloquent que l'action immédiate du robot, sans anticiper les collisions à venir. La méthode proposée, baptisée guidage neuro-symbolique, reformule la sécurité comme un problème d'optimisation sous contrainte à norme minimale, appliqué directement pendant le débruitage des trajectoires intermédiaires bruitées. Testée sur le benchmark SafeLIBERO, elle atteint 82,8% d'évitement de collision et 81,6% de réussite des tâches, soit des gains de 6,3 et 19,8 points par rapport aux méthodes à une seule étape, les progrès les plus marqués apparaissant sur les tâches longues où les erreurs de trajectoire s'accumulent. Pour l'industrie robotique, cette avancée s'attaque à un angle mort réel du déploiement des VLA en usine ou en entrepôt: la plupart des systèmes actuels réagissent après coup plutôt que d'anticiper. Une correction en amont, intégrée au cœur du processus génératif plutôt qu'ajoutée en filtre externe, pourrait réduire les arrêts d'urgence et les interventions humaines sur les lignes où ces modèles pilotent des bras ou des robots mobiles autonomes (AMR). Le gain le plus significatif sur les tâches longues est particulièrement pertinent pour les intégrateurs, puisque c'est précisément sur ces séquences que les architectures VLA actuelles échouent le plus souvent en conditions réelles. Ce travail s'inscrit dans une littérature grandissante sur la sécurité des VLA, alors que ces modèles passent rapidement du stade de démonstration à des déploiements pilotes chez plusieurs acteurs de la robotique humanoïde. Les auteurs comparent leur approche aux méthodes de sécurité "single-step" existantes et proposent des démonstrations vidéo sur leur page de projet dédiée. Reste à voir si cette approche neuro-symbolique, validée pour l'instant en simulation sur SafeLIBERO, tiendra la route sur du matériel physique et à des cadences de production industrielles.

RecherchePaper
1 source
L'œil mobile : améliore la généralisation spatiale des VLA grâce à une collecte de données hybride et dynamique
406arXiv cs.RO 

L'œil mobile : améliore la généralisation spatiale des VLA grâce à une collecte de données hybride et dynamique

Le fil d'actualité de l'IA, voici l'article traduit et synthétisé. Une équipe de recherche publie sur arXiv (référence 2607.02322v1, soumis début juillet 2026) une étude intitulée "The Moving Eye", consacrée à la généralisation spatiale des modèles Vision-Language-Action (VLA). Le protocole expérimental repose sur une configuration à deux bras robotiques : l'un exécute la tâche de manipulation, l'autre sert de caméra mobile filmant la scène sous des angles variables. Les chercheurs comparent trois stratégies de collecte de données : vue fixe (Fixed), multi-fixe avec plusieurs points de vue statiques (Multi-Fixed), et vue mobile en mouvement continu (Moving Views). Les modèles testés couvrent le spectre actuel des architectures de manipulation robotique : ACT, les modèles à diffusion (Diffusion Policy), ainsi que les VLA Pi-0 et GR00T. Résultat central : une approche hybride, combinant mouvement continu de caméra et diversité de points de vue statiques, surpasse nettement les deux autres méthodes prises isolément. Cette étude s'attaque à un problème connu mais peu quantifié dans le secteur : le "shortcut learning", où un modèle VLA apprend des corrélations superficielles (pose relative fixe entre objets, ou entre caméra et base du robot) plutôt que la géométrie spatiale réelle de la tâche. Concrètement, un modèle entraîné avec des caméras fixes peut sembler performant en test mais échouer dès qu'on change la position de la caméra ou la disposition des objets, un écart démo-réalité que les intégrateurs industriels connaissent bien. L'article démontre que multiplier les points de vue fixes ne suffit pas à corriger ce biais, contrairement à une hypothèse répandue dans le secteur : seul le mouvement de caméra combiné à la diversité des vues réduit efficacement ces corrélations parasites, et ce gain se vérifie sur toutes les architectures testées, pas seulement sur les VLA les plus récents. Cette fragilité spatiale des VLA fait l'objet d'une attention croissante depuis la montée en puissance de modèles comme Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA), présentés comme généralistes mais dont la robustesse hors distribution reste discutée. En proposant une méthode de collecte de données peu coûteuse en matériel (un simple bras robotique reconverti en caméra mobile) plutôt qu'une refonte architecturale, les auteurs ouvrent une piste concrète pour les équipes qui entraînent leurs propres politiques de manipulation, avant d'éventuels essais à plus grande échelle sur des tâches et robots variés.

RechercheActu
1 source
IA incarnée : jeu de données de graphes de scène spatiaux pour l'évaluation de modèles vision-langage sur des trajectoires de manipulation robotique
407arXiv cs.RO 

IA incarnée : jeu de données de graphes de scène spatiaux pour l'évaluation de modèles vision-langage sur des trajectoires de manipulation robotique

Traduction avec le style demandé, en 3 paragraphes fluides sans titres. Une équipe de recherche présente EmbodimentSemantic, un jeu de données et un benchmark conçus pour évaluer la capacité des modèles vision-langage-action (VLA) à comprendre l'organisation spatiale des scènes en robotique manipulatrice. Le dataset représente chaque scène sous forme de graphe orienté objet-relation-objet, où chaque triplet encode une relation spatiale précise (support, contenance, ordre, occlusion, profondeur) entre deux objets. Il combine des observations réelles collectées avec le bras robotique low-cost SO101, accompagnées de graphes de scène générés automatiquement, ainsi qu'un benchmark simulé bâti sur l'environnement LIBERO comptant plus de 60 000 images de manipulation et plus de 120 000 graphes de scène spécifiques à chaque caméra, couvrant à la fois des vues à la troisième personne et des vues embarquées au poignet. Dans ce volet simulé, les relations de référence sont dérivées automatiquement de la géométrie MuJoCo, des coordonnées monde, des projections caméra et des contraintes de visibilité, ce qui garantit une annotation fiable sans intervention humaine. Ce travail met le doigt sur une faiblesse structurelle des systèmes VLA actuels: si ces modèles savent reconnaître des objets et suivre des instructions en langage naturel, ils peinent à représenter explicitement comment ces objets sont disposés les uns par rapport aux autres, en particulier sur les relations dépendantes de la profondeur ou du point de vue. Les expériences menées sur des VLM open source et commerciaux montrent que les modèles prédisent souvent des relations plausibles mais échouent sur la structure spatiale exacte, un écart qui rejoint le constat plus large d'un fossé entre démonstrations impressionnantes et robustesse réelle en conditions de manipulation. Pour les intégrateurs et équipes R&D, ce résultat suggère que l'injection explicite de graphes de scène dans les prompts des politiques VLA pourrait améliorer le contrôle en aval, une piste que les auteurs testent directement dans leurs expériences. EmbodimentSemantic s'inscrit dans la lignée des efforts récents visant à combler l'écart entre perception sémantique et contrôle moteur chez les modèles de type Pi-0, GR00T N2 ou Helix, qui reposent tous sur une compréhension fine de la géométrie de la scène pour planifier des trajectoires de manipulation fiables. En proposant un cadre unifié et reproductible pour diagnostiquer le grounding spatial, à la fois en environnement réel low-cost et en simulation contrôlée, les auteurs offrent un outil de benchmarking que les laboratoires de robotique pourront utiliser pour comparer objectivement leurs architectures VLA sur ce point précis, plutôt que de se fier aux seules démonstrations vidéo souvent sélectives des annonces commerciales.

RecherchePaper
1 source
Robustesse de la manipulation robotique : fondations et perspectives
408arXiv cs.RO 

Robustesse de la manipulation robotique : fondations et perspectives

Résumé pour l'article "Robustness of Robotic Manipulation: Foundations and Frontiers" : Une équipe de chercheurs publie sur arXiv une étude systématique consacrée à la robustesse de la manipulation robotique, un chantier resté jusqu'ici fragmenté entre sous-domaines qui n'utilisaient pas les mêmes définitions. Les auteurs proposent d'abord une définition formelle : la robustesse mesure la capacité d'un système de manipulation à atteindre son objectif malgré l'incertitude et la variation des conditions. Ils en dérivent ensuite deux formulations générales, l'une probabiliste, l'autre issue de la théorie du contrôle, avant de cartographier les mécanismes concrets qui produisent de la robustesse à chaque étage de la pile robotique : perception, planification, contrôle, apprentissage de politiques (policy learning) et conception matérielle. Chaque mécanisme est illustré par des travaux de référence, des fondations historiques aux publications récentes. Le papier revient aussi sur les métriques et protocoles d'évaluation existants, souvent hétérogènes, et se conclut par une liste de problèmes ouverts vers une robustesse comparable à celle des humains. L'enjeu dépasse l'exercice académique. Depuis deux ans, une génération de modèles VLA (vision-language-action) comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia, Helix de Figure ou Optimus de Tesla revendique des capacités de manipulation généralistes, mais les annonces s'appuient sur des démonstrations et des métriques propres à chaque acteur, difficiles à comparer entre elles. Pour les intégrateurs et décideurs B2B qui doivent choisir une solution pour de la logistique ou de l'assemblage, disposer d'un cadre commun pour distinguer un modèle réellement robuste d'une démonstration soigneusement sélectionnée devient central, surtout face à l'écart bien documenté entre performance en vidéo et performance en déploiement réel. Cette synthèse s'inscrit dans une lignée qui remonte au contrôle robuste classique des années 1980-1990, avant que l'apprentissage par renforcement puis les politiques end-to-end n'ouvrent de nouvelles pistes dans les années 2010-2020, jusqu'au boom actuel des modèles fondation pour la robotique portés par des laboratoires comme Physical Intelligence, Nvidia, Google DeepMind ou Figure. En posant un vocabulaire et des critères communs, les auteurs cherchent moins à trancher un débat qu'à donner aux chercheurs et industriels un langage partagé pour comparer leurs approches, une étape jugée nécessaire avant toute standardisation sectorielle des tests de robustesse.

RecherchePaper
1 source
Chine : UBTech présente un humanoïde à roues pour automatiser les ateliers de production
409Interesting Engineering 

Chine : UBTech présente un humanoïde à roues pour automatiser les ateliers de production

UBTech, fabricant robotique basé à Shenzhen, a présenté le Cruzr Y1, un humanoïde industriel à roues, lors d'une exposition technologique en Chine, où le robot a effectué en démonstration live du déstackage de caisses et de la palettisation de manière autonome. L'engin embarque des puces domestiques chinoises Digua S100P et S600, la plateforme logicielle propriétaire ROSA, et un modèle VLA (Vision-Language-Action) couplant perception, prise de décision et contrôle moteur. Sa mobilité repose sur des roues omnidirectionnelles à 360 degrés combinées à un mécanisme d'élévation verticale, permettant une circulation dans des allées de fabrication étroites. Les bras doubles utilisent des joints harmoniques avec capteurs de couple, tandis qu'un système multi-capteurs composé de lidar et de caméras de profondeur, disposés sur la tête, les poignets et le châssis, assure une couverture situationnelle à 360 degrés. L'autonomie dépasse quatre heures en charge maximale, avec recharge automatique et swap rapide de batterie pour un fonctionnement continu. En parallèle, UBTech a lancé la série U1 sous sa nouvelle marque grand public UWORLD, affiché à environ 30 000 dollars: plus de 2 100 précommandes en une semaine sur JD.com, livraisons annoncées pour mi-septembre, 88 degrés de liberté, revêtement en silicone réaliste, 183 cm pour la version masculine et 168 cm pour la féminine. L'intégration d'un modèle VLA dans un robot logistique à déploiement industriel est techniquement notable: elle substitue la programmation par trajectoire fixe par une perception adaptative, ce qui réduit théoriquement le temps de reconfiguration pour les intégrateurs. La plateforme Cruzr Y1 n'est ni un AMR classique ni un bras industriel fixe, mais une unité hybride combinant mobilité, manipulation bilatérale et levage vertical en un seul système. Pour un COO logistique, cela représente une alternative potentielle aux architectures AMR plus bras dédiés. Cela dit, UBTech n'a publié aucune métrique de cadence de cycle, taux d'erreur ou volume déployé en conditions réelles: la démonstration reste un proof-of-concept en environnement contrôlé, ce qui rend toute comparaison avec des systèmes en production comme ceux d'Exotec (Skypod) ou de Berkshire Grey prématurée. Fondée en 2012, UBTech compte parmi ses clients industriels Airbus, Texas Instruments, NIO, ZEEKR, Dongfeng Liuzhou Motor et FAW-Volkswagen. Le Cruzr Y1 s'inscrit dans une stratégie de diversification face à la concurrence humanoïde croissante, avec Figure AI et son Figure 03, Tesla et l'Optimus Gen 3, Physical Intelligence avec Pi-0, et NVIDIA avec GR00T N2. Le lancement simultané de la gamme U1 grand public signale une bifurcation stratégique: UBTech vise à la fois le B2B industriel et un marché B2C émergent en Chine, où la demande pour des robots compagnons commence à se structurer. Les prochaines étapes clés seront les retours terrain des pilotes industriels du Cruzr Y1 et les premiers usages réels de la U1 après les livraisons de mi-septembre.

Chine/AsieActu
1 source
WoVR : des modèles du monde comme simulateurs fiables pour l'entraînement post-déploiement des politiques VLA par renforcement
410arXiv cs.RO 

WoVR : des modèles du monde comme simulateurs fiables pour l'entraînement post-déploiement des politiques VLA par renforcement

Des chercheurs ont publié sur arXiv (référence 2602.13977v2) un framework nommé WoVR, conçu pour entraîner via du reinforcement learning (RL) des politiques de type Vision-Language-Action (VLA) sans recourir à des milliers d'heures d'interaction physique réelle. Le principe : substituer le robot réel par un modèle du monde appris, c'est-à-dire un modèle vidéo conditionné par les actions qui prédit le comportement de l'environnement. WoVR articule trois mécanismes distincts : un modèle vidéo action-conditionné à stabilité contrôlée, une stratégie baptisée Keyframe-Initialized Rollouts qui réinitialise les trajectoires imaginées à partir d'images-clés pour limiter l'accumulation d'erreurs sur l'horizon, et une co-évolution conjointe du modèle du monde et de la politique pour maintenir leur cohérence dans le temps. Les expériences rapportées montrent des gains sur le benchmark LIBERO et des améliorations mesurées sur plusieurs plateformes robotiques physiques. Ce travail s'attaque à un verrou central du post-entraînement des VLA : le RL promet d'aller au-delà de l'imitation learning, mais ses besoins en données d'interaction rendent son application directe sur robot physique quasi prohibitive. La contribution de WoVR est de montrer qu'un modèle du monde imparfait peut néanmoins servir de simulateur RL fiable, à condition de contrôler explicitement ses hallucinations plutôt que de les ignorer. C'est un signal positif pour la thèse que le sim-to-real, appliqué non au niveau du rendu physique mais au niveau de la prédiction vidéo apprise, peut débloquer l'optimisation de politiques à grande échelle. La nuance importante : les résultats sont publiés sous forme de papier de recherche, les démonstrations sont disponibles sur wovr-corl.github.io, mais aucun déploiement industriel n'est revendiqué. WoVR s'inscrit dans une vague de recherche qui cherche à reproduire pour la robotique ce que le RL a accompli pour les grands modèles de langage. Les VLA comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou OpenVLA ont montré des capacités impressionnantes en imitation, mais leur amélioration par RL reste un problème ouvert. D'autres approches concurrentes misent sur des simulateurs physiques classiques (Isaac Lab, MuJoCo) ou sur du RL directement en conditions réelles, avec des cycles de collecte longs et coûteux. WoVR propose une troisième voie via les world models vidéo, dans la lignée des travaux de type DIAMOND ou DreamerV3 appliqués à la robotique. La soumission cible CORL, conférence de référence du domaine, ce qui suggère une prochaine validation par les pairs et potentiellement une intégration dans les pipelines d'entraînement open-source des équipes académiques et industrielles dès 2026.

RechercheOpinion
1 source
ReactiveBFM : planification de mouvement réactive en boucle fermée pour le contrôle global des humanoïdes
411arXiv cs.RO 

ReactiveBFM : planification de mouvement réactive en boucle fermée pour le contrôle global des humanoïdes

Des chercheurs ont publié le 30 juin 2026 sur arXiv (identifiant 2606.30362) les travaux ReactiveBFM, un framework de planification-contrôle en boucle fermée temps réel pour humanoïdes, validé sur le robot Unitree G1. L'approche atteint un taux de succès de 93,1 % lors de benchmarks sim-to-sim soumis à des perturbations sévères, surpassant de 28,6 points les baselines en boucle ouverte classiques. Le système permet notamment la poursuite de cibles mobiles en zero-shot, c'est-à-dire sans avoir été entraîné explicitement sur cette tâche, en mobilisant une coordination corps entier fluide et une replanification à la volée. Le verrou technique adressé est le problème dit d'exposition bias : quand un modèle génératif de planification de mouvement est naïvement chaîné avec un contrôleur d'exécution, les écarts de suivi s'accumulent jusqu'à provoquer des effondrements comportementaux. ReactiveBFM répond à cela via un curriculum d'échantillonnage par préfixe planifié (scheduled prefix sampling), qui force le planificateur à apprendre des comportements de récupération d'erreur à partir d'états physiques imparfaits plutôt que de trajectoires de référence idéales. Un second mécanisme d'asynchronisme découple la replanification autorégressive, lente, du tracking haute fréquence, tandis qu'un chunking de trajectoire assure la cohérence spatio-temporelle sans jitter physique. Pour les intégrateurs industriels et les équipes de recherche en contrôle humanoïde, cela valide une piste concrète pour rendre les Behavior Foundation Models (BFMs) exploitables hors conditions laboratoire. Les BFMs sont une classe émergente de modèles pré-entraînés qui fournissent des priors de contrôle pour humanoïdes, analogues aux LLMs pour le texte. Jusqu'ici, leur limitation majeure était l'exécution figée de mouvements pré-définis, sans adaptation à l'environnement. Le Unitree G1, humanoïde chinois à 16 000 dollars commercialisé depuis 2024, s'est imposé comme banc de test standard dans la recherche académique. Les concurrents directs sur le plan scientifique incluent les travaux autour de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et les architectures VLA embarquées chez Figure et Agility Robotics. Ce papier reste à ce stade un preprint non évalué par les pairs : les résultats sim-to-sim sont prometteurs mais aucun déploiement industriel ni transfert sim-to-real robuste n'est encore démontré.

UELes techniques ReactiveBFM (curriculum de préfixe planifié, réplanification asynchrone, chunking de trajectoire) sont directement exploitables par les équipes R&D européennes travaillant sur les Behavior Foundation Models pour humanoïdes, mais aucun acteur français ou européen n'est impliqué dans ces travaux.

RechercheOpinion
1 source
L'ex-directeur du laboratoire robotique et véhicules autonomes de Baidu lève des dizaines de millions pour créer un modèle du monde universel pour la robotique
41236Kr 

L'ex-directeur du laboratoire robotique et véhicules autonomes de Baidu lève des dizaines de millions pour créer un modèle du monde universel pour la robotique

Nüwa Robotics (纽娲机器人), startup chinoise fondée en février 2026 par le Dr Yang Ruigang, vient de boucler un tour angel de 50 millions de yuans (environ 6,9 millions d'euros), mené par Bluerun Ventures, avec la participation de Butong Capital et de Gongqingcheng Puyi Investment. C'est le deuxième financement en moins de deux mois : un seed round avait été conduit par Plug and Play Chine peu avant. Yang Ruigang est une figure connue de l'écosystème autonomie chinois : il a dirigé le laboratoire de conduite autonome et de robotique de Baidu, puis exercé comme CTO d'Inceptio Technology (嬴彻科技), où il a piloté la mise en production de camions autonomes de niveau L3. Aujourd'hui professeur associé à l'Université Jiao Tong de Shanghai, il oriente Nüwa vers un objectif précis : la construction d'un "World Traversal Model" (WTM), un modèle de navigation destiné à des robots de toute morphologie, humanoïdes, quadrupèdes, AGV ou véhicules de livraison. Le pari de Nüwa repose sur un constat que le secteur commence à intérioriser : la mobilité dans les environnements humains reste un verrou sous-estimé de la robotique incarnée. Là où la majorité des acteurs se concentrent sur la manipulation ou les architectures VLA (Vision-Language-Action), Nüwa cible la couche locomotion-navigation avec une ambition de déploiement sans carte ou à partir de plans génériques (Gaode, Baidu Maps). Leur moteur de simulation maison, SimWeaver, affiche selon la société des performances 3x supérieures à NVIDIA ISAAC Sim en vitesse de génération de données, une réduction de 20 % de l'erreur sim-to-real, et un taux de succès en zero-shot de 91 % sur des tâches de manipulation d'objets flexibles. Ces chiffres sont auto-déclarés et non vérifiés par des tiers. En locomotion, le système parvient à franchir des escaliers creux inclinés à 55 degrés en combinant vision et proprioception, là où d'autres solutions procèdent en aveugle. Nüwa intègre également un module de "conformité sociale" : le modèle est entraîné à respecter des règles comportementales implicites comme laisser sortir avant d'entrer dans un ascenseur ou céder le passage en espace public. Nüwa s'inscrit dans un paysage compétitif où les grandes architectures sont déjà définies : chez Figure, le modèle Helix (System 0/1/2) sépare planification lente et contrôle rapide ; NVIDIA GR00T N1 suit une logique similaire ; en Chine, Zhiyuan (智元) découpe locomotion, manipulation et interaction, tandis que Tencent RoboticsX structure son architecture SLAP en quatre couches. Nüwa choisit une entrée différente : transférer les acquis de l'autonomie véhiculaire vers des environnements beaucoup plus denses (ascenseurs, couloirs, centres commerciaux), en capitalisant sur la maîtrise de la simulation physique 3D de l'équipe. Le fondateur reconnaît que la brique manipulation reste à construire from scratch, sans analogue dans la conduite autonome. La feuille de route prévoit un premier déploiement du WTM dans un à deux scénarios réels en 2026, logistique et tourisme en priorité, avant une montée en puissance vers la production de robots propres à Nüwa et l'ouverture de la plateforme à des intégrateurs tiers. Aucun client ni partenaire industriel nommé n'a été annoncé à ce stade.

UEL'émergence de Nüwa illustre la compétition croissante de l'écosystème robotique chinois sur la couche navigation-locomotion, un segment encore peu occupé par les acteurs européens, sans impact opérationnel immédiat pour la France/UE.

Chine/AsieActu
1 source
StereoVLA : améliorer les modèles vision-langage-action grâce à la vision stéréoscopique
413arXiv cs.RO 

StereoVLA : améliorer les modèles vision-langage-action grâce à la vision stéréoscopique

Des chercheurs ont publié sur arXiv (référence 2512.21970v2) StereoVLA, un modèle Vision-Language-Action (VLA) qui intègre la stéréovision dans les pipelines de manipulation robotique généraliste. L'architecture repose sur un encodeur visuel GeoSem (Geometric-and-Semantic), qui extrait en parallèle des indices géométriques issus des disparités entre vues stéréoscopiques et des représentations sémantiques classiques à partir des pixels RGB. Le modèle intègre deux objectifs de co-entraînement : l'Interaction-Region Depth Estimation, pour affiner le raisonnement spatial lors des saisies, et la Camera Parameter Estimation, pour aligner implicitement les repères de perception et d'action du robot. Entraîné sur des données stéréo synthétiques à grande échelle, StereoVLA atteint un gain absolu de 33,4 points de pourcentage en taux de succès en conditions réelles par rapport aux baselines monoculaires, et démontre une robustesse marquée à des angles de caméra proches de l'hémisphère supérieur. Ce gain de 33,4 % est substantiel dans un domaine où les progrès incrémentaux dominent la littérature. Il confirme une hypothèse structurelle : les encodeurs visuels préentraînés sur lesquels s'appuient les VLA actuels (CLIP, SigLIP) sont optimisés pour l'alignement sémantique, au détriment de la représentation géométrique 3D indispensable à la manipulation fine. Pour un intégrateur ou un COO industriel, cette démonstration repositionne le choix du capteur (stéréo vs monoculaire) comme décision architecturale critique dans toute cellule robotisée guidée par VLA. La robustesse aux angles hémisphériques est également un signal de maturité opérationnelle : en déploiement réel, la posture du bras et les contraintes d'encombrement imposent des perspectives de caméra qui mettent en défaut les VLA classiques. Les VLA (Pi-0 de Physical Intelligence, OpenVLA, GR00T N2 de NVIDIA) constituent depuis 2024 le nouveau paradigme de contrôle généraliste pour la manipulation, mais reposent tous sur des encodeurs conçus pour la vision sémantique, non géométrique. StereoVLA adresse directement ce goulot d'étranglement en exploitant la stéréovision, technologie éprouvée dans les AMR et les caméras industrielles de profondeur (RealSense, ZED), mais restée jusqu'ici absente des pipelines VLA. L'étude demeure au stade de la recherche académique : aucun déploiement industriel ni partenariat constructeur n'est annoncé. La validité externe du gain de 33,4 % devra être éprouvée sur des bras commerciaux variés (Franka, UR, xArm) et dans des environnements moins contrôlés avant de conclure à une transférabilité industrielle.

IA physiqueOpinion
1 source
Les modèles d'action du monde permettent un apprentissage par imitation continu avec rejeu génératif récurrent
414arXiv cs.RO 

Les modèles d'action du monde permettent un apprentissage par imitation continu avec rejeu génératif récurrent

Publiés en juin 2026 sur arXiv (référence 2606.27374), des chercheurs présentent REGEN (Recurrent Generative Replay), un cadre d'apprentissage continu par imitation fondé sur les World Action Models (WAMs). Contrairement aux modèles de politique classiques qui se contentent de prédire les actions du robot, les WAMs génèrent également des observations visuelles futures, combinant ainsi deux capacités distinctes dans un seul modèle. REGEN exploite cette dualité en interrogeant récursivement le WAM pour synthétiser des trajectoires de pseudo-replay, conditionnées uniquement sur les instructions des tâches antérieures et les observations de la tâche courante. Testée en simulation et en manipulation réelle, l'approche réduit l'oubli catastrophique de 50 % en comparaison au fine-tuning séquentiel classique, tout en s'approchant des performances des méthodes dites "privileged" qui, elles, conservent l'accès aux démonstrations humaines originales. L'enjeu industriel est direct : l'oubli catastrophique constitue l'un des verrous majeurs au déploiement continu de robots en environnement réel. Dès qu'un système est refiné sur une nouvelle tâche, il dégrade ses capacités acquises précédemment. Les solutions actuelles imposent de conserver les démonstrations humaines originales, ce qui soulève des contraintes de stockage, de coût de collecte et parfois de confidentialité des données opérationnelles. REGEN casse cette dépendance : le robot répète mentalement ses tâches passées sans jamais avoir besoin des vidéos source. Cela ouvre la voie à des déploiements adaptatifs dans des cellules de production ou d'entrepôt où les tâches évoluent en continu. Le gain de 50 % reste cependant partiel, et les auteurs reconnaissent que leur méthode n'atteint pas encore le niveau des méthodes ayant accès aux données réelles. Le travail s'inscrit dans la dynamique des world models appliqués à la robotique, un axe de recherche en forte accélération depuis 2023 porté par des acteurs comme Physical Intelligence (avec π0), Google DeepMind, ou NVIDIA (GR00T N2). L'originalité de REGEN réside dans l'usage génératif du WAM pour l'apprentissage continu, plutôt que pour la planification ou le sim-to-real. Les auteurs identifient deux goulots d'étranglement principaux : la dégradation visuelle sur les horizons longs et l'incohérence entre actions générées et observations synthétisées, deux limites qui dessinent clairement l'agenda de recherche pour les prochaines itérations. Aucun partenaire industriel ni calendrier de commercialisation n'est mentionné ; il s'agit à ce stade d'une contribution académique, non d'un produit déployé.

RechercheOpinion
1 source
RouterVLA : des tests de fumée transformés en supervision pour la sélection de modèles VLA hétérogènes
415arXiv cs.RO 

RouterVLA : des tests de fumée transformés en supervision pour la sélection de modèles VLA hétérogènes

RouterVLA, présenté dans un preprint arXiv déposé en juin 2026 (identifiant 2606.27355), s'attaque à un problème concret souvent ignoré dans le déploiement robotique : comment choisir, parmi plusieurs politiques vision-language-action (VLA) candidates, celle que l'on installe réellement sur le robot. Les équipes robotiques effectuent systématiquement des "smoke tests" - des séries d'essais courts avant déploiement - pour comparer les candidats, puis retiennent un seul vainqueur global. RouterVLA propose de capitaliser sur ces essais déjà réalisés via une technique dite de "cross-fitting à résultats disjoints" : les essais enregistrés construisent un profil de performance pour chaque politique expert gelée, tandis qu'un essai distinct, non inclus dans ce profil, sert à noter l'expert retenu. Évalué sur 34 752 enregistrements de rollouts issus du benchmark LIBERO-Plus, une règle transparente basée sur le taux de succès des probes fait passer le taux de succès hors-échantillon de 0,4686 à 0,6149, soit un gain de 14,64 points de pourcentage. Le résultat le plus saillant n'est pas le gain lui-même, mais ce qui le produit. Sous les profils scalaires étudiés, les scoreurs appris sont statistiquement indiscernables de la simple règle de succès-probe, ce qui implique que la valeur de routage vient du processus de commissionnement - les smoke tests eux-mêmes - et non d'une capacité ML supplémentaire. Ajouter des couches d'apprentissage pour scorer les politiques ne crée donc pas de valeur additionnelle si les profils restent scalaires. Tout aussi important pour l'intégrité des benchmarks : réutiliser le même essai pour sélectionner et évaluer l'expert gonfle artificiellement le gain mesuré par un facteur de 1,87. Ce résultat constitue un avertissement méthodologique direct pour la communauté, car de nombreux papiers comparatifs en robotique pourraient souffrir de ce biais de contamination si la séparation des outcomes n'est pas garantie. LIBERO-Plus est un environnement de simulation pour la manipulation robotique de table, largement utilisé pour évaluer des politiques de généralisation. RouterVLA s'inscrit dans le champ croissant de la sélection hétérogène de politiques VLA, un problème qui devient critique à mesure que les fondations VLA se multiplient : Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA), Helix (Figure AI), ou les politiques maison des labs comme Google DeepMind. La question de savoir quel modèle router selon la tâche est un vrai enjeu d'industrialisation, distinct de celui d'entraîner de meilleurs modèles individuels. Ce preprint ne mentionne ni déploiement réel ni partenaire industriel : il s'agit d'une contribution méthodologique évaluée en simulation. Les suites naturelles seraient d'étendre l'analyse à des profils non-scalaires (embeddings, séquences temporelles) et de valider la séparation des outcomes en manipulation physique réelle.

RechercheOpinion
1 source
SSI-Policy : apprentissage d'interfaces de scène structurées pour la manipulation robotique vision-langage
416arXiv cs.RO 

SSI-Policy : apprentissage d'interfaces de scène structurées pour la manipulation robotique vision-langage

Des chercheurs ont déposé SSI-Policy sur arXiv (2606.26800, juin 2026), un framework modulaire pour la manipulation robotique en régime de faibles données. Le système repose sur une représentation intermédiaire appelée Structured Scene Interface (SSI), une couche RGB-only qui encode simultanément des caractéristiques de profondeur monoculaire, des dispositions spatiales d'objets ancrées dans le langage naturel, et des trajectoires 2D conditionnées par instruction. Sur le benchmark LIBERO avec seulement 10 démonstrations par tâche, SSI-Policy dépasse la meilleure méthode concurrente de près de 15 points, et reste compétitif face aux approches à 50 démonstrations recourant au préentraînement externe à large échelle. Les auteurs valident également sur 13 tâches réelles : raisonnement spatial, transfert cross-embodiment et manipulation avec contact. L'apport central est architectural : en découplant la perception du contrôle via l'interface SSI, la politique aval peut apprendre à partir de très peu de démonstrations. Que l'interface soit entraînable sur des vidéos sans annotation d'action est particulièrement précieux pour les intégrateurs industriels qui peinent à collecter des données de téléopération à grande échelle. L'absence de capteur de profondeur, le système fonctionnant en pure RGB, réduit les prérequis matériels et facilite le déploiement sur des bras standards. Le caractère robot-agnostique de SSI cible directement la faiblesse récurrente des VLA (Vision-Language Action models) comme Pi-0 de Physical Intelligence, OpenVLA ou GR00T N2 de NVIDIA : leur difficulté à transférer vers de nouveaux embodiments sans réentraînement coûteux. SSI-Policy se positionne face à trois familles de méthodes : les approches vidéo (SuSIE, UniSim), sujettes à dérive géométrique sur les horizons longs ; les méthodes 3D (Act3D, RoboPoint), qui exigent du RGB-D ; et les interfaces de flux optique, sans structure géométrique explicite. SSI-Policy prétend en combiner les avantages, affirmation partiellement étayée par les ablations publiées mais restant à confirmer sur des benchmarks plus larges comme RLBench ou DROID. L'article est un preprint, non soumis à évaluation par les pairs. La suite logique : validation sur plateformes humanoïdes complètes et pilotes industriels réels, deux domaines où la robustesse en faible nombre d'exemples reste le verrou commercial principal.

IA physiqueOpinion
1 source
Pilotage du comportement robotique à l'inférence par reconfiguration physiquement informée de la structure de tâche
417arXiv cs.RO 

Pilotage du comportement robotique à l'inférence par reconfiguration physiquement informée de la structure de tâche

Une équipe de recherche a publié sur arXiv (ref. 2606.26588) un système baptisé ReStruct, conçu pour modifier le comportement d'un robot en cours de déploiement sans nécessiter de réentraînement. Le problème visé est ce que les chercheurs appellent le "steering à l'inférence" : forcer une politique robotique apprise à respecter une préférence utilisateur imprévue lors de l'entraînement, au moment du test uniquement. ReStruct repose sur une architecture en deux niveaux : un squelette de haut niveau modélisé comme une machine à états finis (automate neural), qui encode la structure de la tâche, et un contrôleur bas niveau sous forme de politique résiduelle, qui reste entièrement gelé. Lors de la modification d'une préférence, c'est uniquement l'automate qui est reconfiguré via un produit synchrone, mettant à jour les prior d'action transmis au contrôleur. Sur banc de test en simulation et en environnement réel, ReStruct dépasse les modèles VLA (Vision-Language-Action) existants de jusqu'à 25 % en taux de réussite de tâche et en respect des préférences, pour des spécifications allant de contraintes sur des objets spécifiques jusqu'à des contraintes de logique temporelle. L'enjeu industriel est significatif : le réentraînement d'une politique robotique pour chaque nouvelle variante de tâche ou préférence opérateur représente aujourd'hui un verrou majeur à la scalabilité des déploiements. Les approches bout-en-bout (fine-tuning, guidance experte) sont trop coûteuses en pratique, tandis que les méthodes neuro-symboliques classiques génèrent des plans logiquement cohérents mais physiquement irréalisables, ce que ReStruct corrige en intégrant la faisabilité physique directement dans la reconfiguration de la structure de tâche. Le fait que la méthode surpasse les modèles VLA sur ces métriques est notable : les VLA représentent actuellement le paradigme dominant en robotique manipulatrice apprise, et cette architecture hybride formelle-neuronale suggère une voie complémentaire plutôt que concurrente. Ce travail s'inscrit dans un débat de fond entre approches purement end-to-end et méthodes symboliques pour la robotique généraliste. Les modèles VLA comme pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI) misent sur des fondations neuronales massives adaptées par fine-tuning, ce qui les rend rigides face aux variations de préférences non anticipées. ReStruct propose une alternative légère, fondée sur la théorie des automates, qui n'impose pas de réentraîner le contrôleur. Il s'agit d'un preprint académique sans affiliation industrielle annoncée ni déploiement terrain mentionné, mais la démonstration en conditions réelles renforce la crédibilité de l'approche. Les prochaines étapes naturelles seraient l'intégration dans des pipelines de déploiement existants et l'évaluation sur des manipulateurs commerciaux multi-tâches.

RechercheOpinion
1 source
E-TTS : un nouveau cadre de mise à l'échelle au moment de l'inférence pour la manipulation robotique
418arXiv cs.RO 

E-TTS : un nouveau cadre de mise à l'échelle au moment de l'inférence pour la manipulation robotique

Des chercheurs présentent sur arXiv (2606.27268, juin 2026) E-TTS, un cadre de mise à l'échelle à l'inférence (test-time scaling) pour la manipulation robotique, applicable en surcouche de modèles vision-language-action (VLA) existants sans réentraînement ni collecte de données supplémentaire. Le framework repose sur deux mécanismes : un échantillonnage conjoint raisonnement-action avec notation par paires, et un tampon d'historique (history buffer) qui stocke les observations passées pour contextualiser les décisions d'action. Contrairement aux méthodes TTS en boucle ouverte, E-TTS intègre du feedback durant l'inférence via un mécanisme de raffinement itératif en boucle fermée, piloté par des vérificateurs vision-langage. Les auteurs rapportent des gains jusqu'à 33,14 % en simulation et 26,62 % en conditions réelles, mesurés sur 4 benchmarks, 6 environnements, 3 morphologies de robots et 4 modèles VLA de base. L'enjeu est de transposer à la robotique ce qui a fonctionné pour les LLMs : amplifier les capacités à l'inférence sans modifier les poids du modèle. Le défi spécifique aux robots est que les tâches sont séquentielles et longues : une observation instantanée ne suffit pas pour choisir la bonne action, contrairement à une requête texte isolée. En partageant un buffer d'historique entre les modules de raisonnement et de vérification d'action, E-TTS comble un angle mort des méthodes TTS précédentes pour l'embodied AI. Le fait que le gain tienne en conditions réelles (26,62 %) et pas seulement en simulation est un signal positif sur le sim-to-real gap, même si les conditions exactes de ces expériences en monde réel méritent examen dans le papier complet. Le test-time scaling a émergé avec les architectures o1 et o3 d'OpenAI et les approches chain-of-thought pour les LLMs, avant d'être progressivement exploré pour les VLA robotiques. E-TTS s'inscrit dans ce mouvement que les auteurs eux-mêmes qualifient d'"early attempts", ce qui situe honnêtement le niveau de maturité. L'architecture modulaire et plug-and-play est conçue pour s'adapter à des VLA variés, ce qui pourrait faciliter l'adoption par des équipes travaillant sur des modèles comme pi0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA. Le papier ne mentionne ni déploiement industriel ni partenariat avec un constructeur de robots : il reste une preuve de concept académique dont la validation sur des tâches industrielles réelles (assemblage, palettisation) constituerait l'étape suivante naturelle.

💬 Ce qui change ici, c'est le buffer. Appliquer le test-time scaling à un robot, c'est pas aussi simple qu'à un LLM : un bras qui visse en étape 7 ne peut pas raisonner sur une observation instantanée, il lui faut les étapes précédentes pour contextualiser. Que les gains tiennent à 26 % en conditions réelles et pas seulement en sim, c'est le seul résultat qui compte pour l'instant.

IA physiqueOpinion
1 source
TIDAL : boucle diffusion-action à entrelacement temporel pour le contrôle VLA haute fréquence
419arXiv cs.RO 

TIDAL : boucle diffusion-action à entrelacement temporel pour le contrôle VLA haute fréquence

Des chercheurs ont publié sur arXiv (papier 2601.14945, version 2) un cadre architectural nommé TIDAL, Temporally Interleaved Diffusion and Action Loop, qui s'attaque directement au goulot d'étranglement en latence des modèles Vision-Language-Action (VLA). Le problème est précis : les VLA actuels basés sur la diffusion tournent typiquement à environ 2,4 Hz sur hardware embarqué, imposant un paradigme "batch-and-execute" où le robot planifie en bloc puis exécute en boucle ouverte. TIDAL introduit une architecture à double fréquence qui découple le raisonnement sémantique (boucle basse fréquence qui met en cache les embeddings d'intention) de l'actuation motrice (boucle haute fréquence qui entrelace intégration de flux à un pas et exécution). Résultat mesuré : environ 9 Hz de mises à jour de contrôle sur edge hardware, soit 4x la fréquence de feedback des baselines, avec un gain de performance 2x sur des tâches d'interception dynamique. La méthode ajoute également un prédicteur différentiel de mouvement pour compenser l'insensibilité à la vélocité des encodeurs visuels statiques, et une stratégie d'entraînement à désalignement temporel pour apprendre à compenser la latence résiduelle. L'impact concret pour les intégrateurs robotiques réside dans ce que le papier nomme "l'angle mort d'exécution" : quand une cible se déplace pendant la fenêtre d'exécution en boucle ouverte, les baselines VLA échouent systématiquement sous protocole d'inférence non-pausée, TIDAL reste opérationnel. C'est architectural et orthogonal aux optimisations système (quantification, batching), ce qui signifie qu'il peut s'empiler sur d'autres gains de performance. La régression marginale sur les tâches statiques (cibles immobiles) est honnêtement reconnue par les auteurs, ce qui est de bonne pratique évaluative. Pour un décideur B2B, la question pertinente reste ouverte : les gains sont mesurés en simulation et sur tâches de laboratoire, pas sur déploiement réel. TIDAL s'inscrit dans une compétition dense autour de la latence des VLA, portée par les modèles Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et OpenVLA. Ces architectures partagent le défi structurel du sim-to-real et de la fréquence de contrôle insuffisante pour les environnements industriels dynamiques (convoyeurs, pièces en mouvement, collaboration humain-robot). TIDAL est un travail de recherche académique sans annonce de déploiement ni partenaire industriel identifié, ce qui tempère toute projection immédiate. La prochaine étape naturelle serait une validation sur hardware réel, bras manipulateur ou humanoïde, avec métriques de robustesse en conditions non-contrôlées.

IA physiqueOpinion
1 source
RoboRouter : sélection de politiques sans entraînement pour la manipulation robotique
420arXiv cs.RO 

RoboRouter : sélection de politiques sans entraînement pour la manipulation robotique

Des chercheurs ont publié RoboRouter (arXiv:2603.07892, version 4), un système de routage intelligent entre politiques robotiques hétérogènes pour les tâches de manipulation. Plutôt que d'entraîner une nouvelle politique monolithique, RoboRouter maintient un pool de politiques existantes -- modèles vision-langage-action (VLA), politiques vision-action (VA) et approches compositionnelles par code -- et sélectionne automatiquement la meilleure pour chaque nouvelle tâche. Le mécanisme repose sur une représentation sémantique de la tâche, une recherche dans l'historique d'exécutions similaires, puis une prédiction directe sans trial-and-error. Le retour structuré après chaque exécution affine les décisions suivantes. En simulation et en conditions réelles, RoboRouter améliore le taux de succès moyen de plus de 3 points en simulation et de 13 points en environnement réel par rapport aux politiques individuelles, sans dégradation de la vitesse d'exécution. Intégrer une nouvelle politique dans le système ne requiert qu'une évaluation légère, sans coût de réentraînement. Ce résultat a une portée concrète pour les intégrateurs. Le problème central de la manipulation robotique est que chaque paradigme excelle sur sa distribution d'entraînement mais généralise mal hors distribution. RoboRouter contourne ce mur non pas en cherchant un meilleur modèle universel, mais en exploitant les forces complémentaires de politiques spécialisées existantes. Le gain de 13 % en réel est notable car le sim-to-real gap ronge habituellement les gains obtenus en simulation. L'absence de réentraînement signifie que le système peut absorber de nouveaux modèles au fil du temps -- une propriété utile à mesure que les VLA comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) sortent des cycles de recherche pour entrer en déploiement. Ce travail prend place dans un contexte de prolifération rapide des paradigmes de contrôle robotique. Les équipes de Figure (Figure 03), Tesla (Optimus Gen 3) ou 1X parient sur l'unification via un seul grand modèle entraîné à grande échelle. RoboRouter incarne une thèse adverse: l'hétérogénéité contrôlée, avec un orchestrateur léger, peut surpasser la politique unique sans le coût computationnel associé. Les auteurs ne précisent pas de déploiement industriel annoncé ni de partenariats, ce qui place cette contribution dans le registre recherche applicable plutôt que produit shipé. Les prochaines étapes naturelles seraient l'évaluation sur des benchmarks standardisés plus larges (LIBERO, RoboSuite) et l'intégration de politiques récentes à mesure qu'elles sont rendues publiques.

IA physiqueOpinion
1 source
Récupération mémorielle dans les politiques visuomotrices pour le contrôle robotique à long horizon
421arXiv cs.RO 

Récupération mémorielle dans les politiques visuomotrices pour le contrôle robotique à long horizon

Des chercheurs du Robin Lab de l'Université du Texas à Austin ont publié fin juin 2026 un preprint (arXiv:2606.25136) présentant HALO, une politique visuomotrice dotée d'un mécanisme de récupération mémorielle par attention pour le contrôle robotique à long horizon. L'architecture cible les robots polyvalents opérant dans des environnements partiellement observables, typiquement le domicile : le robot doit retrouver où un objet a été posé, se souvenir qu'un utilisateur a déjà accompli une sous-tâche, ou mémoriser l'état d'un appareil activé plusieurs minutes auparavant. HALO répond à deux défis identifiés lors de l'apprentissage par imitation sur données hors-ligne : la corrélation spurieuse entre contexte passé et actions prédites, et l'accumulation d'erreurs en boucle fermée qui entraîne une dérive progressive du modèle. Pour y remédier, la méthode distille des priors issus d'un modèle vision-langage (VLM) via un objectif de question-réponse vidéo généré depuis les trajectoires de démonstration, et combine cela à une attention sparse limitée aux segments d'historique les plus pertinents. Au total, HALO peut récupérer des informations pertinentes sur jusqu'à huit minutes d'expérience passée. Ce résultat est notable car il attaque frontalement le goulot d'étranglement des tâches longues-durées, là où la majorité des politiques visuomotrices actuelles, y compris les approches VLA (Vision-Language-Action) comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, supposent implicitement un horizon court ou une observabilité quasi-complète. La distillation de priors VLM pour orienter la récupération vers l'information pertinente à la tâche est une voie prometteuse pour réduire le gap démo-réalité, car elle ancre l'attention dans une compréhension sémantique plutôt que dans des heuristiques codées à la main. L'attention sparse contribue à contenir la propagation d'erreurs qui, dans les architectures transformer standard sur contexte long, peut faire diverger la politique après quelques dizaines de secondes d'exécution autonome. HALO s'inscrit dans une dynamique de recherche qui voit Transformers et modèles de langage coloniser la couche mémoire des systèmes robotiques, après avoir dominé la planification symbolique et la génération d'instructions. Le Robin Lab publie régulièrement sur l'apprentissage robot en environnements non structurés ; ce travail est encore au stade preprint et aucun déploiement physique à l'échelle n'est annoncé. Les concurrents directs incluent les approches à mémoire épisodique de travaux comme RT-X, mais aussi les architectures récurrentes à état latent explorées par des labos comme CMU ou Stanford. Les prochaines étapes attendues sont une validation sur robot physique dans des scénarios domestiques réels et une comparaison quantitative avec des baselines mémorielle existantes.

RechercheOpinion
1 source
WOLF-VLA : framework de locomotion optimale corps entier pour humanoïdes avec apprentissage vision-langage-action
422arXiv cs.RO 

WOLF-VLA : framework de locomotion optimale corps entier pour humanoïdes avec apprentissage vision-langage-action

Des chercheurs ont publié le 25 juin 2026 sur arXiv (arXiv:2606.25591) WOLF-VLA, un cadre unifié qui combine la synthèse de trajectoires par contrôle optimal (OC) en corps entier avec un dataset multimodal à grande échelle, dans le but d'entraîner des modèles VLA (Vision-Language-Action) capables de piloter la locomotion d'humanoïdes directement depuis des instructions en langage naturel. Le dataset couvre six familles de tâches de locomotion, paramétrées par des variations d'environnement, de couleurs d'objets, de placements et de distracteurs visuels. L'entrainement utilise des trajectoires articulaires dynamiquement cohérentes, des observations visuelles ego-centriques et des instructions textuelles. Les résultats annoncés font état d'une robustesse notable aux variations de conditions initiales et de performances compétitives sur plusieurs tâches et configurations d'environnement. Le dataset complet, les checkpoints de modèle et la suite de benchmarks en simulation seront publiés en open source. Ce travail comble un angle mort important : si les VLA ont prouvé leur efficacité en manipulation (voir Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA), leur extension à la locomotion en corps entier, contact-riche et dynamiquement contrainte, restait quasi inexploitée. Les trois verrous identifiés par les auteurs sont précis -- pénurie de données, absence de démonstrations dynamiquement consistantes, et difficulté à encoder optimalité et sécurité dans un pipeline d'apprentissage -- ce sont exactement les obstacles qui ont maintenu la locomotion hors du champ VLA. La génération de trajectoires via contrôle optimal comme source de données supervisées est une approche méthodologiquement solide pour contourner la dépendance aux démonstrations humaines ou téléopérées. Ce papier s'inscrit dans un mouvement plus large vers des politiques de locomotion instruction-guidées, concurrent de travaux comme ANYmal (ETH Zurich / ANYbotics), Digit (Agility Robotics) ou les approches reinforcement learning de Boston Dynamics. La release open source du benchmark constitue la contribution potentiellement la plus durable : établir un référentiel reproductible pour la locomotion humanoïde VLA permettrait de structurer les comparaisons dans un domaine où les métriques sont encore disparates. Aucun déploiement physique n'est mentionné dans cet article, qui reste une contribution de recherche en simulation -- le transfert sim-to-real sur des plateformes comme Unitree H1 ou Figure 03 constitue la prochaine étape non résolue.

UELe benchmark open source pourrait servir de référence aux laboratoires européens travaillant sur la locomotion humanoïde (ETH Zurich/ANYbotics notamment), mais aucun acteur français ni institution de l'UE n'est directement impliqué dans cette publication.

RechercheOpinion
1 source
Découplage de la sémantique et de l'ancrage géométrique : prompts visuels spatiaux pour l'apprentissage par imitation guidé par le langage
423arXiv cs.RO 

Découplage de la sémantique et de l'ancrage géométrique : prompts visuels spatiaux pour l'apprentissage par imitation guidé par le langage

Une équipe de chercheurs présente SVP-IL dans un préprint publié sur arXiv le 25 juin 2026 (arXiv:2606.25360), une architecture destinée à l'apprentissage par imitation conditionné par le langage naturel en robotique de manipulation. Le constat de départ est précis : les modèles Vision-Language-Action (VLA) de bout en bout actuels couplent dans un même réseau le raisonnement sémantique et le contrôle spatial, ce qui génère un goulot d'étranglement d'alignement quand les données d'entraînement sont rares. SVP-IL découple ces deux fonctions : un modèle fondation vision-langage analyse les instructions textuelles pour produire des masques géométriques zero-shot, traduits en "Spatial Visual Prompts" (SVP), qui sont ensuite injectés dans un générateur d'actions continu via une fusion légère au niveau des features. Résultats sur des tâches à ambiguïté linguistique élevée : avec seulement 50 à 100 démonstrations, le taux de succès moyen passe de 24,0 % à 39,5 %, et atteint 67,8 % sur les benchmarks standards. Des expériences en environnement physique non structuré ont validé la robustesse de l'approche hors laboratoire. L'enjeu industriel de ce résultat est le coût de collecte de données. Les VLA monolithiques comme RT-2, OpenVLA ou π0 (Physical Intelligence) exigent des milliers à des dizaines de milliers de démonstrations pour généraliser à de nouvelles tâches ou de nouveaux environnements, ce qui rend leur déploiement chez les intégrateurs robotiques coûteux et lent. SVP-IL ramène ce seuil à 50-100 démos, soit une réduction d'un ou deux ordres de grandeur, tout en surpassant l'état de l'art sur les tâches à désambiguïsation difficile. Pour un COO industriel ou un intégrateur, cela signifie un temps de mise en service radicalement plus court pour chaque nouvelle cellule de travail. L'approche valide aussi l'hypothèse que le couplage sémantique-spatial n'est pas une nécessité architecturale mais un choix de conception contournable. Les architectures VLA ont émergé à partir de 2022-2023 avec les travaux de Google DeepMind (RT-2), avant d'être popularisées par des modèles open-source et des acteurs comme Physical Intelligence avec π0 ou l'initiative GR00T N2 de NVIDIA. La tendance dominante reste le paradigme monolithique de bout en bout, considéré comme plus simple à scaler. SVP-IL conteste cette hypothèse en montrant qu'un découplage explicite donne de meilleurs résultats en régime de faibles données, sans compromis sur la généralisation. Le préprint ne mentionne pas de partenaire industriel ni de calendrier de déploiement, ce qui en fait pour l'instant une contribution académique ouverte, sans produit shipé associé. Les prochaines étapes naturelles seraient une validation sur des robots commerciaux multi-DOF (bras industriels 6-7 axes, manipulateurs mobiles) et une intégration avec des pipelines de collecte de données synthétiques pour réduire encore davantage le besoin en démonstrations humaines.

RechercheOpinion
1 source
FORCE : affinage par renforcement efficace de modèles VLA via préchauffage calibré par valeur et auto-distillation
424arXiv cs.RO 

FORCE : affinage par renforcement efficace de modèles VLA via préchauffage calibré par valeur et auto-distillation

Une équipe de recherche a publié FORCE (arXiv:2606.26006, juin 2026), un cadre d'entraînement en trois étapes conçu pour affiner les modèles Vision-Language-Action (VLA) par renforcement sans nécessiter d'interventions humaines coûteuses. Sur des benchmarks en simulation et en environnements réels, FORCE affiche une progression absolue de 79 points de pourcentage sur les taux de succès par rapport à la ligne de base en imitation pure, surpasse les méthodes RL existantes de 10 %, et réduit le temps d'entraînement de 32,5 %. Ces chiffres proviennent d'expériences contrôlées décrites dans un preprint non encore évalué par les pairs, ce qui invite à la prudence avant toute extrapolation industrielle. L'importance de ces résultats tient à un problème fondamental des VLA déployés aujourd'hui : leur performance plafonne au niveau de qualité des données d'imitation utilisées pour les pré-entraîner. Le fine-tuning par renforcement est théoriquement capable de dépasser ce plafond, mais se heurte en pratique à deux obstacles majeurs. Le premier est l'oubli catastrophique initial, causé par une fonction de valeur Q instable dès les premiers pas d'optimisation. Le second est la faible qualité des données d'exploration générées par la politique en cours d'apprentissage, qui force habituellement les équipes à injecter des démonstrations humaines supplémentaires à intervalles réguliers. FORCE répond aux deux simultanément : une phase de "Value-Calibrated Warm-Up" stabilise la Q-function via des rollouts on-policy avant de lancer l'apprentissage en ligne, puis cette Q-function calibrée filtre les actions candidates pour ne garder que celles à haute valeur estimée. L'absence d'intervention humaine pendant l'entraînement est l'élément le plus opérationnellement pertinent pour les intégrateurs, car c'est précisément ce coût de supervision qui freine le passage à l'échelle des robots apprenants en cellule industrielle. Le contexte est celui d'une course intense à l'efficacité du fine-tuning VLA, dans laquelle plusieurs équipes cherchent à transformer les grands modèles multimodaux en politiques robotiques fiables. Des travaux comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure) ont démontré que les VLA pré-entraînés sur de larges corpus de données de manipulation peuvent être spécialisés sur des tâches précises, mais le coût de la collecte de données de qualité reste un goulot d'étranglement. FORCE s'inscrit dans la vague des méthodes qui cherchent à substituer du calcul à de la supervision humaine. Les concurrents directs incluent notamment RLVR et des variantes d'entraînement hors-politique couplées à des buffers de replay. Aucun déploiement commercial n'est annoncé à ce stade : FORCE est un résultat de recherche académique dont les prochaines étapes naturelles seraient une validation sur des robots à morphologie variable et une publication dans une conférence de robotique (ICRA, CoRL, RSS).

IA physiqueOpinion
1 source
ROAD-VLA : adaptation en ligne robuste par auto-distillation pour les modèles vision-langage-action
425arXiv cs.RO 

ROAD-VLA : adaptation en ligne robuste par auto-distillation pour les modèles vision-langage-action

Une équipe de chercheurs publie fin juin 2026 ROAD-VLA (arXiv:2606.25800), un cadre d'adaptation en ligne des modèles VLA (Vision-Language-Action) par auto-distillation guidée par avantage. Les VLA, à l'image de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou RT-2 (Google DeepMind), traduisent directement une entrée visuelle et une instruction en langage naturel en séquences d'actions robotiques. Le problème : affiner un tel modèle pré-entraîné sur de nouvelles tâches via apprentissage par renforcement (RL) génère des récompenses trop éparses pour superviser des politiques autoregressives de haute dimension. ROAD-VLA y répond en construisant un "enseignant proximal" dans l'espace des actions, perturbant les logits des tokens d'action avec des estimations d'avantage calibrées pour convertir des récompenses rares en supervision dense token par token. Évalué sur sept environnements de manipulation robotique, en distribution et hors distribution, le framework surpasse PPO (Proximal Policy Optimization, référence RL standard) dans la quasi-totalité des configurations. La découverte la plus saillante est l'existence d'un "modality gap" : les enseignants textuels conditionnés sur des démonstrations, des expériences récupérées ou des plans de haut niveau s'avèrent systématiquement inefficaces pour adapter les politiques d'action VLA. C'est une contradiction directe avec une hypothèse répandue selon laquelle le guidage symbolique ou langagier peut servir de supervision fiable lors du fine-tuning RL. ROAD-VLA démontre que la supervision doit opérer dans l'espace des actions, pas dans l'espace du langage. Pour un intégrateur déployant des bras manipulateurs basés sur VLA, cela ouvre une voie d'adaptation au domaine sans collecter de nouvelles démonstrations massives : le modèle se corrige via son propre comportement et les signaux de récompense de l'environnement réel. Le paradigme VLA a pris son essor avec RT-2 (Google DeepMind, 2023), puis s'est accéléré via Pi-0 (Physical Intelligence, 2024), GR00T N2 (NVIDIA, 2025) et Helix (Figure AI), accompagnés d'une vague de publications académiques. L'adaptation post-déploiement, soit ajuster un modèle généraliste à une géométrie de préhension spécifique ou à un flux industriel précis sans tout ré-entraîner, est désormais identifiée comme le verrou opérationnel suivant par les équipes terrain. Ce travail reste une annonce académique (arXiv, juin 2026), pas un produit livré ni un déploiement industriel réel, et la validation sur robots physiques en conditions industrielles reste à conduire. Aucun acteur français ou européen n'est impliqué dans cette recherche.

RechercheOpinion
1 source
InSight : acquisition autonome de compétences via des VLA pilotables
426arXiv cs.RO 

InSight : acquisition autonome de compétences via des VLA pilotables

Une équipe de chercheurs présente InSight (arXiv:2606.24884, juin 2026), un cadre d'acquisition autonome de compétences pour les modèles vision-language-action (VLA). L'architecture comporte deux étapes : d'abord un pipeline de segmentation automatique qui décompose des démonstrations existantes en primitives étiquetées ("déplacer la pince vers le bol", "soulever vers le haut", "verser la bouteille") via un VLM de décomposition de plans couplé aux poses de l'effecteur terminal ; ensuite un flywheel de données guidé par VLM qui identifie les primitives manquantes pour accomplir une nouvelle tâche, tente des démonstrations autonomes via un contrôle bas niveau proposé par le VLM, et intègre automatiquement les succès dans l'ensemble d'entraînement. Le système a été validé sur cinq tâches de manipulation : retournement de blocs, fermeture de tiroir, balayage, vissage et versement, en simulation et en conditions réelles, sans aucune démonstration humaine des compétences cibles. L'enjeu central : les VLA actuels sont structurellement limités par leur corpus d'entraînement initial, et toute extension vers de nouvelles tâches impose aujourd'hui un coût élevé en téléopération humaine. InSight propose une boucle d'auto-amélioration fermée où les primitives apprises peuvent être composées pour exécuter des tâches à horizon long sans intervention humaine supplémentaire. Pour un intégrateur ou un COO industriel, cela représente une réduction potentielle du coût d'onboarding robotique. Les démonstrations publiées restent cependant relativement simples, et les auteurs ne fournissent pas de métriques de cycle time ni de taux de succès pour des scénarios de production complexes, ce qui invite à la prudence avant toute extrapolation opérationnelle. Les modèles VLA sont un terrain de compétition intense entre Physical Intelligence (Pi-0), NVIDIA (GR00T N2), Google DeepMind (RT-2) et Figure AI (Helix pour la manipulation humanoïde). Tous partagent le même verrou : un plafond de capacités figé à l'entraînement. InSight s'inscrit dans une tendance émergente de systèmes capables de s'auto-étendre, proche des travaux sur les agents génératifs de données. Cette publication demeure un preprint académique sans déploiement annoncé ; les auteurs prévoient de rendre le code public via insight-vla.github.io. Les prochaines étapes concernent la robustesse du flywheel sur des primitives moins déterministes et la validation en environnement industriel réel sur des bras à plus de six degrés de liberté.

IA physiqueOpinion
1 source
Superviser ce qui subsiste : adaptation VLA guidée par la géométrie depuis des vidéos synthétiques de robots
427arXiv cs.RO 

Superviser ce qui subsiste : adaptation VLA guidée par la géométrie depuis des vidéos synthétiques de robots

Une équipe de recherche a publié le 24 juin 2026 sur arXiv un article présentant GRA (Geometry-guided Representation Alignment), une méthode d'adaptation des modèles Vision-Language-Action (VLA) qui exploite des vidéos synthétiques de robots. Le problème de départ est concret : entraîner un VLA nécessite des millions de paires vidéo-action issues de téléopération réelle, une donnée rare et coûteuse à collecter. Les approches existantes contournent cette contrainte en générant des vidéos synthétiques à partir de démonstrations humaines, puis en tentant de récupérer des pseudo-actions à partir des pixels générés. GRA rompt avec cette logique : au lieu d'extraire des commandes moteur depuis des images synthétiques, la méthode identifie ce qui survit vraiment à la génération vidéo, à savoir la géométrie spatiale de la trajectoire de l'effecteur. Ces waypoints 2D sont calculés à partir de la vidéo humaine source via estimation de pose, retargeting, simulation et projection calibrée, puis injectés uniquement dans le backbone de perception visuelle du VLA via une tête auxiliaire 2D. La tête d'action, elle, reste entraînée exclusivement sur des démonstrations réelles. Sur des tâches de manipulation en environnement réel, GRA surpasse les baselines à pseudo-actions à budget de données équivalent et réduit significativement l'écart avec des politiques entraînées sur nettement plus de données réelles. Ce résultat a une portée conceptuelle directe pour quiconque développe des politiques de manipulation à grande échelle. Il formalise ce que les praticiens suspectaient : extraire des commandes moteur depuis des pixels synthétiques est une abstraction mal posée. La vidéo encode le "où" (trajectoire géométrique), pas le "comment" (signal de contrôle). En exploitant uniquement ce qui est préservé par la génération, GRA résout proprement un des obstacles centraux du sim-to-real : l'accumulation d'erreurs introduite par les pseudo-actions. Cela valide aussi l'hypothèse que les VLA peuvent tirer parti de données synthétiques sans polluer leur espace d'action, un point crucial pour les équipes cherchant à réduire le coût de la collecte de données de téléopération. Le contexte est celui d'une course intense à la scalabilité des données pour les modèles VLA : Physical Intelligence (Pi-0), NVIDIA (GR00T N2), Figure (Helix), et d'autres investissent massivement dans la génération de données synthétiques comme levier de passage à l'échelle. La plupart de ces pipelines souffrent précisément du problème que GRA adresse. L'approche reste à ce stade un preprint académique sans déploiement industriel annoncé, et les expériences présentées portent sur des tâches de manipulation tabletop contrôlées, ce qui laisse ouverte la question de sa robustesse sur des environnements moins structurés. Les suites naturelles incluent l'intégration de ce principe dans des pipelines de données à grande échelle et son extension à des trajectoires 3D ou à des architectures diffusion-based comme Pi-0.

IA physiqueOpinion
1 source
Pose6DAug : substitution d'objets multi-vues physiquement plausible pour l'augmentation de données en robotique
428arXiv cs.RO 

Pose6DAug : substitution d'objets multi-vues physiquement plausible pour l'augmentation de données en robotique

Des chercheurs ont publié sur arXiv (réf. 2606.20118) une méthode baptisée Pose6DAug, un framework d'augmentation de données conçu pour améliorer la robustesse des politiques de type Vision-Language-Action (VLA) face à des objets qu'elles n'ont jamais manipulés lors de l'entraînement. Sans collecter un seul épisode de télé-opération supplémentaire, la méthode exploite les démonstrations réussies existantes pour en générer automatiquement de nouvelles, ciblées sur les modes d'échec détectés. Le principe : identifier les cas où la politique échoue sur un objet inconnu, puis remplacer l'objet manipulé dans les épisodes réussis par cet objet cible, tout en conservant la trajectoire d'action d'origine. Pour garantir la cohérence physique et multi-vue, le remplacement n'opère pas en 2D comme le ferait un inpainting vidéo classique, mais directement en 3D : l'objet cible est ancré via un mesh 3D piloté par une trajectoire de pose 6D cohérente temporellement, ce qui permet des rendus géométriquement consistants sur toutes les caméras, y compris sous occultations et angles egocentriques. En fine-tuning un VLA sur ces données augmentées, les auteurs mesurent un gain de 16,5 % de taux de succès sur objets hors-distribution par rapport au meilleur baselin existant, sans dégradation sur les objets connus. Ce résultat est important parce qu'il attaque directement le principal verrou à la mise à l'échelle des VLAs dans des environnements industriels réels : la généralisation à de nouveaux objets exige aujourd'hui des cycles coûteux de collecte de démonstrations humaines pour chaque nouveau cas. Pose6DAug transforme un épisode réussi en source de données synthétiques ciblées, ce qui pourrait réduire drastiquement le coût de déploiement continu des politiques robotiques. La méthode apporte aussi une réponse concrète au débat sur la cohérence sim-to-real : l'augmentation 2D par édition vidéo crée des incohérences entre vues qui dégradent l'apprentissage, tandis que l'approche 3D physiquement ancrée les élimine, validant l'hypothèse que la plausibilité géométrique est déterminante pour l'efficacité des augmentations. Le contexte de ce travail est celui de l'explosion des VLAs généralistes, portée par des modèles comme pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, OpenVLA ou encore Octo, tous confrontés au même problème de distribution shift sur de nouveaux objets. Les approches concurrentes, domain randomization ou collecte de nouvelles démonstrations, peinent à passer à l'échelle industrielle. Pose6DAug se positionne comme une brique de fine-tuning continu et automatique, activable dès qu'un mode d'échec est détecté en production. Les auteurs n'annoncent pas de déploiement terrain ni de partenariat industriel dans cette version preprint ; il s'agit d'une publication de recherche, sans produit commercialisé à ce stade.

UERésultat applicable aux labos et industriels européens travaillant sur des VLAs pour réduire les coûts de collecte de démonstrations, mais aucun acteur FR/EU n'est impliqué dans ce travail de recherche.

IA physiqueOpinion
1 source
ImageWAM : les modèles action-monde ont-ils vraiment besoin de génération vidéo, ou seulement d'édition d'images ?
429arXiv cs.RO 

ImageWAM : les modèles action-monde ont-ils vraiment besoin de génération vidéo, ou seulement d'édition d'images ?

Une équipe de chercheurs publie ImageWAM sur arXiv le 19 juin 2026 (arXiv:2606.19531), un cadre WAM (World Action Model) qui substitue la génération vidéo par l'édition d'images pour prédire les actions robotiques. L'argument central : les WAMs vidéo génèrent des tokens denses sur plusieurs trames futures, consomment de la capacité sur des détails sans rapport avec l'action, et propagent des erreurs lors des prédictions à longue portée. ImageWAM réoriente des modèles d'édition d'image préentraînés pour modéliser uniquement la transformation visuelle entre état courant et état cible. À l'inférence, le système ne décode pas la frame cible : il conditionne un expert d'action par flow-matching sur les caches KV produits pendant le débruitage de l'image éditée. Résultats mesurés : FLOPs réduits à 1/6 et latence à 1/4 par rapport aux WAMs vidéo, avec des performances supérieures aux baselines VLA standard et aux WAMs concurrents, sur simulateur comme en conditions réelles, sans préentraînement additionnel de la politique. Pour la communauté robotique, le résultat questionne une hypothèse fondamentale : la génération vidéo serait indispensable pour que le modèle "comprenne" le monde et déduise des actions pertinentes. ImageWAM montre que l'édition d'image constitue un prior mieux calibré, car elle cible les différences visuelles liées à l'action plutôt que la reconstruction temporelle complète d'une séquence. Les analyses d'attention confirment que les caches se focalisent sur les régions de changement pertinentes pour la tâche, pas sur le fond statique. Pour un intégrateur industriel, l'implication est directe : cycles d'inférence plus rapides et potentiellement matériel embarqué moins coûteux, sans sacrifice de performance selon les expériences rapportées. Les WAMs s'inscrivent dans la continuité des VLAs (Visual Language Action models), qui combinent perception visuelle, langage naturel et contrôle moteur dans un pipeline unifié. Des modèles comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) misent sur des représentations visuelles denses pour généraliser les comportements robotiques entre tâches. ImageWAM se positionne comme une alternative frugale, réutilisant des capacités d'édition d'image préentraînées sans nécessiter de préentraînement vidéo de grande échelle. Le papier reste pour l'instant dans le domaine expérimental : aucun déploiement industriel ni partenaire terrain n'est mentionné. Les prochaines étapes naturelles seraient une validation sur des plateformes humanoïdes ou de manipulation industrielle, précisément les environnements où la latence d'inférence constitue un critère de qualification déterminant.

RechercheOpinion
1 source
Co-VLA : modélisation structurée des actions intégrant la coordination pour systèmes VLA bi-bras
430arXiv cs.RO 

Co-VLA : modélisation structurée des actions intégrant la coordination pour systèmes VLA bi-bras

Des chercheurs ont publié Co-VLA (arXiv:2606.20285), un framework de manipulation bimanurale qui intègre des priors structurels explicites dans les modèles VLA (Vision-Language-Action). L'architecture remplace la tête d'action monolithique habituelle par un Structured Action Expert (SAE) couplé à un Latent-Aware Controller (LAC) opérant au niveau des commandes articulaires. Le SAE décompose la représentation latente en une composante partagée encodant l'intent de coordination au niveau de la tâche, et des résidus par bras capturant les ajustements d'exécution propres à chaque effecteur. Les résultats expérimentaux, en simulation et sur banc réel, montrent un gain de 27 points de taux de succès sur les tâches à coordination serrée, un doublement des performances hors-distribution (de 13 % à 27 %), et une réduction du temps d'exécution allant jusqu'à 25 % face aux baselines monolithiques. L'enjeu central est de rendre fiable et interprétable la coordination bimanurale dans des scénarios industriellement contraints : assemblage à force symétrique, manipulation d'objets déformables, chaînes de montage à deux bras. Les VLA actuels comme Pi-0 ou GR00T N2 montrent que la coordination émergente fonctionne sur des tâches simples, mais échoue à garantir la stabilité quand les contraintes d'exécution sont critiques. Co-VLA répond à cette limite sans requérir de contrôle en force ni en impédance : le LAC module en temps réel la synchronisation, l'asymétrie et les contraintes de sécurité tout en restant compatible avec les pipelines de contrôle standard, ce qui abaisse la barrière d'intégration pour les équipementiers. Le doublement des performances OOD est l'indicateur le plus stratégique, suggérant que la structure explicite améliore la robustesse hors-distribution, un critère décisif pour les déploiements industriels réels. Le domaine des VLA pour la manipulation s'est accéléré depuis 2023, porté par des modèles comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et OpenVLA, qui ont repoussé les limites de la généralisation en manipulation mono et bimanurale. Co-VLA s'inscrit dans une tendance qui réintroduit de la structure explicite dans l'apprentissage end-to-end, une tension classique entre approches connexionnistes et symboliques qui refait surface à l'ère des grands modèles de fondation. Aucun partenaire industriel ni timeline de commercialisation n'est mentionné dans l'abstract : il s'agit d'un preprint de recherche académique, sans robot identifié ni déploiement annoncé à ce stade.

RechercheOpinion
1 source
Génération d'actions robotiques continues et cohérentes par correspondance de flux sensible aux fréquences
431arXiv cs.RO 

Génération d'actions robotiques continues et cohérentes par correspondance de flux sensible aux fréquences

Une équipe de recherche propose FAFM (Frequency-Aware Flow Matching), une méthode de génération d'actions robotiques présentée en préprint arXiv (2606.20135, juin 2026), qui reformule le problème du flow matching pour la manipulation robotique dans le domaine fréquentiel. Le principe : plutôt que de prédire directement des séquences d'actions discrètes (des "chunks"), FAFM applique une transformée en cosinus discrète (DCT) sur ces séquences pour les convertir en coefficients fréquentiels, effectue le flow matching sur ces coefficients, puis reconstruit des actions continues via expansion en base cosinus. Pour garantir la cohérence temporelle, la méthode ajoute une contrainte de type Sobolev sur la dérivée temporelle du premier ordre, ce qui pénalise les changements brusques et atténue les erreurs hautes fréquences. L'approche s'applique sans paramètres réseau supplémentaires, aussi bien aux politiques de flow matching autonomes qu'aux modèles vision-langage-action (VLA). Les résultats sont validés sur les benchmarks LapGym, LIBERO et évitement d'obstacles, ainsi qu'en déploiement réel sur un bras Franka. L'intérêt industriel est direct : la fragmentation des fréquences de contrôle est un problème concret lors de l'agrégation de données de démonstration provenant de robots différents (certains à 10 Hz, d'autres à 50 Hz), et les méthodes actuelles de diffusion policy ou de flow matching standard y sont explicitement vulnérables. Les actions temporellement incohérentes qui en résultent dégradent la stabilité du contrôle en boucle fermée, un facteur bloquant pour le déploiement en production. Le fait que FAFM améliore simultanément le taux de succès, la fluidité du mouvement, la robustesse aux biais mécaniques et la vitesse de convergence sans modifier l'architecture existante est une proposition de valeur claire pour les intégrateurs : pas de refonte du pipeline, pas de surcoût computationnel. La compatibilité avec les VLA est également notable, car ces modèles dominent les annonces récentes (pi-0 de Physical Intelligence, GR00T N2 de NVIDIA) et souffrent précisément de ce type d'artefacts temporels à l'inférence. Le flow matching s'est imposé ces dix-huit derniers mois comme alternative crédible à la diffusion policy (Chi et al., 2023, Columbia), avec des temps d'inférence plus courts et une meilleure expressivité multimodale. Les travaux récents de Physical Intelligence (pi-0, pi-0.5) et de Figure AI ont largement adopté ce paradigme pour leurs politiques générales. FAFM s'inscrit dans une tendance de raffinement de ces fondations plutôt que de rupture : on optimise la stabilité et la généralisation inter-fréquences, deux verrous identifiés lors des premiers déploiements industriels à grande échelle. La validation sur Franka reste modeste en termes de diversité de tâches, et le code est disponible sous revue anonyme, ce qui signifie que la méthode n'est pas encore auditée par la communauté. Les prochaines étapes naturelles seraient une validation sur des plateformes humanoïdes multi-articulées et sur des datasets hétérogènes à grande échelle, là où la question des fréquences mixtes est la plus aiguë.

RecherchePaper
1 source
L'action latente axée sur le mouvement permet l'entraînement VLA multi-morphologie depuis des vidéos subjectives humaines
432arXiv cs.RO 

L'action latente axée sur le mouvement permet l'entraînement VLA multi-morphologie depuis des vidéos subjectives humaines

Une équipe de chercheurs a publié un cadre d'entraînement basé sur des actions latentes permettant de former des modèles VLA (Vision-Language-Action) généralistes à partir de vidéos égocentriques humaines non annotées, sous l'identifiant arXiv:2606.18955. L'architecture centrale, baptisée Hybrid Disentangled VQ-VAE, décompose les dynamiques de mouvement des arrière-plans environnementaux via des masques physiques et construit un codebook d'actions multi-embodiment. Pré-entraîné exclusivement sur des vidéos humaines sans étiquettes d'action, le modèle ne requiert que 50 trajectoires robotiques annotées pour s'adapter à un embodiment cible, contre des milliers généralement exigés par les approches concurrentes. Les résultats, validés en simulation et en environnement réel, affichent des performances comparables aux meilleurs modèles VLA entraînés sur des jeux de données massifs et entièrement annotés. Une stratégie de découplage intention-perception complète l'architecture : le backbone VLM prédit l'intention d'action tandis qu'un encodeur visuel gelé distinct fournit les caractéristiques propres à l'état courant à un module expert d'action, réduisant ainsi les hallucinations d'action. Ce travail s'attaque directement au principal goulot d'étranglement du domaine : la rareté des données robotiques avec annotations de haute fidélité. Les vidéos humaines égocentriques, abondantes sur internet et capturant une grande diversité environnementale, restaient jusqu'ici inexploitables dans les paradigmes d'entraînement classiques faute de labels d'action. Descendre à 50 trajectoires pour l'adaptation aval représente un changement d'ordre de grandeur pour les intégrateurs industriels qui n'ont ni la logistique ni le budget pour constituer des datasets robotiques à grande échelle. Le codebook cross-embodiment ouvre en outre la voie à des modèles fondamentaux transférables entre différentes morphologies de robots, ce qui répond à l'un des reproches récurrents faits aux approches VLA : leur faible généralisation inter-plateforme. Le contexte concurrentiel est dense. Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et OpenVLA visent tous à former des modèles VLA généralistes, mais s'appuient principalement sur des datasets robotiques annotés comme OpenX-Embodiment ou des jeux propriétaires. Des travaux antérieurs comme UniSim ou des approches de pré-entraînement sur vidéo internet avaient déjà exploré cette direction sans atteindre ce niveau de frugalité en données. Ce preprint arXiv reste à ce stade une contribution de recherche : pas de déploiement industriel annoncé, pas de partenariat déclaré. Les prochaines étapes naturelles seraient une évaluation sur des benchmarks standardisés comme LIBERO ou RoboSuite, et une validation sur une palette plus large de morphologies robotiques réelles.

RechercheOpinion
1 source
HALOMI : apprentissage de la loco-manipulation humanoïde avec perception active à partir de démonstrations humaines
433arXiv cs.RO 

HALOMI : apprentissage de la loco-manipulation humanoïde avec perception active à partir de démonstrations humaines

Une équipe de chercheurs vient de publier sur arXiv (réf. 2606.18772) HALOMI, un framework permettant à un humanoïde d'apprendre la "loco-manipulation" -- navigation et manipulation d'objets combinées -- à partir de démonstrations humaines captées en conditions réelles. Le système étend l'Universal Manipulation Interface (UMI) avec une perception égocentrique double : caméras en vue subjective (ego-view) et au niveau du poignet (wrist-view), enregistrant simultanément les trajectoires tête-mains de l'opérateur. La validation s'effectue sur le Unitree G1, humanoïde équipé d'un cou motorisé, sur cinq catégories de tâches réelles : navigation, préhension, manipulation bimane, coordination corps entier, et comportements dynamiques incluant lancer d'objets et accroupissement profond. HALOMI atteint un taux de réussite moyen de 85 % sur les trois tâches évaluées quantitativement. Ce résultat cible l'un des obstacles fondamentaux du retargeting humain-humanoïde : au-delà du sim-to-real gap, il existe un "human-to-humanoid gap" dans la perception égocentrique et l'exécution motrice. HALOMI l'attaque sur deux fronts : un alignement de la vue subjective, et une adaptation de trajectoire dite "controller-aware" qui intègre les contraintes dynamiques propres au robot. Le contrôleur de suivi tête-main opère dans un espace latent appris (manifold contraint), ce qui le rend plus robuste face aux cibles hors distribution -- écueil classique du retargeting direct. Le 85 % est à nuancer : les tâches qualitatives comme le lancer dynamique n'ont pas de métriques publiées, et les conditions expérimentales exactes (nombre d'essais, variabilité de scène) restent non précisées dans le papier. HALOMI s'inscrit dans la tendance qui exploite les démonstrations humaines pour réduire le coût de collecte de données sur robot, dans la lignée directe d'UMI (Stanford, 2023), et en parallèle des approches Vision-Language-Action comme Pi-Zero (Physical Intelligence) ou GR00T N2 (NVIDIA). La particularité ici est l'accent mis sur la perception active : le cou motorisé du G1 est un élément fonctionnel du pipeline, pas un détail cosmétique. Le Unitree G1, commercialisé autour de 16 000 dollars, s'est imposé comme banc de test académique commun depuis 2024. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné dans le papier : HALOMI reste pour l'heure une contribution de recherche, sans annonce de commercialisation.

RechercheOpinion
1 source
VEGA : apprentissage de VLA de navigation depuis des vidéos égocentriques réelles avec supervision géométrique
434arXiv cs.RO 

VEGA : apprentissage de VLA de navigation depuis des vidéos égocentriques réelles avec supervision géométrique

Une équipe de chercheurs a publié sur arXiv (juin 2026) VEGA, une méthode pour entraîner des modèles de navigation de type VLA (Vision-Language-Action) à partir de vidéos égocentrées non étiquetées issues d'internet. Le principe : reconstruire la géométrie locale d'une scène à partir de vidéo monoculaire, puis générer des trajectoires obstacles-aware conditionnées sur des objectifs de navigation exprimés en texte, image ou waypoints spatiaux. Cette distribution de trajectoires sert ensuite à entraîner une politique de navigation par flow-matching. Les auteurs publient également VEGA-Bench, un benchmark de 250 000 scènes et environ 5 millions d'objectifs de navigation couplés à leur géométrie de scène, conçu pour évaluer la progression vers l'objectif, l'évitement de collisions et le dégagement autour des obstacles. Sur ce benchmark, VEGA réduit les collisions de 33,0 % et améliore le dégagement d'obstacles de 17,9 % par rapport au meilleur baseline. En conditions réelles, les gains sont plus marqués : au moins +150 % de taux de succès, -66,7 % de collisions et +60 % d'amélioration du dégagement. Ce travail s'attaque à un verrou structurel de la navigation robotique : comment tirer parti de la masse de vidéos égocentrées disponibles sur internet sans disposer d'annotations de trajectoires ni de données de reward. La clé de VEGA est d'utiliser la géométrie reconstruite exclusivement à l'entraînement, ce qui permet de distiller une planification obstacle-aware directement dans une politique visuelle, sans que la géométrie soit nécessaire à l'inférence. C'est un argument concret en faveur de la scalabilité des VLA de navigation, un domaine où le fossé démo-réalité reste prononcé. Les chiffres en conditions réelles sont significatifs, bien que les auteurs ne précisent pas la taille exacte ni la variété des environnements de test, ce qui limite la portée des conclusions sur la généralisation. La navigation en langage naturel par VLA s'inscrit dans une compétition active entre approches : les travaux de Google DeepMind sur RT-2 et NavIQ, les efforts d'Physical Intelligence (pi) avec Pi-0, ou encore GR00T N2 de NVIDIA explorent des axes proches. VEGA se distingue par l'angle supervision géométrique à partir de vidéos brutes, sans nécessiter de données en simulateur ni d'annotation humaine. Le code et le benchmark seront rendus publics à la publication, ce qui permettra à la communauté de valider les résultats de manière indépendante, étape indispensable avant tout usage industriel.

RechercheOpinion
1 source
SC3-Eval : évaluer les modèles fondation pour la robotique via la génération vidéo auto-cohérente
435arXiv cs.RO 

SC3-Eval : évaluer les modèles fondation pour la robotique via la génération vidéo auto-cohérente

Une équipe de chercheurs a publié fin juin 2026 SC3-Eval (arXiv:2606.18610), un cadre d'évaluation des politiques de manipulation robotique basé sur la génération vidéo cohérente. Le principe : plutôt que de rouler une politique en conditions réelles, un modèle fondamental vidéo pré-entraîné simule les trajectoires du robot et prédit si la tâche aboutit. SC3-Eval repose sur trois mécanismes de cohérence complémentaires. La cohérence dynamique avant-inverse entraîne simultanément le modèle à prédire les images à partir des actions et à récupérer les actions à partir des images, ancrant les rollouts à un espace d'action physiquement plausible. La cohérence multi-vue oblige le modèle à reconstruire chaque caméra depuis les autres, maintenant la cohérence spatiale sur de longs épisodes. Enfin, à l'inférence, un signal d'incertitude par chunk d'actions interrompt les rollouts dont les images générées divergent des actions demandées. Évalué sur sept politiques vision-langage-action (VLA) réelles, SC3-Eval atteint une corrélation de Pearson de 0,929 avec les résultats terrain et un MMRV de 0,119, surpassant trois baselines vidéo existantes. Ce résultat a une portée pratique immédiate : évaluer une politique de manipulation en conditions réelles est coûteux, lent et difficile à paralléliser. Un corrélat simulé à 0,929 constitue un substitut crédible pour filtrer les candidats politiques avant déploiement physique, réduisant potentiellement les cycles d'itération de plusieurs semaines à quelques heures. Fait notable, SC3-Eval reproduit fidèlement les modes d'échec observés en réel, permettant un diagnostic fin au niveau tâche plutôt qu'un classement agrégé, ce qui est plus actionnable pour un intégrateur. Le cadre se généralise par ailleurs à des tâches hors distribution d'entraînement, un point critique pour les équipes qui développent des politiques généralistes. Ce travail s'inscrit dans la vague d'adoption des modèles VLA commerciaux et de recherche, Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, Helix, OpenVLA, dont l'évaluation standardisée reste un goulot d'étranglement reconnu. Les approches alternatives passent par des simulateurs physiques classiques (MuJoCo, Isaac Sim) ou des rollouts réels coûteux ; les world models vidéo comme UniSim ou IRASim avaient amorcé cette direction mais se heurtaient à la dérive autorégressiveet à l'incohérence multi-caméras que SC3-Eval adresse directement. Le code et les données ne sont pas encore publiés au moment de la préprint, ce qui limite l'adoption immédiate. La prochaine étape logique sera de valider la méthode sur des plateformes humanoïdes à plus haute dimensionnalité, où le coût d'évaluation réelle est encore plus prohibitif.

RechercheOpinion
1 source
Pré-entraînement contrastif action-image pour le contrôle visuomoteur
436arXiv cs.RO 

Pré-entraînement contrastif action-image pour le contrôle visuomoteur

Des chercheurs ont publié CAIP (Contrastive Action-Image Pre-training), un encodeur visuel pour la robotique qui exploite 32 041 heures de vidéo égocentrique humaine, complétées par seulement 88 heures de données de manipulation robotique. Le principe central consiste à extraire les poses 3D des mains humaines depuis des vidéos filmées en vue subjective, et à les utiliser comme signal de substitution pour les actions d'effecteur terminal, un proxy qui s'aligne naturellement avec les espaces d'action des bras robotiques. Via un objectif d'apprentissage contrastif, CAIP apprend une représentation unifiée liant images et actions. Évalué sur deux mains dextres réelles (Dexmate Vega et Sharpa Wave), le modèle affiche des gains supérieurs à 30% sur des tâches de manipulation précise : pliage de tissu, versage de liquide, et manipulations en dextérité fine. Ce résultat touche directement un verrou bien connu dans la communauté : la pénurie de données robotiques étiquetées freine la pré-formation de grands encodeurs visuels, là où le NLP ou la vision généraliste disposent de milliards d'exemples. CAIP propose une voie de passage scalable sans collecter davantage de trajectoires robot, en exploitant la vidéo humaine disponible à l'échelle d'Internet comme source implicite de signaux d'action. En surpassant DINOv2, SigLIP, MVP et R3M sur des benchmarks en conditions réelles (et non en simulation), l'approche renforce l'hypothèse que le sim-to-real gap peut être partiellement contourné en ancrant la représentation visuelle dans des dynamiques d'action humaine, plutôt qu'en augmentant les données robot brutes. Ce travail s'inscrit dans un courant de recherche actif autour des politiques visuomotrices apprenant depuis la vidéo humaine. Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et les approches issues d'OpenVLA croisent des signaux similaires, bien que depuis des angles différents. CAIP se distingue en isolant le signal de pose 3D des mains comme modalité intermédiaire explicite, plutôt que d'ingérer du langage ou des représentations d'action latentes. Le code et les modèles ne sont pas encore publiés au moment de la soumission (arXiv:2606.17256, juin 2026). La prochaine étape naturelle serait de tester la généralisation à des morphologies robotiques plus variées et à des tâches bimanuelles, domaine où les pipelines VLA (Vision-Language-Action) peinent encore à démontrer une robustesse hors laboratoire.

RechercheOpinion
1 source
MuseVLA : un modèle VLA multimodal adaptatif pour la manipulation robotique
437arXiv cs.RO 

MuseVLA : un modèle VLA multimodal adaptatif pour la manipulation robotique

Des chercheurs présentent ce mois-ci MuseVLA (arXiv:2606.17598, juin 2026), un modèle Vision-Language-Action capable d'intégrer des capteurs non-RGB comme entrées de perception active lors de tâches de manipulation robotique. Sur un robot à main dextre testée en conditions réelles, MuseVLA atteint un taux de succès moyen de 80,6 % sur trois familles de tâches : saisie guidée par la température, recherche d'objet par signal audio, et récupération d'objet dissimulé assistée par radar. L'architecture repose sur un mécanisme en deux temps : le modèle génère d'abord un "sensor token" qui sélectionne dynamiquement la modalité sensorielle pertinente pour la tâche en cours, puis convertit la mesure capteur en une "grounded sensor image", une représentation intermédiaire unifiée fusionnée avec le flux RGB classique avant la génération d'action. Les auteurs introduisent également un pipeline de synthèse de données qui augmente des datasets RGB existants avec des images capteur simulées, contournant ainsi le coût prohibitif de la collecte de données multisensorielles réelles. L'apport principal est architectural plutôt que purement empirique : le découplage entre le traitement capteur spécifique et le backbone VLA permet d'intégrer de nouveaux capteurs sans réentraîner le modèle de base, un principe analogue aux "tool calls" dans les LLM. Cette modularité répond à une limite structurelle des VLA actuels, dont Pi-0 (Physical Intelligence), OpenVLA ou GR00T N2 (NVIDIA), qui opèrent quasi exclusivement sur RGB. La capacité de zéro-shot sur des tâches non vues lors de l'entraînement est notable, même si les conditions expérimentales restent celles d'un laboratoire, sans déploiement industriel rapporté. Les métriques de cycle time ou de robustesse en environnement non contrôlé ne sont pas fournies, ce qui limite l'interprétation du 80,6 % en contexte réel. Le papier s'inscrit dans une effervescence autour des VLA généralistes depuis mi-2024, avec des acteurs comme Physical Intelligence, 1X Technologies, Enchanted Tools côté européen, et les équipes de Google DeepMind ou Carnegie Mellon qui multiplient les approches de fusion multimodale. MuseVLA reste pour l'instant un preprint sans code ni dataset publié, et la question de la généralisation à des capteurs industriels standards (LiDAR, force/torque) n'est pas traitée. Les prochaines étapes naturelles seraient un benchmark comparatif sur des plateformes connues type Franka ou UR, et une validation hors labo pour confirmer la thèse du sim-to-real sur les données capteur synthétiques.

UELes acteurs européens comme Enchanted Tools opèrent dans le même segment VLA généraliste, mais ce preprint n'implique aucune institution ou entreprise française ou européenne.

IA physiqueOpinion
1 source
Robots comme tokens : un transformeur de diffusion unifié pour la génération de trajectoires multi-robots coordonnées
438arXiv cs.RO 

Robots comme tokens : un transformeur de diffusion unifié pour la génération de trajectoires multi-robots coordonnées

Des chercheurs ont publié sur arXiv (2606.15550) Roken, pour "Robots as Tokens", un transformeur de diffusion unifié capable de générer simultanément des trajectoires coordonnées pour plusieurs robots mobiles. Contrairement aux approches dominantes, qui soit se limitent à la planification monorobot, soit enchaînent les trajectoires de façon séquentielle avant d'appliquer des post-traitements itératifs pour résoudre les conflits inter-robots, Roken produit l'ensemble des trajectoires en une seule passe feed-forward. Chaque robot est représenté comme un token discret dans le modèle, ce qui lui permet d'interagir naturellement avec les autres via la self-attention, et de se référer aux tokens de carte pour percevoir l'environnement par cross-attention. Des tâches auxiliaires fondées sur le théorème de Bayes fournissent une supervision spatio-temporelle multi-échelle pour apprendre la distribution conditionnelle. À l'inférence, le modèle supporte indifféremment la planification monorobot, la génération coordonnée multi-robot et la génération conditionnelle (en fixant certains tokens comme conditions). Les expériences, menées en simulation dans des environnements encombrés variés, montrent des taux de succès élevés sur des tâches de navigation avec contraintes de connectivité, dépassant le planificateur classique qui avait servi à générer les données d'entraînement. L'intérêt principal de Roken réside dans sa scalabilité et sa généralisation : le modèle est entraîné sur des équipes de tailles mixtes et se généralise à des équipes et des environnements non vus lors de l'entraînement, y compris en observation partielle. Pour les intégrateurs de flottes AMR ou les systèmes multi-agents en entrepôt, cette capacité à planifier pour N robots sans replanification itérative représente un gain de latence significatif. Que le modèle surpasse son propre générateur de données d'entraînement est notable, mais il faut souligner que toutes les expériences sont en simulation ; le transfert sim-to-real reste non démontré, ce qui est le verrou habituel pour ce type d'approche. Ce travail s'inscrit dans une vague de recherche qui transpose les succès des modèles génératifs (diffusion, transformeurs) du langage et de la vision vers la planification robotique. Des travaux comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) explorent des architectures similaires pour le contrôle mono-robot, mais la coordination multi-agents via des tokens partagés reste un territoire peu défriché. Roken propose une formalisation élégante du problème, mais son évaluation reste entièrement simulée à ce stade. Les prochaines étapes naturelles seraient une validation sur robots réels et une comparaison avec des planificateurs multi-agents classiques comme CBS (Conflict-Based Search) sur des métriques standardisées.

RecherchePaper
1 source
AVA-VLA : améliorer les modèles vision-langage-action avec l'attention visuelle active
439arXiv cs.RO 

AVA-VLA : améliorer les modèles vision-langage-action avec l'attention visuelle active

Des chercheurs de LiAuto-DSR, division R&D de Li Auto (constructeur automobile chinois), publient sur arXiv (réf. 2511.18960, quatrième révision) AVA-VLA, un cadre algorithmique ciblant une limite structurelle des modèles Vision-Language-Action (VLA). Le diagnostic central : les VLA existants traitent chaque observation visuelle indépendamment à chaque pas de temps, modélisant la manipulation robotique comme un processus markovien (MDP) alors que la réalité est un processus partiellement observable (POMDP). AVA-VLA introduce un état récurrent servant d'approximation neurale de la croyance de l'agent sur l'historique de la tâche, couplé à un module d'attention visuelle active (AVA) qui réattribue dynamiquement des poids aux tokens visuels selon l'instruction courante et l'historique d'exécution. Les auteurs revendiquent l'état de l'art sur LIBERO et CALVIN, deux benchmarks académiques standards en manipulation robotique simulée, ainsi qu'un transfert vers des tâches de manipulation bimanuelle en conditions réelles, sans que les métriques terrain soient détaillées dans l'abstract. L'apport architectural est notable : les VLA phares actuels, OpenVLA, π0 de Physical Intelligence et GR00T N2 de NVIDIA, traitent l'observation visuelle sans mémoire explicite du contexte passé. Conditionner l'attention visuelle à l'historique d'exécution couvre un angle mort structurel sur les tâches séquentielles longues, là où des actions antérieures modifient la scène sans être immédiatement visibles dans l'image courante. Pour les intégrateurs industriels, cela suggère des bras manipulateurs plus robustes sur des workflows multi-étapes sans remise à zéro du contexte. Réserve : la formulation "transfers effectively" manque de quantification, et LIBERO comme CALVIN restent des environnements largement simulés. Le secteur des VLA s'est considérablement densifié depuis mi-2024 : π0 en octobre 2024, GR00T N2 en mars 2025, et une constellation de variantes académiques (RoboVLMs, OpenVLA-OFT) alimentent la littérature. L'approche récurrente d'AVA-VLA prolonge des travaux classiques sur la résolution de POMDP à base de LSTM, réinterprétés ici dans le paradigme VLA moderne. LiAuto, principalement connu pour ses véhicules hybrides à autonomie étendue, affiche à travers DSR des ambitions en robotique de manipulation. Le code source n'est pas encore publié et aucun déploiement terrain n'est annoncé : il s'agit pour l'instant d'une contribution de recherche académique dont la portée industrielle reste à confirmer hors simulation.

RechercheOpinion
1 source
T-Rex : manipulation dextérique à réaction tactile
440arXiv cs.RO 

T-Rex : manipulation dextérique à réaction tactile

Une équipe de chercheurs vient de publier T-Rex (Tactile-Reactive Dexterous Manipulation), un système d'apprentissage robotique qui intègre le retour tactile dans un modèle Vision-Language-Action (VLA) pour la manipulation dextre. Pour entraîner le système, les auteurs ont constitué un dataset de 100 heures de données tactiles à haute fréquence, collectées via une méthode centrée sur des primitives motrices élémentaires afin de maximiser l'efficacité de la collecte. L'architecture proposée, baptisée variable-rate Mixture-of-Transformers (MoT), est couplée à un encodeur tactile temporel de type VQ-VAE qui compresse les signaux tactiles à fréquence élevée sans saturer le flux de traitement du VLA de base. Validé sur 12 tâches de manipulation nécessitant un contrôle de force précis ou la gestion d'objets déformables, T-Rex affiche un taux de succès supérieur de plus de 30 % à celui du meilleur modèle concurrent testé. Ce résultat est significatif parce que les VLA actuels, dont Pi-0 de Physical Intelligence, OpenVLA ou les variantes de GR00T de NVIDIA, ignorent généralement le canal tactile ou se limitent à des encodeurs statiques incapables de capter la dynamique du contact en temps réel. Or, c'est précisément cette réactivité tactile qui distingue la dextérité humaine : ajuster la prise sur un objet glissant, détecter un défaut de surface, moduler la force sur un emballage souple. T-Rex démontre qu'il est possible de greffer un flux tactile à haute fréquence sur un VLA préentraîné sans dégrader ses capacités visuolinguistiques, ce qui ouvre la voie à une intégration progressive dans des pipelines d'apprentissage existants plutôt qu'à une refonte complète de l'architecture. La raison pour laquelle le tactile restait sous-exploité dans les VLA tient à trois obstacles cumulatifs : rareté des données tactiles diversifiées, contraintes architecturales des transformeurs optimisés pour la vision, et absence de benchmarks standardisés. T-Rex s'attaque aux trois simultanément, ce qui distingue ce travail des contributions précédentes comme DIGIT ou GelSight couplées à des politiques RL classiques. Dans le paysage concurrentiel, les acteurs spécialisés en capteurs tactiles (Contactile, Tac Sensing, BioTac) pourraient trouver dans ce framework un argument pour accélérer l'adoption hardware. Le code, le dataset et les poids du modèle ne sont pas encore mentionnés comme publics au moment de la soumission arXiv ; leur disponibilité conditionne la reproductibilité et l'impact réel de ce travail au-delà du laboratoire.

IA physiqueOpinion
1 source
TacStyle : personnalisation des politiques tactiles du robot via des représentations structurées de comportement
441arXiv cs.RO 

TacStyle : personnalisation des politiques tactiles du robot via des représentations structurées de comportement

Une équipe de recherche publie sur arXiv (réf. 2606.14862) TacStyle, une méthode permettant à un bras robotique d'adapter finement ses comportements tactiles aux préférences individuelles des utilisateurs. Le cas d'usage central est concret : modifier la force exercée lors du pliage de linge ou du nettoyage de surfaces, selon ce que l'utilisateur souhaite. Plutôt que de conditionner directement la politique du robot sur des instructions en langage naturel, TacStyle apprend d'abord une représentation latente structurée qui organise les préférences utilisateurs en fonction des différences entre trajectoires observées. Un modèle de fondation interprète ensuite cette représentation à partir d'une consigne textuelle et sélectionne la valeur dans l'espace latent qui produit le comportement désiré. La méthode a été validée à la fois en simulation et sur plateforme réelle, avec des résultats montrant qu'elle nécessite significativement moins d'annotations de préférences que les politiques conditionnées directement sur le langage. L'enjeu est de combler une lacune structurelle dans les politiques robotiques conditionnées par le langage (VLA, diffusion policies) : jusqu'ici, le langage permet de préciser quoi faire, pas comment le faire. Or, la nuance comportementale, notamment le contrôle continu de la force ou de la pression, résiste mal aux instructions abstraites. Dire à un robot "appuie un peu plus fort qu'avant" est insuffisamment précis pour piloter un comportement calibré. TacStyle démontre que raisonner dans un espace latent structuré, avant de générer le mouvement, permet un contrôle plus fin tout en réduisant le coût d'annotation, argument décisif pour un déploiement industriel ou en assistance à domicile. Ce travail s'inscrit dans la trajectoire ouverte par les politiques de comportement par imitation (BC) augmentées du langage, popularisées par des systèmes comme pi-0 de Physical Intelligence ou les modèles GR00T N2 de NVIDIA. La littérature sur l'apprentissage des préférences (RLHF transposé à la robotique) constitue l'autre branche connexe. TacStyle ne vise pas encore un produit commercialisé ; il s'agit d'une contribution académique qui ouvre la voie à des robots d'assistance mieux adaptables, notamment en environnement domestique ou en soins aux personnes âgées, secteurs où la personnalisation des interactions physiques représente un différenciateur critique.

IA physiqueOpinion
1 source
Modèle d'action géométrique pour l'apprentissage de politiques robotiques
442arXiv cs.RO 

Modèle d'action géométrique pour l'apprentissage de politiques robotiques

Des chercheurs ont déposé le 16 juin 2026 sur arXiv (arXiv:2606.17046) le Geometric Action Model (GAM), une politique de manipulation robotique conditionnée par le langage naturel. L'architecture réutilise un modèle fondamental géométrique (GFM) pré-entraîné en le scindant en deux segments : les couches superficielles encodent les observations visuelles, tandis qu'un prédicteur causal inséré à la jonction génère des tokens latents futurs conditionnés sur les instructions textuelles, la proprioception et l'historique d'actions du robot. Les blocs restants du GFM décodent ensuite simultanément la géométrie future de la scène et les actions à exécuter via un backbone unique partagé. Sur une suite de benchmarks en simulation et sur robot réel incluant des tâches de manipulation en contact riche, GAM affiche selon ses auteurs une précision, une robustesse, une vitesse d'inférence et une compacité supérieures aux baselines VLA à large échelle actuellement en référence. Le problème central qu'adresse ce travail est le décalage entre les représentations 2D dominantes dans les VLA (vision-language-action models) et la nature tridimensionnelle des interactions physiques. Des systèmes comme Pi-0 et Pi0.5 (Physical Intelligence), GR00T N2 (NVIDIA) ou les modèles RT-X (Google DeepMind) opèrent principalement sur des espaces latents dérivés d'images 2D, ce qui les handicape pour les tâches de saisie précise, d'assemblage et de dépose sur surfaces contraintes. Ancrer la prédiction d'actions directement dans un espace géométrique 3D, avec une modification minimale du modèle fondamental sous-jacent, constitue le pari architectural de GAM. Si ces résultats résistent à une reproductibilité indépendante, ils valideraient l'hypothèse que des priors géométriques explicites améliorent la généralisation des politiques généralistes face au gap sim-to-real. Cette publication s'inscrit dans une course aux VLA généralistes lancée depuis RT-2 (Google DeepMind, 2023), où la majorité des acteurs industriels, dont Figure (Helix), Agility Robotics, 1X et Physical Intelligence, misent sur des transformers multimodaux sans encodage 3D explicite. En parallèle, plusieurs laboratoires académiques (Berkeley, Stanford, CMU) explorent l'intégration de représentations géométriques comme le Gaussian Splatting dans les politiques robotiques. GAM s'inscrit dans cette seconde tendance avec une proposition architecturale minimaliste. À ce stade, il s'agit d'un preprint arXiv non peer-reviewed, sans déploiement industriel ni partenariat hardware annoncé ; une validation sur des plateformes commerciales standards (UR, Franka) en dehors du laboratoire reste à démontrer.

IA physiqueOpinion
1 source
Transférer le contact, pas seulement le mouvement : préhension souple entre mains dextériques
443arXiv cs.RO 

Transférer le contact, pas seulement le mouvement : préhension souple entre mains dextériques

Des chercheurs ont publié mi-juin 2026 sur arXiv (réf. 2606.15516) une méthode de transfert de politiques de préhension dextre entre mains robotiques hétérogènes. L'approche introduit une interface force-position cross-embodiment : le mouvement est encodé dans un espace latent de pose de main commun à toutes les plateformes, tandis que les efforts de chaque main sont calibrés par identification système en couples articulaires physiques exprimés en N.m, puis convertis en forces au bout des doigts et en descripteurs compacts de charge par doigt. Une politique visuomoteur entraînée par flow matching combine vision, proprioception et contact calibré ; un masquage visuel structuré pousse la politique à s'appuyer sur la force lorsque les contacts sont occultés. Le même contrôleur hybride force-position sert à la collecte de démonstrations et à l'exécution, assurant la cohérence des cibles de force entre entraînement et déploiement. L'enjeu est réel : la préhension dextre stable exige la régulation du contact, pas seulement le suivi de trajectoire. Quand un doigt glisse, se déforme ou sort du champ visuel, c'est le retour de force qui maintient la charge appropriée sur l'objet. Les architectures cross-embodiment existantes unifient le mouvement via des poses retargetées ou des actions latentes, mais laissent le signal de force lié au hardware de chaque main, bloquant le transfert. En calibrant ce signal dans une unité physique commune (N.m), les auteurs rendent la boucle de régulation de contact comparable entre plateformes structurellement différentes. Pour un intégrateur qui déploie plusieurs modèles de mains sur une même cellule, cela ouvre la perspective de bibliothèques de skills partagées plutôt que de politiques ad hoc par hardware. Les expériences montrent que des primitives apprises sont réemployables dans des pipelines de manipulation longue portée, test de généralisation nettement plus exigeant qu'une démonstration isolée. La publication s'inscrit dans le sillage des architectures cross-embodiment post-GR00T N2 et pi0, où l'effort de la communauté vise la réutilisation de politiques entre robots sans retraining complet. Elle répond directement aux limites de travaux comme DexMV ou AnyGrasp, qui normalisent le mouvement mais ignorent la physique du contact. Fait inhabituel : l'abstract ne mentionne ni institution ni auteurs explicites, ce qui peut indiquer une soumission industrielle anonymisée ou un groupe en cours de dévoilement. Le travail reste à ce stade un résultat expérimental de laboratoire sans déploiement annoncé ; la prochaine étape naturelle serait une validation sur des mains commerciales comme la Shadow Hand ou l'Ability Hand dans des scénarios industriels réels.

RechercheOpinion
1 source
Pondération hiérarchique des avantages pour l'affinage par apprentissage par renforcement en ligne des VLA à partir de résultats d'épisodes épars
444arXiv cs.RO 

Pondération hiérarchique des avantages pour l'affinage par apprentissage par renforcement en ligne des VLA à partir de résultats d'épisodes épars

Une équipe de chercheurs publie sur arXiv (2606.17043) une méthode baptisée HABC (Hierarchical Advantage-Weighted Behavior Cloning), destinée à affiner en ligne, par apprentissage par renforcement, des politiques VLA (Vision-Language-Action) préentraînées. L'approche cible un problème précis : lors des épisodes de rollout sur robot réel, seul un signal binaire est disponible (succès ou échec), alors que l'algorithme d'entraînement réclame une supervision à chaque transition. Sur trois tâches bimanales à contact riche, HABC fait passer les taux de succès de 36 %, 44 % et 12 % (baselines par imitation supervisée seule) à respectivement 92 %, 88 % et 38 %, soit des gains de 56, 44 et 26 points de pourcentage. L'apport central est une décomposition de l'objectif en deux dimensions orthogonales : la viabilité (la politique peut-elle réussir la tâche ?) et l'efficacité (le fait-elle rapidement ?). Confondre les deux dans un scalaire unique pose problème dès que le succès de base est acquis : le gradient s'annule, incapable de discriminer une exécution rapide d'une lente. HABC entraîne deux têtes de critique séparées sur des sous-ensembles de données distincts, puis les fusionne via une porte adaptative g_t qui privilégie la viabilité quand le succès est incertain et bascule vers l'efficacité quand il est maîtrisé. Un second mécanisme, l'"intervention-aware credit assignment", restreint les labels d'épisode aux seuls segments exécutés de façon autonome par la politique courante, empêchant les reprises en main humaines de polluer l'attribution de crédit, biais particulièrement dévastateur dans les environnements industriels où les opérateurs interviennent régulièrement. Cette contribution s'inscrit dans une vague de travaux cherchant à rendre le fine-tuning en ligne des VLA praticable hors simulation. Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et OpenVLA ont chacun mis en avant des capacités de généralisation, mais l'amélioration continue post-déploiement par RL demeure un problème ouvert. HABC y répond sans modifier l'architecture du modèle sous-jacent, ce qui la rend compatible avec les VLA existants sans refonte coûteuse. Le preprint ne mentionne ni partenariat industriel ni calendrier de déploiement : il s'agit d'une contribution académique dont les résultats sur robot réel lui confèrent plus de poids que les travaux purement simulés, mais dont la validation reste limitée à trois tâches et n'implique aucun acteur européen identifié.

RechercheOpinion
1 source
LaST₀ : raisonnement spatio-temporel latent en chaîne pour les modèles VLA robotiques
445arXiv cs.RO 

LaST₀ : raisonnement spatio-temporel latent en chaîne pour les modèles VLA robotiques

Des chercheurs ont proposé LaST₀ (Latent Spatio-Temporal Chain-of-Thought), un framework pour modèles Vision-Langage-Action (VLA) appliqués à la manipulation robotique, publié en janvier 2026 sur arXiv (2601.05248, v4). Évalué sur 10 tâches réelles couvrant la manipulation sur table, la manipulation sur base mobile et la manipulation dextre, le système améliore le taux de succès moyen de respectivement 13 %, 14 % et 14 % par rapport aux meilleures méthodes VLA actuelles. L'architecture repose sur un design Mixture-of-Transformers dual : un "expert raisonnement" opérant à basse fréquence pour l'inférence latente, et un "expert action" générant des commandes motrices à haute fréquence, les deux modules fonctionnant à des cadences hétérogènes pour permettre un basculement adaptatif. Le raisonnement intermédiaire s'effectue dans un espace latent compact encodant la dynamique visuelle future, la structure 3D de la scène et les états proprioceptifs du robot, sans passer par du texte en langage naturel. L'enjeu central est le compromis latence/raisonnement qui freine le déploiement industriel des VLA. Les approches qui génèrent des traces de raisonnement en langage naturel avant d'agir, comme certaines variantes de Pi-0 (Physical Intelligence) ou OpenVLA, introduisent une latence d'inférence incompatible avec les cycles rapides de la manipulation robotique. LaST₀ court-circuite ce goulot en déplaçant le raisonnement dans un espace latent plus dense informationnellement, plus rapide à générer, et capable de capturer des attributs physiques difficiles à verbaliser comme la friction ou la compliance des objets. Les gains mesurés sur des environnements réels, et non en simulation, constituent un signal notable : le sim-to-real gap n'est pas le seul obstacle, et la représentation interne du raisonnement importe autant que la qualité des données d'entraînement. Les VLA ont émergé comme architecture dominante pour la généralisation en robotique depuis les travaux de Google sur RT-2 (2023), puis se sont accélérés avec Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et Helix de Figure AI en 2025. Le débat structurant du secteur oppose raisonnement explicite de type LLM et politiques réactives de type diffusion. LaST₀ propose une troisième voie, un système dual à fréquences hétérogènes combinant les deux sans les latences du premier ni les limites de généralisation du second. La publication reste pour l'instant purement académique, sans pilote industriel annoncé, mais l'architecture est directement transposable aux manipulateurs commerciaux et aux plateformes humanoïdes existantes.

IA physiqueOpinion
1 source
Penser moins, agir tôt : raisonnement latent renforcé avec sortie anticipée dans les modèles VLA
446arXiv cs.RO 

Penser moins, agir tôt : raisonnement latent renforcé avec sortie anticipée dans les modèles VLA

Une équipe de recherche publie sur arXiv (identifiant 2606.15099, juin 2026) AVA-VLA (Adaptive Variable Alignment VLA), un cadre d'inférence pour modèles vision-langage-action qui abandonne le raisonnement explicite par chaîne de pensée (Chain-of-Thought, CoT) au profit de variables latentes non observables. Le modèle combine un mécanisme de débruitage par apprentissage par renforcement, qui traite la génération d'états latents comme un processus de décision séquentiel optimisé par des récompenses au niveau de la tâche, et une stratégie de sortie anticipée (Early Exit) qui interrompt le raisonnement dès que la confiance dans l'état courant dépasse un seuil adaptatif. Sur le benchmark LIBERO, référence standard pour les tâches de décision en environnement incarné, AVA-VLA atteint un taux de succès moyen de 98,3 % tout en réduisant le temps d'inférence d'un facteur 6 par rapport aux méthodes CoT explicites. Cette publication s'attaque à l'un des principaux goulots d'étranglement des VLA : la latence introduite par la génération de texte intermédiaire avant chaque action. Pour un intégrateur ou un constructeur de robot humanoïde, une réduction 6x de la latence d'inférence change concrètement l'équation matérielle - elle ouvre la voie à des contrôleurs embarqués moins puissants ou à des boucles de contrôle plus rapides sans GPU de serveur. Le score de 98,3 % sur LIBERO est élevé, mais il convient de noter que ce benchmark reste en simulation ; les auteurs ne rapportent aucun résultat sur robot physique, et l'écart sim-to-real n'est pas discuté. Il s'agit donc d'une contribution de recherche, pas d'un déploiement validé en production. Les modèles VLA à raisonnement explicite ont été popularisés notamment par pi-0 de Physical Intelligence et GR00T N2 de NVIDIA, qui s'appuient tous deux sur des étapes de planification en langage naturel avant l'exécution motrice. AVA-VLA s'inscrit dans une tendance concurrente cherchant à internaliser ce raisonnement, approche voisine des travaux sur les "thinking tokens" latents dans les LLM (Meta COCONUT, DeepMind). La prochaine étape naturelle sera de valider ces gains sur des plateformes robotiques physiques dans des configurations de tâches longues - précisément le régime où la propagation d'erreurs des méthodes CoT est la plus problématique et où les benchmarks simulés montrent leurs limites.

RechercheOpinion
1 source
ROVE : l'apprentissage par renforcement pour débloquer les interventions humaines dans la manipulation par humanoïdes
447arXiv cs.RO 

ROVE : l'apprentissage par renforcement pour débloquer les interventions humaines dans la manipulation par humanoïdes

Une équipe de chercheurs a publié fin juin 2026 ROVE (Reinforcement learning for humanoid VLA post-training with imperfect human interventions), un framework de renforcement dédié à l'amélioration des modèles Vision-Language-Action (VLA) sur robots humanoïdes à partir d'interventions humaines imparfaites. Le principe : un opérateur prend la main sur le robot lors des phases d'échec, générant des trajectoires correctives qui servent ensuite à affiner le modèle. Le problème bien identifié par les auteurs est que ces interventions humaines sont souvent hésitantes, sous-optimales, voire erronées, ce qui rend l'imitation naïve contre-productive. ROVE introduit deux mécanismes centraux : un pipeline human-in-the-loop capable de collecter simultanément des données de déploiement autonome et d'intervention, et une méthode d'estimation de valeur dite "optimiste" (Optimistic Value Estimation, OVE) qui filtre les comportements à haute valeur depuis des trajectoires de qualité mixte. Le framework intègre également des vidéos d'expériences humaines cross-embodiment pour enrichir la supervision sur les modes de défaillance et de récupération rares. Sur des tâches réelles de manipulation à contact-riche et fine-grained, ROVE surpasse les baselines par apprentissage par expérience et s'améliore de manière consistante à chaque itération rollout-intervention. L'enjeu central ici est la scalabilité du déploiement humanoïde en conditions réelles. Les modèles VLA, Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, OpenVLA -- ont démontré des capacités de généralisation remarquables, mais leur post-training sur hardware humanoïde reste un goulot d'étranglement : la cinématique whole-body et le contrôle de mains dextères compliquent radicalement la collecte de données téléopérées de qualité. ROVE invalide l'hypothèse selon laquelle l'intervention humaine doit être experte pour être utile : OVE permet d'extraire un signal d'avantage informatif même depuis des démonstrations imparfaites, ce qui signifie qu'on peut utiliser des opérateurs non-spécialistes pour améliorer continûment le modèle en production. C'est un changement de paradigme potentiellement significatif pour les intégrateurs : la qualité du déploiement n'est plus bornée par la disponibilité d'experts en téléopération. Ce travail s'inscrit dans une vague de recherches sur le RLHF appliqué à la robotique physique, après les travaux pionniers sur l'imitation par intervention (HATO, HITL-TAMER) et les approches par feedback correctif. Les humanoïdes ciblés restent non précisés dans l'abstract (preprint arXiv, les détails hardware seront à vérifier dans le papier complet), mais les résultats sur tâches contact-rich suggèrent une applicabilité aux plateformes type Figure 03, Unitree H1/G1 ou Agility Digit. Le positionnement concurrentiel est clair : là où Physical Intelligence mise sur la qualité des données téléopérées en amont, ROVE parie sur la rectification en boucle fermée en aval. Les prochaines étapes probables incluent des tests à plus grande échelle et une évaluation sur plusieurs architectures VLA, mais en l'état de preprint, aucun déploiement commercial n'est annoncé.

IA physiqueOpinion
1 source
WAM4D : modèle d'action du monde 4D rapide via des tokens de registre spatial
448arXiv cs.RO 

WAM4D : modèle d'action du monde 4D rapide via des tokens de registre spatial

Une équipe de chercheurs a publié fin juin 2026 sur arXiv (arXiv:2606.14048) WAM4D, un modèle d'action mondial (WAM) capable de prédire simultanément vidéo future et actions robotiques en espace 4D (3D plus temps). Sa contribution centrale repose sur des spatial register tokens légers, injectés à l'entraînement dans un transformeur causal de type Mixture-of-Transformers pour y distiller des priors géométriques denses, puis supprimés à l'inférence afin de préserver la vitesse de génération d'actions. L'architecture intègre également une attention causale mixte (causal mixture attention) segmentant la visibilité entre tokens vidéo, action et géométrie. Les résultats sont évalués sur le benchmark RoboTwin 2.0 et sur des tâches de manipulation réelle, avec des gains mesurés en cohérence spatiale et en précision de prédiction d'action. L'intérêt de l'approche tient à un compromis longtemps bloquant en robotique de manipulation: les WAMs opérant en espace 2D ou latent produisent des rollouts visuellement plausibles mais ignorent les contraintes géométriques 3D et la géométrie de contact occludée, deux facteurs critiques pour la préhension précise. À l'inverse, forcer une représentation 4D dense à l'inférence alourdit le décodage géométrique et ralentit la génération d'actions causales. WAM4D dissocie les deux phases en apprenant la géométrie à l'entraînement via les register tokens, sans répercuter ce coût à l'inférence, une stratégie comparable au token pruning dans les Vision Transformers. Ce découplage entraînement/inférence pourrait représenter un levier concret pour les équipes robotiques cherchant à intégrer des priors 3D dans des politiques fonctionnant en temps réel. Les WAMs s'inscrivent dans une tendance plus large visant à doter les robots de politiques génératives capables de simuler leurs propres conséquences avant d'agir, un domaine en concurrence directe avec UniSim et Genie 2 (Google DeepMind), ainsi que les Visual Language Action models comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. WAM4D se distingue de ces approches par son ancrage explicite en géométrie 4D, là où la majorité des VLAs raisonnent en espace de features visuelles 2D ou latentes. Le paper ne mentionne ni déploiement industriel ni partenariat commercial; il s'agit d'une contribution académique dont les suites naturelles seraient une validation sur des benchmarks standardisés comme Open X-Embodiment ou des tests sur des plateformes commerciales (Franka, UR, xArm).

IA physiqueOpinion
1 source
LabVLA : ancrage des modèles vision-langage-action (VLA) dans les laboratoires scientifiques
449arXiv cs.RO 

LabVLA : ancrage des modèles vision-langage-action (VLA) dans les laboratoires scientifiques

Une équipe de chercheurs a publié le 16 juin 2026 sur arXiv (référence 2606.13578) un article présentant LabVLA, un modèle Vision-Language-Action conçu spécifiquement pour l'exécution autonome de protocoles expérimentaux en laboratoire scientifique. Le système repose sur deux briques : RoboGenesis, un moteur de génération de données par simulation qui décompose des flux de travail en compétences atomiques, valide les exécutions et exporte des démonstrations structurées pour différents profils de robots ; et LabVLA lui-même, dont l'entraînement se déroule en deux étapes -- un préentraînement par tokenisation d'actions FAST sur le backbone Qwen3-VL-4B-Instruct, suivi d'un affinage par flow matching avec un expert d'actions de type DiT (Diffusion Transformer) sous isolation des connaissances. Sur le benchmark LabUtopia, LabVLA affiche le taux de succès moyen le plus élevé parmi tous les systèmes testés, en distribution comme hors distribution. L'enjeu est structurant : les IA actuelles peuvent lire de la littérature scientifique, générer des hypothèses et planifier des protocoles, mais l'exécution physique au banc de laboratoire reste humaine. Les instruments spécialisés, les liquides transparents (difficiles à percevoir pour les capteurs RGB classiques) et les séquences protocolaires rigides créent des défis absents des benchmarks domestiques sur lesquels la plupart des VLA existants -- Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, OpenVLA -- ont été entraînés. Si LabVLA tient ses promesses hors simulation, cela ouvrirait la voie à une automatisation crédible des laboratoires de biologie, chimie ou pharmacologie, un marché adressé aujourd'hui par des acteurs comme Automata, Opentrons ou Hamilton Robotics. La course aux VLA généralistes a démarré en 2024 avec Octo, puis OpenVLA et Pi-0, calibrés principalement sur des tâches ménagères. Le sim-to-real gap en milieu laboratoire reste un obstacle non résolu : les résultats présentés dans ce preprint sont entièrement issus de simulation -- LabUtopia est lui-même un environnement virtuel -- et aucun déploiement sur robot physique n'est rapporté. La robustesse sur de vraies paillasses, avec contaminations, vibrations et variabilités instrumentales, reste à démontrer. Les auteurs annoncent comme prochaines étapes l'extension des profils de robots compatibles avec RoboGenesis et des évaluations sur hardware réel.

UEImpact indirect pour les laboratoires pharmaceutiques et biotechs européens si le sim-to-real gap est comblé, mais aucun déploiement ni partenariat européen annoncé.

IA physiqueOpinion
1 source
SCALE : observation et exécution adaptatives guidées par l'auto-incertitude dans les modèles VLA
450arXiv cs.RO 

SCALE : observation et exécution adaptatives guidées par l'auto-incertitude dans les modèles VLA

Une équipe de chercheurs propose SCALE (Self-uncertainty Conditioned Adaptive Looking and Execution), une méthode d'inférence adaptative pour les modèles Vision-Language-Action (VLA) publiée sur arXiv (2602.04208v2). Contrairement aux approches de test-time scaling (TTS) existantes, SCALE ne nécessite ni entraînement supplémentaire, ni vérificateur externe, ni passes multiples : un seul passage forward suffit. Le système repose sur un mécanisme de self-uncertainty (auto-incertitude) qui module simultanément deux dimensions : la représentation visuelle, c'est-à-dire comment le modèle perçoit la scène, et l'action produite. Inspiré de la théorie de l'inférence active (Active Inference), SCALE élargit son exploration perceptuelle et motrice en situation d'incertitude élevée, et se concentre sur l'exploitation lorsque la confiance est forte. Les auteurs valident l'approche sur des benchmarks simulés et réels, avec des gains mesurés sur plusieurs VLA de l'état de l'art. L'intérêt industriel est direct. Les méthodes TTS existantes pour robots empruntent leur logique aux succès des LLM comme o1, mais exigent des ressources difficilement compatibles avec la production : vérificateurs externes, passes multiples, parfois fine-tuning ciblé. SCALE lève ce verrou en maintenant l'efficacité d'un passage unique, compatible avec des contraintes de temps réel sur systèmes embarqués. Plus structurellement, la méthode adresse un angle souvent ignoré par les approches concurrentes : l'ambiguïté perceptuelle. En conditions réelles, un robot confronté à une scène mal éclairée ou partiellement occultée a autant besoin de reconsidérer sa perception que son action. SCALE couple ces deux dimensions, là où les TTS classiques n'interviennent qu'au niveau du décodage d'action -- une distinction qui compte dès que l'on sort des environnements contrôlés de laboratoire. Le test-time scaling appliqué à la robotique reste un champ en construction. Des modèles comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA visent à généraliser le contrôle robotique via des architectures VLA, mais leur robustesse hors distribution est un problème ouvert. La plupart des améliorations passent encore par du fine-tuning ; SCALE propose une voie alternative en améliorant le comportement à l'inférence sans toucher aux poids du modèle. L'article ne documente pas encore de déploiements industriels à grande échelle, et les benchmarks utilisés restent des environnements relativement balisés. Si la robustesse se confirme dans des configurations non contrôlées, la méthode pourrait s'intégrer comme composant standard dans les pipelines VLA déployés par des acteurs comme Figure AI, Agility Robotics ou 1X Technologies.

IA physiqueOpinion
1 source