Aller au contenu principal
IA physiquearXiv cs.RO 

DriftingVLA : génération vision-langage-action native en une étape par dérive temporelle par dimension

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent DriftingVLA, un modèle vision-langage-action (VLA) capable de générer un chunk d'action complet en une seule passe avant du réseau expert, sans les itérations multiples typiques des modèles à flux continus. Plutôt que d'apprendre un champ de flux nécessitant une intégration pas à pas à l'inférence, le système utilise un objectif de "distribution drifting" pour apprendre directement une correspondance entre bruit et séquence d'actions. Une innovation clé, le Per-Dimension Temporal Drifting (PDTD), traite chaque dimension de contrôle du robot comme une unité de dérive distincte durant l'entraînement, tout en laissant le modèle générer le chunk d'action de façon jointe pour préserver les dépendances entre dimensions. Sur les bancs d'essai, DriftingVLA atteint 98,32% de réussite sur LIBERO, 81,09% sur RoboTwin 2.0 et 77,67% sur six tâches réelles à bras simple et double, tout en offrant une génération 3,36 fois plus rapide que les approches multi-étapes.

Pour les intégrateurs et ingénieurs en robotique, ce travail s'attaque à un goulot d'étranglement bien identifié du contrôle robotique en ligne : les modèles VLA à flux continu, malgré leur expressivité, imposent un raffinement multi-étapes qui alourdit la latence à chaque cycle de décision. En démontrant qu'un modèle "one-step" natif peut égaler voire dépasser des baselines multi-étapes et d'autres approches one-step existantes sur des tâches simulées et réelles, DriftingVLA apporte un élément de preuve empirique que la vitesse d'inférence n'a pas nécessairement à se payer en performance de contrôle. Ce résultat compte pour la course actuelle à l'exécution temps réel des modèles fondation robotiques, où la latence conditionne directement la viabilité industrielle d'un VLA sur une chaîne de production ou un bras manipulateur.

Cette publication s'inscrit dans la lignée des modèles VLA à flux qui ont établi la génération d'action continue mais restent pénalisés par leur coût d'inférence itératif. Les auteurs comparent explicitement DriftingVLA à des baselines de flux multi-étapes ainsi qu'à d'autres modèles one-step existants, qu'il surpasse sur l'ensemble des bancs d'essai testés. Il s'agit à ce stade d'un travail de recherche évalué en simulation (LIBERO, RoboTwin 2.0) et sur un nombre restreint de tâches réelles, sans indication d'intégration commerciale ou de déploiement industriel annoncé ; la suite logique consisterait en une validation sur un éventail plus large de plateformes robotiques et de tâches de manipulation avant toute adoption par des intégrateurs.

Dans nos dossiers

À lire aussi

La simplicité avant tout : génération d'actions en une étape pour les modèles vision-langage-action (VLA)
1arXiv cs.RO 

La simplicité avant tout : génération d'actions en une étape pour les modèles vision-langage-action (VLA)

Une équipe de chercheurs publie sur arXiv (2606.05737, juin 2026) une méthode simplifiée pour accélérer la génération d'actions dans les modèles VLA (vision-language-action) à base de diffusion. L'observation centrale: là où les pipelines diffusion classiques requièrent dix étapes de débruitage itératif pour produire un chunk d'actions, un simple biais de la distribution d'entraînement vers les états à bruit élevé suffit à obtenir des politiques efficaces en une seule étape, sans modèle enseignant, sans distillation et sans objectif auxiliaire. Sur les benchmarks LIBERO, LIBERO-Plus et LIBERO-Pro devenus quasi-standards pour la manipulation dextre simulée, les politiques one-step entraînées avec ce calendrier biaisé égalent ou dépassent des politiques à décodage dix-étapes entraînées avec une distribution uniforme. Sur LIBERO-Long spécifiquement, un modèle combinant un LVM de 1,4 milliard de paramètres et une tête d'action de 30 millions de paramètres atteint 95,6 % de taux de succès en une seule étape. Une validation croisée sur robot bimanual réel (plateforme YAM, dans le cadre d'une évaluation RSS) confirme la tendance, sur un échantillon limité. L'enjeu opérationnel est direct: réduire le décodage d'un facteur dix libère de la latence critique pour les applications temps-réel. Mais l'argument de fond est plus structurel. Les auteurs identifient une asymétrie fondamentale entre génération d'images et génération d'actions robotiques: un espace d'action (quelques degrés de liberté, un chunk de positions articulaires) est incomparablement plus compact qu'une image de millions de pixels. Cette différence implique que les méthodes one-step avancées développées pour la synthèse d'images (distillation de consistency models, score distillation, flow matching accéléré) ne sont pas nécessairement requises ici. Pour un intégrateur ou un décideur industriel, cela simplifie significativement le pipeline d'entraînement: pas de phase de distillation en deux étapes, pas de teacher freezing, et donc moins de complexité opérationnelle pour déployer un VLA performant. Les VLA à base de diffusion ont connu une montée en puissance rapide depuis mi-2024, portée par pi0 de Physical Intelligence, GR00T N2 de NVIDIA et Helix de Figure AI, tous construits autour d'architectures à flux diffusion ou flow-matching pour la génération d'actions. Ce travail s'inscrit dans un mouvement de simplification qui cherche à réduire la friction entre recherche et déploiement industriel. Les benchmarks LIBERO restent cantonnés à la manipulation de petits objets en environnement simulé, et la validation sur robot réel présentée ici reste préliminaire. Les prochaines étapes naturelles seront de tester cette approche à plus grande échelle sur des architectures de référence comme pi0 ou GR00T, dans des contextes d'assemblage ou de logistique où la latence d'inférence est un critère de déploiement direct.

IA physiqueOpinion
1 source
TBD-VLA : modèle vision-langage-action à diffusion par blocs temporels
2arXiv cs.RO 

TBD-VLA : modèle vision-langage-action à diffusion par blocs temporels

Une équipe de chercheurs propose TBD-VLA (Temporal Block Diffusion Vision Language Action Model), un nouveau cadre de génération d'actions pour les modèles Vision-Language-Action (VLA) robotiques, publié le 9 juin 2026 sur arXiv (identifiant 2606.07895). L'approche repose sur la diffusion discrète par blocs temporels : les séquences d'actions sont partitionnées en blocs, à l'intérieur desquels un processus de diffusion masquée génère les tokens d'action en parallèle, tandis que la génération reste autoregressive d'un bloc à l'autre. Le modèle intègre également une fonctionnalité baptisée "Real-Time Chunking", qui permet l'exécution asynchrone des blocs d'action via un mécanisme d'interpolation temporelle (temporal in-painting). Les auteurs rapportent des gains de performance significatifs sur benchmarks en simulation et sur des tâches de manipulation en environnement réel par rapport aux approches VLA antérieures, sans préciser de métriques chiffrées dans l'abstract. L'enjeu central que TBD-VLA cherche à résoudre est double : la latence d'inférence élevée des VLA discrets classiques, et l'absence de modélisation explicite des dépendances temporelles dans les architectures de décodage parallèle récentes. Les VLA discrets standard génèrent les actions token par token de manière autoregressive, une approche précise mais trop lente pour les contraintes temps-réel d'un bras manipulateur industriel. Les tentatives précédentes de décodage parallèle accélèrent l'inférence mais sacrifient la cohérence temporelle entre tokens. TBD-VLA propose un compromis structuré : parallélisme intra-bloc pour la vitesse, autoregressivité inter-blocs pour la cohérence. Si les gains annoncés se confirment à l'échelle, cette architecture offre une voie vers des VLA déployables en milieu industriel avec des contraintes de cycle time réalistes. Le développement des VLA robotiques s'est accéléré depuis 2023 avec des modèles comme Pi-0 de Physical Intelligence (basé sur la diffusion continue), OpenVLA de l'Université de Californie Berkeley, et les approches RoboVLMs. TBD-VLA se distingue en restant dans l'espace des tokens discrets, aligné avec les architectures LLM standards, tout en empruntant à la diffusion pour la génération intra-bloc. Le papier publie un site de projet (tbd-vla.github.io) et présente des résultats sur simulation et manipulation réelle, mais reste à ce stade une contribution académique sans déploiement industriel annoncé. La prochaine étape logique serait une intégration dans des pipelines de fine-tuning sur données propriétaires, terrain sur lequel Physical Intelligence et Figure AI conservent une avance significative.

IA physiqueOpinion
1 source
MemoryVLA++ : modélisation temporelle par mémoire et imagination dans les modèles vision-langage-action (VLA)
3arXiv cs.RO 

MemoryVLA++ : modélisation temporelle par mémoire et imagination dans les modèles vision-langage-action (VLA)

Une équipe de chercheurs publie sur arXiv (2606.09827, juin 2026) MemoryVLA++, un framework de modélisation temporelle pour modèles VLA (Vision-Language-Action). L'architecture combine trois composants : une mémoire de travail construite à partir des tokens perceptifs et cognitifs générés par un VLM pré-entraîné sur l'observation courante ; une banque mémoire Perceptual-Cognitive qui indexe contexte sémantique et détails bas niveau des interactions passées via un mécanisme de consolidation sans redondance ; et un modèle du monde simulant des états futurs dans un espace latent de débruitage. Ces latents imaginés, guidés par la mémoire, alimentent un expert d'action à diffusion qui produit des séquences d'actions temporellement cohérentes. Évalué sur cinq benchmarks de simulation (Libero, SimplerEnv, Mikasa-Robo, Calvin, Libero-Plus) et trois catégories de tâches réelles sur trois robots distincts, le système affiche des gains de +9 % sur les tâches générales, +26 % sur les tâches mémoire-dépendantes, et +28 % sur les tâches d'anticipation. Ces résultats adressent une faiblesse structurelle des VLAs actuels (Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, OpenVLA), tous limités à l'observation instantanée et incapables de maintenir un contexte opérationnel sur plusieurs étapes. Pour des tâches longue-portée (reprendre une manipulation interrompue, enchaîner des gestes interdépendants), cette limitation est rédhibitoire en environnement industriel réel. Le gain de +26 % sur les tâches mémoire-dépendantes, mesuré hors simulation, est le point le plus solide de la publication : il suggère que l'architecture surmonte partiellement le sim-to-real gap qui affaiblit beaucoup de travaux académiques récents. Pour un intégrateur ou un COO industriel, c'est la différence entre un robot qui réinitialise sa compréhension à chaque step et un qui maintient un contexte cohérent sur l'ensemble de la séquence de manipulation. MemoryVLA++ s'inscrit dans une vague de travaux cherchant à injecter du raisonnement temporel dans les fondations robotiques, face aux architectures VLA portées par Physical Intelligence, NVIDIA et Google DeepMind. L'inspiration est explicitement cognitive : mémoire de travail (buffer court terme), système hippocampique (mémoire épisodique des interactions passées) et simulation mentale d'états futurs, trois mécanismes documentés en neurosciences. L'article reste un preprint non relu par les pairs, et les vidéos de démonstration sur la page projet méritent une lecture critique avant toute conclusion définitive. Les suites naturelles seraient une validation sur bras industriels à 6-7 DOF en environnement non contrôlé et une comparaison rigoureuse avec des approches à mémoire externe de type RAG robotique. Aucun acteur européen n'est impliqué dans ces travaux.

IA physiqueOpinion
1 source
VANE : entraînement fiable en temps de test pour les modèles vision-langage-action par prédiction visuelle future
4arXiv cs.RO 

VANE : entraînement fiable en temps de test pour les modèles vision-langage-action par prédiction visuelle future

Des chercheurs publient VANE (arXiv:2608.09448, soumis en aout 2026), une méthode de test-time training (TTT) pour les modèles vision-langage-action (VLA) utilises en manipulation robotique en boucle fermée. Le problème cible: l'adaptation en ligne classique mélange dans un espace de correction unique des ajustements incompatibles entre taches, et modifie les actions suivantes du robot avant même de savoir si la correction précédente était pertinente. VANE conditionne l'adaptation du prompt sur le contexte visuel et langagier courant, puis apprend a partir des conséquences visuelles futures des actions exécutées: les mises a jour candidates sont isolées de la politique active, évaluées sur les observations suivantes, et validées uniquement si les preuves futures les confirment, ce qui rend l'adaptation sélective et réversible. Sur le benchmark SimplerEnv WidowX, VANE améliore le taux de succès moyen de 3,2 points de pourcentage par rapport a la baseline TTT standard. Sur Google Robot en revanche, les gains obtenus au moment du déploiement restent dépendants de la tache et de l'embodiment (le type de robot), signe que la méthode ne généralisé pas uniformément. Pour les intégrateurs et laboratoires qui déploient des politiques VLA en production, ce travail s'attaque a un angle mort connu mais rarement traite proprement: l'adaptation test-time non supervisée peut dégrader silencieusement une politique déjà entraînée, en particulier en manipulation robotique ou une erreur d'action n'est visible qu'après coup. En rendant chaque mise a jour réversible et conditionnée a une preuve visuelle future, VANE propose une alternative aux méthodes TTT qui appliquent les corrections immédiatement et sans garde-fou. Le résultat mitige sur Google Robot est tout aussi instructif que le gain sur WidowX: il confirme que les bénéfices de l'adaptation en ligne ne sont pas garantis d'un robot a l'autre, et que le TTT reste une piste a valider embodiment par embodiment plutôt qu'une solution universelle, un rappel utile face aux discours présentant l'adaptation en temps réel comme un problème déjà résolu pour les VLA. VANE s'inscrit dans la lignée des travaux récents sur le test-time training applique aux politiques VLA de type RT-2, OpenVLA, Pi-0 ou GR00T, qui cherchent a corriger les policies au moment du déploiement sans reentrainement complet. Sa contribution spécifique est de traiter l'adaptation comme un processus a vérifier avant validation plutôt que comme une mise a jour immédiate, une approche qui rejoint les efforts plus larges du secteur pour fiabiliser le passage de la simulation au déploiement réel. Les auteurs testent leur méthode sur deux bancs d'essai standards, SimplerEnv WidowX et Google Robot, mais les résultats contrastes sur ce second environnement suggèrent qu'une validation plus large, sur d'autres plateformes et taches de manipulation, sera nécessaire avant d'envisager une adoption industrielle.

IA physiqueActu
1 source