DriftingVLA : génération vision-langage-action native en une étape par dérive temporelle par dimension
Des chercheurs présentent DriftingVLA, un modèle vision-langage-action (VLA) capable de générer un chunk d'action complet en une seule passe avant du réseau expert, sans les itérations multiples typiques des modèles à flux continus. Plutôt que d'apprendre un champ de flux nécessitant une intégration pas à pas à l'inférence, le système utilise un objectif de "distribution drifting" pour apprendre directement une correspondance entre bruit et séquence d'actions. Une innovation clé, le Per-Dimension Temporal Drifting (PDTD), traite chaque dimension de contrôle du robot comme une unité de dérive distincte durant l'entraînement, tout en laissant le modèle générer le chunk d'action de façon jointe pour préserver les dépendances entre dimensions. Sur les bancs d'essai, DriftingVLA atteint 98,32% de réussite sur LIBERO, 81,09% sur RoboTwin 2.0 et 77,67% sur six tâches réelles à bras simple et double, tout en offrant une génération 3,36 fois plus rapide que les approches multi-étapes.
Pour les intégrateurs et ingénieurs en robotique, ce travail s'attaque à un goulot d'étranglement bien identifié du contrôle robotique en ligne : les modèles VLA à flux continu, malgré leur expressivité, imposent un raffinement multi-étapes qui alourdit la latence à chaque cycle de décision. En démontrant qu'un modèle "one-step" natif peut égaler voire dépasser des baselines multi-étapes et d'autres approches one-step existantes sur des tâches simulées et réelles, DriftingVLA apporte un élément de preuve empirique que la vitesse d'inférence n'a pas nécessairement à se payer en performance de contrôle. Ce résultat compte pour la course actuelle à l'exécution temps réel des modèles fondation robotiques, où la latence conditionne directement la viabilité industrielle d'un VLA sur une chaîne de production ou un bras manipulateur.
Cette publication s'inscrit dans la lignée des modèles VLA à flux qui ont établi la génération d'action continue mais restent pénalisés par leur coût d'inférence itératif. Les auteurs comparent explicitement DriftingVLA à des baselines de flux multi-étapes ainsi qu'à d'autres modèles one-step existants, qu'il surpasse sur l'ensemble des bancs d'essai testés. Il s'agit à ce stade d'un travail de recherche évalué en simulation (LIBERO, RoboTwin 2.0) et sur un nombre restreint de tâches réelles, sans indication d'intégration commerciale ou de déploiement industriel annoncé ; la suite logique consisterait en une validation sur un éventail plus large de plateformes robotiques et de tâches de manipulation avant toute adoption par des intégrateurs.
Dans nos dossiers




