DSDyn-VLA : un cadre à double flux pour la manipulation dynamique, avec perception du mouvement, anticipation et correction en temps réel
Des chercheurs proposent DSDyn-VLA, un cadre « lent-rapide » à double flux destiné à la manipulation d'objets en mouvement, comme sur un convoyeur, un cas où les modèles vision-langage-action (VLA) actuels décrochent. L'article, publié sur arXiv (2609.39198), identifie trois écarts. L'écart de perception : une image statique ne porte aucune information de mouvement. L'écart de latence : le temps d'inférence rend l'action obsolète quand elle est exécutée. L'écart de contrôle : les « action chunks » sont joués en boucle ouverte, sans ajustement en temps réel. Le « Flow-Planner », lent, joue le rôle de planificateur macro. Il ajoute au VLA du flux optique pour la perception temporelle, ainsi qu'un mécanisme de « conscience de l'état futur » qui anticipe la latence d'inférence. Le « Res-Refiner », rapide, est une politique d'apprentissage par renforcement légère qui injecte des corrections résiduelles haute fréquence, en boucle fermée, dans les chunks planifiés. Les auteurs publient aussi DynBench, un banc d'essai sous MuJoCo de neuf tâches de manipulation dynamique. Ils annoncent une baisse de plus de 76 % du taux d'échec face à l'état de l'art en configuration à forte latence sur le benchmark Kinetix. Ils annoncent aussi un taux de succès environ 6 fois supérieur à celui de PI0.5 en conditions réelles dynamiques, et environ 5 fois supérieur sur DynBench. Code et poids doivent être publiés en open source.
Ces résultats visent une faiblesse que les intégrateurs connaissent bien : les VLA brillent en démonstration sur des scènes statiques, mais la logistique et la production réelles impliquent des pièces qui bougent, comme les convoyeurs, le tri à la volée ou le transfert vers un opérateur. Si ces gains tiennent, l'architecture suggère qu'un VLA généraliste ne suffit pas et qu'une couche de correction rapide, séparée du modèle de fondation, est nécessaire. Cela rejoint le découpage système 1 / système 2 déjà visible dans plusieurs architectures commerciales. Des réserves s'imposent toutefois. Les multiples (6x, 5x) sont relatifs à une base de comparaison PI0.5 qui n'était pas conçue pour ce régime, et un ratio élevé peut refléter un taux de succès de départ très bas. Le protocole réel (nombre d'essais, vitesse des objets, matériel) n'est pas précisé dans le résumé, et il s'agit d'une prépublication non évaluée par des pairs.
Le travail s'inscrit dans la course à la réduction de la latence des VLA, notamment le « real-time chunking » et les approches d'exécution asynchrone, qui traitent surtout la continuité des actions plutôt que le suivi d'objets mobiles. Les concurrents directs sont les familles Pi de Physical Intelligence, dont PI0.5 sert de référence, et les modèles à double système comme Helix de Figure ou GR00T de NVIDIA. Aucun acteur européen n'est cité dans le résumé. La suite dépendra de la publication effective du code et des poids, de la reproduction des résultats par des tiers, et d'un passage de DynBench, entièrement simulé, à des cadences industrielles réelles.
Dans nos dossiers




