DynaHarness : un cadre physique dynamique pour des agents robotiques auto-évolutifs
DynaHarness, un travail publié sur arXiv (2609.40306), propose une couche de supervision dite « harnais physique dynamique » qui encadre l'exécution de politiques robotiques pré-entraînées sur des tâches de manipulation longues. L'architecture sépare un « cerveau lent », chargé du raisonnement sémantique (il propose des capacités et leurs arguments symboliques), et un « cerveau rapide », qui ancre les commandes dans le monde physique, les surveille, refuse les actions non résolues, substitue une capacité à une autre et demande un nouveau plan si nécessaire. Un contrat d'exécution partagé borne chaque commande acceptée et consigne les traces d'exécution à travers trois familles de composants : des compétences analytiques, des compétences de récupération et un VLA (modèle vision-langage-action) gelé. Sur le benchmark LIBERO-Pro, le système atteint 75,2 % de réussite sur 800 états initiaux nouvellement tirés, contre 17,5 % pour la politique gelée seule. À bibliothèque de capacités identique, l'exécution dynamique complète obtient 74,0 %, contre 63,9 % pour un replanning nominal en une étape.
Pour les intégrateurs et les équipes R&D, l'intérêt est moins le score que le déplacement du problème. Les auteurs soutiennent qu'une politique VLA, même performante, ne suffit pas sur les tâches longues : la valeur se joue dans la manière dont les capacités existantes sont ancrées, surveillées et coordonnées à l'exécution, sans réentraîner le modèle de base. L'écart entre 17,5 % et 75,2 % illustre la fragilité d'un VLA gelé face à des conditions initiales perturbées, ce qui rejoint le constat de nombreux déploiements : la robustesse vient de l'orchestration autour du modèle. Le gain plus modeste de 10 points face au replanning simple indique toutefois que l'essentiel de l'amélioration provient de la bibliothèque de capacités elle-même, et que la gouvernance dynamique apporte un complément mesurable mais pas décisif. Il faut aussi noter que les résultats sont obtenus uniquement en simulation, sans validation sur robot physique mentionnée dans le résumé.
Ce travail s'inscrit dans la tendance des architectures à double système, où un module lent planifie et un module rapide exécute, popularisée côté industrie par des approches comme Helix de Figure ou GR00T de NVIDIA, et dans la montée des agents capables de se réviser eux-mêmes. La particularité de DynaHarness est sa boucle d'auto-évolution : l'attribution des échecs localise la faute dans les traces, déclenche une révision ciblée d'une capacité ou d'un mécanisme d'exécution, puis des tests de régression appariés décident de l'admission ou du rejet de la modification. LIBERO-Pro, variante plus exigeante du benchmark LIBERO conçue pour mettre à nu la sur-adaptation des politiques, reste un banc d'essai simulé. Une page projet est disponible, mais aucune date de transfert vers du matériel réel n'est annoncée.
Pas d\'impact direct sur la France/UE
Dans nos dossiers



