Aller au contenu principal
RecherchearXiv cs.RO 

DynaHarness : un cadre physique dynamique pour des agents robotiques auto-évolutifs

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

DynaHarness, un travail publié sur arXiv (2609.40306), propose une couche de supervision dite « harnais physique dynamique » qui encadre l'exécution de politiques robotiques pré-entraînées sur des tâches de manipulation longues. L'architecture sépare un « cerveau lent », chargé du raisonnement sémantique (il propose des capacités et leurs arguments symboliques), et un « cerveau rapide », qui ancre les commandes dans le monde physique, les surveille, refuse les actions non résolues, substitue une capacité à une autre et demande un nouveau plan si nécessaire. Un contrat d'exécution partagé borne chaque commande acceptée et consigne les traces d'exécution à travers trois familles de composants : des compétences analytiques, des compétences de récupération et un VLA (modèle vision-langage-action) gelé. Sur le benchmark LIBERO-Pro, le système atteint 75,2 % de réussite sur 800 états initiaux nouvellement tirés, contre 17,5 % pour la politique gelée seule. À bibliothèque de capacités identique, l'exécution dynamique complète obtient 74,0 %, contre 63,9 % pour un replanning nominal en une étape.

Pour les intégrateurs et les équipes R&D, l'intérêt est moins le score que le déplacement du problème. Les auteurs soutiennent qu'une politique VLA, même performante, ne suffit pas sur les tâches longues : la valeur se joue dans la manière dont les capacités existantes sont ancrées, surveillées et coordonnées à l'exécution, sans réentraîner le modèle de base. L'écart entre 17,5 % et 75,2 % illustre la fragilité d'un VLA gelé face à des conditions initiales perturbées, ce qui rejoint le constat de nombreux déploiements : la robustesse vient de l'orchestration autour du modèle. Le gain plus modeste de 10 points face au replanning simple indique toutefois que l'essentiel de l'amélioration provient de la bibliothèque de capacités elle-même, et que la gouvernance dynamique apporte un complément mesurable mais pas décisif. Il faut aussi noter que les résultats sont obtenus uniquement en simulation, sans validation sur robot physique mentionnée dans le résumé.

Ce travail s'inscrit dans la tendance des architectures à double système, où un module lent planifie et un module rapide exécute, popularisée côté industrie par des approches comme Helix de Figure ou GR00T de NVIDIA, et dans la montée des agents capables de se réviser eux-mêmes. La particularité de DynaHarness est sa boucle d'auto-évolution : l'attribution des échecs localise la faute dans les traces, déclenche une révision ciblée d'une capacité ou d'un mécanisme d'exécution, puis des tests de régression appariés décident de l'admission ou du rejet de la modification. LIBERO-Pro, variante plus exigeante du benchmark LIBERO conçue pour mettre à nu la sur-adaptation des politiques, reste un banc d'essai simulé. Une page projet est disponible, mais aucune date de transfert vers du matériel réel n'est annoncée.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

RoboHarn-Evo : évolution de connaissances physiques hiérarchiques pour une manipulation robotique qui s'auto-améliore
1arXiv cs.RO 

RoboHarn-Evo : évolution de connaissances physiques hiérarchiques pour une manipulation robotique qui s'auto-améliore

Des chercheurs publient sur arXiv RoboHarn-Evo, un « harnais » à double boucle qui fait évoluer une base de connaissances physiques hiérarchiques (HPK, Hierarchical Physical Knowledge) à partir de l'expérience d'interaction, sans jamais mettre à jour les poids du modèle de base. La HPK comporte deux niveaux. La connaissance de tâche indique quelle sous-tâche exécuter et quand elle est achevée. La connaissance d'action décrit des stratégies géométriques relatives à l'objet et leurs effets physiques. À l'exécution, l'agent récupère l'entrée pertinente au niveau de décision concerné, puis l'adapte à la scène courante et à l'objectif. D'un épisode à l'autre, le retour physique sert à réviser les entrées anciennes, à ajuster leur domaine d'applicabilité et à réorganiser la base pour les récupérations suivantes. Sur le benchmark RMBench, le gain moyen de succès atteint 24,2 points selon les modèles d'agent. Avec 80 déroulés d'interaction, le succès sur tâches hors entraînement passe de 48,3 % à 75,0 % pour GPT-5.5 et de 70,0 % à 88,3 % pour GPT-6. Le système corrige plus de 83 % des erreurs de connaissance historiques tout en conservant 95,8 % des connaissances valides. En transfert zéro-shot de RMBench vers RoboDojo, il gagne 35,0 et 25,0 points selon les configurations. L'intérêt tient à la place de l'amélioration. Les modèles vision-langage pilotent bien la planification longue durée, mais la réussite dépend de l'effet réel des interactions locales : saisie, insertion, alignement. Ici, le progrès vient d'une mémoire externe, lisible et révisable, et non d'un réentraînement ou d'un fine-tuning. Pour un intégrateur, cela suggère une piste d'adaptation sur site moins coûteuse, avec des connaissances auditables, corrigeables et potentiellement transférables d'une cellule à l'autre. Le taux de conservation de 95,8 % répond au risque classique des mémoires d'agents, qui accumulent des règles erronées ou obsolètes. Deux réserves s'imposent toutefois. Les résultats portent sur des benchmarks, très probablement simulés, avec des échantillons de test réduits : les pas de 1,7 point suggèrent une soixantaine de tâches ou d'épisodes hors entraînement, donc des marges d'incertitude notables. Rien n'est dit non plus des temps de cycle, du coût d'inférence ni de la robustesse sur du matériel réel. Le transfert zéro-shot reste par ailleurs un test entre deux environnements de simulation, pas une preuve de généralisation au monde physique. Ce travail s'inscrit dans la tendance des agents « auto-améliorants » par mémoire et bibliothèques de compétences, transposée à la manipulation. Il se place face aux approches qui passent par l'apprentissage des poids, comme les modèles VLA (vision-langage-action) de type Pi-0, GR00T ou Helix, qui exigent des données de téléopération et du calcul d'entraînement. Il s'appuie sur des modèles de fondation généralistes pour la planification et laisse l'expérience physique enrichir la connaissance externe. La suite logique serait une validation sur robots réels, avec bruit de perception et contacts non modélisés, puis une comparaison directe avec des VLA affinés à budget d'interaction équivalent. Aucun pilote industriel ni calendrier n'est annoncé à ce stade.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
RACaP : raisonnement, action et codage à base d'agents pour un apprentissage robotique évolutif
2arXiv cs.RO 

RACaP : raisonnement, action et codage à base d'agents pour un apprentissage robotique évolutif

Des chercheurs ont publié sur arXiv, le 25 septembre 2026 (référence 2609.29394), un article décrivant RACaP (Reasoning, Acting, and Coding as Policies), un framework agentique pour l'apprentissage robotique évolutif. Contrairement aux méthodes Code as Policies (CaP) classiques, qui génèrent et réparent du code au moment de l'exécution au prix d'une latence et d'un mélange entre mécanismes réutilisables et décisions spécifiques à la tâche, RACaP déplace la génération de code vers une phase d'évolution en amont et s'appuie, au déploiement, sur une boucle ReAct qui appelle des API de politiques figées et typées, combinant curriculum d'apprentissage et auto-évolution autonome. Sur les bancs d'essai en simulation LIBERO, RACaP atteint 54,4% de réussite sur LIBERO-90, 45,0% en zero-shot sur LIBERO-PRO et 46,0% sur LIBERO-Long, contre au maximum 4,0% pour les baselines CaP sur les tâches à long horizon, soit 2,5 fois leur taux de réussite sur LIBERO-PRO et un temps de décision médian 1,9 fois plus rapide. Un fine-tuning par échantillonnage par rejet distille ensuite les décisions ReAct de GPT-5.6 dans un modèle compact Qwen3-VL-8B-Instruct, accélérant l'inférence par décision d'un facteur 13,2 et réduisant les appels physiques répétés de 16 à 4. Ce travail cible un problème concret pour les intégrateurs: la latence et la fragilité des approches où un modèle de langage génère et corrige du code de contrôle en direct, ce qui complique la maintenance et le passage à l'échelle sur des tâches longues. En séparant le code réutilisable, figé après évolution, des décisions prises en temps réel via mémoire de travail, mémoire d'expérience et retour visuel, RACaP illustre une piste pour rendre les agents VLA (vision-language-action) plus robustes et plus rapides sans sacrifier l'adaptabilité. La distillation vers un modèle compact comme Qwen3-VL-8B-Instruct répond directement à une contrainte industrielle: les grands modèles comme GPT-5.6 restent trop lents et coûteux pour tourner en boucle fermée sur un robot physique. Ces résultats demeurent toutefois obtenus en simulation sur les bancs académiques LIBERO, et non lors d'un déploiement réel en usine ou en entrepôt, laissant ouvert l'écart classique entre performance simulée et performance en conditions réelles. RACaP s'inscrit dans la lignée des méthodes Code as Policies, qui font piloter des robots par des grands modèles de langage générant directement du code exécutable, une approche dont les limites sur les tâches longues et complexes sont confirmées ici par les scores plafonnés à 4,0% des baselines CaP citées dans l'article. En comparant son architecture à ces méthodes de référence sur les mêmes bancs LIBERO-90, LIBERO-PRO et LIBERO-Long, l'équipe cherche à démontrer qu'une architecture combinant code figé et raisonnement au moment de l'action offre une meilleure transférabilité zero-shot, un critère que surveillent les décideurs avant tout investissement en robotique VLA. L'article, disponible en prépublication sous la référence 2609.29394v1, ne mentionne ni calendrier de déploiement sur robot physique ni partenariat industriel; les prochaines étapes attendues pour ce type de travaux académiques restent une validation sur plateforme réelle et une revue par les pairs.

RechercheActu
1 source
3arXiv cs.RO 

ASENA : des agents auto-évolutifs pour la navigation de l'IA incarnée

Des chercheurs publient ASENA, un système d'agent incarné qui relie des agents de codage généralistes aux capteurs, au calcul, à l'exécution supervisée et à une mémoire persistante d'un robot. L'agent écrit et exécute des programmes, relit les résultats enregistrés, corrige ses échecs et réutilise des notes et des compétences exécutables, le tout sans modifier les poids du modèle. Le système s'accompagne d'ASENA-VLN, une politique de navigation monoculaire de 4 milliards de paramètres, proposée comme outil optionnel. Elle prédit des trajectoires dans le repère du corps, pour des itinéraires longs comme pour des comportements à court horizon, grâce à un décodeur vision-langage unique. Celui-ci est entraîné sur des instructions de parcours, des questions-réponses visuelles et un nouveau jeu de tâches de navigation « atomiques » dérivées de la géométrie. Seule, la politique atteint 68,7 % de succès sur R2R et 70,2 % sur RxR, ce que les auteurs présentent comme l'état de l'art. Couplée à l'agent de codage, elle ajoute 11 points de succès sur les deux benchmarks agentiques tout en réduisant le temps d'exécution. Dix passes sur des sous-ensembles récurrents de 100 tâches, avec retour du simulateur, font passer le succès de 72 % à 98 % sur R2R et de 65 % à 89 % sur RxR. En question-réponse incarnée, ASENA annonce aussi la meilleure précision, avec moins d'étapes d'interaction. Des démonstrations réelles sur un Unitree G1 combinent recherche, inspection visuelle, raisonnement spatial et gestes synthétisés, sans carte préalable. L'intérêt tient moins au score de navigation qu'à l'architecture. Ici, l'amélioration ne passe pas par un réentraînement : elle vient de la mémoire de l'agent (notes, scripts, compétences), ce qui rapproche le robot d'un logiciel qu'on débogue que d'un modèle qu'on affine. Pour un intégrateur, cela ouvre la voie à une adaptation d'un site à l'autre sans cycle de collecte de données ni de fine-tuning. Il faut toutefois lire les gains avec prudence. Le passage de 72 % à 98 % est mesuré sur des sous-ensembles de 100 tâches rejouées dix fois avec retour du simulateur : cela ressemble davantage à une mémorisation de tâches récurrentes qu'à une généralisation à des environnements inédits. Les résultats chiffrés restent obtenus en simulation, et les démonstrations sur G1 sont qualitatives, sans taux de réussite, durée ni nombre d'essais publiés. L'écart entre démonstration et fiabilité en conditions réelles reste donc entier. Ce travail s'inscrit dans deux tendances qui convergent : les politiques vision-langage-action pour la navigation, évaluées sur R2R et RxR, et les agents de codage appliqués à la robotique, où le LLM génère du code plutôt que des commandes bas niveau. En faisant de la politique apprise un simple outil parmi d'autres, ASENA se positionne à l'opposé des approches de bout en bout comme Pi-0 ou GR00T, qui concentrent tout dans un seul modèle. Le G1 de Unitree, plateforme humanoïde à bas coût largement répandue en recherche, sert de support. Il s'agit d'une prépublication arXiv (v1), non évaluée par les pairs. Le code, les jeux de données et d'éventuels tests hors simulation seront les vrais juges de la portée du système.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
SwarmCoDe : cadre de co-conception évolutif pour essaims de robots hétérogènes par spéciation dynamique
4arXiv cs.RO 

SwarmCoDe : cadre de co-conception évolutif pour essaims de robots hétérogènes par spéciation dynamique

SwarmCoDe est un algorithme de co-évolution collaborative (CCEA) présenté dans un preprint arXiv (2603.26240v2) qui vise à automatiser la co-conception d'essaims de robots hétérogènes à grande échelle. La méthode centrale, dite "spéciation dynamique", fait émerger automatiquement des espèces de robots distinctes en fonction de la complexité de la tâche, sans les définir a priori. L'algorithme optimise simultanément la planification de tâches et la morphologie physique des robots, sous contrainte de budget de fabrication. Il intègre un "gène de dominance" qui dicte la composition de l'essaim, et des "tags génétiques" inspirés de mécanismes biologiques de coopération inter-espèces, permettant aux agents d'identifier des partenaires bénéfiques sans frontières prédéfinies. Les expériences rapportées, toutes simulées, montrent des essaims pouvant atteindre 200 agents, soit quatre fois la taille de la population évolutionnaire utilisée pour les générer. Le problème que SwarmCoDe cherche à résoudre est structurel : dans les approches classiques, la co-conception d'un essaim devient rapidement intractable à mesure que le nombre d'agents augmente, l'espace de design croissant exponentiellement. Le gène de dominance découple la taille physique de l'essaim de la population évolutionnaire, ce qui constitue la contribution technique principale : elle rend le calcul viable pour de grands systèmes sans explosion des ressources computationnelles. Pour les intégrateurs industriels et les équipes R&D déployant des flottes de robots, cela ouvre la perspective d'une optimisation automatique de la diversité matérielle, plutôt qu'une définition manuelle du mix robotique. Les améliorations marginales sur chaque unité se composent à l'échelle, ce qui explique pourquoi le co-design est stratégique dès qu'on parle de dizaines ou centaines d'agents en déploiement réel. La co-conception robotique est un domaine actif depuis une décennie, mais généralement appliquée à des robots unitaires ou de petits groupes homogènes. SwarmCoDe s'inscrit dans la continuité des travaux sur l'évolution morphologique (NEAT, neuroévolution) et des recherches sur les essaims hétérogènes, notamment des groupes comme celui de Josh Bongard à l'Université du Vermont. Les approches concurrentes incluent l'optimisation multi-objectif classique et les frameworks de co-design par gradient. Point critique à noter : l'article ne présente aucune validation sur robots physiques, toutes les métriques étant issues de simulation. Le fossé sim-to-real reste un verrou non adressé dans ce travail, et constituera l'épreuve décisive pour une adoption en contexte industriel.

RecherchePaper
1 source