Aller au contenu principal
RegenHarness : un harnais d'agent robotique à auto-amélioration récursive validée par preuves
RecherchearXiv cs.RO 

RegenHarness : un harnais d'agent robotique à auto-amélioration récursive validée par preuves

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un preprint arXiv (2609.27612v1, non relu par des pairs) présente RegenHarness, une couche d'orchestration pour agents robotiques qui distingue proposition du modèle, fin d'exécution du contrôleur et vérification réelle de la tache. Son architecture combine une boucle modèle générant des propositions conditionnées au contexte et une boucle agent organisée en quatre contextes isoles par rôle (planification, supervision, vérification, récupération), avec une mémoire versionnée et une porte de validation liée a l'identité et a la version de la tache, vérifiant l'objectif utilisateur avant toute déclaration de succès. Les auteurs documentent un déploiement réel sur un robot quadrupède en entrepôt: navigation déclenchée a la voix, inspection panoramique, analyse visuelle, livraison de message, retour et compte-rendu vocal, traces par audio, images, trajectoires et reçus. Un second circuit distinct montre que l'achèvement d'une tache dépend de l'historique d'exécution et non de la seule proximité au point final.

Les auteurs revendiquent le premier protocole d'auto-amélioration récursive "évidence-gated" pour des agents robotiques incarnes, une affirmation non encore validée par des pairs. A partir des journaux d'exécution, le système peut proposer des modifications de ses propres règles de contexte, gabarits de tache, routage ou politiques de récupération, mais leur adoption reste soumise a des tests de régression fixes et une autorisation explicite, avec déploiement et retour arrière versionnes; il ne touche jamais aux poids du modèle ni a la porte de validation elle-même. Pour les intégrateurs, l'intérêt tient moins a un nouveau modèle qu'a cette couche de gouvernance qui sépare ce qu'un modèle propose de ce qui est vérifie comme réellement accompli.

RegenHarness s'inscrit dans une recherche plus large visant a combler l'écart entre les modèles généralistes vision-langage-action et une exécution fiable sur le terrain, en ajoutant une couche de vérification autour des politiques existantes plutôt qu'en modifiant les modèles eux-mêmes. L'abstract ne nomme ni laboratoire, ni entreprise, ni plateforme quadrupède précise, empêchant toute comparaison avec les piles commerciales du secteur. Aucun volume de déploiement, calendrier de pilote ni prix n'est communique: il s'agit a ce stade d'une preuve de concept sur un site d'entrepôt et un circuit de test complémentaire, sans extension annoncée a d'autres plateformes.

À lire aussi

Au-delà de l'imitation : politiques robotiques auto-améliorées par Q-planning hors politique
1arXiv cs.RO 

Au-delà de l'imitation : politiques robotiques auto-améliorées par Q-planning hors politique

Un article publié le 24 août 2026 sur arXiv (2608.21204) présente Q-Planning, une méthode qui permet à une politique robotique de manipulation entraînée par imitation (behaviour cloning, BC) de progresser seule après un échec, sans nouvelle démonstration humaine. Le système couple une grande politique visuomotrice BC à une petite fonction Q entraînée hors politique, capable d'apprendre aussi bien des réussites que des essais ratés collectés en déploiement. Sur les bancs d'essai simulés LIBERO et RoboTwin, dix itérations d'auto-amélioration font passer les scores de 93% à 99% sur LIBERO-10 et de 83,8% à 91,4% sur RoboTwin. Sur deux tâches réelles bimanuelles à fort contact, empiler des tasses et insérer un portefeuille, le taux de réussite grimpe de 40% à 90% et de 25% à 80% en cinq itérations, sans aucune intervention humaine. Ce résultat s'attaque à une limite structurelle du behaviour cloning, colonne vertébrale de la plupart des politiques robotiques actuelles: un modèle qui échoue ne peut normalement rien en tirer sans démonstrations supplémentaires, ce qui freine l'amélioration continue à l'échelle industrielle. Le fine-tuning par renforcement promettait cette autonomie mais peinait à passer à l'échelle des modèles à plusieurs milliards de paramètres qui équipent les politiques génératives actuelles. En cantonnant l'apprentissage à une petite fonction Q plutôt qu'à l'acteur complet, Q-Planning propose une mise à jour continue nettement moins coûteuse en calcul. Les auteurs comparent leur méthode à cinq alternatives (Best-of-N, filtered SFT, IBRL, DSRL, DAWR) sous budget identique et affirment qu'elle est la seule à s'améliorer de façon stable à partir des échecs, sans entraîner d'acteur auxiliaire distinct. Ces travaux s'inscrivent dans la recherche actuelle sur l'apprentissage continu des politiques robotiques généralistes, un terrain où plusieurs laboratoires cherchent à combler l'écart entre démonstrations en simulation et robustesse en déploiement réel. Les gains rapportés reposent pour l'instant sur des bancs d'essai contrôlés et deux tâches manipulées en laboratoire; aucun déploiement industriel, partenariat ou intégration produit n'est mentionné, l'article restant au stade de publication de recherche. La suite logique consisterait à valider la méthode sur davantage de tâches et de plateformes bimanuelles ou humanoïdes avant toute exploitation commerciale.

RecherchePaper
1 source
Agents de codage avec harnais conscient des obstacles pour une manipulation robotique sûre
2arXiv cs.RO 

Agents de codage avec harnais conscient des obstacles pour une manipulation robotique sûre

Une étude publiée sur arXiv (2609.20822, 18 septembre 2026) évalue la sécurité des "coding agents", ces systèmes où un modèle de langage écrit directement le code du contrôleur robotique, sans entraînement spécifique au robot. Testés sur des tâches associant un objectif de manipulation à un obstacle interdit de contact, ces agents le heurtent dans la majorité des cas, alors même que leurs traces de raisonnement mentionnent l'obstacle et que le prompt en interdit explicitement le contact: ni la perception ni la consigne ne sont en cause, c'est la planification qui échoue à prioriser la contrainte de sécurité. En décomposant la manipulation en une phase de trajet et un moment de contact, les auteurs identifient deux manques: aucune notion de route dégagée ni de replanification pendant le trajet, aucune prise en compte de la contrainte pendant le geste de contact lui-même. Leur solution, SafeHarness, ajoute une planification de trajet par boîtes englobantes et séquences de points de passage vérifiées avant exécution, plus un choix de position de contact évitant l'obstacle. Résultat: 71,9% de réussite de tâche et 87,5% d'évitement de collision, soit respectivement 6,5 et 27,0 points de plus que le précédent état de l'art, et 2,3 et 1,5 fois les scores du même agent sans ces harnais. Ce résultat nuance l'idée qu'un modèle capable de verbaliser une contrainte de sécurité et de recevoir une consigne explicite s'y conforme automatiquement lors de l'exécution, une hypothèse implicite chez les promoteurs des coding agents comme voie rapide vers des robots généralistes sans données spécifiques. Pour les intégrateurs et décideurs qui envisagent de déployer des agents pilotés par LLM en environnement partagé avec des humains, l'étude montre qu'un bon prompt ne suffit pas: il faut séparer explicitement planification de trajectoire et exécution du contact dans l'architecture. Elle rappelle aussi qu'un taux de réussite de tâche élevé peut masquer un comportement dangereux tant que le taux de collision n'est pas mesuré séparément. Ces travaux s'inscrivent dans la lignée des approches "code as policy", où un LLM génère un programme de contrôle plutôt que d'être entraîné de bout en bout sur des données robotiques, une piste prisée car elle évite la collecte de données propre à chaque robot. SafeHarness se positionne face à un état de l'art antérieur non nommé dans le résumé, qu'il dépasse nettement sur les deux métriques de sécurité et de performance. Publiée le 18 septembre 2026, l'étude reste un travail de recherche évalué sur des tâches de benchmark, sans plateforme robotique commerciale ni déploiement pilote mentionnés, ni calendrier annoncé pour une éventuelle mise en œuvre au-delà du laboratoire.

RecherchePaper
1 source
Apprentissage d'une exécution robuste en manipulation robotique par apprentissage par renforcement à base d'agents
3arXiv cs.RO 

Apprentissage d'une exécution robuste en manipulation robotique par apprentissage par renforcement à base d'agents

Traduction en cours. Ce papier de recherche s'attaque à un problème central de la manipulation robotique : la fragilité d'exécution face à l'incertitude et aux tâches longues, où une petite déviation peut faire échouer toute une séquence d'actions. Les modèles vision-langage-action (VLA) actuels, malgré leurs bonnes capacités de généralisation, manquent de mécanismes explicites pour détecter qu'une exécution dérape et pour s'en remettre. Les auteurs proposent deux contributions complémentaires : des métriques permettant d'évaluer en temps réel la qualité de l'exécution, et un cadre d'apprentissage par renforcement dit "agentique", où une politique de haut niveau observe l'historique récent d'exécution et choisit parmi un petit ensemble de modes d'exécution pour réguler le comportement du robot. Plutôt que de réapprendre directement les actions bas niveau, cette politique déclenche des mécanismes de récupération qui ramènent le robot vers des états nominaux déjà visités, permettant à la tâche de reprendre son cours. Testée sur le benchmark LIBERO, la méthode améliore le taux de réussite jusqu'à 13,7% en conditions standards, et jusqu'à 39,2% en conditions perturbées. L'enjeu dépasse la simple performance chiffrée : c'est une réponse directe à l'écart entre démonstration et réalité qui pénalise l'industrie humanoïde et les intégrateurs. Un modèle VLA capable d'enchaîner des tâches en laboratoire s'effondre souvent dès qu'un objet glisse, qu'un capteur bruite, ou qu'une perturbation externe survient sur une ligne réelle. En ajoutant une couche de supervision qui détecte la dérive et enclenche une correction plutôt que de laisser le modèle bas niveau tenter d'improviser, cette approche s'attaque directement à la robustesse, le principal frein à la mise en production de bras manipulateurs et d'humanoïdes en environnement industriel non contrôlé. Le gain nettement plus marqué en conditions perturbées (39,2%) qu'en conditions standards (13,7%) suggère que le bénéfice réel se manifeste précisément là où les décideurs B2B en ont besoin: en présence d'aléas, pas en démo scriptée. Ce travail s'inscrit dans la lignée des recherches récentes sur les modèles VLA généralistes (dans la veine de Pi-0 ou GR00T N2), qui ont démontré une capacité de généralisation impressionnante mais restent critiqués pour leur manque de garanties d'exécution en conditions réelles. En séparant la décision de haut niveau (quel mode d'exécution adopter) de l'apprentissage bas niveau des actions, les auteurs évitent de devoir réentraîner l'ensemble du modèle VLA pour gagner en robustesse, une approche modulaire qui pourrait s'intégrer à des piles existantes plutôt que les remplacer. Reste à voir si cette architecture agentique se transpose au-delà du benchmark simulé LIBERO vers des déploiements physiques réels, où la latence de décision et la diversité des modes de défaillance sont bien plus complexes qu'en simulation.

RecherchePaper
1 source
You Don't Restez Pas dans la Boucle : une Boucle Robotique à Base d'Agents pour Améliorer les Politiques Robotiques
4arXiv cs.RO 

You Don't Restez Pas dans la Boucle : une Boucle Robotique à Base d'Agents pour Améliorer les Politiques Robotiques

Un article de recherche publié sur arXiv (arXiv:2608.07555v1, intitulé "You Don't Need To Stay in The Loop: An Agentic Robotics Loop for Robot-Policy Improvement") présente AgenticRobotics, une architecture de contrôle indépendante du backend pour automatiser l'amélioration des politiques robotiques. Le système transpose à la robotique l'architecture des agents de codage type Claude Code ou Codex, où un agent principal pilote la boucle pendant que des sous-agents exécutent les tâches via des outils. Ici, un contrôleur LLM dirige des workers jetables à travers des transactions entraîner-évaluer-améliorer, avec cinq briques: un objectif immuable, une mesure détenue par le contrôleur, une récupération après crash indexée par commit, une bibliothèque de compétences graduée par preuves, et un registre d'outils à surface d'appel standardisée et enregistrée. Sur la lignée testée par les auteurs, le taux de fausse promotion tombe à 0,001 par run en version durcie contre 0,005 à 0,021 en version de base, les décisions restent valides à tout moment sous arrêt optionnel, aucun effet n'est perdu ou dupliqué sous injection de pannes, et un vérificateur signé détecte les six classes de falsification d'artefacts testées. Le point de départ est que les outils robotiques (politiques entraînées, pipelines d'entraînement, collecte de données) échouent régulièrement, contrairement aux outils logiciels des agents de codage: AgenticRobotics mesure donc et enregistre la qualité de chaque outil à chaque appel, et l'expire dès que l'artefact sous-jacent change. Les auteurs précisent que le titre est une revendication opérationnelle et non une revendication de performance: l'opérateur humain peut quitter la boucle parce que la promotion des candidats est conditionnée à des preuves et que l'état du système est récupérable, pas parce que la boucle sélectionne de meilleurs checkpoints qu'un humain. Sur la lignée testée, ce n'est d'ailleurs pas le cas. Pour les intégrateurs et responsables R&D en robotique, l'intérêt n'est donc pas un gain de performance des politiques mais une réduction mesurable du risque opérationnel lors de cycles d'amélioration continue à grande échelle, une distinction utile face aux discours qui assimilent automatisation de la supervision et automatisation de la décision de qualité. Le travail prolonge explicitement les architectures d'agents de codage popularisées par Claude Code (Anthropic) et Codex (OpenAI), adaptées ici au contexte des politiques robotiques apprenantes, où les pipelines d'entraînement produisent des artefacts instables et coûteux à valider. En présentant AgenticRobotics comme un plan de contrôle indépendant du backend, les auteurs visent une architecture générique plutôt que liée à un fournisseur ou une pile logicielle unique. L'article ne mentionne ni déploiement industriel ni partenariat commercial: il s'agit d'une contribution de recherche évaluée sur une seule lignée expérimentale de politique, ce qui limite pour l'instant la portée des résultats. Les suites logiques, non détaillées dans cette publication, porteraient sur l'extension à davantage de lignées de politiques et de backends robotiques afin de confirmer la généralité des garanties de sécurité et de traçabilité mises en avant.

RecherchePaper
1 source