
RegenHarness : un harnais d'agent robotique à auto-amélioration récursive validée par preuves
Un preprint arXiv (2609.27612v1, non relu par des pairs) présente RegenHarness, une couche d'orchestration pour agents robotiques qui distingue proposition du modèle, fin d'exécution du contrôleur et vérification réelle de la tache. Son architecture combine une boucle modèle générant des propositions conditionnées au contexte et une boucle agent organisée en quatre contextes isoles par rôle (planification, supervision, vérification, récupération), avec une mémoire versionnée et une porte de validation liée a l'identité et a la version de la tache, vérifiant l'objectif utilisateur avant toute déclaration de succès. Les auteurs documentent un déploiement réel sur un robot quadrupède en entrepôt: navigation déclenchée a la voix, inspection panoramique, analyse visuelle, livraison de message, retour et compte-rendu vocal, traces par audio, images, trajectoires et reçus. Un second circuit distinct montre que l'achèvement d'une tache dépend de l'historique d'exécution et non de la seule proximité au point final.
Les auteurs revendiquent le premier protocole d'auto-amélioration récursive "évidence-gated" pour des agents robotiques incarnes, une affirmation non encore validée par des pairs. A partir des journaux d'exécution, le système peut proposer des modifications de ses propres règles de contexte, gabarits de tache, routage ou politiques de récupération, mais leur adoption reste soumise a des tests de régression fixes et une autorisation explicite, avec déploiement et retour arrière versionnes; il ne touche jamais aux poids du modèle ni a la porte de validation elle-même. Pour les intégrateurs, l'intérêt tient moins a un nouveau modèle qu'a cette couche de gouvernance qui sépare ce qu'un modèle propose de ce qui est vérifie comme réellement accompli.
RegenHarness s'inscrit dans une recherche plus large visant a combler l'écart entre les modèles généralistes vision-langage-action et une exécution fiable sur le terrain, en ajoutant une couche de vérification autour des politiques existantes plutôt qu'en modifiant les modèles eux-mêmes. L'abstract ne nomme ni laboratoire, ni entreprise, ni plateforme quadrupède précise, empêchant toute comparaison avec les piles commerciales du secteur. Aucun volume de déploiement, calendrier de pilote ni prix n'est communique: il s'agit a ce stade d'une preuve de concept sur un site d'entrepôt et un circuit de test complémentaire, sans extension annoncée a d'autres plateformes.
Dans nos dossiers




