Aller au contenu principal
Agentic Harnesses : des couches de vérification pilotées par LLM pour l'autonomie des robots
RecherchearXiv cs.RO 

Agentic Harnesses : des couches de vérification pilotées par LLM pour l'autonomie des robots

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié sur arXiv (identifiant 2608.09857) propose une couche de vérification pilotée par des grands modèles de langage (LLM), insérée entre la planification et l'exécution des actions d'un robot autonome. Ce middleware, dénommé « agentic harness », intercepte les plans avant qu'ils n'atteignent le serveur MCP (Model Context Protocol) et les commandes bas niveau du robot, en s'appuyant sur un ensemble de LLM juges qui combinent raisonnement en chaîne de pensée et synthèse multi-modèles, selon une logique de mélange d'experts et d'auto-cohérence. Chaque plan est classé en trois catégories : approuvé, rejeté pour reformulation, ou escaladé vers une révision humaine. Les auteurs rapportent une précision proche de 85% sur ces trois catégories, un taux de blocage de 97% des attaques adversariales, et des erreurs quasi nulles entre acceptation et rejet, la plupart des erreurs résiduelles se situant à la frontière de l'escalade.

Cette proposition comble un angle mort de la recherche en robotique autonome, jusqu'ici concentrée sur l'exécution des plans plutôt que sur la vérification de leur faisabilité : comme les LLM généralistes, les modèles de planification robotique peuvent produire des actions biaisées vers l'objectif fixé par l'utilisateur, contraires à l'éthique scientifique, dangereuses faute de mémoire des risques déjà identifiés, ou vulnérables aux attaques adversariales. Pour les intégrateurs qui déploient des piles agentiques combinant modèles vision-langage-action et contrôle robotique, ce travail illustre un besoin croissant de gouvernance intermédiaire entre la décision du modèle et l'actionnement physique. Il apporte une mesure rare dans un domaine où les garanties de sécurité restent souvent qualitatives, même si des erreurs subsistent à la frontière de l'escalade, où l'arbitrage humain reste nécessaire.

Cette recherche s'inscrit dans la montée des architectures agentiques en robotique, où les modèles de fondation vision-langage-action, tels que ceux développés par Physical Intelligence, NVIDIA ou Figure AI pour piloter des robots humanoïdes, sont de plus en plus reliés à des chaînes d'outils via des protocoles comme MCP. L'article, publié en août 2026, ne précise ni plateforme robotique testée ni calendrier de déploiement industriel : il s'agit à ce stade d'une contribution méthodologique de recherche, dont l'adoption par des laboratoires ou des intégrateurs reste à démontrer.

À lire aussi

DiSCo : des copilotes de séquence par diffusion pour l'autonomie partagée
1arXiv cs.RO 

DiSCo : des copilotes de séquence par diffusion pour l'autonomie partagée

Une équipe de recherche présente DiSCo (Diffusion Sequence Copilots), une méthode d'autonomie partagée où un copilote IA fondé sur une politique de diffusion assiste un opérateur humain pour piloter des systèmes complexes comme un bras robotique ou un véhicule simulé. Décrit dans un article déposé sur arXiv (identifiant 2603.22787, version 2, republiée en cross-listing), le système « ensemence » et « inpaint » le processus de diffusion à partir des actions récentes de l'utilisateur, produisant des séquences de commandes cohérentes avec ses gestes passés, réglées par trois hyperparamètres équilibrant conformité aux actions expertes, alignement avec l'intention de l'utilisateur et réactivité perçue. Les auteurs rapportent une amélioration « substantielle » des performances en conduite simulée et en manipulation robotique, sans chiffres précis de gain ou de taux de réussite dans le résumé, et mettent en ligne un site de projet avec démonstrations vidéo. Pour les concepteurs de systèmes de téléopération et d'assistance au geste, ce travail cible un compromis concret : un copilote trop intrusif écrase l'intention de l'utilisateur, tandis qu'un copilote trop passif n'aide pas sur les tâches difficiles ou lorsque le signal de commande est dégradé. En s'appuyant sur une politique de diffusion générant des séquences entières d'actions plutôt que des règles fixes ou une politique de renforcement entraînée séparément, DiSCo s'inscrit dans la bascule du secteur robotique vers des modèles génératifs de trajectoires, dans l'esprit des architectures VLA déployées côté humanoïdes. Le travail reste toutefois cantonné à la simulation, sans essai mentionné sur bras robotique physique ou véhicule réel, ce qui distingue nettement cette publication académique d'une annonce produit ou d'un pilote industriel prêt à déployer. L'autonomie partagée est un champ de recherche ancien en robotique et en interaction homme-machine, longtemps dominé par des règles de correction ou des politiques d'inférence d'intention entraînées séparément du contrôle. L'essor des politiques de diffusion en robotique depuis 2023, comme alternative à l'apprentissage par renforcement, a ouvert la voie à des méthodes génératives produisant des séquences d'actions complètes, cadre que DiSCo adapte au contrôle partagé via des techniques d'inpainting empruntées à la génération d'images. Le statut « replace-cross » de l'article sur arXiv indique une nouvelle version d'un travail déjà soumis, et la suite logique, non précisée dans le résumé, consisterait à valider la méthode avec de véritables opérateurs humains sur du matériel physique, seule façon de confirmer que les gains mesurés en simulation se transposent au monde réel.

RecherchePaper
1 source
VeriGraph : graphes de scène pour la vérification de plans de robots
2arXiv cs.RO 

VeriGraph : graphes de scène pour la vérification de plans de robots

Des chercheurs ont publié VeriGraph (arXiv:2411.10446v3), un système de planification robotique qui combine des modèles vision-langage (VLM) avec un mécanisme de vérification formelle des actions. Le principe central repose sur l'utilisation de graphes de scène comme représentation intermédiaire : à partir d'images en entrée, le système construit un graphe capturant les objets présents et leurs relations spatiales, puis s'en sert pour valider et corriger en boucle les séquences d'actions générées par un planificateur LLM. Les gains rapportés sur des tâches de manipulation sont significatifs : +58 % de taux de complétion sur les tâches guidées par langage, +56 % sur des puzzles tangram, et +30 % sur les tâches guidées par image, par rapport aux méthodes de référence testées. Ce résultat pointe un problème structurel bien documenté dans le domaine : les VLM et LLM génèrent des plans plausibles en surface mais géométriquement ou physiquement incorrects, un objet posé sur une surface inexistante, une saisie dans un ordre impossible. VeriGraph traite ce gap en introduisant une couche de vérification symbolique ancrée dans l'état réel de la scène, ce qui réduit les hallucinations de planification sans nécessiter de fine-tuning du modèle sous-jacent. Pour les intégrateurs industriels et les équipes robotique, cela suggère une voie pragmatique : greffer un vérificateur léger sur des LLM généralistes plutôt que de tout réentraîner, ce qui abaisse potentiellement le coût d'adaptation à de nouveaux environnements. VeriGraph s'inscrit dans un courant de recherche actif autour des architectures hybrides neuro-symboliques pour la robotique, où des travaux comme SayPlan (Rana et al.), LLMTAMP ou les approches PDDL-guided cherchent tous à contraindre la génération de plans par des vérificateurs formels ou géométriques. La nouveauté ici réside dans l'usage du graphe de scène comme interface universelle entre perception et planification. Les auteurs publient le code sur un site dédié, ce qui facilite la reproductibilité, mais les expériences restent en environnement simulé ou de laboratoire contrôlé, aucun déploiement en conditions industrielles réelles n'est mentionné à ce stade.

RechercheOpinion
1 source
Vérification visuelle : pilotage à l'inférence et amélioration autonome des politiques
3arXiv cs.RO 

Vérification visuelle : pilotage à l'inférence et amélioration autonome des politiques

Des chercheurs ont publié le 17 juin 2026 un preprint arXiv (2606.18247) présentant VERITAS, un cadre de type générateur-vérificateur destiné aux politiques robots généralistes. Le principe : une politique robot pré-entraînée joue le rôle de "générateur" et est couplée à un "vérificateur visuel" sans gradient qui évalue les actions produites au moment de l'inférence, c'est-à-dire pendant le déploiement réel. Les résultats rapportés indiquent que ce steering à l'inférence surpasse systématiquement la politique généraliste de base sans nécessiter de données de démonstration supplémentaires. Plus significatif encore, les trajectoires auto-générées et validées par le vérificateur servent ensuite de supervision pour un fine-tuning offline : selon les auteurs, ce post-training atteint une efficacité comparable à celle obtenue avec des démonstrations d'experts humains, et ce sans aucune intervention humaine dans la boucle. L'enjeu industriel est direct : l'un des freins majeurs au déploiement à grande échelle de robots généralistes est le coût d'annotation humaine pour maintenir ou améliorer les performances après mise en service. VERITAS propose un mécanisme d'auto-amélioration autonome où le robot apprend de sa propre pratique, ce qui, si les résultats se confirment sur du matériel physique à l'échelle, réduirait structurellement le coût d'intégration pour les opérateurs industriels et les intégrateurs. La distinction entre "steering à l'inférence" (amélioration immédiate sans retraining) et "amélioration offline" (fine-tuning asynchrone sur rollouts vérifiés) est pertinente pour les décideurs B2B qui doivent planifier des cycles de mise à jour. Il faut cependant noter que le papier ne documente pas de métriques de déploiement sur des sites de production réels, ce qui tempère les conclusions. Cette approche s'inscrit dans une tendance forte issue des LLMs : transposer le "test-time compute scaling" au domaine robotique. Des politiques généralistes comme pi-0 (Physical Intelligence), OpenVLA ou RT-2 (Google DeepMind) ont démontré la faisabilité du transfert multi-tâches, mais butent sur la dégradation en conditions réelles non vues à l'entraînement. VERITAS tente de combler ce fossé sans recourir à des méthodes coûteuses comme DAgger ou RLHF classique. Aucun partenaire industriel ni calendrier de validation sur plateforme physique n'est mentionné dans le preprint ; les prochaines étapes attendues sont une évaluation sur robots physiques (humanoïdes ou manipulateurs) dans des environnements non contrôlés.

RechercheOpinion
1 source
Un cadre d'apprentissage autonome en boucle fermée piloté par LLM pour robots confrontés à des tâches inédites en environnement ouvert
4arXiv cs.RO 

Un cadre d'apprentissage autonome en boucle fermée piloté par LLM pour robots confrontés à des tâches inédites en environnement ouvert

Une équipe de recherche a publié le 22 avril 2026 sur arXiv (référence 2604.22199) un framework d'apprentissage autonome en boucle fermée piloté par LLM, conçu pour permettre à des robots d'intégrer durablement de nouvelles compétences sans recourir indéfiniment à des modèles de langage externes. Le principe central : lorsqu'un robot rencontre une tâche absente de sa bibliothèque locale de méthodes, il déclenche un processus structuré dans lequel le LLM joue le rôle de raisonnement de haut niveau (analyse de tâche, sélection de modèle candidat, planification de collecte de données, organisation de la stratégie d'exécution). Le robot apprend ensuite à partir de sa propre exécution ou par observation active de comportements externes réussis, effectue un entraînement quasi-temps-réel, et consolide le résultat validé dans sa bibliothèque locale pour toute réutilisation future. Les résultats expérimentaux montrent une réduction du temps moyen d'exécution de 7,7772 s à 6,7779 s, et surtout une chute du nombre moyen d'appels LLM par tâche de 1,0 à 0,2 dans les scénarios de ré-exécution répétée -- soit 80 % de dépendance au LLM éliminée sur les tâches déjà apprises. L'intérêt industriel de cette approche est d'ordre économique autant que technique. Les architectures actuelles de robotique généraliste (VLA, agents LLM embarqués) génèrent des coûts d'inférence récurrents et des latences incompatibles avec des déploiements à l'échelle en environnement de production. En construisant un savoir local cumulatif à partir d'interactions réussies, ce framework agit comme un mécanisme de compilation implicite : les appels LLM coûteux disparaissent au fil des répétitions. C'est une réponse directe au reproche souvent adressé aux systèmes fondation : leur dépendance permanente au cloud pour des décisions qui devraient devenir réflexes. Ce travail s'inscrit dans une tendance de recherche active autour de l'adaptation continue des robots en monde ouvert, en concurrence avec des approches comme l'apprentissage few-shot en ligne (RT-2, OpenVLA) ou les architectures de mémoire hiérarchique explorées chez Physical Intelligence (pi0) et chez Figure AI. La distinction clé ici est la boucle fermée entre observation, entraînement local et pruning des dépendances externes, une piste encore peu exploitée à l'échelle réelle. Les auteurs ne citent pas de partenaire industriel ni de déploiement terrain : il s'agit pour l'heure d'une preuve de concept académique, dont la robustesse en environnement non contrôlé reste à démontrer.

RechercheOpinion
1 source