Aller au contenu principal
Agent à base d'affordances : orchestration de compétences avec vérification intégrée
RecherchearXiv cs.RO 

Agent à base d'affordances : orchestration de compétences avec vérification intégrée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un préprint publié sur arXiv le 1er mai 2026 (identifiant 2605.00663) présente l'Affordance Agent Harness, un système d'orchestration de modules d'IA conçu pour résoudre l'un des problèmes les plus coriaces de la robotique de manipulation : l'affordance grounding, c'est-à-dire la capacité d'un agent à identifier précisément où et comment interagir avec un objet dans une scène réelle. Le défi est que les zones d'action pertinentes sont souvent petites, partiellement occultées, réfléchissantes ou visuellement ambiguës. L'architecture proposée est un système en boucle fermée qui chaîne plusieurs modules spécialisés, détection, segmentation, imagination d'interaction, via un composant baptisé Router, capable de sélectionner et de paramétrer dynamiquement les modules selon la difficulté de chaque instance. Un module Verifier évalue ensuite la fiabilité des preuves accumulées à partir de trois critères : cohérence interne du système, stabilité multi-échelle, et suffisance des évidences. Si ces seuils ne sont pas atteints, des tentatives ciblées sont relancées avant qu'un module final fusionne l'ensemble pour produire la prédiction. Les expériences sur plusieurs benchmarks d'affordance montrent une meilleure frontière de Pareto précision-coût que les pipelines fixes, avec moins d'appels de modules et une latence réduite, bien que l'article ne fournisse pas de chiffres absolus dans le résumé.

L'intérêt de cette approche tient à son principe de vérification avant engagement : là où les pipelines fixes traitent toutes les images de la même façon et accumulent les erreurs en cascade, l'Affordance Agent Harness décide en temps réel si les preuves collectées sont suffisantes pour se commettre. C'est une réponse directe au problème dit du "demo-to-reality gap" en robotique : les systèmes qui fonctionnent bien en conditions contrôlées échouent face à l'ambiguïté réelle. La mémoire épisodique intégrée permet en outre de capitaliser sur les objets récurrents, ce qui est pertinent dans des environnements industriels répétitifs. Pour un intégrateur ou un COO industriel, cela signifie moins d'interventions humaines pour les cas limites et un coût d'inférence maîtrisé, deux contraintes centrales pour le passage à l'échelle.

Ce travail s'inscrit dans une tendance forte depuis 2024 : combiner des modèles fondationnels de vision (VLMs, SAM-type pour la segmentation) dans des architectures d'agents modulaires pour la perception robotique. Des systèmes concurrents comme RoboPoint, SpatialVLM ou les approches VLA (Vision-Language-Action) de Physical Intelligence (Pi-0) cherchent également à résoudre l'ancrage spatial pour la manipulation. La différence revendiquée ici est le contrôle explicite du coût d'inférence et la capacité de récupération ciblée en cas d'erreur intermédiaire, plutôt qu'un modèle bout-en-bout. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné dans ce préprint, il s'agit à ce stade d'une contribution de recherche, avec une page projet publique. Les prochaines étapes naturelles seraient une validation sur des robots physiques en conditions non structurées, ce que l'article ne documente pas encore.

À lire aussi

MistyPilot : contrôler un robot social grâce à l'orchestration multi-agents de compétences LLM
1arXiv cs.RO 

MistyPilot : contrôler un robot social grâce à l'orchestration multi-agents de compétences LLM

Un preprint arXiv publié fin août 2026 (2608.15549v1) présente MistyPilot, un framework multi-agents à base de LLM pour piloter le robot social Misty à partir d'instructions en langage naturel. Un "Task Router" aiguille chaque instruction vers l'un de deux agents spécialisés : un agent d'interaction physique pour le contrôle déclenché par capteurs et l'invocation directe de compétences, et un agent d'interaction sociale pour la gestion d'état conversationnel et la génération de réponses multimodales contextuelles, qui réutilise les résultats déjà générés quand c'est possible plutôt que de relancer systématiquement une génération complète. Le système a été testé sur cinq suites de composants, avec liaisons capteurs-compétences et invocations de skills exécutées sur un robot Misty physique, ainsi que via une étude utilisateur préliminaire auprès de 12 participants, avec une extensibilité vérifiée jusqu'à 100 compétences et une variance inférieure à celle d'un système mono-agent autrement identique. Le code sera publié via la page du projet. Le problème ciblé est concret pour les intégrateurs de robotique sociale : composer manuellement des API en compétences, lier des événements capteurs à ces compétences et gérer l'état des tâches à l'exécution freine le passage de démonstrations scriptées à des interactions robustes et durables. En séparant le contrôle réactif physique de la gestion sociale à état persistant, MistyPilot répond à une limite fréquente des architectures mono-agent, à savoir une variance et une instabilité plus élevées des réponses, et illustre une voie de production fondée sur l'orchestration de compétences existantes plutôt que sur le réentraînement complet d'un modèle vision-langage-action. L'étude reste toutefois un prototype de recherche à petite échelle, sans mesure d'usage prolongé en conditions réelles. Misty, petit robot social de bureau développé par Misty Robotics, dispose d'un écosystème de compétences programmables via API jusqu'ici assemblées manuellement par les développeurs. MistyPilot s'inscrit dans la vague de travaux visant à faire piloter des robots par des LLM ou des modèles vision-langage-action, un champ largement dominé par des approches orientées manipulation physique comme Pi-0, GR00T N2 ou Helix, dont il se distingue en ciblant spécifiquement l'interaction sociale et conversationnelle plutôt que la locomotion ou la préhension. Aucun calendrier de commercialisation ni partenariat industriel n'est annoncé ; seule la publication du code source via la page du projet est confirmée, ce qui permettra une vérification indépendante des résultats revendiqués sur le routage et l'extensibilité à 100 compétences.

RecherchePaper
1 source
Diagnostiquer les échecs de transfert sémantique dans la composition de compétences VLA orchestrée par agents
2arXiv cs.RO 

Diagnostiquer les échecs de transfert sémantique dans la composition de compétences VLA orchestrée par agents

Des chercheurs ont testé un système d'orchestration d'agents pour l'exécution de tâches robotiques longues sur le benchmark BEHAVIOR-1K, qui simule des tâches ménagères nécessitant l'enchaînement de plusieurs compétences comme la navigation, la saisie, la pose d'objets et l'ouverture de portes. Le système s'appuie sur des checkpoints de compétences basés sur le modèle vision-langage-action Pi-0.5, entraînés à partir de démonstrations nettoyées issues de BEHAVIOR-1K. Chaque compétence reçoit des arguments typés et un budget d'étapes, et un modèle vision-langage multi-vues vérifie si l'exécution doit continuer, réessayer ou replanifier. Les auteurs comparent deux conditions de départ : des instantanés "propres" pris à la frontière entre deux compétences, et des états "chaînés" issus réellement de l'exécution de la compétence précédente. Résultat : les compétences testées individuellement atteignent 77 à 100% de réussite depuis des instantanés propres, sous vérification validée par des humains. Mais une fois enchaînées dans des rollouts complets, ces mêmes compétences échouent fréquemment à partir des états chaînés, avec un taux de réussite de bout en bout proche de zéro. Cette étude pointe un problème central pour l'industrie robotique qui cherche à déployer des VLA généralistes : le "handoff sémantique" entre compétences. Un modèle peut valider parfaitement sa propre postcondition tout en laissant le robot, les objets ou la caméra dans un état dont la compétence suivante ne peut pas repartir. Cela contredit l'hypothèse implicite de nombreux pipelines actuels selon laquelle empiler des compétences individuellement performantes suffit à obtenir un comportement fiable sur le long horizon. Pour les intégrateurs et décideurs B2B qui évaluent des démonstrations VLA impressionnantes en isolation, ce travail rappelle que le taux de réussite d'une compétence seule ne prédit pas la robustesse en conditions réelles d'enchaînement, où l'état de départ est "sale" plutôt que propre. Le travail s'inscrit dans la lignée de BEHAVIOR-1K, benchmark de tâches ménagères longues, et s'appuie sur la famille Pi-0.5, une architecture vision-langage-action comparable à des approches comme GR00T N2 ou Helix développées ailleurs dans le secteur. Les auteurs analysent les traces d'exécution et attribuent les échecs à trois causes : le manque de préparation pour la compétence suivante, une mauvaise identification de la cible, et des erreurs de contrôle bas niveau. Plutôt que d'annoncer des résultats de succès, l'article transforme un taux de réussite quasi nul en diagnostic actionnable, plaidant pour que les futures bibliothèques de compétences VLA intègrent explicitement la robustesse aux états chaînés, largement sous-représentés dans les démonstrations propres utilisées à l'entraînement.

RecherchePaper
1 source
Tâche hiérarchique de planification et de compétences : planification robotique hiérarchique avec des compétences en boîte noire
3arXiv cs.RO 

Tâche hiérarchique de planification et de compétences : planification robotique hiérarchique avec des compétences en boîte noire

Des chercheurs publient sur arXiv (version 3, remplaçant une précédente) une méthode baptisée TASP (Task and Skill Planning), qui étend la planification hiérarchique de tâches et de mouvements (TAMP) pour intégrer des compétences robotiques hétérogènes déjà existantes : politiques apprises, contrôleurs à retour de force, et modules « boîte noire ». L'approche s'appuie sur les Composable Interaction Primitives (CIP) pour générer automatiquement des plans de mouvement de transition, en amont et en aval de chaque compétence, qui relient deux savoir-faire consécutifs entre eux. Ces primitives permettent d'ajuster la trajectoire aussi bien au moment de la planification qu'en cours d'exécution. Les auteurs valident leur système par des expériences réelles sur un manipulateur bimanuel et un manipulateur mobile, en résolvant des tâches longues et complexes, y compris des scénarios de manipulation mobile sur plusieurs pièces avec une structure de tâche non monotone, c'est-à-dire nécessitant de revenir en arrière ou de réordonner des sous-objectifs. L'intérêt pour l'industrie tient au fait que les méthodes TAMP classiques supposaient jusqu'ici que chaque action robotique se ramène à de la planification de mouvement cinématique pure, ce qui limitait leur usage aux tâches purement géométriques. En montrant qu'un planificateur hiérarchique peut combiner des compétences de nature très différente tout en conservant un raisonnement sur les échecs centré sur les objets, TASP ouvre une voie modulaire : un intégrateur peut assembler des politiques déjà entraînées séparément, sans devoir tout réentraîner dans un modèle unique. Cela nourrit le débat entre l'approche « tout-en-un » portée par les grands modèles vision-langage-action et une approche composite où des briques spécialisées restent pilotées par un planificateur symbolique classique, potentiellement plus robuste et plus facile à déboguer en environnement industriel. Ce travail s'inscrit dans une tendance récente de la recherche en robotique consistant à hybrider TAMP et contrôleurs en boucle fermée ou compétences apprises, plutôt que de s'en tenir à la planification de mouvement pure. Il se positionne en alternative modulaire face aux modèles génériques de type Pi-0, GR00T N2 ou Helix, qui visent au contraire une politique unique bout-en-bout. Il s'agit ici d'un article de recherche académique, sans annonce de produit commercial ni de calendrier de déploiement : les résultats montrent une faisabilité réelle sur deux plateformes robotiques distinctes, mais restent à ce stade du domaine expérimental plutôt qu'industriel.

RecherchePaper
1 source
Généraliser les compétences de manipulation avec un agent de codage local
4arXiv cs.RO 

Généraliser les compétences de manipulation avec un agent de codage local

Des chercheurs ont testé un système où un modèle de langage-vision open-weight, exécuté localement, pilote un bras robotique UR3e en écrivant et exécutant lui-même son propre code, sans programmation ni entraînement spécifique pour chaque nouvelle tâche. Le modèle utilisé, Qwen3.8-27B, agit comme un agent de codage placé au-dessus d'un service qui fournit la cinématique, les limites de sécurité et des techniques classiques de vision par ordinateur. Les auteurs ont évalué le système sur neuf tâches construites à partir de jouets pour enfants, conçues pour tester la généralisation selon la couleur, la taille, la forme et les variations de la tâche elle-même. Sur 45 essais au total (cinq par tâche), le robot a réussi à généraliser dans 30 cas, avec des temps d'exécution allant de 3,4 à 67,5 minutes selon la complexité de la tâche. Lorsqu'on demandait à l'agent de refaire une tâche déjà réussie, la durée chutait de 50%, signe d'une forme d'auto-amélioration au fil des répétitions. L'étude, publiée en préprint sur arXiv, reste une démonstration de laboratoire sur un bras fixe, sans déploiement industriel ni produit commercialisé. L'intérêt de ce travail est de tester une alternative aux approches dominantes de la robotique pilotée par le langage, qui reposent soit sur une interface d'action figée, soit sur une politique entraînée de type VLA (vision-language-action), à l'image de Pi-0, GR00T N2 ou Helix. Ces méthodes généralisent mal à de nouvelles tâches sans collecte de données supplémentaire ni réentraînement, ce qui freine leur adoption chez les intégrateurs. En laissant un modèle local générer et exécuter du code plutôt que produire directement des actions, les auteurs cherchent à contourner ce goulot d'étranglement : un taux de réussite de deux tiers et une division par deux du temps d'exécution après une première réussite suggèrent qu'un agent de codage local peut s'adapter à la volée à des variations d'objets sans nouvelle donnée d'entraînement. Le résultat reste à nuancer : des temps de cycle dépassant l'heure pour les tâches complexes restent très éloignés des standards industriels, et neuf tâches construites à partir de jouets ne reflètent pas la diversité d'un environnement de production réel. Ce travail s'inscrit dans la dynamique des modèles de langage open-weight capables d'écrire, exécuter et déboguer du code de façon autonome sur une seule station de travail, capacité que les auteurs transposent ici du logiciel pur à la commande physique d'un robot. Il se positionne en contrepoint des grands modèles VLA propriétaires ou semi-ouverts développés par des laboratoires de robotique manipulatrice et humanoïde comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T N2), qui misent sur des politiques massivement entraînées plutôt que sur du code généré à la volée. Les auteurs présentent leur approche comme préliminaire, reconnaissent des limites qu'ils ne détaillent pas dans le résumé, et annoncent vouloir approfondir le mécanisme d'auto-amélioration observé pour ouvrir la voie à un déploiement réel de ce type d'agent local en robotique. Aucun calendrier ni partenariat industriel n'est mentionné à ce stade.

UELe bras robotique testé est un UR3e du fabricant danois Universal Robots, ce qui concerne indirectement l'écosystème robotique industriel européen, mais aucune entreprise ou institution européenne n'est impliquée dans l'étude elle-même.

RecherchePaper
1 source