Aller au contenu principal
RecherchearXiv cs.RO 

iAm.md : auto-évaluation des compétences d'un robot par introspection à base d'agents, pour des domaines inconnus à vocabulaire ouvert

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.10962) iAm.md, un standard au format Markdown accompagné d'un cadre de génération. Il vise à réduire ce que les auteurs appellent les « échecs d'ancrage » (grounding failures) dans les agents robotiques pilotés par des modèles de fondation. Le problème est le suivant : à cause de fenêtres de contexte limitées ou d'hallucinations inhérentes à la prédiction du token suivant, un agent peut produire un comportement sans avoir vérifié que le robot déployé et l'environnement observé permettent réellement l'action demandée. Pour y remédier, le système construit une cartographie sémantique à vocabulaire ouvert. Il combine des détections vision-langage locales et de la segmentation d'objets, puis rattache ces résultats à des enregistrements d'objets persistants. Ces enregistrements sont stockés dans une représentation intermédiaire standardisée, que l'agent peut relire pour s'auto-interroger, ce que les auteurs nomment « introspection agentique ». L'évaluation porte sur un robot TIAGo simulé, sur des tâches combinant navigation et manipulation. Le résumé de l'article ne donne ni taux de réussite ni comparaison chiffrée avec une méthode de référence.

L'intérêt pratique tient au changement de cadrage : la génération de comportement autonome est traitée comme un problème de génération de code, grâce aux progrès récents du raisonnement des modèles de fondation. Dans cette logique, l'agent doit prouver qu'une compétence est réalisable avant de l'exécuter. Un fichier Markdown lisible par l'humain comme par le modèle sert de contrat entre ce que le robot sait faire, ce qu'il a effectivement observé et ce qui lui est demandé. Pour un intégrateur, c'est une réponse directe à un point faible des planificateurs à base de LLM : proposer des plans plausibles mais inexécutables, faute de vérification des capacités et de la scène. Le format texte brut facilite aussi l'audit et le débogage, des critères décisifs en environnement industriel. Les auteurs affirment que la même représentation soutient à la fois l'auto-évaluation des compétences et la généralisation de tâches sous forme de code exécutable.

Il faut toutefois relativiser la portée. Les résultats sont obtenus en simulation, sur une seule plateforme, et rien n'indique encore une validation sur matériel réel, où le bruit de perception et la dérive des cartes compliquent la persistance des objets. Ce travail s'inscrit dans la lignée des approches qui ancrent les modèles de langage dans les affordances du robot, comme SayCan, et des planificateurs générant du code. Il vise un maillon que les modèles VLA bout en bout traitent de manière implicite. TIAGo, développé par PAL Robotics (Barcelone), est une plateforme de recherche européenne très répandue, ce qui facilite la reproduction par d'autres laboratoires. La suite logique serait un test sur robot physique, dans des environnements dynamiques, avec des métriques comparables à celles des benchmarks existants.

Impact France/UE

Le robot TIAGo de PAL Robotics (Barcelone) sert de plateforme d'évaluation, ce qui facilite la reproduction par les laboratoires européens, sans impact réglementaire ou industriel direct.

Dans nos dossiers

À lire aussi

ASPIRE : découverte de compétences à base d'agents pour la robotique
1arXiv cs.RO 

ASPIRE : découverte de compétences à base d'agents pour la robotique

ASPIRE (Agentic Skill Programming through Iterative Robot Exploration) est un nouveau système d'apprentissage continu pour la robotique, décrit dans un article publié sur arXiv (2607.00272) début juillet 2026. Contrairement à la programmation robotique traditionnelle, qui impose de coder manuellement la perception multimodale, la gestion des contacts physiques et la diversité des échecs d'exécution, ASPIRE écrit et corrige lui-même ses programmes de contrôle selon le paradigme "code-as-policy", puis capitalise chaque correction validée dans une bibliothèque de compétences réutilisables. Le système s'appuie sur trois briques : un moteur d'exécution en boucle fermée qui expose des traces multimodales fines pour diagnostiquer les échecs et synthétiser des réparations ; une bibliothèque de compétences qui s'enrichit en continu de correctifs transférables ; et une recherche évolutionnaire qui génère des séquences de tâches et des programmes de contrôle variés, au-delà du simple raffinement trajectoire par trajectoire. Sur les bancs d'essai simulés, ASPIRE dépasse les méthodes précédentes de 77% sur les manipulations perturbées de LIBERO-Pro, 72% sur les transferts bimanuels de Robosuite, et 32% sur les tâches ménagères longues de BEHAVIOR-1K. Ce travail s'attaque directement à un point de friction connu du secteur : la difficulté à faire generaliser des politiques de contrôle robotique au-delà de la tâche pour laquelle elles ont été conçues, sans réentraînement lourd à chaque nouvelle configuration. La bibliothèque cumulative d'ASPIRE permet une généralisation zero-shot à des tâches longues jamais vues : 31% de réussite sur LIBERO-Pro Long, contre seulement 4% pour les meilleures méthodes concurrentes, qui pourtant s'appuient sur du raisonnement et des tentatives répétées au moment de l'exécution. Pour les intégrateurs et décideurs robotique, c'est un signal encourageant sur la viabilité de bibliothèques de compétences auto-construites plutôt que de politiques VLA monolithiques entraînées une fois pour toutes, mais les auteurs restent prudents : ils ne parlent que de "premières preuves" de transfert simulation-vers-réel, pas d'un problème résolu. Ce résultat s'inscrit dans la lignée des travaux récents sur les politiques de contrôle générées ou affinées par des grands modèles de langage, où l'enjeu principal est de dépasser le stade de la démonstration isolée pour atteindre une robustesse répétable en conditions réelles. Contrairement aux approches par apprentissage par renforcement pur ou aux VLA entraînés de bout en bout (type Pi-0 ou GR00T), ASPIRE mise sur l'exploration itérative et la mémoire de compétences pour réduire l'effort de programmation à chaque nouvel embodiment ou API robotique. Les auteurs annoncent vouloir approfondir la validation du transfert sim-to-real sur des plateformes physiques variées, une étape encore à venir puisque l'article ne documente pour l'instant que des résultats en simulation.

RecherchePaper
1 source
SkillWeaver : exploration à base d'agents de compétences d'interaction neuronales pour la génération de données robotiques à grande échelle
2arXiv cs.RO 

SkillWeaver : exploration à base d'agents de compétences d'interaction neuronales pour la génération de données robotiques à grande échelle

SkillWeaver, un framework publié sur arXiv (2609.36171), propose de générer automatiquement des données robotiques en simulation grâce à un agent de raisonnement. Le système repose sur des « Neural Interaction Skills » (NIS), des politiques paramétrables, réutilisables et en boucle fermée, entraînées par apprentissage par renforcement pour la manipulation riche en contacts. Étant donné une tâche et un environnement simulé, un agent VLM (modèle vision-langage) décide de la prochaine action, invoque et paramètre une NIS, observe le résultat, puis produit des étapes de vérification, de réflexion et de mémoire. L'exploration prend la forme d'une recherche arborescente guidée par un vérificateur. Le système a généré 39,1 K démonstrations sur 14,1 K scènes, ensuite distillées en politiques visuomotrices. Il s'agit d'un travail de recherche, sans produit ni déploiement industriel associé. L'enjeu porte sur le goulot d'étranglement de la donnée. La téléopération reste coûteuse et difficilement extensible à des environnements variés ou à des tâches longues. Les pipelines de simulation actuels dépendent souvent de contrôleurs en boucle ouverte, de séquences de compétences scriptées ou de programmes propres à chaque tâche, ce qui limite leur généralité. SkillWeaver déplace la logique : le savoir-faire physique est encapsulé dans des primitives apprises, et l'agent découvre lui-même les enchaînements gagnants. Les auteurs affirment une meilleure généralisation à de nouveaux objets, configurations spatiales, tâches et environnements, ainsi qu'un transfert sim-to-sim et sim-to-real en zéro ou few-shot. Ces résultats viennent du résumé de l'article. Le résumé ne donne aucun taux de réussite, aucun modèle de référence ni aucun protocole. Le volume de manipulation réelle testé est aussi inconnu, alors que c'est là que se joue l'écart entre démonstration et réalité. La revendication d'une alternative « scalable » reste donc à confirmer par les tableaux détaillés. Le travail s'inscrit dans la recherche sur la génération de données synthétiques pour les modèles VLA (vision-langage-action), qui alimentent aujourd'hui les efforts autour de Pi-0, GR00T ou Helix. Elle vise à réduire la dépendance à la collecte humaine. Les approches concurrentes combinent LLM et code généré, ou augmentent un petit nombre de démonstrations humaines en simulation. L'originalité ici est de placer des politiques RL fermées, et non du code ou des trajectoires scriptées, comme briques de l'exploration. La suite dépendra de la publication du code et des données, de la reproduction par d'autres laboratoires et de la mesure du coût de calcul de la recherche arborescente. Aucun acteur français ou européen n'est cité dans le résumé.

RecherchePaper
1 source
De la perception à l'assistance : autonomie partagée à vocabulaire ouvert pour la manipulation robotique
3arXiv cs.RO 

De la perception à l'assistance : autonomie partagée à vocabulaire ouvert pour la manipulation robotique

Des chercheurs présentent un système d'autonomie partagée pour la téléopération de bras manipulateurs en environnement industriel, publié le 24 juillet 2026 sur arXiv (référence 2607.17323). Le dispositif repose sur une seule caméra RGB-D qui capture les mouvements du bras et les gestes de la main de l'opérateur, sans combinaison connectée, marqueur fiduciaire ni étape de calibration préalable. La cible à saisir est désignée par une simple consigne textuelle en langage libre, interprétée par un modèle vision-langage via la caméra embarquée sur le préhenseur, puis suivie en continu par un modèle de segmentation vidéo promptable sur les caméras du robot, ce qui isole en permanence un repère de saisie de la carte des obstacles. Un contrôleur prédictif (MPC) accéléré par GPU exécute chaque commande tout en évitant les collisions avec l'environnement et avec le robot lui même, grâce à une reconstruction volumétrique calculée en temps réel, pendant qu'un champ de potentiel corrige la trajectoire de l'opérateur lors de l'approche finale. Testé sur un manipulateur mobile quadrupède, le système atteint une précision de positionnement de 59 mm d'erreur quadratique moyenne par rapport à une référence de capture de mouvement, et maintient le bras à au moins 18 cm des obstacles même lorsque l'opérateur tente délibérément une collision de 6 cm. Sur une tâche de manipulation de vanne industrielle et une tâche de prise dépose, le framework complet réussit tous les essais, tandis que le mode entièrement autonome, déclenché par geste, réussit quatre essais sur cinq par tâche. L'intérêt pour l'industrie robotique tient au problème visé: en téléopération classique, aligner précisément un effecteur avec une cible en environnement encombré, avec une perception de profondeur limitée par caméra, reste une source d'erreurs et de collisions coûteuses. En retirant marqueurs et calibration tout en gardant l'opérateur dans la boucle de décision, le système promet un déploiement plus rapide sur des cellules industrielles existantes. Le fait que retirer soit le module de collision, soit le module d'assistance provoque des échecs par des mécanismes différents montre que les deux briques sont complémentaires et non redondantes, un signal utile pour les intégrateurs qui évaluent la robustesse réelle de ces architectures avant tout achat. Le travail s'inscrit dans la convergence actuelle entre modèles vision-langage et téléopération assistée, où l'ancrage d'instructions textuelles dans la perception robotique gagne du terrain face aux interfaces manuelles pures. Les auteurs positionnent leur contribution comme une alternative légère aux pipelines nécessitant équipement dédié ou calibration lourde, et annoncent la possibilité de basculer vers une exécution autonome sur la même cible sans pipeline de perception séparé, ouvrant la voie à des essais plus poussés sur d'autres plateformes et tâches industrielles.

RecherchePaper
1 source
Singe voit, singe fait ? Un benchmark pour évaluer l'apprentissage de compétences robotiques par observation
4arXiv cs.RO 

Singe voit, singe fait ? Un benchmark pour évaluer l'apprentissage de compétences robotiques par observation

Une équipe de recherche a déposé sur arXiv, sous la référence 2609.08209 (version 2, remplaçant une publication antérieure), un article présentant RoboReel, un benchmark unifié destiné à évaluer les modèles qui apprennent des politiques de manipulation robotique par observation de vidéos humaines. Le jeu de données regroupe des vidéos de démonstrations humaines réelles, des trajectoires robotiques simulées et des environnements d'évaluation couvrant dix tâches de manipulation. Les auteurs ont conçu quatre suites de tests distinctes, mesurant notamment la robustesse des modèles face aux distracteurs visuels et leur capacité à mener à bien des tâches longues comportant plusieurs étapes. Le benchmark compare plus de sept algorithmes de l'état de l'art en apprentissage par observation (Learning from Observation, LfO), dont des variantes fondées sur des modèles vision-langage-action (VLA) développées par les auteurs eux-mêmes, ainsi que plusieurs choix de représentation des données d'entrée. Le code, les vidéos et la documentation du projet sont mis à disposition sur roboreel.github.io. Cette initiative répond à un problème concret pour le secteur robotique: l'apprentissage à partir de vidéos humaines est présenté depuis plusieurs années comme un moyen de contourner la pénurie de données d'entraînement, la collecte de démonstrations téléopérées restant lente et coûteuse à grande échelle. Or les auteurs constatent que les méthodes publiées jusqu'ici reposent sur des hypothèses, du matériel et des protocoles d'évaluation si divergents qu'il devient impossible de comparer réellement les progrès revendiqués d'un papier à l'autre, un problème classique de fragmentation méthodologique dans un champ en expansion rapide. Plus significatif pour les intégrateurs et décideurs du secteur, l'analyse comparative montre que les tâches à long horizon et celles exigeant une faible tolérance d'erreur restent difficiles pour l'ensemble des modèles testés, quelle que soit leur architecture. Ce constat tempère l'idée selon laquelle l'apprentissage par vidéo suffirait à produire des compétences de manipulation robustes à l'échelle industrielle, et invite à la prudence face aux démonstrations isolées mises en avant par certains laboratoires. RoboReel s'inscrit dans la continuité de travaux récents ayant montré des résultats prometteurs pour l'apprentissage de compétences de manipulation à partir de vidéos humaines, sans télé-opération ni collecte de données directement sur le robot cible, une piste explorée par de nombreux laboratoires académiques et industriels de la robotique manipulatrice. Faute de cadre d'évaluation commun, ces travaux restaient difficiles à situer les uns par rapport aux autres, chaque équipe validant ses résultats sur son propre environnement et son propre matériel. En proposant un socle partagé de dix tâches, de vidéos et de trajectoires simulées librement réutilisables, les auteurs visent à doter le champ du LfO d'un outil de comparaison équivalent à ceux qui existent déjà pour d'autres sous-domaines de l'apprentissage robotique. La publication met le code et les données à disposition de la communauté via la page du projet, sans annoncer à ce stade de déploiement industriel ni de partenariat commercial associé.

RecherchePaper
1 source