iAm.md : auto-évaluation des compétences d'un robot par introspection à base d'agents, pour des domaines inconnus à vocabulaire ouvert
Des chercheurs publient sur arXiv (2610.10962) iAm.md, un standard au format Markdown accompagné d'un cadre de génération. Il vise à réduire ce que les auteurs appellent les « échecs d'ancrage » (grounding failures) dans les agents robotiques pilotés par des modèles de fondation. Le problème est le suivant : à cause de fenêtres de contexte limitées ou d'hallucinations inhérentes à la prédiction du token suivant, un agent peut produire un comportement sans avoir vérifié que le robot déployé et l'environnement observé permettent réellement l'action demandée. Pour y remédier, le système construit une cartographie sémantique à vocabulaire ouvert. Il combine des détections vision-langage locales et de la segmentation d'objets, puis rattache ces résultats à des enregistrements d'objets persistants. Ces enregistrements sont stockés dans une représentation intermédiaire standardisée, que l'agent peut relire pour s'auto-interroger, ce que les auteurs nomment « introspection agentique ». L'évaluation porte sur un robot TIAGo simulé, sur des tâches combinant navigation et manipulation. Le résumé de l'article ne donne ni taux de réussite ni comparaison chiffrée avec une méthode de référence.
L'intérêt pratique tient au changement de cadrage : la génération de comportement autonome est traitée comme un problème de génération de code, grâce aux progrès récents du raisonnement des modèles de fondation. Dans cette logique, l'agent doit prouver qu'une compétence est réalisable avant de l'exécuter. Un fichier Markdown lisible par l'humain comme par le modèle sert de contrat entre ce que le robot sait faire, ce qu'il a effectivement observé et ce qui lui est demandé. Pour un intégrateur, c'est une réponse directe à un point faible des planificateurs à base de LLM : proposer des plans plausibles mais inexécutables, faute de vérification des capacités et de la scène. Le format texte brut facilite aussi l'audit et le débogage, des critères décisifs en environnement industriel. Les auteurs affirment que la même représentation soutient à la fois l'auto-évaluation des compétences et la généralisation de tâches sous forme de code exécutable.
Il faut toutefois relativiser la portée. Les résultats sont obtenus en simulation, sur une seule plateforme, et rien n'indique encore une validation sur matériel réel, où le bruit de perception et la dérive des cartes compliquent la persistance des objets. Ce travail s'inscrit dans la lignée des approches qui ancrent les modèles de langage dans les affordances du robot, comme SayCan, et des planificateurs générant du code. Il vise un maillon que les modèles VLA bout en bout traitent de manière implicite. TIAGo, développé par PAL Robotics (Barcelone), est une plateforme de recherche européenne très répandue, ce qui facilite la reproduction par d'autres laboratoires. La suite logique serait un test sur robot physique, dans des environnements dynamiques, avec des métriques comparables à celles des benchmarks existants.
Le robot TIAGo de PAL Robotics (Barcelone) sert de plateforme d'évaluation, ce qui facilite la reproduction par les laboratoires européens, sans impact réglementaire ou industriel direct.
Dans nos dossiers




