FRAMES : récupération après échec et surveillance des compétences incarnées pour la loco-manipulation humanoïde
Des chercheurs présentent FRAMES (Failure Recovery And Monitoring of Embodied Skills), un framework de supervision pour le robot humanoïde Unitree G1, publie sur arXiv le 22 septembre 2026 sous la référence 2609.22538. Le système se greffe au-dessus du contrôleur corps entier CEER et articule trois agents: un Planner Agent qui décompose une instruction en langage naturel en sous-taches via des compétences paramétrées, un Monitor Agent base sur un modèle vision-langage qui évalué chaque compétence a partir d'observations multi-vues temporelles et de preuves de contact du robot, et un Recovery Agent qui reçoit un retour d'échec circonstancie pour corriger l'exécution. Un module mémoire réutilisé l'expérience de compétences passées, complète par un ancrage géométrique via cartes de profondeur et segmentation. Les auteurs ont teste isolement le module de surveillance dans le simulateur MuJoCo, sur 100 essais repartis en 50 exécutions ratées et 50 réussies, couvrant cinq taches de loco-manipulation. Le moniteur détecte 48 des 50 échecs et valide correctement 46 des 50 réussites, pour une précision globale de 94,0%.
Ce résultat cible un angle mort connu des pipelines robotiques bases sur des planificateurs LLM: choisir la bonne compétence ne garantit pas son exécution physique, et une seule erreur d'approche, de prise, de transport ou de dépôt peut invalider un plan long-horizon entier. En isolant et en validant un module de détection d'échec avant de boucler la récupération complète, les auteurs apportent une preuve partielle mais concrète que la supervision par modèle vision-langage peut distinguer succès et échec avec une fiabilité mesurable, plutôt que d'empiler des compétences sans contrôle qualité. Pour les intégrateurs et décideurs qui évaluent des humanoïdes pour la loco-manipulation industrielle, ce travail rappelle que la robustesse opérationnelle reste distincte de la réussite d'une démonstration isolée, et que la détection d'échec en temps réel devient une brique nécessaire avant tout déploiement a l'échelle. Le papier reste explicite sur les limites de sa propre validation.
FRAMES s'inscrit dans la lignée des architectures combinant planification par grands modèles de langage et bibliothèques de compétences réutilisables pour piloter des humanoïdes, approche désormais courante face a la multiplication des contrôleurs corps entier comme CEER sur la plateforme Unitree G1. L'apport du papier est de traiter la surveillance et la récupération d'échec comme un module a part entière plutôt que comme un correctif ad hoc, avec une architecture a mémoire capitalisant sur les exécutions passées. Les auteurs précisent que seule la brique de surveillance a été validée indépendamment, en simulation, et que l'évaluation de bout en bout de la boucle complète de récupération, avec Planner et Recovery Agent opérant ensemble sur le robot réel, reste en cours. Le passage de ces résultats simules a une validation sur le G1 physique constituera le prochain jalon déterminant pour juger de la maturité réelle de l'approche.
Dans nos dossiers




