Aller au contenu principal
RecherchearXiv cs.RO 

FRAMES : récupération après échec et surveillance des compétences incarnées pour la loco-manipulation humanoïde

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent FRAMES (Failure Recovery And Monitoring of Embodied Skills), un framework de supervision pour le robot humanoïde Unitree G1, publie sur arXiv le 22 septembre 2026 sous la référence 2609.22538. Le système se greffe au-dessus du contrôleur corps entier CEER et articule trois agents: un Planner Agent qui décompose une instruction en langage naturel en sous-taches via des compétences paramétrées, un Monitor Agent base sur un modèle vision-langage qui évalué chaque compétence a partir d'observations multi-vues temporelles et de preuves de contact du robot, et un Recovery Agent qui reçoit un retour d'échec circonstancie pour corriger l'exécution. Un module mémoire réutilisé l'expérience de compétences passées, complète par un ancrage géométrique via cartes de profondeur et segmentation. Les auteurs ont teste isolement le module de surveillance dans le simulateur MuJoCo, sur 100 essais repartis en 50 exécutions ratées et 50 réussies, couvrant cinq taches de loco-manipulation. Le moniteur détecte 48 des 50 échecs et valide correctement 46 des 50 réussites, pour une précision globale de 94,0%.

Ce résultat cible un angle mort connu des pipelines robotiques bases sur des planificateurs LLM: choisir la bonne compétence ne garantit pas son exécution physique, et une seule erreur d'approche, de prise, de transport ou de dépôt peut invalider un plan long-horizon entier. En isolant et en validant un module de détection d'échec avant de boucler la récupération complète, les auteurs apportent une preuve partielle mais concrète que la supervision par modèle vision-langage peut distinguer succès et échec avec une fiabilité mesurable, plutôt que d'empiler des compétences sans contrôle qualité. Pour les intégrateurs et décideurs qui évaluent des humanoïdes pour la loco-manipulation industrielle, ce travail rappelle que la robustesse opérationnelle reste distincte de la réussite d'une démonstration isolée, et que la détection d'échec en temps réel devient une brique nécessaire avant tout déploiement a l'échelle. Le papier reste explicite sur les limites de sa propre validation.

FRAMES s'inscrit dans la lignée des architectures combinant planification par grands modèles de langage et bibliothèques de compétences réutilisables pour piloter des humanoïdes, approche désormais courante face a la multiplication des contrôleurs corps entier comme CEER sur la plateforme Unitree G1. L'apport du papier est de traiter la surveillance et la récupération d'échec comme un module a part entière plutôt que comme un correctif ad hoc, avec une architecture a mémoire capitalisant sur les exécutions passées. Les auteurs précisent que seule la brique de surveillance a été validée indépendamment, en simulation, et que l'évaluation de bout en bout de la boucle complète de récupération, avec Planner et Recovery Agent opérant ensemble sur le robot réel, reste en cours. Le passage de ces résultats simules a une validation sur le G1 physique constituera le prochain jalon déterminant pour juger de la maturité réelle de l'approche.

Dans nos dossiers

À lire aussi

OmniContact : enchaînement de méta-compétences par flux de contact pour la loco-manipulation humanoïde généralisable
1arXiv cs.RO 

OmniContact : enchaînement de méta-compétences par flux de contact pour la loco-manipulation humanoïde généralisable

Des chercheurs ont publié le 26 juin 2026 sur arXiv (réf. 2606.26201) un framework hiérarchique baptisé OmniContact, conçu pour enchaîner des séquences complexes de locomotion et manipulation sur des humanoïdes. Le coeur du système est une représentation intermédiaire appelée "contact flow" (CF): trajectoires corporelles clés et signaux binaires de contact en série temporelle. Deux modules s'appuient dessus, CF-Track (politique bas-niveau, bibliothèque de compétences unifiée) et CF-Gen (planificateur haut-niveau heuristique qui synthétise les séquences futures). En simulation, les résultats annoncés atteignent 98,7% de succès sur la tâche "Carry Box" et 76,5% sur "Push-Stack Boxes", soit respectivement +40,9% et +66,5% face aux baselines sur l'exécution de méta-compétences et leur enchaînement. Le dataset OmniContact, constitué via capture de mouvement (MoCap) d'interactions humain-objet, supporte l'entraînement. Le vrai défi des humanoïdes industriels n'est pas l'exécution d'un geste unitaire mais l'enchaînement robuste de séquences longues avec récupération autonome en cas de défaillance, ce verrou précis que OmniContact cible. Le système propose une interface structurée lisible par le planificateur haut-niveau, une voie médiane entre représentations explicites trop rigides pour la planification et embeddings implicites trop opaques pour la composition fiable. L'intégration avec des VLMs (Vision-Language Models) permettrait des instructions en langage naturel converties en séquences de contact flows, comme l'illustre la démonstration d'arrangement de boîtes en forme de coeur. Nuance importante: toutes les métriques publiées sont issues de conditions contrôlées en laboratoire, sans validation sur hardware physique ni déploiement industriel réel, ce qui laisse entier le problème du sim-to-real. La loco-manipulation longue horizon est devenu le benchmark officieux du secteur humanoïde en 2025-2026. Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (pi0) et Boston Dynamics s'affrontent sur des tâches de plus en plus généralisables, tandis que NVIDIA pousse GR00T N2 comme couche de policy universelle. OmniContact vient du monde académique, sans entreprise identifiée derrière ce preprint, mais son approche par contact flow s'inscrit dans la tendance des représentations intermédiaires structurées, en parallèle des architectures VLA à diffusion. La collecte MoCap dédiée aux interactions humain-objet sur humanoïdes confirme que les données de référence restent un goulot d'étranglement même quand la simulation abonde. La prochaine étape déterminante sera le transfert sur un humanoïde physique, condition sine qua non pour que ce framework passe du laboratoire au hangar.

RecherchePaper
1 source
ViLoMan : apprentissage de compétences de loco-manipulation du corps entier par vision et proprioception pour robots humanoïdes
2arXiv cs.RO 

ViLoMan : apprentissage de compétences de loco-manipulation du corps entier par vision et proprioception pour robots humanoïdes

Le laboratoire à l'origine du projet ViLoMan, publié en preprint sur arXiv (arXiv:2609.19340, soumission anonyme en relecture en double aveugle, page projet viloman-anonymous.pages.dev), présente un système d'apprentissage pour la loco-manipulation autonome des robots humanoïdes. La méthode transforme des démonstrations humaines partielles, capturées de façon cinématique lors d'interactions homme-objet, en trajectoires robotiques complètes et physiquement exécutables. Ces trajectoires alimentent ensuite un entraînement par distillation enseignant-élève, qui produit une politique unique convertissant des observations de profondeur en vision égocentrique et des mesures proprioceptives directement en commandes articulaires pour l'ensemble du corps. Une fois déployée, cette politique ne nécessite ni mouvement de référence ni commande intermédiaire. Les auteurs l'ont testée sur des tâches de fermeture de porte, avec des configurations de porte et des positions de départ variées, en simulation puis sur un robot réel Unitree G1, montrant qu'une seule politique suffit à accomplir la tâche uniquement à partir des capteurs embarqués. Ce travail s'attaque à deux obstacles centraux du secteur : la rareté de données d'interaction robot-objet physiquement réalisables, et la difficulté d'apprendre un contrôle unifié du corps entier à partir des seules observations embarquées, sans capture de mouvement externe ni téléopération lourde. En démontrant un transfert simulation-réel fonctionnel avec un capteur de profondeur et la proprioception seuls, l'étude apporte un contre-exemple concret à l'hypothèse selon laquelle les politiques de loco-manipulation humanoïde exigent nécessairement de vastes jeux de données téléopérées coûteux à constituer. Pour les intégrateurs et décideurs robotique, l'intérêt réside surtout dans la méthode de conversion des démonstrations humaines en données d'entraînement robot exploitables, une piste alternative aux pipelines de collecte par téléopération utilisés par des acteurs comme Figure ou Physical Intelligence. ViLoMan s'inscrit dans la compétition croissante autour des politiques vision-langage-action et des architectures de contrôle whole-body pour humanoïdes, aux côtés d'approches commerciales comme Helix de Figure, GR00T N2 de Nvidia ou Pi-0 de Physical Intelligence, qui reposent largement sur des données de téléopération à grande échelle. Ici, l'origine académique et le statut anonyme de la soumission signalent une contribution de recherche encore au stade du laboratoire, validée sur une seule tâche restreinte de fermeture de porte plutôt que déployée en conditions industrielles. Les prochaines étapes attendues concernent l'extension à d'autres tâches de manipulation et à des environnements plus variés avant toute perspective de déploiement réel.

RecherchePaper
1 source
Un système rapide, résilient et adaptable pour les comportements de loco-manipulation des robots humanoïdes
3arXiv cs.RO 

Un système rapide, résilient et adaptable pour les comportements de loco-manipulation des robots humanoïdes

Une équipe de recherche a publié le 2 septembre 2026 sur arXiv (2609.01518) un système d'architecture comportementale pour la loco-manipulation sur robots humanoïdes, conçu pour tourner localement et être modifié en temps réel pendant l'exécution. L'architecture combine des Affordance Templates centrées objets, une structure en arbre organisant la logique des tâches, et une scène de perception éditable au runtime, exécutée par un contrôleur corps entier combinant marche et mouvements du buste, avec une interface opérateur synchronisée en continu pour superviser et corriger à la volée. Testé sur un Unitree H1-2 et un second robot nommé Alex sur six variantes de tâches, le système franchit une porte à pousser en 34 secondes et trie six balles par couleur en 45 secondes sous perturbation humaine directe. Des sessions d'autorat chronométrées montrent la création ou l'adaptation d'un comportement de loco-manipulation en quelques heures. Ce résultat nuance un discours dominant dans la robotique humanoïde, où la performance repose de plus en plus sur des modèles vision-langage-action entraînés de bout en bout, à la manière de Pi-0, GR00T N2 ou Helix. Les auteurs affirment que leur approche, explicitement programmée plutôt qu'apprise, reste compétitive face à ces systèmes récents, tout en offrant un avantage opérationnel : créer ou corriger un comportement en heures plutôt qu'en semaines de collecte de données. Pour les intégrateurs et décideurs industriels, cela ouvre une voie alternative moins dépendante de gigantesques jeux de démonstrations, potentiellement plus rapide à auditer sur site, même si les chiffres de cycle avancés restent issus de démonstrations contrôlées. Le travail s'inscrit dans la course à l'autonomie des humanoïdes pour des tâches physiquement pénibles, dangereuses ou répétitives, un terrain disputé par Figure AI avec Figure 03, Tesla avec Optimus Gen 3 ou NVIDIA avec GR00T, majoritairement pariés sur l'apprentissage à grande échelle. En misant sur une architecture éditable localement et supervisée par un opérateur, les auteurs positionnent leur système comme complémentaire, voire alternatif, à ces approches pilotées par les données. Aucun acteur français ou européen n'est cité, et cette publication reste à ce stade une contribution de recherche sur arXiv plutôt qu'un produit commercialisé, sans calendrier annoncé de pilotes au-delà des six tâches démontrées.

RecherchePaper
1 source
LUCID : contrôle unifié des compétences latentes via une dynamique imaginée pour la loco-manipulation humanoïde à long terme
4arXiv cs.RO 

LUCID : contrôle unifié des compétences latentes via une dynamique imaginée pour la loco-manipulation humanoïde à long terme

Le laboratoire de recherche à l'origine du papier arXiv:2608.07746v1 (soumis en catégorie cross-listing, daté d'août 2026) présente LUCID, acronyme de "Latent-Skill Unified Control via Imagined Dynamics", un framework d'apprentissage par renforcement hiérarchique et basé sur un modèle du monde, destiné aux tâches de loco-manipulation humanoïde longue durée. La méthode se déroule en deux temps : une politique bas niveau, conditionnée par des codes latents structurés, est d'abord entraînée par imitation adversariale puis gelée ; un modèle de dynamique de haut niveau ("macro-dynamics world model") est ensuite appris conjointement avec une politique de décision, ce modèle prédisant les transitions d'état à horizon étendu induites par chaque décision latente, ce qui permet d'optimiser la politique haut niveau via des simulations imaginées plutôt que par essais réels. Les auteurs évaluent LUCID sur des scénarios simulés de réarrangement multi-objets et rapportent une amélioration du taux de réussite complète des tâches ainsi que des taux de complétion partielle, comparés à des méthodes de référence combinant planificateurs scriptés, automates à états finis ou politiques model-free spécifiques à une tâche. Le problème visé est celui de la coordination longue durée chez les robots humanoïdes : enchaîner marche, atteinte et préhension sur des séquences complexes sans dépendre d'automates codés à la main, un goulot d'étranglement que les démonstrations courtes de nombreux acteurs du secteur (modèles VLA type Pi-0, GR00T N2 ou Helix) laissent souvent dans l'ombre. En remplaçant la planification scriptée par un modèle du monde appris, capable de projeter les conséquences de décisions latentes avant de les exécuter, LUCID propose une alternative architecturale aux pipelines VLA end-to-end dominants, ce qui intéresse directement les intégrateurs cherchant à fiabiliser des tâches multi-étapes en logistique ou en usine plutôt qu'à empiler des démonstrations isolées. Il s'agit toutefois d'une contribution strictement académique et simulée : aucun robot physique, aucune entreprise ni aucun site de déploiement n'est mentionné dans l'abstract, et les gains rapportés portent uniquement sur des environnements de simulation de réarrangement d'objets, sans chiffres de charge utile, de degrés de liberté ou de temps de cycle réels. LUCID s'inscrit dans la lignée des travaux sur les modèles du monde appliqués à la robotique (dans l'esprit de Dreamer ou TD-MPC), en offrant une voie hiérarchique et modulaire face à l'approche monolithique des modèles VLA. Aucun essai matériel, partenariat industriel ou calendrier de transfert vers un robot réel n'est annoncé à ce stade.

RecherchePaper
1 source