Aller au contenu principal
RecherchearXiv cs.RO 

CEER2 : compliance directionnelle et réglable de l'effecteur final et de la base pour la loco-manipulation humanoïde

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient CEER2, un cadre de contrôle de compliance pour la manipulation et la locomotion de robots humanoïdes (loco-manipulation), décrit dans un preprint arXiv (2609.38709). Le système combine deux briques. La première est une compliance directionnelle et réglable des effecteurs (EE, les mains ou les pinces), c'est-à-dire une raideur qui varie selon l'axe : le robot peut céder à une force de contact dans une direction tout en gardant sa précision de mouvement dans une autre. La seconde est une compliance sélectionnable du tronc (« root »), qui permet à la base du robot soit de rejeter une force externe, soit de la suivre. L'architecture est hiérarchique : un contrôleur d'apprentissage par renforcement module, par des commandes de haut niveau sur les effecteurs et le tronc, une politique de suivi de mouvement du corps entier qui reste figée. Les forces d'interaction ne sont pas mesurées par des capteurs dédiés. Elles sont estimées à partir de l'historique proprioceptif. Les essais, en simulation puis sur un humanoïde réel, couvrent le contrôle directionnel de la raideur, son ajustement en ligne, des comportements distincts du tronc, la manipulation compliante et le portage collaboratif. Le résumé ne précise ni le modèle de robot, ni les valeurs de raideur, ni les taux de réussite.

L'enjeu est concret pour l'industrie. Les humanoïdes savent de mieux en mieux reproduire des mouvements complexes du corps entier, mais le contact physique reste le point faible : essuyer une surface, insérer une pièce, ouvrir une porte ou porter une charge avec un opérateur exigent de répondre à la force sans perdre la trajectoire utile. L'estimation de force par proprioception, sans capteurs force-couple aux poignets, pourrait réduire le coût et la fragilité du matériel, ce qui compte pour un intégrateur. Le fait de ne pas réentraîner la politique de base, mais de la moduler par une couche supérieure, laisse aussi espérer une réutilisation sur d'autres tâches. Deux réserves s'imposent. Il s'agit d'un preprint sans validation par les pairs, et la démonstration sur une seule plateforme ne dit rien de la robustesse sur des cycles longs, avec des charges variées ou en environnement industriel non contrôlé.

Ce travail s'inscrit dans un mouvement plus large où les politiques de suivi de mouvement appris (reinforcement learning en simulation, transfert au réel) ont rendu la locomotion humanoïde fiable, et où l'interaction avec les forces devient le front suivant. Il rejoint les recherches sur le contrôle d'impédance appris, la loco-manipulation de corps entier et les modèles vision-langage-action (VLA) qui dominent les annonces des acteurs commerciaux, souvent peu explicites sur la gestion du contact. Les auteurs mettent en avant le portage collaboratif humain-robot, cas d'usage pertinent pour la logistique et l'assistance. Les suites probables sont des tests sur des tâches contact-riches plus longues, des comparaisons chiffrées avec des contrôleurs classiques d'impédance ou d'admittance, et une intégration avec des politiques de haut niveau.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

FRAMES : récupération après échec et surveillance des compétences incarnées pour la loco-manipulation humanoïde
1arXiv cs.RO 

FRAMES : récupération après échec et surveillance des compétences incarnées pour la loco-manipulation humanoïde

Des chercheurs présentent FRAMES (Failure Recovery And Monitoring of Embodied Skills), un framework de supervision pour le robot humanoïde Unitree G1, publie sur arXiv le 22 septembre 2026 sous la référence 2609.22538. Le système se greffe au-dessus du contrôleur corps entier CEER et articule trois agents: un Planner Agent qui décompose une instruction en langage naturel en sous-taches via des compétences paramétrées, un Monitor Agent base sur un modèle vision-langage qui évalué chaque compétence a partir d'observations multi-vues temporelles et de preuves de contact du robot, et un Recovery Agent qui reçoit un retour d'échec circonstancie pour corriger l'exécution. Un module mémoire réutilisé l'expérience de compétences passées, complète par un ancrage géométrique via cartes de profondeur et segmentation. Les auteurs ont teste isolement le module de surveillance dans le simulateur MuJoCo, sur 100 essais repartis en 50 exécutions ratées et 50 réussies, couvrant cinq taches de loco-manipulation. Le moniteur détecte 48 des 50 échecs et valide correctement 46 des 50 réussites, pour une précision globale de 94,0%. Ce résultat cible un angle mort connu des pipelines robotiques bases sur des planificateurs LLM: choisir la bonne compétence ne garantit pas son exécution physique, et une seule erreur d'approche, de prise, de transport ou de dépôt peut invalider un plan long-horizon entier. En isolant et en validant un module de détection d'échec avant de boucler la récupération complète, les auteurs apportent une preuve partielle mais concrète que la supervision par modèle vision-langage peut distinguer succès et échec avec une fiabilité mesurable, plutôt que d'empiler des compétences sans contrôle qualité. Pour les intégrateurs et décideurs qui évaluent des humanoïdes pour la loco-manipulation industrielle, ce travail rappelle que la robustesse opérationnelle reste distincte de la réussite d'une démonstration isolée, et que la détection d'échec en temps réel devient une brique nécessaire avant tout déploiement a l'échelle. Le papier reste explicite sur les limites de sa propre validation. FRAMES s'inscrit dans la lignée des architectures combinant planification par grands modèles de langage et bibliothèques de compétences réutilisables pour piloter des humanoïdes, approche désormais courante face a la multiplication des contrôleurs corps entier comme CEER sur la plateforme Unitree G1. L'apport du papier est de traiter la surveillance et la récupération d'échec comme un module a part entière plutôt que comme un correctif ad hoc, avec une architecture a mémoire capitalisant sur les exécutions passées. Les auteurs précisent que seule la brique de surveillance a été validée indépendamment, en simulation, et que l'évaluation de bout en bout de la boucle complète de récupération, avec Planner et Recovery Agent opérant ensemble sur le robot réel, reste en cours. Le passage de ces résultats simules a une validation sur le G1 physique constituera le prochain jalon déterminant pour juger de la maturité réelle de l'approche.

RecherchePaper
1 source
HuGo : des LLM comme concepteurs de code de politique corps entier pour la loco-manipulation humanoïde
2arXiv cs.RO 

HuGo : des LLM comme concepteurs de code de politique corps entier pour la loco-manipulation humanoïde

Le laboratoire ICON Lab, associé à Negar Mehr et présenté sur iconlab.negarmehr.com, publie sur arXiv (2609.30594) une méthode nommée HuGo, pour Humanoid policy code Generation. Un grand modèle de langage y génère, à partir d'une description de tâche, du code exécutable en boucle fermée qui pilote un humanoïde au-dessus d'une politique de contrôle corps entier bas niveau laissée figée. Ce code est ensuite affiné automatiquement grâce aux trajectoires numériques et à des images vidéo sélectionnées des essais, sans récompense ni démonstration spécifiques à la tâche. Sur cinq tâches de loco-manipulation simulées et deux politiques bas niveau, HuGo dépasse nettement une base d'apprentissage par renforcement et se rapproche d'une base fondée sur des démonstrations ; un transfert zero-shot vers du matériel réel est également rapporté, amélioré par la même boucle d'affinement appliquée aux essais réels, sans démonstration experte ni réentraînement. Ce travail cible un goulot d'étranglement connu de la robotique humanoïde : produire une politique de loco-manipulation par tâche exige aujourd'hui une ingénierie de récompense coûteuse ou la collecte de démonstrations suivie d'un entraînement dédié, deux voies difficiles à faire passer à l'échelle. En déplaçant la logique de tâche vers du code généré par un LLM plutôt que vers des poids appris, HuGo se positionne comme une alternative aux modèles vision-langage-action tels que Pi-0, GR00T N2 ou Helix, qui reposent sur de vastes jeux de démonstrations pour entraîner des politiques bout en bout. Si l'approche se confirme à plus grande échelle, elle ouvrirait une voie moins gourmande en données pour ajouter des tâches à un humanoïde déjà déployé, un enjeu que suivent de près les intégrateurs. Le périmètre testé, cinq tâches simulées, reste restreint et appelle vérification sur des benchmarks plus larges. Cette publication s'inscrit dans une lignée de recherches sur le contrôle hiérarchique, où une couche bas niveau entraînée une fois reste figée pendant qu'une couche supérieure générée par LLM pilote la tâche. Il s'agit pour l'instant d'un preprint arXiv classé comme nouvelle soumission, sans robot ni entreprise commerciale nommés ni pilote industriel annoncé. Les auteurs renvoient vers le site du projet, iconlab.negarmehr.com/HuGo, pour les démonstrations, sans calendrier pour une extension à davantage de tâches ou de plateformes.

RecherchePaper
1 source
Un système rapide, résilient et adaptable pour les comportements de loco-manipulation des robots humanoïdes
3arXiv cs.RO 

Un système rapide, résilient et adaptable pour les comportements de loco-manipulation des robots humanoïdes

Une équipe de recherche a publié le 2 septembre 2026 sur arXiv (2609.01518) un système d'architecture comportementale pour la loco-manipulation sur robots humanoïdes, conçu pour tourner localement et être modifié en temps réel pendant l'exécution. L'architecture combine des Affordance Templates centrées objets, une structure en arbre organisant la logique des tâches, et une scène de perception éditable au runtime, exécutée par un contrôleur corps entier combinant marche et mouvements du buste, avec une interface opérateur synchronisée en continu pour superviser et corriger à la volée. Testé sur un Unitree H1-2 et un second robot nommé Alex sur six variantes de tâches, le système franchit une porte à pousser en 34 secondes et trie six balles par couleur en 45 secondes sous perturbation humaine directe. Des sessions d'autorat chronométrées montrent la création ou l'adaptation d'un comportement de loco-manipulation en quelques heures. Ce résultat nuance un discours dominant dans la robotique humanoïde, où la performance repose de plus en plus sur des modèles vision-langage-action entraînés de bout en bout, à la manière de Pi-0, GR00T N2 ou Helix. Les auteurs affirment que leur approche, explicitement programmée plutôt qu'apprise, reste compétitive face à ces systèmes récents, tout en offrant un avantage opérationnel : créer ou corriger un comportement en heures plutôt qu'en semaines de collecte de données. Pour les intégrateurs et décideurs industriels, cela ouvre une voie alternative moins dépendante de gigantesques jeux de démonstrations, potentiellement plus rapide à auditer sur site, même si les chiffres de cycle avancés restent issus de démonstrations contrôlées. Le travail s'inscrit dans la course à l'autonomie des humanoïdes pour des tâches physiquement pénibles, dangereuses ou répétitives, un terrain disputé par Figure AI avec Figure 03, Tesla avec Optimus Gen 3 ou NVIDIA avec GR00T, majoritairement pariés sur l'apprentissage à grande échelle. En misant sur une architecture éditable localement et supervisée par un opérateur, les auteurs positionnent leur système comme complémentaire, voire alternatif, à ces approches pilotées par les données. Aucun acteur français ou européen n'est cité, et cette publication reste à ce stade une contribution de recherche sur arXiv plutôt qu'un produit commercialisé, sans calendrier annoncé de pilotes au-delà des six tâches démontrées.

RecherchePaper
1 source
OmniContact : enchaînement de méta-compétences par flux de contact pour la loco-manipulation humanoïde généralisable
4arXiv cs.RO 

OmniContact : enchaînement de méta-compétences par flux de contact pour la loco-manipulation humanoïde généralisable

Des chercheurs ont publié le 26 juin 2026 sur arXiv (réf. 2606.26201) un framework hiérarchique baptisé OmniContact, conçu pour enchaîner des séquences complexes de locomotion et manipulation sur des humanoïdes. Le coeur du système est une représentation intermédiaire appelée "contact flow" (CF): trajectoires corporelles clés et signaux binaires de contact en série temporelle. Deux modules s'appuient dessus, CF-Track (politique bas-niveau, bibliothèque de compétences unifiée) et CF-Gen (planificateur haut-niveau heuristique qui synthétise les séquences futures). En simulation, les résultats annoncés atteignent 98,7% de succès sur la tâche "Carry Box" et 76,5% sur "Push-Stack Boxes", soit respectivement +40,9% et +66,5% face aux baselines sur l'exécution de méta-compétences et leur enchaînement. Le dataset OmniContact, constitué via capture de mouvement (MoCap) d'interactions humain-objet, supporte l'entraînement. Le vrai défi des humanoïdes industriels n'est pas l'exécution d'un geste unitaire mais l'enchaînement robuste de séquences longues avec récupération autonome en cas de défaillance, ce verrou précis que OmniContact cible. Le système propose une interface structurée lisible par le planificateur haut-niveau, une voie médiane entre représentations explicites trop rigides pour la planification et embeddings implicites trop opaques pour la composition fiable. L'intégration avec des VLMs (Vision-Language Models) permettrait des instructions en langage naturel converties en séquences de contact flows, comme l'illustre la démonstration d'arrangement de boîtes en forme de coeur. Nuance importante: toutes les métriques publiées sont issues de conditions contrôlées en laboratoire, sans validation sur hardware physique ni déploiement industriel réel, ce qui laisse entier le problème du sim-to-real. La loco-manipulation longue horizon est devenu le benchmark officieux du secteur humanoïde en 2025-2026. Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (pi0) et Boston Dynamics s'affrontent sur des tâches de plus en plus généralisables, tandis que NVIDIA pousse GR00T N2 comme couche de policy universelle. OmniContact vient du monde académique, sans entreprise identifiée derrière ce preprint, mais son approche par contact flow s'inscrit dans la tendance des représentations intermédiaires structurées, en parallèle des architectures VLA à diffusion. La collecte MoCap dédiée aux interactions humain-objet sur humanoïdes confirme que les données de référence restent un goulot d'étranglement même quand la simulation abonde. La prochaine étape déterminante sera le transfert sur un humanoïde physique, condition sine qua non pour que ce framework passe du laboratoire au hangar.

RecherchePaper
1 source