Aller au contenu principal
InterEvolve : évolution à l'inférence des programmes de récompense pour la loco-manipulation humanoïde
RecherchearXiv cs.RO 

InterEvolve : évolution à l'inférence des programmes de récompense pour la loco-manipulation humanoïde

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.02196) InterEvolve, une méthode qui permet à un humanoïde de résoudre des tâches de locomanipulation pour lesquelles son contrôleur n'a jamais été entraîné, sans réentraînement. Le système repose sur un modèle fondation comportemental « forward-backward » (FB) sensible aux objets. Des résidus d'objet, ajoutés à un modèle de corps gelé, convertissent au moment du test une nouvelle récompense, portant sur le corps ou sur les objets, en comportement de locomanipulation. Les tâches sont décrites par des « programmes de récompense » : des récompenses par étapes, avec conditions d'achèvement et constantes ajustables. Un agent LLM révise la structure du programme en contexte, à partir des retours d'exécution et d'une bibliothèque de programmes vérifiés. Un optimiseur numérique règle les constantes. Chaque candidat est validé dans plusieurs scénarios de simulation parallèles. Les compétences évoluées ont été exécutées de façon autonome sur un Unitree G1 physique, à partir de la perception égocentrique embarquée. Le résumé ne donne ni taux de réussite, ni temps de cycle, ni nombre d'itérations.

L'intérêt est de déplacer l'effort d'ingénierie. Au lieu de collecter des démonstrations ou de relancer un entraînement par renforcement pour chaque nouvelle tâche, on suppose qu'un contrôleur généraliste contient déjà l'essentiel de la compétence motrice, et on la rend accessible par une interface de planification expressive, exécutable et mesurable. Les auteurs affirment que les récompenses conçues à la main laissent inexploitée une grande part des capacités du modèle FB, et que les programmes évolués les libèrent, parfois par des stratégies inédites. Pour un intégrateur, la promesse est une adaptation à de nouvelles tâches sans nouveau cycle d'entraînement. Les limites sont nettes : la validation est surtout en simulation, la démonstration physique se limite à une plateforme, le G1, et aucune comparaison chiffrée n'est donnée dans le résumé. L'écart entre simulation et réalité reste donc à mesurer sur des tâches industrielles.

Ce travail s'inscrit dans deux courants. Le premier est celui des modèles fondation comportementaux et des contrôleurs généralistes pour humanoïdes, qui visent un contrôle du corps entier réutilisable. Le second est la conception de récompenses par LLM, déjà explorée avec des approches comme Eureka. InterEvolve y ajoute une mémoire sous forme de bibliothèque de compétences vérifiées, ainsi qu'une vérification parallèle en simulation. Il se distingue des approches VLA (vision-langage-action) comme Pi-0, Helix ou GR00T, qui apprennent directement une politique à partir de données. Ici, le LLM fait de la planification et de l'optimisation, et le contrôle bas niveau reste figé. Le G1, très répandu en recherche, est la plateforme de démonstration habituelle. Les prochaines étapes à surveiller sont la publication du code, des évaluations sur d'autres robots et des tâches plus longues en conditions réelles.

À lire aussi

FRAMES : récupération après échec et surveillance des compétences incarnées pour la loco-manipulation humanoïde
1arXiv cs.RO 

FRAMES : récupération après échec et surveillance des compétences incarnées pour la loco-manipulation humanoïde

Des chercheurs présentent FRAMES (Failure Recovery And Monitoring of Embodied Skills), un framework de supervision pour le robot humanoïde Unitree G1, publie sur arXiv le 22 septembre 2026 sous la référence 2609.22538. Le système se greffe au-dessus du contrôleur corps entier CEER et articule trois agents: un Planner Agent qui décompose une instruction en langage naturel en sous-taches via des compétences paramétrées, un Monitor Agent base sur un modèle vision-langage qui évalué chaque compétence a partir d'observations multi-vues temporelles et de preuves de contact du robot, et un Recovery Agent qui reçoit un retour d'échec circonstancie pour corriger l'exécution. Un module mémoire réutilisé l'expérience de compétences passées, complète par un ancrage géométrique via cartes de profondeur et segmentation. Les auteurs ont teste isolement le module de surveillance dans le simulateur MuJoCo, sur 100 essais repartis en 50 exécutions ratées et 50 réussies, couvrant cinq taches de loco-manipulation. Le moniteur détecte 48 des 50 échecs et valide correctement 46 des 50 réussites, pour une précision globale de 94,0%. Ce résultat cible un angle mort connu des pipelines robotiques bases sur des planificateurs LLM: choisir la bonne compétence ne garantit pas son exécution physique, et une seule erreur d'approche, de prise, de transport ou de dépôt peut invalider un plan long-horizon entier. En isolant et en validant un module de détection d'échec avant de boucler la récupération complète, les auteurs apportent une preuve partielle mais concrète que la supervision par modèle vision-langage peut distinguer succès et échec avec une fiabilité mesurable, plutôt que d'empiler des compétences sans contrôle qualité. Pour les intégrateurs et décideurs qui évaluent des humanoïdes pour la loco-manipulation industrielle, ce travail rappelle que la robustesse opérationnelle reste distincte de la réussite d'une démonstration isolée, et que la détection d'échec en temps réel devient une brique nécessaire avant tout déploiement a l'échelle. Le papier reste explicite sur les limites de sa propre validation. FRAMES s'inscrit dans la lignée des architectures combinant planification par grands modèles de langage et bibliothèques de compétences réutilisables pour piloter des humanoïdes, approche désormais courante face a la multiplication des contrôleurs corps entier comme CEER sur la plateforme Unitree G1. L'apport du papier est de traiter la surveillance et la récupération d'échec comme un module a part entière plutôt que comme un correctif ad hoc, avec une architecture a mémoire capitalisant sur les exécutions passées. Les auteurs précisent que seule la brique de surveillance a été validée indépendamment, en simulation, et que l'évaluation de bout en bout de la boucle complète de récupération, avec Planner et Recovery Agent opérant ensemble sur le robot réel, reste en cours. Le passage de ces résultats simules a une validation sur le G1 physique constituera le prochain jalon déterminant pour juger de la maturité réelle de l'approche.

RecherchePaper
1 source
GaitSpan : de la marche à la course, l'évolution progressive de la locomotion humanoïde
2arXiv cs.RO 

GaitSpan : de la marche à la course, l'évolution progressive de la locomotion humanoïde

GaitSpan est un nouveau framework d'apprentissage présente dans un preprint arXiv (2607.12114v1, publie en juillet 2026) qui permet a une politique de contrôle humanoïde pretrainee sur la marche de s'étendre vers des allures plus rapides, jogging et course, sans réapprentissage complet. Le système traite la marche comme une "compétence germe" (seed skill), c'est a dire une structure motrice réutilisable pour l'équilibre, le support, la coordination du corps et les transitions de contact, qui est ensuite régénérée a de nouveaux rythmes, étendue en foulées plus longues et plus hautes, puis corrigée par une adaptation résiduelle. La méthode combine trois mécanismes: une génération de rythme qui module la politique de marche figée via plusieurs horloges internes et apprend des combinaisons conditionnées par des commandes de vitesse; un façonnage de foulée qui récompense des schémas de locomotion dynamique adaptes aux vitesses élevées, inspire de la dynamique du pendule inverse a ressort (spring-loaded inverted pendulum); et une adaptation résiduelle qui capture les détails de mouvement non couverts par les deux premiers mécanismes. Selon les auteurs, GaitSpan est la première politique humanoïde unique, conditionnée par commande, a couvrir un spectre continu allant de la marche au jogging jusqu'a des régimes proches de la course, tout en se transférant a différentes morphologies de robots et en se déployant en zero-shot sur des terrains simules inédits comme sur des terrains réels. Pour l'industrie de la robotique humanoïde, cela répond a une limite récurrente des approches actuelles: les stratégies existantes de diversification des allures, qu'elles reposent sur des calendriers de démarche prédéfinis, l'imitation de clips de mouvement humain, l'entrainement d'experts spécialisés ou la distillation de plusieurs compétences en une seule politique, restent rigides face a des commandes de vitesse continues, des terrains varies et des changements de morphologie. Une politique capable de généraliser la course a partir d'une base de marche déjà maîtrisée réduirait le cout d'ingénierie et accélèrerait le déploiement sur des plateformes variées. Comparee aux approches de référence utilisant plusieurs experts ou l'imitation de démonstrations humaines, GaitSpan apprend plus vite et obtient de meilleures performances de démarche, selon les tests rapportes par les auteurs. Le papier s'inscrit dans la lignée des travaux récents sur les politiques VLA et d'apprentissage par renforcement pour la locomotion humanoïde, ou la question du transfert sim-to-real et de la généralisation entre vitesses et terrains reste un enjeu central de robustesse avant déploiement industriel a grande échelle.

RecherchePaper
1 source
CEER2 : compliance directionnelle et réglable de l'effecteur final et de la base pour la loco-manipulation humanoïde
3arXiv cs.RO 

CEER2 : compliance directionnelle et réglable de l'effecteur final et de la base pour la loco-manipulation humanoïde

Des chercheurs publient CEER2, un cadre de contrôle de compliance pour la manipulation et la locomotion de robots humanoïdes (loco-manipulation), décrit dans un preprint arXiv (2609.38709). Le système combine deux briques. La première est une compliance directionnelle et réglable des effecteurs (EE, les mains ou les pinces), c'est-à-dire une raideur qui varie selon l'axe : le robot peut céder à une force de contact dans une direction tout en gardant sa précision de mouvement dans une autre. La seconde est une compliance sélectionnable du tronc (« root »), qui permet à la base du robot soit de rejeter une force externe, soit de la suivre. L'architecture est hiérarchique : un contrôleur d'apprentissage par renforcement module, par des commandes de haut niveau sur les effecteurs et le tronc, une politique de suivi de mouvement du corps entier qui reste figée. Les forces d'interaction ne sont pas mesurées par des capteurs dédiés. Elles sont estimées à partir de l'historique proprioceptif. Les essais, en simulation puis sur un humanoïde réel, couvrent le contrôle directionnel de la raideur, son ajustement en ligne, des comportements distincts du tronc, la manipulation compliante et le portage collaboratif. Le résumé ne précise ni le modèle de robot, ni les valeurs de raideur, ni les taux de réussite. L'enjeu est concret pour l'industrie. Les humanoïdes savent de mieux en mieux reproduire des mouvements complexes du corps entier, mais le contact physique reste le point faible : essuyer une surface, insérer une pièce, ouvrir une porte ou porter une charge avec un opérateur exigent de répondre à la force sans perdre la trajectoire utile. L'estimation de force par proprioception, sans capteurs force-couple aux poignets, pourrait réduire le coût et la fragilité du matériel, ce qui compte pour un intégrateur. Le fait de ne pas réentraîner la politique de base, mais de la moduler par une couche supérieure, laisse aussi espérer une réutilisation sur d'autres tâches. Deux réserves s'imposent. Il s'agit d'un preprint sans validation par les pairs, et la démonstration sur une seule plateforme ne dit rien de la robustesse sur des cycles longs, avec des charges variées ou en environnement industriel non contrôlé. Ce travail s'inscrit dans un mouvement plus large où les politiques de suivi de mouvement appris (reinforcement learning en simulation, transfert au réel) ont rendu la locomotion humanoïde fiable, et où l'interaction avec les forces devient le front suivant. Il rejoint les recherches sur le contrôle d'impédance appris, la loco-manipulation de corps entier et les modèles vision-langage-action (VLA) qui dominent les annonces des acteurs commerciaux, souvent peu explicites sur la gestion du contact. Les auteurs mettent en avant le portage collaboratif humain-robot, cas d'usage pertinent pour la logistique et l'assistance. Les suites probables sont des tests sur des tâches contact-riches plus longues, des comparaisons chiffrées avec des contrôleurs classiques d'impédance ou d'admittance, et une intégration avec des politiques de haut niveau.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
KINO : une interface à images-clés pour la planification par VLM et le contrôle du corps entier en loco-manipulation humanoïde
4arXiv cs.RO 

KINO : une interface à images-clés pour la planification par VLM et le contrôle du corps entier en loco-manipulation humanoïde

Des chercheurs présentent KINO (arXiv:2609.18869v1), un framework hiérarchique pour la loco-manipulation de robots humanoïdes qui insère des « keyframes » de mouvement comme représentation intermédiaire entre un modèle vision-langage (VLM) chargé de la planification et un contrôleur par renforcement (RL) chargé de l'exécution corps entier. Chaque keyframe encode une pose cible pour l'ensemble du corps du robot et, si nécessaire, la pose de l'objet manipulé. À partir d'une instruction en langage naturel, d'observations de la scène et d'un retour d'exécution, le VLM sélectionne successivement des keyframes pertinentes dans une bibliothèque prédéfinie ; ces keyframes sont ensuite réajustées à la scène courante pour tenir compte de la position et des dimensions des objets, avant qu'une politique conditionnée par keyframe ne génère les actions articulaires. Les auteurs introduisent une stratégie d'échantillonnage de keyframes basée sur la saillance pour l'entraînement de la politique bas niveau, qui fait passer le taux de réussite de bout en bout de 44 % à 92 % lorsque le VLM ne fournit que des keyframes éparses. Le système a été évalué sur des tâches de prise, transport et dépose d'objets, en simulation et sur un humanoïde Unitree G1, avec manipulation à une et deux mains. Ce résultat s'inscrit dans un débat central du secteur robotique : comment relier des modèles vision-langage capables de raisonner sur des instructions abstraites à des contrôleurs bas niveau capables de produire des mouvements corps entier stables. Plutôt que de miser sur une architecture VLA (vision-language-action) de bout en bout, à l'image de Pi-0, GR00T N2 ou Helix, KINO mise sur une représentation intermédiaire discrète et interprétable, ce qui pourrait faciliter le débogage et le contrôle qualité pour des intégrateurs industriels tout en limitant la fréquence des appels au VLM, coûteux en calcul. Le saut de 44 % à 92 % de succès reste toutefois une mesure obtenue en conditions contrôlées de recherche, pas un chiffre de déploiement industriel, et mériterait d'être confirmé sur des tâches plus variées. Le travail s'inscrit dans la vague de recherches académiques cherchant à rendre les humanoïdes capables de manipulation généraliste sans réentraînement massif pour chaque nouvelle scène, un axe exploré en parallèle par les architectures VLA de Physical Intelligence, NVIDIA ou Figure. Le choix du Unitree G1, plateforme humanoïde accessible et déjà utilisée dans de nombreux laboratoires, en fait un banc d'essai plutôt qu'un produit fini : aucun partenariat industriel ni calendrier de commercialisation n'est mentionné dans l'article. Les auteurs indiquent que le système généralise à des emplacements de dépose non vus pendant l'entraînement, un point clé pour juger de sa robustesse au-delà des démonstrations sélectionnées, mais le nombre d'essais et les conditions exactes de ces tests de généralisation ne sont pas précisés.

RecherchePaper
1 source