Aller au contenu principal
RecherchearXiv cs.RO 

Humanoid Horizon : allonger l'horizon des tâches de loco-manipulation du corps entier par entraînement parallèle, démarrage dynamique et filtrage de la récompense

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent Humanoid Horizon, un cadre de politique unifiée pour qu'un robot humanoïde enchaîne, en un seul épisode ininterrompu, la navigation, la saisie, le transport et le placement précis de plusieurs objets lourds ou volumineux dans un intérieur encombré. Trois mécanismes le composent. Le Parallel Training Strategy répartit N scènes en S flux d'étapes concurrents, tous pilotés par une politique partagée, si bien que chaque étape de transport reçoit des mises à jour de gradient en continu. Le Dynamic Starting Mechanism réinitialise l'état de départ de chaque environnement avec les états terminaux issus des déroulés des étapes amont, ce qui élargit progressivement la couverture des transitions. Enfin, le Reward Gating annule la récompense pour le reste de l'épisode, dans les flux des étapes ultérieures, lorsque l'objet précédent est déplacé au-delà d'un seuil. Sur le benchmark LHM-Humanoid à deux objets (350 scènes d'entraînement, 66 scènes de test non vues), la méthode dépasse 80 % de réussite par étape. Au-delà de deux objets, le taux de succès baisse avec l'horizon, mais de façon graduelle, alors que tous les baselines comparés chutent brutalement.

L'intérêt de ce travail tient à un verrou concret de la manipulation mobile humanoïde : tenir une tâche longue sans que les étapes tardives dégradent les précédentes. Les auteurs identifient deux modes d'échec qui expliquent pourquoi les politiques de bout en bout s'effondrent sur les longues séquences. Le premier est le biais de récompense facile, où l'entraînement sur-optimise les premières étapes de transport. Le second est l'oubli catastrophique, où se concentrer sur les dernières étapes fait régresser les premières. Le Reward Gating est notable pour un cas d'usage logistique : il apprend à la politique à ne pas perturber un objet qui vient d'être posé, une exigence évidente en entrepôt ou en intérieur domestique. Il faut toutefois relativiser. Les résultats portent sur un benchmark, apparemment en simulation, avec seulement deux objets pour le chiffre phare de 80 %. Le texte ne mentionne ni transfert sim-to-real, ni robot physique, ni temps de cycle, ni payload précis. Il ne prouve donc pas qu'un déploiement industriel soit prêt, mais il apporte une recette d'entraînement reproductible.

Ce travail s'inscrit dans la montée de l'apprentissage par renforcement pour la locomanipulation du corps entier, qui se heurte aux horizons longs, où les récompenses sont éparses et où les erreurs s'accumulent d'une étape à l'autre. Il se place face aux approches séquentielles, qui entraînent les étapes l'une après l'autre, et face aux baselines non nommés dans le résumé, sur lesquels la comparaison reste à examiner dans l'article complet. Le débat plus large oppose les politiques VLA généralistes, portées par des acteurs comme Figure avec Helix ou NVIDIA avec GR00T, aux politiques de contrôle entraînées en simulation, dont celle-ci relève. Les prochaines étapes à surveiller sont la validation sur matériel réel, le passage à trois objets ou plus avec une dégradation maîtrisée et la publication du code et du benchmark pour permettre une réplication indépendante.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Sumo : la loco-manipulation dynamique et généralisable du corps entier
1arXiv cs.RO 

Sumo : la loco-manipulation dynamique et généralisable du corps entier

Un institut de recherche a publié via arXiv (article 2604.08508, troisième révision) un travail intitulé "Sumo: Dynamic and Generalizable Whole-Body Loco-Manipulation", mené sur les serveurs du RAI Institute (ex-Boston Dynamics AI Institute, hébergé sur rai-inst.com). La méthode combine sim-to-real et pilotage en temps réel: une politique de contrôle corps entier pré-entraînée est guidée au moment de l'exécution par un planificateur basé sur l'échantillonnage, sans réentraînement supplémentaire. Les chercheurs ont testé l'approche sur un robot quadrupède Spot (Boston Dynamics) dans le monde réel, avec deux tâches marquantes: redresser un pneu plus lourd que la capacité de levage nominale du robot, et traîner une barrière anti-émeute plus grande et plus haute que l'engin lui-même. Le système s'est aussi montré capable de généraliser à une variété d'objets et de tâches sans réglage additionnel, la fonction de coût pouvant être ajustée à la volée. En simulation uniquement, les auteurs étendent la méthode à un humanoïde pour ouvrir une porte et pousser une table. Code et vidéos sont publiés sur sumo.rai-inst.com. L'intérêt principal tient à la généralisation obtenue sans réentraînement par objet: une seule politique, pilotée différemment selon le contexte, remplace la logique habituelle d'entraînement dédié à chaque tâche de manipulation. Pour les intégrateurs et les équipes de R&D en robotique mobile, cela suggère une voie pour dépasser les limites de charge utile nominale annoncées par les constructeurs, un enjeu concret en logistique, chantier ou intervention d'urgence où les objets à déplacer dépassent souvent les specs du robot. Il faut toutefois noter que les résultats humanoïdes ne sont validés qu'en simulation, sans transfert réel démontré, et qu'aucun chiffre précis de masse, de temps de cycle ou de taux de réussite n'est communiqué dans le résumé, ce qui invite à la prudence avant de parler de percée généralisée. Le RAI Institute a été fondé par Marc Raibert, également fondateur de Boston Dynamics, comme structure de recherche indépendante à but non lucratif détachée de la feuille de route produit de Boston Dynamics. Spot reste la plateforme quadrupède commerciale de Boston Dynamics, ici réutilisée comme banc d'essai académique plutôt que comme produit vendu. Ce travail se distingue des approches dominantes du moment fondées sur des modèles vision-langage-action comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, en misant sur la planification par échantillonnage plutôt que sur un grand modèle appris de bout en bout. Les prochaines étapes attendues concernent la validation réelle du volet humanoïde, actuellement cantonné à la simulation.

RecherchePaper
1 source
MASkillBlender : coordination décentralisée du corps entier pour la loco-manipulation multi-humanoïdes par fusion de compétences
2arXiv cs.RO 

MASkillBlender : coordination décentralisée du corps entier pour la loco-manipulation multi-humanoïdes par fusion de compétences

Des chercheurs publient sur arXiv (2610.01102) MASkillBlender, un cadre d'apprentissage par renforcement multi-agent (MARL) destiné à la coordination décentralisée de plusieurs humanoïdes pour des tâches de locomanipulation, c'est-à-dire des tâches où les robots marchent et manipulent des objets en même temps. Le principe tient en deux étages. Des compétences de corps entier, pré-entraînées pour un humanoïde seul, servent de briques réutilisables. Une politique de haut niveau, partagée et décentralisée, apprend ensuite à les combiner à partir de récompenses au niveau de la tâche uniquement. Elle n'a besoin ni de trajectoires de référence propres à chaque tâche, ni de l'ingénierie de récompense lourde que demandent d'ordinaire les approches existantes. Les auteurs ajoutent une augmentation de données par permutation pour les systèmes homogènes. Elle exploite l'interchangeabilité des robots identiques. Ils démontrent aussi que les échantillons permutés conservent la direction du gradient de politique de l'échantillon d'origine dans le formalisme du jeu de Markov homogène. L'évaluation couvre plusieurs tâches de coordination et deux morphologies d'humanoïdes, uniquement en simulation. L'intérêt tient au verrou que visent les auteurs. Le contrôle corps entier d'un seul humanoïde progresse, mais le passage à plusieurs robots fait exploser la dimension de l'espace d'action, impose une prise de décision décentralisée et complique le passage à l'échelle. Réutiliser des compétences individuelles comme primitives, plutôt que d'apprendre chaque tâche coopérative de zéro, est une piste crédible pour déplacer des charges encombrantes à deux ou plus, ce qui concerne la logistique et la manutention. Les résultats sont pourtant limités. Ils portent sur la simulation, sans transfert sim-to-real, sans matériel réel et sans chiffres publiés dans le résumé (taux de réussite, nombre de robots, temps d'entraînement). La mention de performances « fortes » reste donc à vérifier dans l'article complet. Rien ne prouve non plus que les compétences mélangées tiendront face aux contacts, aux délais de communication et aux écarts de dynamique du monde réel. Ce travail relève de la recherche académique, pas d'un produit ni d'un déploiement. Le contexte est celui d'un champ qui s'est d'abord concentré sur la locomotion et la manipulation d'un humanoïde isolé, avec des politiques apprises en simulation puis transférées. La coordination multi-robots reposait souvent sur des conceptions spécifiques à chaque tâche ou sur des références de mouvement coûteuses à produire. MASkillBlender se rattache à cette lignée de travaux sur le mélange de compétences, qu'il étend au cadre multi-agent. Les acteurs industriels qui visent des flottes d'humanoïdes en entrepôt ou en usine misent surtout sur des modèles généralistes de type VLA et sur des déploiements monorobot. La coordination décentralisée de plusieurs humanoïdes reste, elle, peu abordée publiquement. Les prochaines étapes à surveiller sont la validation sur robots physiques, le passage à davantage d'agents et une comparaison chiffrée avec les méthodes centralisées.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Vers un modèle généraliste de locomanipulation humanoïde par préentraînement sur des données humaines égocentriques du corps entier
3arXiv cs.RO 

Vers un modèle généraliste de locomanipulation humanoïde par préentraînement sur des données humaines égocentriques du corps entier

Des chercheurs publient λ0, une politique vision-langage-action (VLA) pour humanoïde qui pilote l'ensemble du corps, c'est-à-dire la locomotion, la posture, la manipulation à deux mains et les mouvements de doigts. Le travail repose sur HumanVerse-500, un jeu de données de 500 heures de comportements humains de locomanipulation en environnements ouverts. Il a été collecté avec un système portable léger qui synchronise la vidéo égocentrique avec les mouvements du corps et des mains. L'entraînement se fait en trois étapes. La première apprend l'interaction à partir de jeux de données égocentriques variés. La deuxième coordonne corps et mains grâce à HumanVerse-500. La troisième adapte la politique à des tâches et à des robots précis. λ0 apprend un espace de représentation commun pour transférer l'expérience humaine, tandis que des interfaces propres à chaque domaine gèrent les écarts entre états et actions de l'humain et du robot. L'évaluation porte sur le benchmark SIMPLE et sur quatre tâches réelles de locomanipulation. Les auteurs revendiquent des performances « état de l'art » et analysent aussi le comportement à l'échelle, la généralisation et l'apport de chaque étape. Ils annoncent la publication du code, des modèles et des données. L'article précise toutefois ni le robot utilisé, ni les taux de réussite, ni les concurrents comparés. L'enjeu est le coût de la donnée. Les vidéos égocentriques sont abondantes mais couvrent mal le mouvement du corps entier et sa coordination avec la manipulation. La téléopération d'humanoïdes produit la bonne donnée, mais elle est chère et difficile à passer à l'échelle. Cette étude teste une voie médiane : capter des humains équipés de capteurs légers, puis transférer vers le robot. Si les résultats tiennent, la collecte de démonstrations par téléopération deviendrait moins déterminante, et la capacité à capter du mouvement humain en conditions réelles le deviendrait davantage. Pour un intégrateur, cela pourrait réduire le coût d'adaptation à une nouvelle tâche ou à un nouveau robot, ce que la troisième étape cherche à démontrer. Il faut rester prudent : quatre tâches réelles, sans taux de réussite publiés dans le résumé, restent une base étroite. Le « état de l'art » dépend entièrement des références choisies. L'écart entre démonstration de laboratoire et déploiement industriel n'est pas traité ici. Ce travail s'inscrit dans le mouvement des modèles fondation pour humanoïdes. Les VLA de type Pi-0, GR00T ou Helix ont d'abord ciblé des bras et des mains, avant de s'étendre au corps entier. En parallèle, le pré-entraînement sur vidéo humaine devient une piste majeure pour contourner la rareté des données robotiques. Les acteurs industriels qui ont leurs propres flottes de téléopération, comme Tesla, Figure ou Agility, ont un avantage en données propriétaires, que des corpus ouverts comme HumanVerse-500 pourraient réduire pour les laboratoires académiques et les petites équipes, y compris en Europe. La suite dépend de la publication effective du code, des modèles et des données, puis de reproductions indépendantes sur d'autres plateformes. Ce sont elles qui diront si le transfert humain vers robot résiste hors du cadre des auteurs.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Uni-VLaT : adaptation tactile du corps entier des politiques VLA pour la loco-manipulation humanoïde
4arXiv cs.RO 

Uni-VLaT : adaptation tactile du corps entier des politiques VLA pour la loco-manipulation humanoïde

Des chercheurs publient Uni-VLaT, une méthode qui greffe un sens du toucher distribué sur tout le corps à des politiques VLA (vision-langage-action) préentraînées pour piloter un humanoïde en loco-manipulation. Le principe est d'ajouter une voie tactile dont l'état latent n'est pas seulement entraîné à produire des actions, mais aussi à prédire les représentations tactiles, proprioceptives et visuelles futures. Ce second objectif construit un contexte multimodal ancré dans le tactile. Les auteurs testent le système sur cinq tâches réelles : locomotion déclenchée par le toucher, interaction physique prolongée, contact avec un humain et loco-manipulation. Le taux de réussite moyen atteint 75 %, soit 43 points de plus qu'une base sans entrée tactile et 7 points de plus qu'une base tactile sans supervision prédictive. Sur deux architectures VLA préentraînées, le balayage de table gagne 30 points sur chacune, et la tâche « Back-Tap Walking » (marcher en réponse à une tape dans le dos) progresse de 85 à 90 points. Les ablations indiquent que la prédiction tactile contextualisée et les cibles futures absolues sont déterminantes. L'enjeu est de combler un angle mort des VLA actuels, qui reposent sur la vision et la proprioception. Quand la zone de contact est masquée, par exemple un bras qui frotte une surface ou une main humaine posée sur le dos, ces deux signaux ne suffisent pas à caractériser l'interaction. Contrairement aux capteurs de force ou de couple placés en quelques points prédéfinis, une peau tactile distribuée conserve la cartographie spatiale du contact sur tout le corps. Le résultat le plus parlant pour un intégrateur est la distinction entre simple ajout d'un capteur et apprentissage prédictif : la modalité brute apporte 36 points sur les 43 gagnés, mais la supervision prédictive rend la fusion plus robuste. Cela suggère que les politiques généralistes peuvent être étendues à de nouvelles modalités sans repartir de zéro, un point utile pour la cobotique humanoïde en contact avec des opérateurs. Les limites sont nettes : cinq tâches seulement, un robot de laboratoire, aucun chiffre sur les temps de cycle, la robustesse à long terme ou la durabilité des capteurs. Ce n'est ni un produit ni un déploiement. Ce travail s'inscrit dans la montée en puissance des modèles VLA pour humanoïdes, dont Pi-0, GR00T ou Helix, pour l'essentiel centrés sur la vision, le langage et la proprioception. Le tactile reste le parent pauvre de ces architectures, freiné par le coût, la fragilité et le câblage des peaux électroniques. La question d'une sensibilité corps entier concerne aussi des acteurs européens comme Wandercraft ou Enchanted Tools, dont les robots opèrent près des humains, même si l'article ne cite aucun partenaire industriel. Les prochaines étapes probables sont une validation sur davantage de plateformes et de capteurs, puis une comparaison avec des approches de contrôle en force, avant tout transfert industriel.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source