Humanoid Horizon : allonger l'horizon des tâches de loco-manipulation du corps entier par entraînement parallèle, démarrage dynamique et filtrage de la récompense
Des chercheurs proposent Humanoid Horizon, un cadre de politique unifiée pour qu'un robot humanoïde enchaîne, en un seul épisode ininterrompu, la navigation, la saisie, le transport et le placement précis de plusieurs objets lourds ou volumineux dans un intérieur encombré. Trois mécanismes le composent. Le Parallel Training Strategy répartit N scènes en S flux d'étapes concurrents, tous pilotés par une politique partagée, si bien que chaque étape de transport reçoit des mises à jour de gradient en continu. Le Dynamic Starting Mechanism réinitialise l'état de départ de chaque environnement avec les états terminaux issus des déroulés des étapes amont, ce qui élargit progressivement la couverture des transitions. Enfin, le Reward Gating annule la récompense pour le reste de l'épisode, dans les flux des étapes ultérieures, lorsque l'objet précédent est déplacé au-delà d'un seuil. Sur le benchmark LHM-Humanoid à deux objets (350 scènes d'entraînement, 66 scènes de test non vues), la méthode dépasse 80 % de réussite par étape. Au-delà de deux objets, le taux de succès baisse avec l'horizon, mais de façon graduelle, alors que tous les baselines comparés chutent brutalement.
L'intérêt de ce travail tient à un verrou concret de la manipulation mobile humanoïde : tenir une tâche longue sans que les étapes tardives dégradent les précédentes. Les auteurs identifient deux modes d'échec qui expliquent pourquoi les politiques de bout en bout s'effondrent sur les longues séquences. Le premier est le biais de récompense facile, où l'entraînement sur-optimise les premières étapes de transport. Le second est l'oubli catastrophique, où se concentrer sur les dernières étapes fait régresser les premières. Le Reward Gating est notable pour un cas d'usage logistique : il apprend à la politique à ne pas perturber un objet qui vient d'être posé, une exigence évidente en entrepôt ou en intérieur domestique. Il faut toutefois relativiser. Les résultats portent sur un benchmark, apparemment en simulation, avec seulement deux objets pour le chiffre phare de 80 %. Le texte ne mentionne ni transfert sim-to-real, ni robot physique, ni temps de cycle, ni payload précis. Il ne prouve donc pas qu'un déploiement industriel soit prêt, mais il apporte une recette d'entraînement reproductible.
Ce travail s'inscrit dans la montée de l'apprentissage par renforcement pour la locomanipulation du corps entier, qui se heurte aux horizons longs, où les récompenses sont éparses et où les erreurs s'accumulent d'une étape à l'autre. Il se place face aux approches séquentielles, qui entraînent les étapes l'une après l'autre, et face aux baselines non nommés dans le résumé, sur lesquels la comparaison reste à examiner dans l'article complet. Le débat plus large oppose les politiques VLA généralistes, portées par des acteurs comme Figure avec Helix ou NVIDIA avec GR00T, aux politiques de contrôle entraînées en simulation, dont celle-ci relève. Les prochaines étapes à surveiller sont la validation sur matériel réel, le passage à trois objets ou plus avec une dégradation maîtrisée et la publication du code et du benchmark pour permettre une réplication indépendante.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




