
InterEvolve : évolution à l'inférence des programmes de récompense pour la loco-manipulation humanoïde
Des chercheurs publient sur arXiv (2610.02196) InterEvolve, une méthode qui permet à un humanoïde de résoudre des tâches de locomanipulation pour lesquelles son contrôleur n'a jamais été entraîné, sans réentraînement. Le système repose sur un modèle fondation comportemental « forward-backward » (FB) sensible aux objets. Des résidus d'objet, ajoutés à un modèle de corps gelé, convertissent au moment du test une nouvelle récompense, portant sur le corps ou sur les objets, en comportement de locomanipulation. Les tâches sont décrites par des « programmes de récompense » : des récompenses par étapes, avec conditions d'achèvement et constantes ajustables. Un agent LLM révise la structure du programme en contexte, à partir des retours d'exécution et d'une bibliothèque de programmes vérifiés. Un optimiseur numérique règle les constantes. Chaque candidat est validé dans plusieurs scénarios de simulation parallèles. Les compétences évoluées ont été exécutées de façon autonome sur un Unitree G1 physique, à partir de la perception égocentrique embarquée. Le résumé ne donne ni taux de réussite, ni temps de cycle, ni nombre d'itérations.
L'intérêt est de déplacer l'effort d'ingénierie. Au lieu de collecter des démonstrations ou de relancer un entraînement par renforcement pour chaque nouvelle tâche, on suppose qu'un contrôleur généraliste contient déjà l'essentiel de la compétence motrice, et on la rend accessible par une interface de planification expressive, exécutable et mesurable. Les auteurs affirment que les récompenses conçues à la main laissent inexploitée une grande part des capacités du modèle FB, et que les programmes évolués les libèrent, parfois par des stratégies inédites. Pour un intégrateur, la promesse est une adaptation à de nouvelles tâches sans nouveau cycle d'entraînement. Les limites sont nettes : la validation est surtout en simulation, la démonstration physique se limite à une plateforme, le G1, et aucune comparaison chiffrée n'est donnée dans le résumé. L'écart entre simulation et réalité reste donc à mesurer sur des tâches industrielles.
Ce travail s'inscrit dans deux courants. Le premier est celui des modèles fondation comportementaux et des contrôleurs généralistes pour humanoïdes, qui visent un contrôle du corps entier réutilisable. Le second est la conception de récompenses par LLM, déjà explorée avec des approches comme Eureka. InterEvolve y ajoute une mémoire sous forme de bibliothèque de compétences vérifiées, ainsi qu'une vérification parallèle en simulation. Il se distingue des approches VLA (vision-langage-action) comme Pi-0, Helix ou GR00T, qui apprennent directement une politique à partir de données. Ici, le LLM fait de la planification et de l'optimisation, et le contrôle bas niveau reste figé. Le G1, très répandu en recherche, est la plateforme de démonstration habituelle. Les prochaines étapes à surveiller sont la publication du code, des évaluations sur d'autres robots et des tâches plus longues en conditions réelles.
Dans nos dossiers




