ADAPT : des amorces de diffusion agiles et pilotables pour un contrôle robuste d'humanoïdes en ligne, guidé par texte
Un preprint publié sur arXiv (référence 2609.00677v1) décrit ADAPT (Agile Diffusion Action Priors), un framework de contrôle interactif du corps entier de robots humanoïdes piloté par texte. Contrairement aux pipelines texte-vers-mouvement dominants, qui génèrent une trajectoire suivie ensuite par un contrôleur séparé, ADAPT fonctionne en boucle fermée de bout en bout : le robot répond en continu aux commandes tout en gardant l'équilibre et des transitions fluides. Il apprend un prior d'action par diffusion à partir de trajectoires état-action annotées en texte, complété par une politique résiduelle d'apprentissage par renforcement entraînée sur le contrôleur gelé pour améliorer la robustesse entre consignes. L'abstract ne précise ni plateforme robotique testée, ni charge utile, degrés de liberté ou temps de cycle.
L'intérêt tient à la fusion, en une seule boucle, de la génération de mouvement et de son exécution : les systèmes actuels séparent souvent un module texte-vers-mouvement d'un contrôleur bas niveau, ce qui crée latence et ruptures dès qu'une commande change. ADAPT vise des humanoïdes plus réactifs au langage naturel, un enjeu pour les intégrateurs voulant doter leurs robots d'interfaces conversationnelles en entrepôt ou en usine. Il suggère aussi que les priors d'action par diffusion combinés au renforcement, dans la lignée de travaux comme Pi-0 ou GR00T N2, forment une base viable pour du contrôle général, sans toutefois de déploiement physique ni de comparaison chiffrée démontrés : la contribution reste académique, non encore validée par relecture par les pairs.
Ce travail s'inscrit dans la course menée par des laboratoires et entreprises comme Figure AI avec Helix, NVIDIA avec GR00T N2 ou Physical Intelligence avec Pi-0, pour doter les humanoïdes de piles vision-langage-action capables de suivre des instructions en langage naturel plutôt que des routines préprogrammées. Là où ces acteurs couplent souvent de grands modèles multimodaux à des primitives de mouvement, ADAPT propose des priors d'action par diffusion entraînés sur des données texte-état-action, complétés par du renforcement, comme alternative plus légère en boucle fermée. Aucun acteur français ou européen du secteur, comme Wandercraft ou Pollen, n'apparaît dans cette publication. Les suites attendues, non détaillées dans l'abstract, sont une réplication indépendante et une validation sur robot physique.
Dans nos dossiers



