
HODAgent : vers des humanoïdes réactifs et disponibles à la demande pour l'interaction physique avec l'humain
Un preprint déposé sur arXiv en août 2026 (arXiv:2608.17584v1) présente HODAgent, un agent de raisonnement « System-2 » pour robots humanoïdes de service interagissant directement avec des humains. Son architecture semi-duplex combine un Env-Interactor, un Planner, un Executor et une mémoire hiérarchique afin de suivre l'état de la tâche pendant tout l'épisode : le robot accepte une nouvelle requête en pleine action, garde sa progression, révise son plan et vérifie le résultat avant de clôturer. Une interface commune relie simulation et robot physique, un Unitree G1, en isolant le contrôle bas niveau. Sur 164 cas en simulation, HODAgent atteint 84,8% et 91,5% de succès conjoint selon le VLM utilisé, soit 9,8 et 18,9 points de plus que les références. Sur le robot réel, les taux vont de 92% pour les tâches atomiques à 72% pour les tâches composites et 63,3% pour les tâches complètes, avec un gain de 0,7 à 9,0 points sur plusieurs benchmarks d'IA incarnée.
Ces résultats ciblent l'écart persistant entre démonstrations et usage réel des humanoïdes : interrompre une action en cours pour intégrer une nouvelle consigne, puis vérifier concrètement si la tâche est accomplie plutôt que de suivre un plan figé, reste rarement démontré à cette échelle hors laboratoire. Pour les intégrateurs, l'intérêt tient surtout à la portabilité : une même couche de décision opérant en simulation et sur robot physique, avec le contrôle bas niveau isolé derrière une interface partagée, réduit le travail de réimplémentation entre prototype et pilote. La chute des taux de réussite entre tâches atomiques (92%) et tâches complètes (63,3%) confirme néanmoins que l'enchaînement de sous-tâches demeure le principal facteur d'échec, un repère utile face aux annonces plus promotionnelles du secteur.
Le travail s'inscrit dans la mouvance des agents « System 2 », conçus pour planifier et corriger leur action plutôt que réagir de manière réflexe, un axe distinct des modèles vision-langage-action génératifs de type Pi-0, GR00T N2 ou Helix qui occupent la communication du secteur humanoïde. Le choix du Unitree G1 comme plateforme de test reflète sa large adoption par la recherche académique, faute d'accès aux humanoïdes propriétaires de Figure AI, Tesla ou Agility Robotics. Publié comme preprint non encore relu par les pairs, sans partenaire industriel ni date de déploiement pilote annoncée, HODAgent reste pour l'instant une contribution de recherche destinée à être reproduite et comparée par d'autres équipes.
Dans nos dossiers




