ASENA : des agents auto-évolutifs pour la navigation de l'IA incarnée
Des chercheurs publient ASENA, un système d'agent incarné qui relie des agents de codage généralistes aux capteurs, au calcul, à l'exécution supervisée et à une mémoire persistante d'un robot. L'agent écrit et exécute des programmes, relit les résultats enregistrés, corrige ses échecs et réutilise des notes et des compétences exécutables, le tout sans modifier les poids du modèle. Le système s'accompagne d'ASENA-VLN, une politique de navigation monoculaire de 4 milliards de paramètres, proposée comme outil optionnel. Elle prédit des trajectoires dans le repère du corps, pour des itinéraires longs comme pour des comportements à court horizon, grâce à un décodeur vision-langage unique. Celui-ci est entraîné sur des instructions de parcours, des questions-réponses visuelles et un nouveau jeu de tâches de navigation « atomiques » dérivées de la géométrie. Seule, la politique atteint 68,7 % de succès sur R2R et 70,2 % sur RxR, ce que les auteurs présentent comme l'état de l'art. Couplée à l'agent de codage, elle ajoute 11 points de succès sur les deux benchmarks agentiques tout en réduisant le temps d'exécution. Dix passes sur des sous-ensembles récurrents de 100 tâches, avec retour du simulateur, font passer le succès de 72 % à 98 % sur R2R et de 65 % à 89 % sur RxR. En question-réponse incarnée, ASENA annonce aussi la meilleure précision, avec moins d'étapes d'interaction. Des démonstrations réelles sur un Unitree G1 combinent recherche, inspection visuelle, raisonnement spatial et gestes synthétisés, sans carte préalable.
L'intérêt tient moins au score de navigation qu'à l'architecture. Ici, l'amélioration ne passe pas par un réentraînement : elle vient de la mémoire de l'agent (notes, scripts, compétences), ce qui rapproche le robot d'un logiciel qu'on débogue que d'un modèle qu'on affine. Pour un intégrateur, cela ouvre la voie à une adaptation d'un site à l'autre sans cycle de collecte de données ni de fine-tuning. Il faut toutefois lire les gains avec prudence. Le passage de 72 % à 98 % est mesuré sur des sous-ensembles de 100 tâches rejouées dix fois avec retour du simulateur : cela ressemble davantage à une mémorisation de tâches récurrentes qu'à une généralisation à des environnements inédits. Les résultats chiffrés restent obtenus en simulation, et les démonstrations sur G1 sont qualitatives, sans taux de réussite, durée ni nombre d'essais publiés. L'écart entre démonstration et fiabilité en conditions réelles reste donc entier.
Ce travail s'inscrit dans deux tendances qui convergent : les politiques vision-langage-action pour la navigation, évaluées sur R2R et RxR, et les agents de codage appliqués à la robotique, où le LLM génère du code plutôt que des commandes bas niveau. En faisant de la politique apprise un simple outil parmi d'autres, ASENA se positionne à l'opposé des approches de bout en bout comme Pi-0 ou GR00T, qui concentrent tout dans un seul modèle. Le G1 de Unitree, plateforme humanoïde à bas coût largement répandue en recherche, sert de support. Il s'agit d'une prépublication arXiv (v1), non évaluée par les pairs. Le code, les jeux de données et d'éventuels tests hors simulation seront les vrais juges de la portée du système.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




