Aller au contenu principal
RecherchearXiv cs.RO 

ASENA : des agents auto-évolutifs pour la navigation de l'IA incarnée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient ASENA, un système d'agent incarné qui relie des agents de codage généralistes aux capteurs, au calcul, à l'exécution supervisée et à une mémoire persistante d'un robot. L'agent écrit et exécute des programmes, relit les résultats enregistrés, corrige ses échecs et réutilise des notes et des compétences exécutables, le tout sans modifier les poids du modèle. Le système s'accompagne d'ASENA-VLN, une politique de navigation monoculaire de 4 milliards de paramètres, proposée comme outil optionnel. Elle prédit des trajectoires dans le repère du corps, pour des itinéraires longs comme pour des comportements à court horizon, grâce à un décodeur vision-langage unique. Celui-ci est entraîné sur des instructions de parcours, des questions-réponses visuelles et un nouveau jeu de tâches de navigation « atomiques » dérivées de la géométrie. Seule, la politique atteint 68,7 % de succès sur R2R et 70,2 % sur RxR, ce que les auteurs présentent comme l'état de l'art. Couplée à l'agent de codage, elle ajoute 11 points de succès sur les deux benchmarks agentiques tout en réduisant le temps d'exécution. Dix passes sur des sous-ensembles récurrents de 100 tâches, avec retour du simulateur, font passer le succès de 72 % à 98 % sur R2R et de 65 % à 89 % sur RxR. En question-réponse incarnée, ASENA annonce aussi la meilleure précision, avec moins d'étapes d'interaction. Des démonstrations réelles sur un Unitree G1 combinent recherche, inspection visuelle, raisonnement spatial et gestes synthétisés, sans carte préalable.

L'intérêt tient moins au score de navigation qu'à l'architecture. Ici, l'amélioration ne passe pas par un réentraînement : elle vient de la mémoire de l'agent (notes, scripts, compétences), ce qui rapproche le robot d'un logiciel qu'on débogue que d'un modèle qu'on affine. Pour un intégrateur, cela ouvre la voie à une adaptation d'un site à l'autre sans cycle de collecte de données ni de fine-tuning. Il faut toutefois lire les gains avec prudence. Le passage de 72 % à 98 % est mesuré sur des sous-ensembles de 100 tâches rejouées dix fois avec retour du simulateur : cela ressemble davantage à une mémorisation de tâches récurrentes qu'à une généralisation à des environnements inédits. Les résultats chiffrés restent obtenus en simulation, et les démonstrations sur G1 sont qualitatives, sans taux de réussite, durée ni nombre d'essais publiés. L'écart entre démonstration et fiabilité en conditions réelles reste donc entier.

Ce travail s'inscrit dans deux tendances qui convergent : les politiques vision-langage-action pour la navigation, évaluées sur R2R et RxR, et les agents de codage appliqués à la robotique, où le LLM génère du code plutôt que des commandes bas niveau. En faisant de la politique apprise un simple outil parmi d'autres, ASENA se positionne à l'opposé des approches de bout en bout comme Pi-0 ou GR00T, qui concentrent tout dans un seul modèle. Le G1 de Unitree, plateforme humanoïde à bas coût largement répandue en recherche, sert de support. Il s'agit d'une prépublication arXiv (v1), non évaluée par les pairs. Le code, les jeux de données et d'éventuels tests hors simulation seront les vrais juges de la portée du système.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

NavGen : les modèles génératifs visuels comme moteur de données évolutif pour la navigation 3D incarnée
1arXiv cs.RO 

NavGen : les modèles génératifs visuels comme moteur de données évolutif pour la navigation 3D incarnée

Des chercheurs présentent NavGen dans un article publié sur arXiv (identifiant 2609.30770), un pipeline de génération de données texte-vers-vidéo destiné à l'entraînement de modèles de navigation aérienne pour drones. Le système produit des épisodes de navigation vision-langage (VLN) simulant des environnements intérieurs et extérieurs, associés à une méthode de diversification stylistique conçue pour multiplier les scénarios rares et coûteux à collecter dans la réalité. Le jeu de données résultant compte environ 400 000 épisodes de navigation. Les auteurs comparent leurs résultats à ceux obtenus avec des jeux de données UAV existants sur plusieurs métriques et constatent que les performances du modèle entraîné sur NavGen progressent avec l'échelle des données, dépassant les modèles entraînés sur les corpus concurrents. Pour vérifier le transfert vers le monde réel, l'équipe a déployé le modèle selon un paradigme dit "world-action-model" lors d'essais de vol réels, avec un taux de réussite de 75% sur des tâches et environnements de navigation variés. Cette approche s'attaque à un compromis structurel connu du secteur de la robotique aérienne : les données simulées sont générables à grande échelle mais souffrent d'un écart visuel important entre simulation et réalité, tandis que les données de vol réelles sont fidèles mais coûteuses et lentes à rassembler. En proposant les modèles génératifs vidéo comme une troisième voie, capable de produire des observations visuelles réalistes sans les contraintes logistiques du vol réel, NavGen apporte un élément de preuve empirique en faveur de l'hypothèse selon laquelle des générateurs vidéo haute fidélité peuvent servir de moteurs de données scalables pour l'IA incarnée. Le résultat intéresse directement les intégrateurs et laboratoires travaillant sur des modèles vision-langage-action : un taux de succès de 75% en conditions réelles, à nuancer selon la difficulté exacte des tâches testées et le nombre d'essais réalisés, suggère que l'écart entre démonstration et déploiement réel peut se réduire grâce à des données synthétiques mieux conçues plutôt que par la seule accumulation de vols réels. NavGen s'inscrit dans la lignée des travaux récents qui cherchent à contourner la pénurie de données d'entraînement pour la robotique incarnée, un problème déjà posé pour les bras manipulateurs et les humanoïdes et qui touche tout autant la navigation aérienne autonome. L'article ne révèle ni affiliation institutionnelle ni drone commercial associé au projet, et reste au stade de préprint scientifique : aucun partenariat industriel, pilote client ni feuille de route de déploiement n'est mentionné à ce jour. Les auteurs positionnent leur travail comme une alternative aux jeux de données UAV existants utilisés comme références dans le domaine, sans toutefois les nommer explicitement. La suite logique, non confirmée par les auteurs, serait l'extension de la méthode à d'autres classes de robots mobiles ou à des tâches de navigation plus complexes.

RechercheOpinion
1 source
HUMEMBR : apprentissage des routines humaines pour la navigation incarnée prédictive
2arXiv cs.RO 

HUMEMBR : apprentissage des routines humaines pour la navigation incarnée prédictive

Des chercheurs ont publié sur arXiv (arXiv:2606.30404, juin 2026) un système baptisé HUMEMBR, Human-Centered Memory for Embodied Robots, conçu pour permettre à un robot incarné de modéliser, mémoriser et exploiter les routines comportementales des individus qu'il côtoie. Le système répond à des requêtes telles que « où se trouve probablement cette personne en ce moment » ou « à quelle heure quitte-t-elle habituellement le bâtiment », en s'appuyant sur un historique d'observations accumulé sur le long terme. HUMEMBR couple une construction mémoire continue à un mécanisme de récupération et d'interrogation parallèle, produisant des représentations structurées des routines humaines interrogeables à la demande. Le système a été validé sur un robot physique déployé dans deux environnements distincts, sans que le papier précise le modèle de plateforme, le nombre de DOF ni les conditions exactes des essais terrain. L'intérêt principal de HUMEMBR réside dans son efficacité computationnelle par rapport aux approches naïves à base de LLM en plein contexte : les auteurs rapportent de meilleures performances sur le raisonnement à long horizon tout en consommant significativement moins de tokens. Pour les intégrateurs de robots de service ou les déployeurs en environnement tertiaire (hôpitaux, entrepôts, bureaux), cela ouvre la voie à des robots capables d'anticiper la position d'un opérateur sans requête GPS ni tag actif, en inférant simplement depuis des patterns observés. C'est un pas vers la résolution du « routine gap », la difficulté à faire raisonner un robot sur des comportements récurrents et non étiquetés, au-delà de la navigation réactive classique. La navigation incarnée guidée par le langage (VLA, NavLLM) est un champ très actif depuis 2023, avec des travaux comme NavGPT, SayNav ou EmbodiedGPT qui explorent l'usage des LLMs comme planificateurs de trajectoire. HUMEMBR se différencie en ciblant explicitement la modélisation comportementale humaine sur la durée, plutôt que la seule compréhension d'instructions à la volée. Aucun partenaire industriel ni calendrier de transfert technologique n'est mentionné dans l'abstract, il s'agit d'une contribution académique, pas d'un produit annoncé. Les prochaines étapes naturelles seraient de tester la robustesse face à des changements de routine imprévus et de quantifier les performances sur des métriques standardisées comme HM3D ou R2R.

RecherchePaper
1 source
Déploiement de modèles fondation pour la navigation robotique incarnée
3arXiv cs.RO 

Déploiement de modèles fondation pour la navigation robotique incarnée

Un article publié sur arXiv (2609.25666v1) détaille deux limites concrètes du déploiement de modèles de fondation (FM) sur des agents incarnés chargés de navigation : un biais d'entraînement qui dégrade la personnalisation dans des environnements inédits, et une longueur de contexte insuffisante qui pénalise les tâches à long horizon. Face au premier problème, les auteurs proposent TAP (Transit-Aware Planning), qui amorce le FM avec des données d'habitudes humaines extraites directement de la scène. Pour le second, ils introduisent MemCtrl, doté d'une "tête de mémoire" (memory head) qui gère activement le contexte plutôt que de le laisser s'accumuler passivement. Testé en conditions réelles dans un environnement de laboratoire avec un robot Turtlebot sur une tâche de recherche de cible personnalisée, TAP affiche une amélioration moyenne de 18% par rapport à une base sans cette méthode. MemCtrl, évalué sur plusieurs tâches incarnées, obtient un gain moyen de 6%, qui monte à 20% sur les sous-ensembles d'instructions longues, tout en consommant près de moitié moins de contexte que le modèle de référence. Ces résultats visent deux angles morts souvent minimisés dans les annonces de robots généralistes pilotés par des modèles vision-langage-action (VLA) : la personnalisation réelle une fois le robot sorti de son jeu de données d'entraînement, et le coût en contexte des tâches longues, qui limite la scalabilité en usage réel. Le fait que le gain de TAP soit mesuré sur un robot physique, et non sur des vidéos sélectionnées en simulation, constitue un signal utile pour les intégrateurs, même si l'échelle reste celle d'un laboratoire contrôlé et non d'un déploiement commercial. Diviser par deux le budget de contexte tout en améliorant la précision représente aussi un argument économique concret pour qui doit faire tourner ces modèles en inférence à grande échelle sur du matériel embarqué. Pour les décideurs B2B qui évaluent des piles VLA pour la logistique ou le service, le papier rappelle que le sim-to-real et le passage à l'échelle du contexte restent des problèmes ouverts, non résolus par la seule taille des modèles. Le travail s'inscrit dans un corpus déjà dense de recherches sur la navigation incarnée pilotée par des FM, que les auteurs organisent en une taxonomie pour situer leurs deux contributions par rapport à l'état de l'art. Il s'agit d'une publication de recherche académique, pas d'une annonce produit : elle défend une position argumentée sur la déployabilité réelle des agents incarnés fondés sur des FM et liste des pistes de recherche ouvertes plutôt qu'une feuille de route commerciale. Aucun partenariat industriel, aucun site de déploiement commercial ni aucun calendrier de mise sur le marché n'est mentionné ; les suites annoncées portent sur l'extension des tests à d'autres environnements et tâches à long horizon, pas sur un lancement produit.

RechercheActu
1 source
IA incarnée : automatisation de la conception d'architectures d'agents
4arXiv cs.RO 

IA incarnée : automatisation de la conception d'architectures d'agents

Une équipe de chercheurs a publié fin juin 2026 (arXiv:2606.30111) une étude sur l'automatisation de la conception d'architectures d'agents incarnés. Ils introduisent AgentCanvas, un environnement d'exécution à graphe typé qui représente les pipelines de perception, mémoire, planification et action comme des programmes nœud-à-fil éditables, et KDLoop, une procédure de recherche par agent codeur alternant proposition, critique, expérimentation et distillation, avec des réflexions déclenchées en cas de stagnation. L'évaluation suit une matrice 3x4 : trois variantes d'Agent Architecture Search (AAS) testées sur quatre tâches incarnées couvrant la navigation vision-langage, la réponse à des questions situées (embodied QA) et la manipulation conditionnée par le langage. Les résultats montrent des gains directionnels de taux de succès, mais un candidat apparemment performant a été écarté après détection d'une fuite de données (leak-bearing). L'intérêt de ces travaux réside dans le transfert, pour la première fois de façon systématique, des méthodes AAS -- jusqu'ici cantonnées aux agents textuels -- vers des agents perceptifs en simulation. Pour les architectes de systèmes cognitifs, cela ouvre la possibilité d'automatiser partiellement le choix de stockage de l'information, du traitement des observations et de l'enchaînement des appels de modèles, tâche jusqu'ici confiée à l'intuition des chercheurs. Les auteurs identifient cependant trois contraintes propres à l'incarné, absentes dans les benchmarks textuels : le bruit de rollout masque les signaux d'optimisation, la recherche se piège dans des bassins d'édition locaux, et l'attribution de crédit épisodique reste partielle même avec des journaux détaillés. La détection d'un candidat corrompu par fuite de données illustre par ailleurs un risque d'évaluation spécifique aux environnements simulés, où l'agent peut exploiter des artefacts de la simulation plutôt que résoudre la tâche réelle. Ces travaux s'inscrivent dans la mouvance des méthodes de méta-design d'architectures cognitives, appliquées ici à la couche système plutôt qu'aux poids des modèles. Les benchmarks dominants en navigation vision-langage (R2R, ALFRED) restent maîtrisés par des architectures manuelles, et des frameworks comme LangGraph ou AutoGen couvrent l'espace des agents textuels sans gestion de rollout simulé. Aucun acteur européen ou français n'est impliqué dans cette publication. Les prochaines étapes identifiées par les auteurs incluent l'extension à des environnements physiques réels et le renforcement de KDLoop face au bruit de rollout, deux verrous explicites avant toute applicabilité industrielle.

RecherchePaper
1 source