Aller au contenu principal
RecherchearXiv cs.RO 

Hierarchical Fast-Slow ReAct : un agent de navigation vers un objectif sans apprentissage préalable

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Publié en août 2026 sur arXiv, ce travail de recherche présente un agent hiérarchique rapide-lent pour la navigation vers un objet cible en zero-shot (ZSON) : un robot doit localiser une catégorie d'objet dans un bâtiment jamais visité. Les méthodes dominantes choisissent la frontière d'exploration par argmax sur une carte de valeur vision-langage, sans conserver les preuves passées. Le système proposé garde ce contrôleur réactif actif à chaque pas, en construisant une mémoire ancrée sur les coordonnées : grille sémantique des pièces et objets confirmés, plus des images-clés bornées, chaque détection filtrée par un VLM avant écriture. Une couche délibérative relit cette mémoire en boucle bornée raisonnement-récupération-action, se déclenche sur des événements structurels, raisonne d'abord en texte et ne rappelle une image qu'en dernier recours, sous plafonds d'appels et repli automatique. Résultat : 68,75% de succès sur HM3D v1 (val) et 47,29% sur MP3D (val), meilleur score zero-shot comparé ; sur 2000 épisodes HM3D, un argmax simple à la place de la délibération coûte 3,40 points de succès (IC 95% [1,70 ; 5,05]), perte que la délibération systématique ne comble pas.

Ce résultat contredit l'hypothèse selon laquelle interroger un VLM à intervalle fixe depuis la vue courante suffit, et qu'une mémoire explicite ne vaut pas son coût de calcul. En montrant qu'une mémoire persistante couplée à une délibération sélective bat l'argmax pur et la délibération exhaustive, l'étude donne un argument concret aux intégrateurs de robots mobiles d'intérieur (logistique, inspection, service) arbitrant entre coût des appels VLM et qualité de décision, et confirme la bascule vers des architectures hybrides rapide-lent en IA incarnée.

Le travail s'inscrit dans la lignée des méthodes ZSON à carte de valeur vision-langage, dominantes mais sans mémoire longue, et des architectures plus récentes plaçant un VLM directement dans la boucle de décision, jugées coûteuses et rigides. Il s'appuie sur les benchmarks standards HM3D et MP3D, sous simulateur Habitat, pour se comparer aux méthodes zero-shot existantes. Aucun partenaire industriel n'est mentionné : la validation reste en simulation, l'étape suivante logique étant un test sur robot réel.

À lire aussi

HAM-VLN : une mémoire agentique hiérarchique pour la navigation vision-langage sans apprentissage préalable
1arXiv cs.RO 

HAM-VLN : une mémoire agentique hiérarchique pour la navigation vision-langage sans apprentissage préalable

Une équipe de recherche présente HAM-VLN, un système de navigation robotique par instructions en langage naturel (Vision-and-Language Navigation) fonctionnant sans aucun entraînement spécifique, exploitant un modèle multimodal de type LLM pour interpréter les observations visuelles et décider de l'action suivante. Le système introduit une mémoire agentique hiérarchique : à chaque appel du modèle servant à choisir le prochain déplacement, HAM-VLN enregistre aussi des informations sémantiques et réflexives, type de pièce, objets détectés, progression de la navigation, notes d'échec, dans un graphe du monde persistant et ancré en profondeur (depth-grounded). Les points de passage récents restent conservés textuellement dans une fenêtre bornée, tandis que l'historique plus ancien n'est réintégré au contexte que via une recherche pondérée par pertinence, récence et importance, complétée par une expansion topologique à un saut. Sur les benchmarks standards, HAM-VLN atteint 61,0% de taux de réussite sur VLN-CE R2R, 52,7% sur VLN-CE RxR et 79,7% sur HM3D-v2 ObjectNav, avec une réduction de plus de 65% de la longueur de contexte par rapport aux approches précédentes, sans appel LLM supplémentaire au-delà de la décision par point de passage. L'enjeu principal est le goulot d'étranglement mémoire qui limite aujourd'hui la navigation robotique à long horizon pilotée par LLM : empiler des flux d'images ou des cartes denses dans le contexte d'un modèle devient vite ingérable en coût de calcul et en cohérence de raisonnement. En couplant la génération de mémoire à la décision d'action elle-même, sans multiplier les appels au modèle, HAM-VLN répond à une critique récurrente des approches "training-free" en robotique : leur dépendance à des contextes toujours plus longs et coûteux. Une réduction de 65% de ce contexte, à performances égales ou supérieures, est un signal concret pour les équipes qui cherchent à déployer des agents de navigation en environnement inconnu sans phase de fine-tuning coûteuse. Ce travail s'inscrit dans la lignée des méthodes récentes de VLN "zero-shot" apparues avec la généralisation des LLM multimodaux, qui remplacent les pipelines de navigation entraînés end-to-end par du raisonnement en langage naturel au moment de l'inférence. Les benchmarks utilisés, VLN-CE (R2R et RxR) et HM3D-v2 ObjectNav, sont des références académiques standard du domaine, ce qui permet une comparaison directe avec les approches concurrentes basées sur mémoire d'images ou cartographie dense. L'article, publié sur arXiv, ne mentionne pas d'implémentation matérielle sur robot réel ni de calendrier de déploiement industriel.

RecherchePaper
1 source
ZONDA : navigation vers un objet sans apprentissage préalable avec évitement dynamique en environnements multi-étages
2arXiv cs.RO 

ZONDA : navigation vers un objet sans apprentissage préalable avec évitement dynamique en environnements multi-étages

Une équipe de recherche présente ZONDA, un nouveau framework de navigation robotique "zero-shot" vers un objet désigné (Object Goal Navigation), conçu pour fonctionner dans des environnements multi-étages et en présence de piétons en mouvement. Le système repose sur trois composants : une planification heuristique multi-étages qui exploite des cartes de différences de hauteur pour permettre à un robot de gravir des escaliers et de changer d'étage sans contrôleur spécifique à la plateforme ; une vérification multi-vues de la cible, qui croise des observations à différentes échelles avec un modèle vision-langage (VLM) pour réduire les faux positifs de détection ; et un module d'évitement dynamique des piétons, qui suit et anticipe leurs déplacements pour générer des trajectoires préventives. Le système a été testé sur un robot bipède TITA du fabricant chinois Direct Drive Tech, ainsi que sur des simulations extensives utilisant les jeux de données HM3D et MP3D, deux benchmarks de référence pour la navigation en environnement intérieur photoréaliste. Les auteurs annoncent des résultats "significativement améliorés" par rapport aux méthodes existantes, ainsi qu'une robustesse maintenue sur HM3D-DYNA, une variante dynamique du benchmark incluant des agents mobiles. Cette publication s'attaque à une limite concrète et rarement traitée des systèmes de navigation robotique actuels : la quasi-totalité des méthodes de pointe supposent un environnement statique et confiné à un seul étage, une hypothèse commode en laboratoire mais irréaliste pour un déploiement réel en entrepôt, hôpital ou bâtiment de bureaux à plusieurs niveaux. En combinant franchissement d'escaliers sans apprentissage spécifique au robot et anticipation des piétons, ZONDA vise directement l'écart entre démonstration en simulation et usage industriel, un problème central pour les intégrateurs qui cherchent à déployer des robots mobiles ou humanoïdes au-delà d'un seul plateau. À noter que l'abstract ne fournit pas de chiffres précis de performance (taux de succès, distance parcourue, temps de cycle) permettant de comparer objectivement l'ampleur du gain revendiqué face aux méthodes concurrentes, une réserve à garder en tête avant de considérer le résultat comme acquis. Le champ de l'Object Goal Navigation s'est largement construit sur des benchmarks comme HM3D et MP3D, où les méthodes récentes intègrent de plus en plus des modèles vision-langage pour améliorer la reconnaissance sémantique des cibles, dans la lignée de travaux comme les architectures VLA utilisées en manipulation robotique. Le choix du robot bipède TITA de Direct Drive Tech comme plateforme de test réel, plutôt qu'un robot à roues plus classique en recherche de navigation, souligne l'ambition de valider l'approche sur une morphologie capable physiquement de franchir des escaliers, condition nécessaire à toute navigation multi-étages. L'article, publié sur arXiv le 24 juillet 2026, ne mentionne pas de partenariat industriel ni de calendrier de déploiement commercial ; il s'agit à ce stade d'une contribution académique, dont la prochaine étape logique serait une validation sur davantage de plateformes robotiques et dans des environnements réels plus variés que le cadre expérimental actuel.

RecherchePaper
1 source
Fonctions de navigation neuronales pour une planification de mouvement généralisable sans apprentissage préalable
3arXiv cs.RO 

Fonctions de navigation neuronales pour une planification de mouvement généralisable sans apprentissage préalable

Des chercheurs présentent en juin 2026 (arXiv 2606.03756) Neural Navigation Functions (Neural-NF), un planificateur réactif conçu pour opérer en transfert zéro-shot sur des géométries d'environnements jamais vus. La méthode intègre l'apprentissage dans un planificateur elliptique structuré : les features dérivées du Laplacien intrinsèque de la géométrie cible sont converties en coefficients locaux d'une équation aux dérivées partielles (EDP), dont la résolution produit une fonction de valeur globalement cohérente sur le domaine cible. Par construction, le comportement est garanti sans collision, avec descente monotone et minimum global unique à l'objectif, pour tout modèle admissible. Empiriquement, Neural-NF surpasse les planificateurs appris à prédiction directe de fonction de valeur d'un facteur allant jusqu'à 5, sur un ensemble de géométries variées. L'enjeu est la combinaison rare de garanties formelles et de capacité de généralisation. La quasi-totalité des planificateurs appris abandonnent les preuves de convergence pour s'adapter à de nouvelles géométries ; à l'inverse, les navigation functions classiques de Koditschek et Rimon offrent des garanties mathématiques mais sur des classes de géométries fixées à l'avance. En encapsulant l'apprentissage dans la structure PDE plutôt qu'en laissant le réseau prédire librement la sortie, Neural-NF préserve ces garanties par construction. Pour un intégrateur robotique ou un COO industriel, cela signifie un planificateur qui n'a pas besoin d'être ré-entraîné à chaque nouveau site de déploiement, tout en maintenant une trajectoire certifiée sans collision. Le facteur 5 annoncé mérite toutefois d'être nuancé : il est mesuré contre une famille spécifique de planificateurs à prédiction directe, et non contre l'état de l'art global de la planification de mouvement. La navigation function remonte aux travaux fondateurs de Koditschek et Rimon publiés dans l'International Journal of Robotics Research entre 1990 et 1992, qui établissaient des garanties de convergence dans des espaces à obstacles sphériques. Neural-NF s'inscrit dans l'effort actuel de généralisation à des géométries arbitraires, en concurrence avec les approches par champs de distances signées, représentations NeRF, ou planificateurs par diffusion. L'article reste un preprint non encore revu par les pairs, sans affiliation industrielle ni plan de commercialisation mentionné. Les prochaines étapes naturelles seraient une validation sur des benchmarks 3D partagés tels que Habitat ou MuJoCo, pour situer Neural-NF face aux planificateurs MPPI, par diffusion, et aux VLA appliqués à la navigation.

RecherchePaper
1 source
Imagine2Real : vers l'interaction robot humanoïde-objet sans apprentissage préalable grâce aux priors génératifs vidéo
4arXiv cs.RO 

Imagine2Real : vers l'interaction robot humanoïde-objet sans apprentissage préalable grâce aux priors génératifs vidéo

Une équipe de chercheurs présente Imagine2Real, un framework zéro-shot pour la manipulation humanoïde d'objets, publié sur arXiv en mai 2026. L'Humanoid-Object Interaction (HOI) en corps entier, soit la capacité d'un humanoïde à interagir physiquement avec des objets en coordonnant l'ensemble de ses degrés de liberté, reste historiquement freinée par la rareté des données 3D haute fidélité. Imagine2Real contourne cette limitation en s'appuyant sur des vidéos génératives comme priors de mouvement, sans recourir à des modèles CAO explicites. Les déplacements du robot et des objets sont formalisés comme des trajectoires 4D en points discrets. Un module appelé Keypoints Tracker suit uniquement trois repères critiques (base, mains, objet), court-circuitant le retargeting morphologique, source classique d'amplification d'erreurs. Pour maintenir des allures naturelles malgré ces signaux épars, le système exploite l'espace latent d'un Behavior Foundation Model (BFM), un modèle de fondation entraîné sur des comportements locomoteurs. Une stratégie d'entraînement progressive complète le pipeline, permettant un déploiement physique zéro-shot en environnement de capture de mouvement (mocap). Le travail s'attaque à deux verrous documentés dans la littérature : le "Representation Misalignment", décalage entre les priors géométriques et la réalité physique du robot, et la "Retargeting Complexity", difficulté d'adapter des mouvements humains à une morphologie robotique différente. En réduisant le retargeting à trois points-clés et en supprimant la dépendance aux modèles CAO, Imagine2Real compresse le pipeline de données nécessaire pour générer de nouveaux comportements. Le zéro-shot démontré en déploiement physique, et non uniquement en simulation, distingue la contribution des approches antérieures. Pour un intégrateur ou un décideur industriel, l'enjeu est clair : bootstrapper de nouvelles compétences de manipulation sans dataset 3D dédié ni séquences mocap par tâche. Imagine2Real s'inscrit dans un courant de recherche exploitant les video diffusion models comme source de connaissance pour la robotique, en parallèle des travaux de Physical Intelligence (pi0, pi0-FAST), de NVIDIA (GR00T N2) et des approches VLA de Google DeepMind. La distinction revendiquée est l'abandon des priors géométriques là où les méthodes concurrentes les jugent incontournables. Aucun partenaire industriel ni calendrier de déploiement réel n'est mentionné dans ce preprint : il s'agit d'une contribution de recherche fondamentale, dont les suites naturelles incluront l'extension à des catégories d'objets plus larges et une validation hors environnement mocap contrôlé.

RechercheOpinion
1 source