Aller au contenu principal
RePlan-Bot : replanification à plusieurs niveaux pour le suivi d'instructions par IA incarnée
RecherchearXiv cs.RO 

RePlan-Bot : replanification à plusieurs niveaux pour le suivi d'instructions par IA incarnée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a publié fin mai 2026 un preprint arXiv (2605.25851) présentant RePlan-Bot, un agent conçu pour l'exécution d'instructions en langage naturel dans des environnements 3D interactifs, un champ désigné sous le terme Embodied Instruction Following (EIF). Le système repose sur trois couches complémentaires : un auditeur de haut niveau basé sur un LLM, qui ajuste dynamiquement les sous-objectifs en fonction des retours de l'environnement ; un mécanisme de recherche guidé par le sens commun, s'appuyant sur une carte d'instances multi-couches pour localiser précisément les objets ; et un correcteur léger basé sur un Vision Transformer (ViT), chargé de détecter et corriger les actions bas niveau à risque avant qu'elles ne causent des erreurs irréversibles. Évalué sur le benchmark ALFRED (Action Learning From Realistic Environments and Directives), RePlan-Bot revendique des performances à l'état de l'art dans les environnements vus et non vus, bien que l'abstract ne fournisse aucun chiffre précis de taux de succès ni comparaisons numériques explicites.

L'intérêt de cette architecture pour les équipes d'IA embarquée réside dans sa gestion du replanning continu face aux changements d'état irréversibles, un point de défaillance classique des systèmes de planification hiérarchique. En robotique de service ou en manipulation d'objets, une action mal exécutée (déplacer un objet au mauvais endroit, ouvrir un conteneur prématurément) peut invalider l'ensemble du plan en cours. RePlan-Bot adresse ce problème via un audit permanent pendant l'exécution, ce qui le distingue des approches plan-then-execute qui supposent un environnement statique. La combinaison LLM haute-décision et ViT basse-exécution reflète une tendance structurante dans les architectures VLA (Vision-Language-Action) actuelles : déléguer la supervision sémantique à un modèle de langage, et la correction réactive à un modèle vision plus léger et plus rapide.

Le benchmark ALFRED, publié par l'Allen Institute for AI en 2020, reste la référence dominante pour l'EIF en simulation (environnement iTHOR), mais son écart avec les conditions réelles (manipulation physique, bruit sensoriel, variabilité des objets) est bien documenté dans la littérature. RePlan-Bot s'inscrit dans un champ de recherche concurrentiel qui inclut des travaux comme FILM et HLSM, ainsi que des approches VLA plus récentes comme OpenVLA ou Pi-0 de Physical Intelligence. Aucun déploiement matériel ni partenariat industriel n'est mentionné dans le preprint : il s'agit d'une contribution académique en environnement simulé, et la question du transfert sim-to-real, centrale pour tout intégrateur, reste entière.

À lire aussi

Planification de trajet fondée sur le bon sens à partir d'instructions abstraites
1arXiv cs.RO 

Planification de trajet fondée sur le bon sens à partir d'instructions abstraites

CoRS (commonsense ranked search), décrit dans un article arXiv du 22 septembre 2026 (arXiv:2609.22813v1), est un planificateur de chemin qui traduit une instruction abstraite comme "déplace-toi prudemment" en itinéraire respectant des considérations de bon sens jamais formulées explicitement, à l'image d'un sol mouillé qu'un ouvrier contourne sans consigne écrite. Le système combine grands modèles de langage (LLM) et modèles vision-langage (VLM) : pour chaque région observée, il déduit une considération locale ("sol glissant, détour justifié"), compare ces considérations entre elles ("la foule pèse plus que le sol mouillé"), puis convertit ce classement en coûts pour un algorithme de recherche classique garantissant toujours un chemin valide. Les auteurs publient un benchmark dédié : trois environnements, 1350 problèmes, cinq instructions réparties sur trois niveaux d'abstraction. Les résultats montrent que CoRS repère les considérations implicites, contourne celles qui méritent un détour et traverse normalement les autres zones, un comportement que les planificateurs récents fondés sur des LLM ne reproduisent pas. Pour les intégrateurs de robots mobiles autonomes appelés à opérer parmi des humains (entrepôts, hôpitaux, bureaux), cela pointe un écart persistant entre le raisonnement affiché par les LLM en démonstration et leur capacité réelle à transformer un ordre flou en trajectoire sûre. L'étude suggère que le bon sens doit être ancré région par région dans la perception visuelle puis structuré en classement comparatif, plutôt qu'ajouté comme simple contrainte textuelle dans un prompt. Publié comme preprint "new" sur arXiv, sans évaluation par les pairs à ce stade, CoRS s'inscrit dans les efforts visant à combler l'écart entre planification symbolique classique, robuste mais rigide face à l'implicite, et approches tout-LLM, flexibles mais incapables de garantir un chemin valide. L'article ne cite ni fabricant, ni site de déploiement, ni calendrier commercial : son apport tient au benchmark public et à la méthode de classement comparatif plutôt qu'à un produit prêt à intégrer. Les suites logiques évoquées restent une validation sur robot physique en conditions réelles et une comparaison directe avec les planificateurs LLM concurrents cités dans l'étude.

RecherchePaper
1 source
Planification du réarrangement de scènes pour l'IA incarnée
2arXiv cs.RO 

Planification du réarrangement de scènes pour l'IA incarnée

Une équipe de recherche présente Embodied Scene Rearrangement Planning (ESRP), une nouvelle tâche qui demande à un agent incarné de réorganiser des meubles dans une scène 3D pour atteindre une configuration cible, en ne disposant que d'observations égocentriques et d'un plan cible vu du dessus. Pour évaluer cette tâche, les auteurs publient ESRP-Bench, un benchmark construit sur le simulateur OmniGibson qui comprend plus de 5 400 paires de scènes et 8 200 objets, accompagné de trois métriques à plusieurs niveaux pour juger la qualité de la réorganisation. Quatre méthodes de référence sont testées: une approche hiérarchique de planification tâche-et-mouvement (TAMP), une méthode basée sur un modèle vision-langage (VLM), et deux approches par apprentissage, l'une par imitation (IL) et l'autre par renforcement (RL). Le papier est publié sur arXiv sous la référence 2608.27371, avec une page projet disponible sur pie-lab.cn/ESRP. L'intérêt de ce travail tient à sa contrainte centrale: contrairement aux tâches de réarrangement étudiées jusqu'ici, ESRP interdit tout accès à un état global de la scène et introduit des occlusions mutuelles entre objets, ce qui oblige l'agent à recouper des vues partielles avec un objectif global, un problème représentatif des limites réelles du déploiement robotique. Les résultats expérimentaux montrent que les quatre approches testées, y compris celles fondées sur des modèles vision-langage, peinent à accomplir la tâche efficacement sur un horizon long. Ce constat va à l'encontre de l'idée reçue selon laquelle les architectures VLA ou VLM se généralisent facilement à des tâches de planification complexe: ici, ni la planification symbolique classique ni l'apprentissage ne suffisent seuls face à la perception partielle et aux occlusions. ESRP s'inscrit dans la lignée des benchmarks de réarrangement de scènes utilisés pour évaluer la compréhension spatiale et la planification à long horizon chez les agents incarnés, mais se distingue en supprimant l'hypothèse commode d'un accès à l'état complet de l'environnement. Aucun calendrier de déploiement industriel n'est annoncé: il s'agit d'un jalon de recherche ouvert, destiné à servir de terrain d'essai standardisé pour la communauté avant tout transfert vers des scénarios robotiques réels.

RecherchePaper
1 source
OJOx : démonstrations conditionnées par des spécifications pour l'IA incarnée dans la construction
3arXiv cs.RO 

OJOx : démonstrations conditionnées par des spécifications pour l'IA incarnée dans la construction

Des chercheurs ont publié sur arXiv (id 2609.22289) un article présentant OJOx, une interface de capture de démonstrations conçue pour l'IA incarnée appliquée au secteur de la construction. Le système délivre la géométrie d'un modèle de conception à un casque de réalité mixte, l'ancre dans l'espace de travail physique, puis la restitue dans la vue stéréo en passthrough du démonstrateur, tout en enregistrant simultanément le mouvement du corps entier et des mains. Les auteurs introduisent la notion de "démonstration conditionnée par la spécification" : un enregistrement synchronisé de l'état physique perçu par l'opérateur, de l'état visé fourni par une conception externe, et du comportement qui relie les deux. Une session entièrement instrumentée est rapportée, la pose d'un mur de 33 composants réalisée à partir d'une spécification qui évolue en cours de chantier, et vérifiée par rapport à la scène physique réelle via une caméra externe positionnée indépendamment du système de capture. Les données restent compatibles avec les infrastructures existantes de retargeting pour robots humanoïdes et ont été rejouées en simulation sur un Unitree G1. Ce travail cible un angle mort des pipelines de données pour les modèles vision-langage-action : les grands corpus de démonstrations égocentriques ou corps entier capturent ce qu'une personne fait, rarement pourquoi elle le fait, c'est-à-dire l'intention de conception qui donne son sens au geste. Dans la construction, où chaque ouvrage est défini par un modèle spécifique au projet, une politique entraînée par simple imitation risque de reproduire la géométrie observée sans apprendre à généraliser vers une spécification jamais vue à l'entraînement. OJOx propose donc un format de données permettant de tester explicitement cette capacité de généralisation, plutôt que de simplement supposer qu'elle émerge de l'échelle des données ; il s'agit néanmoins d'une contribution méthodologique et d'un outil de capture, pas d'un produit commercial ni d'un déploiement en usine, à ce stade une preuve de concept limitée à une seule session instrumentée. Cette publication s'inscrit dans la course plus large des laboratoires de robotique incarnée à constituer des jeux de démonstrations humaines à grande échelle pour entraîner des modèles fondation destinés aux robots humanoïdes, un effort généralement concentré sur des tâches de manipulation générique et répétable. La construction, où chaque tâche suit un plan différent, restait jusqu'ici peu couverte par ce type de capture. En rendant ses enregistrements compatibles avec les pipelines de retargeting existants et en les rejouant sur un Unitree G1, l'équipe positionne OJOx comme un module interopérable avec l'écosystème matériel humanoïde déjà en place. L'article ne fournit ni calendrier de déploiement ni partenaire industriel : il ouvre la voie à des jeux de données plus larges pour évaluer si des politiques VLA peuvent réellement agir vers des spécifications absentes de leur entraînement, une question encore ouverte pour l'ensemble du secteur.

RecherchePaper
1 source
TravExplorer : exploration incarnée inter-niveaux par planification 3D sensible à la traversabilité
4arXiv cs.RO 

TravExplorer : exploration incarnée inter-niveaux par planification 3D sensible à la traversabilité

Des chercheurs proposent TravExplorer, un framework de navigation autonome multi-étages publié en mai 2026 sur arXiv (arXiv:2605.19958). Le système s'attaque à la navigation zero-shot par objets (ZSON, Zero-Shot Object Navigation), soit la capacité à localiser une cible désignée en langage naturel dans un environnement inconnu, sans carte préalable. Validé sur 4 195 épisodes simulés dans les benchmarks HM3D (Habitat-Matterport 3D) et Matterport3D (MP3D), puis sur 50 essais réels avec un robot quadrupède Unitree Go2, TravExplorer opère sur escaliers, paliers et espaces à chevauchements verticaux. Le système maintient une carte volumétrique unifiée distinguant structures occupées et surfaces accessibles au robot, extrait des frontières traversables sur sols, escaliers et paliers, et s'appuie sur un planificateur hiérarchique couplant une recherche 3D guidée par points d'appui (foothold-guided) à une optimisation de trajectoire localement contrainte en vertical. Presque tous les systèmes ZSON existants supposent un environnement mono-étage et une représentation plane, une hypothèse qui casse dans tout bâtiment réel comportant escaliers ou mezzanines. TravExplorer comble ce fossé avec deux apports concrets : un module sémantique allégé qui aligne une carte d'instances probabiliste (segmentation open-vocabulary en ligne) avec une carte de valeur spatiale via image-to-text rapide, réduisant la latence de raisonnement ; et une stratégie de perception active FOV-aware pour résoudre les zones partiellement observées lors des transitions d'étages. Les résultats sur HM3D et MP3D sont supérieurs aux baselines ObjectNav de référence, et les 50 essais sur Go2 sans carte ni intervention humaine constituent une validation sim-to-real concrète, même si elle reste limitée à une seule plateforme et à des intérieurs contraints. Le champ du ZSON multi-étages émerge dans un contexte plus large d'ambition robotique pour les environnements non structurés. HM3D (Meta) et MP3D sont les benchmarks standards du domaine ; y surpasser les méthodes ObjectNav actuelles est un signal de maturité technique. Le Unitree Go2, quadrupède de recherche commercialisé autour de 8 700 euros, est devenu une plateforme de référence en navigation académique. Le code source sera mis à disposition sur GitHub. Les extensions logiques incluent des bâtiments plus complexes, des espaces semi-ouverts et l'intégration sur robots humanoïdes ou à roues. Aucun acteur européen n'est impliqué dans cette publication.

RecherchePaper
1 source