Aller au contenu principal
RecherchearXiv cs.RO 

Vers l'échec à la supervision : DynamicEnvPlan pour une planification incarnée robuste à long terme

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont présenté DynamicEnvPlan, un système de planification en boucle fermée pour agents humanoïdes évoluant dans des environnements qui changent en cours d'exécution, publié sur arXiv début août 2026 (arXiv:2608.00613). Le framework associe agents humanoïdes, compétences primitives de haut niveau, mémoire sémantique structurée et perturbations contrôlables. Trois modules, planification, perturbation et correction supervisée, transforment les échecs d'exécution en traces de récupération, utilisées pour un fine-tuning supervisé en plusieurs étapes. Testé sur 104 combinaisons tâche-scène couvrant des conditions i.i.d., de généralisation compositionnelle et hors distribution, le système fait passer le taux de réussite de 33,3% à 76,2% par rapport au planificateur de base, tout en améliorant les sept métriques d'évaluation retenues, dont la sécurité et la conformité d'affordance, c'est-à-dire le respect des contraintes physiques d'interaction avec les objets.

Cette approche cible un angle mort classique des benchmarks robotiques: les échecs de planification, objet déplacé, obstacle apparu, porte fermée, sont généralement consignés comme des scores d'évaluation plutôt que réinjectés dans l'entraînement. En transformant systématiquement ces échecs en signal d'apprentissage, DynamicEnvPlan illustre un basculement dans la planification pilotée par des modèles vision-langage-action (VLA): passer d'une exécution calquée sur des trajectoires nominales à une capacité de récupération active face à un monde qui bouge pendant l'action. Pour les intégrateurs qui travaillent sur des humanoïdes en environnement non contrôlé, entrepôt, domicile, site industriel, un gain de 43 points de taux de réussite sur des scénarios incluant de l'hors distribution est un signal concret que le fossé entre démonstration et robustesse réelle peut se combler par la donnée d'entraînement. Les résultats restent toutefois mesurés en simulation, sur un périmètre encore limité.

Le travail s'inscrit dans la vague de recherche en planification embodied qui a suivi la percée des modèles VLA comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, où la difficulté ne réside plus dans l'exécution motrice mais dans une planification de haut niveau capable de s'adapter. Contrairement à ces systèmes orientés produit, DynamicEnvPlan reste un travail académique centré sur la méthode de génération de données, sans robot ni partenaire industriel précisé, ni calendrier de déploiement physique. La suite logique serait une validation sur plateforme humanoïde réelle, au-delà de la simulation, et une comparaison directe avec les frameworks de planification hiérarchique déjà utilisés par les acteurs commerciaux du secteur.

À lire aussi

Vision-Langage-Politique : un modèle pour la planification dynamique des tâches robotiques
1arXiv cs.RO 

Vision-Langage-Politique : un modèle pour la planification dynamique des tâches robotiques

Une équipe de recherche propose un nouveau modèle baptisé Vision-Language-Policy, ou VLP, destiné à la planification dynamique de tâches robotiques à partir de commandes en langage naturel. Décrit dans un article déposé sur arXiv (2512.19178, version révisée), le système s'appuie sur un modèle vision-langage affiné sur des données réelles, capable d'interpréter des instructions sémantiques et de raisonner sur la scène de travail observée pour générer directement des politiques de comportement pilotant le robot. Les auteurs ont testé leur approche sur plusieurs robots différents et sur une variété de tâches en conditions réelles, démontrant que le modèle peut ajuster sa stratégie en cours d'exécution lorsque les instructions changent, sans nécessiter de replanification complète. Des vidéos de démonstration sont disponibles sur robovlp.github.io. L'article ne précise pas de métriques chiffrées de type charge utile, degrés de liberté ou temps de cycle, ni de nom de robot commercial identifiable, ce qui limite l'évaluation de la performance réelle du système face aux standards du secteur. L'intérêt de ce travail réside dans la promesse de généralisation inter-incarnations, c'est-à-dire la capacité d'un même modèle à fonctionner sur des morphologies de robots différentes sans réentraînement spécifique à chaque plateforme. C'est l'un des points durs actuels de l'IA robotique, où les modèles VLA (vision-language-action) peinent souvent à transférer d'un bras ou d'un humanoïde à un autre. Si l'adaptabilité dynamique aux changements de consigne se confirme à plus grande échelle, cela répondrait à une limite classique des architectures de planification traditionnelles, qui séparent rigidement le raisonnement de haut niveau de l'exécution bas niveau et s'adaptent mal aux imprévus. Ce travail s'inscrit dans la lignée des modèles VLA récents comme Pi-0 ou GR00T N2, qui cherchent tous à unifier perception, langage et action dans un même modèle entraîné de bout en bout. Il s'agit ici d'une contribution académique, sans annonce de partenaire industriel ni de déploiement commercial, et la prudence reste de mise tant qu'une validation indépendante sur des benchmarks standardisés n'a pas été publiée.

RechercheActu
1 source
Uni-LaViRA : traduction d'actions langage-vision-robot pour une navigation incarnée unifiée
2arXiv cs.RO 

Uni-LaViRA : traduction d'actions langage-vision-robot pour une navigation incarnée unifiée

Des chercheurs présentent Uni-LaViRA (Language-Vision-Robot Actions Translation), une architecture de navigation incarnée publiée le 28 mai 2026 sur arXiv (2605.27582), capable de piloter quatre types de robots distincts, robots à roues, quadrupèdes, humanoïdes et un drone à voilure fixe construit sur mesure, sans aucun entraînement spécifique sur des trajectoires robot. Le système s'appuie sur des grands modèles multimodaux de langage préentraînés (MLLMs) pour décomposer la navigation en deux types de commandes : une commande directionnelle sémantique en langage naturel, et une cible visuelle au niveau pixel. En mode zéro-shot, Uni-LaViRA atteint 60,7 % de taux de succès sur VLN-CE R2R, 51,3 % sur VLN-CE RxR, 77,7 % sur HM3D-v2, 60,0 % sur HM3D-OVON, 54,7 % sur MP3D-EQA et 40,0 % sur OpenUAV. Deux mécanismes structurent la boucle d'agent : le TODO List Memory (TDM), qui maintient une liste de sous-objectifs mise à jour à chaque pas et réinjectée dans la fenêtre d'attention du modèle, et le Second Chance Backtrack (SCB), qui ramène le robot à son état précédant une erreur et force le replanning à partir de la sous-trajectoire échouée. Ce résultat interpelle directement le paradigme dominant des VLA à grande échelle, qui réclame des millions de trajectoires et des milliers d'heures GPU pour atteindre des niveaux de performance comparables. Si les chiffres se confirment en environnements non contrôlés, Uni-LaViRA suggère qu'une partie du problème de généralisation en navigation peut être résolue structurellement, via un raisonnement sur la géométrie de l'action, plutôt que par accumulation de données. Pour les intégrateurs robotiques, cela réduit potentiellement le coût d'adaptation à de nouveaux sites ou morphologies de robots, deux points de friction majeurs dans les déploiements industriels. La capacité à unifier wheeled AMR, quadrupèdes et humanoïdes sous une même architecture sans fine-tuning est particulièrement notable. L'article s'inscrit dans un contexte de compétition intense autour des architectures VLA : Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, et les approches OpenVLA ou RoboFlamingo ont chacun nécessité des pipelines de collecte de données coûteux. Uni-LaViRA ne cherche pas à remplacer ces modèles sur des tâches de manipulation précise, mais positionne le raisonnement structuré comme alternative crédible pour la navigation. Les benchmarks utilisés (HM3D, MP3D, R2R) sont des standards académiques en simulation ; la validation sur robots réels reste limitée aux quatre plateformes de l'étude, et les performances en conditions industrielles non contrôlées restent à démontrer. Aucune timeline de déploiement ni partenariat industriel n'est mentionné.

RechercheOpinion
1 source
HiMe : mémoire incarnée hiérarchique pour le contrôle vision-langage-action à long terme
3arXiv cs.RO 

HiMe : mémoire incarnée hiérarchique pour le contrôle vision-langage-action à long terme

Un article publié le 7 juillet 2026 sur arXiv présente HiMe, un cadre de mémoire hiérarchique pour les modèles Vision-Language-Action (VLA), ces systèmes qui pilotent robots et bras manipulateurs en combinant vision, langage et commande motrice. Les auteurs identifient ce qu'ils appellent le paradoxe fréquence-compétence : les modèles de raisonnement les plus capables sont trop lents pour le contrôle temps réel, tandis que les modèles rapides manquent de capacité de raisonnement pour les tâches longues et non markoviennes, où l'action dépend de tout l'historique et pas seulement de l'observation immédiate. HiMe répond en découplant l'intelligence du robot en trois couches : un Executor haute fréquence pour l'exécution, un Sentry pour la mémoire de travail, et un Planner pour la stratégie long terme, le tout appuyé par une base de connaissances dynamique capable de s'ajouter, se mettre à jour et se supprimer elle même. Pour l'industrie robotique, cette architecture cible un point faible documenté des VLA actuels, à l'image de Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure : leur dépendance à l'observation instantanée, qui les fragilise sur des tâches longues ou nécessitant de se souvenir d'une consigne donnée bien plus tôt. Beaucoup de démonstrations spectaculaires de robots humanoïdes reposent sur des séquences courtes et scriptées ; HiMe s'attaque explicitement à l'écart entre ces démonstrations et des tâches réelles multi-étapes, un angle mort souvent pointé par les intégrateurs. Si la séparation entre réactivité et raisonnement tient à l'échelle, elle offrirait une piste concrète pour concilier les deux sans sacrifier l'un pour l'autre. Le travail s'inscrit dans la lignée des recherches sur la mémoire des agents robotiques, qui cherchent à dépasser les architectures VLA à plat où toute l'information transite par une seule fenêtre de contexte. Les auteurs rapportent de meilleurs taux de réussite que ces références plates sur des tâches à horizon long, ainsi qu'une capacité inédite à corriger ses propres connaissances internes selon les préférences exprimées par un humain. Publié sans affiliation industrielle mise en avant, ce travail reste à ce stade une contribution académique : reste à voir si des laboratoires ou fournisseurs de VLA commerciaux comme Physical Intelligence, Nvidia ou Figure s'en inspireront pour des robots déployés en usine ou en entrepôt.

RechercheActu
1 source
RePlan-Bot : replanification à plusieurs niveaux pour le suivi d'instructions par IA incarnée
4arXiv cs.RO 

RePlan-Bot : replanification à plusieurs niveaux pour le suivi d'instructions par IA incarnée

Une équipe de recherche a publié fin mai 2026 un preprint arXiv (2605.25851) présentant RePlan-Bot, un agent conçu pour l'exécution d'instructions en langage naturel dans des environnements 3D interactifs, un champ désigné sous le terme Embodied Instruction Following (EIF). Le système repose sur trois couches complémentaires : un auditeur de haut niveau basé sur un LLM, qui ajuste dynamiquement les sous-objectifs en fonction des retours de l'environnement ; un mécanisme de recherche guidé par le sens commun, s'appuyant sur une carte d'instances multi-couches pour localiser précisément les objets ; et un correcteur léger basé sur un Vision Transformer (ViT), chargé de détecter et corriger les actions bas niveau à risque avant qu'elles ne causent des erreurs irréversibles. Évalué sur le benchmark ALFRED (Action Learning From Realistic Environments and Directives), RePlan-Bot revendique des performances à l'état de l'art dans les environnements vus et non vus, bien que l'abstract ne fournisse aucun chiffre précis de taux de succès ni comparaisons numériques explicites. L'intérêt de cette architecture pour les équipes d'IA embarquée réside dans sa gestion du replanning continu face aux changements d'état irréversibles, un point de défaillance classique des systèmes de planification hiérarchique. En robotique de service ou en manipulation d'objets, une action mal exécutée (déplacer un objet au mauvais endroit, ouvrir un conteneur prématurément) peut invalider l'ensemble du plan en cours. RePlan-Bot adresse ce problème via un audit permanent pendant l'exécution, ce qui le distingue des approches plan-then-execute qui supposent un environnement statique. La combinaison LLM haute-décision et ViT basse-exécution reflète une tendance structurante dans les architectures VLA (Vision-Language-Action) actuelles : déléguer la supervision sémantique à un modèle de langage, et la correction réactive à un modèle vision plus léger et plus rapide. Le benchmark ALFRED, publié par l'Allen Institute for AI en 2020, reste la référence dominante pour l'EIF en simulation (environnement iTHOR), mais son écart avec les conditions réelles (manipulation physique, bruit sensoriel, variabilité des objets) est bien documenté dans la littérature. RePlan-Bot s'inscrit dans un champ de recherche concurrentiel qui inclut des travaux comme FILM et HLSM, ainsi que des approches VLA plus récentes comme OpenVLA ou Pi-0 de Physical Intelligence. Aucun déploiement matériel ni partenariat industriel n'est mentionné dans le preprint : il s'agit d'une contribution académique en environnement simulé, et la question du transfert sim-to-real, centrale pour tout intégrateur, reste entière.

RechercheOpinion
1 source