Aller au contenu principal
ADM-Planner : planification à long horizon guidée par LLM pour manipulateurs mobiles avec mémoire dynamique à attention renforcée
RecherchearXiv cs.RO 

ADM-Planner : planification à long horizon guidée par LLM pour manipulateurs mobiles avec mémoire dynamique à attention renforcée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent ADM-Planner, un système de planification pour robots mobiles manipulateurs qui combine un grand modèle de langage avec une mémoire dynamique à attention renforcée (ADM, Attention-enhanced Dynamic Memory). L'idée centrale consiste à séparer la connaissance persistante de l'espace de travail de l'état centré sur les objets, mis à jour de façon asynchrone par les observations et les résultats d'action, tout en ne présentant au LLM qu'un sous-ensemble borné d'informations pertinentes pour la prochaine décision, avec replanification automatique dès qu'une mise à jour invalide le plan en cours. Sur 1 500 épisodes de simulation en environnement bruité à 14 conteneurs, ADM atteint 100% de tâches réussies intégralement, contre 62% pour une mémoire statique figée et 97% pour une mémoire dynamique sans filtrage, tout en réduisant de 95,8% la taille du contexte transmis au modèle. Un test en conditions réelles sur six épisodes avec un planificateur GPT-5 Mini montre que les deux variantes de mémoire dynamique complètent toutes les missions, ADM réduisant de 14,4% les tokens d'entrée facturés et le nombre moyen d'appels au planificateur de 7,0 à 6,0. Une étude séparée de 60 essais sous PyBullet confirme 100% de succès pour ADM contre 50% pour la mémoire statique, et le robot manipulateur mobile équipé d'ADM-Planner a mené à bien diverses missions en intérieur et extérieur, y compris avec des cibles révélées après le début de l'exécution.

Ce travail s'attaque à un problème concret pour tout intégrateur déployant des robots en environnement changeant, entrepôt, site logistique ou espace partagé avec des humains: un contexte figé devient obsolète dès qu'un objet est déplacé, tandis qu'un historique complet accumule des informations redondantes ou contradictoires qui dégradent la fiabilité du LLM. En démontrant qu'une gestion sélective de l'état bat à la fois la mémoire statique et l'historique brut, tout en réduisant nettement le coût en tokens et la latence liée aux appels API, l'étude apporte un argument concret en faveur d'architectures de mémoire structurée plutôt que du simple empilement de prompts, une question centrale pour la viabilité économique des LLM appliqués à la planification robotique long-horizon.

Le travail reste à ce stade un preprint arXiv, sans affiliation institutionnelle précisée dans le résumé, et ses résultats les plus solides proviennent de simulation à grande échelle, les essais physiques réels en intérieur et extérieur n'étant décrits que qualitativement sans chiffres de réussite détaillés. ADM-Planner se positionne sur la planification de tâches pilotée par LLM plutôt que sur le contrôle continu de bas niveau, un axe distinct des modèles vision-langage-action end-to-end qui dominent actuellement les annonces du secteur humanoïde. Les auteurs mettent à disposition une page projet dédiée pour suivre d'éventuelles publications complémentaires ou du code associé.

À lire aussi

2AM : ancrer la mémoire de l'agent pour guider des modèles d'action pilotables en manipulation à long horizon
1arXiv cs.RO 

2AM : ancrer la mémoire de l'agent pour guider des modèles d'action pilotables en manipulation à long horizon

Publiée le 11 septembre 2026 sur arXiv sous la référence 2609.11308, une nouvelle architecture baptisée 2AM propose une autre méthode pour la manipulation robotique à long horizon, ces tâches multi-étapes qui exigent de se souvenir de ce qui a déjà été fait. Le système sépare strictement deux rôles : un agent multimodal conserve seul la mémoire de la tâche et traduit l'historique des interactions en instructions de sous-tâches en langage naturel, complétées par des indices optionnels en 2D (points de préhension, de dépose et de déplacement) ; un modèle d'action unique, basé uniquement sur des images RGB et sans état interne entre les épisodes, exécute le mouvement. Pour le rendre pilotable, les auteurs ont enrichi les démonstrations d'étiquettes d'indices structurées et entraîné le modèle avec abandon aléatoire de conditions, bruit spatial et décalage temporel, afin qu'il tolère des instructions imparfaites. Testé sur le benchmark LIBERO-Mem, sans profondeur, sans géométrie calculée en ligne ni déplacement d'objets planifié, 2AM atteint un taux de complétion moyen de 76,3 %, contre 14,8 % pour la meilleure référence publiée à ce jour, soit un gain de 61,5 points, avec 63,0 % de réussite au sens large et 11,8 % au sens strict. Ce résultat vise un problème méthodologique récurrent des systèmes agentiques actuels, qui combinent souvent des modèles vision-langage-action (VLA) avec planificateurs et outils géométriques, parfois appuyés par de la profondeur ou une géométrie calibrée : il devient difficile de savoir si les gains viennent d'observations plus riches, d'outils moteurs alternatifs ou de la politique elle-même, et si les échecs viennent de la politique ou d'une interface langagière mal spécifiée. En réduisant volontairement la panoplie d'outils au profit d'une interface à plus haute bande passante entre agent et modèle d'action, 2AM isole la variable de précision du pilotage. Le résultat suggère que la mémoire de tâche peut rester entièrement côté agent, sans être intégrée dans la politique d'action, un choix opposé à la tendance qui consiste à faire porter mémoire et raisonnement par un seul grand modèle entraîné de bout en bout. Pour les équipes qui développent des modèles d'action génératifs comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure AI, ce travail introduit une hypothèse alternative : la capacité effective d'un modèle dépendrait autant de la précision avec laquelle il est piloté que de ce qu'il a appris à l'entraînement, ce qui interroge la course actuelle aux VLA toujours plus massifs. Le travail s'inscrit dans la lignée des benchmarks LIBERO, largement utilisés en apprentissage de politiques robotiques, dont LIBERO-Mem constitue une extension dédiée aux tâches à mémoire longue. Il se positionne en creux face aux architectures dominantes du secteur, qui empilent VLA, planificateurs symboliques et perception 3D pour gérer des séquences de manipulation complexes, une approche que la publication critique implicitement pour son opacité dans l'attribution des performances. Aucun déploiement matériel réel n'est mentionné : les résultats restent circonscrits à la simulation et au benchmark, sans validation sur robot physique ni pilote industriel annoncé. L'affiliation institutionnelle des auteurs et un calendrier de suite ne sont pas précisés, ce qui situe cette publication au stade de la recherche amont plutôt que d'un produit ou d'un partenariat commercial.

RechercheActu
1 source
DynaForge : apprentissage résiduel guidé par la planification pour la génération de démonstrations de manipulation dynamique
2arXiv cs.RO 

DynaForge : apprentissage résiduel guidé par la planification pour la génération de démonstrations de manipulation dynamique

Des chercheurs ont publié le 23 septembre 2026 sur arXiv (2609.25631v1) DynaForge, un framework destiné à générer automatiquement des démonstrations de manipulation dynamique d'objets pour l'entraînement de politiques robotiques par apprentissage par imitation. Le système combine une planification globale à basse fréquence avec une cinématique inverse centrée sur l'objet à haute fréquence, puis applique une politique résiduelle pour corriger les actions au moment critique du contact. Un curriculum implicite regroupe les tentatives par conditions similaires et privilégie les lots à succès mixte, concentrant l'apprentissage par renforcement résiduel sur la frontière de compétence en évolution. Sur les tâches Can et Bottle, DynaForge nécessite 0,73 fois moins d'étapes d'optimisation que l'algorithme GRPO standard pour un budget d'étapes d'environnement identique, avec un taux de succès final supérieur. Sur neuf tâches de simulation, le taux moyen de génération de démonstrations réussies passe de 41,30% avec la seule planification a priori à 78,37% avec DynaForge. Avec 800 démonstrations par tâche, des politiques DP3 entraînées sur ces données atteignent 49,11% de succès moyen, contre 7,07% pour des données générées par la méthode concurrente DOMINO. Sur trois tâches dynamiques réelles, les politiques entraînées avec DynaForge obtiennent entre 30% et 60% de succès, contre 0% à 10% pour celles issues de DOMINO. La manipulation dynamique, lancer, attraper au vol, gestes exigeant une réaction rapide au contact, reste un point faible des pipelines d'apprentissage par imitation, car les démonstrations générées automatiquement échouent souvent près du contact ou simplifient excessivement l'interaction physique, comme le fait le rejeu à la DOMINO. En améliorant nettement le taux de génération de démonstrations exploitables tout en réduisant le coût de calcul par rapport à des méthodes de renforcement classiques comme GRPO, DynaForge s'attaque directement au goulot d'étranglement des données qui freine l'entraînement de politiques à grande échelle, qu'il s'agisse de politiques de diffusion comme DP3 ou de modèles vision-langage-action plus larges. L'écart de 20 à 50 points de succès observé en conditions réelles suggère que ces démonstrations reflètent mieux la dynamique physique que les méthodes précédentes, un enjeu central pour les intégrateurs qui cherchent à transférer des politiques entraînées en simulation vers du matériel réel sans réentraînement coûteux. DynaForge se positionne explicitement face à deux familles de méthodes existantes: les approches purement basées sur la planification, sujettes à l'échec au moment du contact, et DOMINO, qui simplifie les interactions dynamiques au prix du réalisme. Le recours à GRPO, algorithme d'optimisation de politique par groupe popularisé dans l'entraînement de modèles de langage, illustre la porosité croissante entre techniques de renforcement issues du traitement du langage et robotique. Le résumé ne précise ni affiliation institutionnelle ni disponibilité du code, et la validation réelle reste limitée à trois tâches sans détail sur le nombre d'essais, ce qui invite à la prudence avant toute extrapolation à un déploiement industriel.

RecherchePaper
1 source
Mémoire spatio-sémantique dynamique et résiliente avec localisation hybride pour la manipulation mobile
3arXiv cs.RO 

Mémoire spatio-sémantique dynamique et résiliente avec localisation hybride pour la manipulation mobile

Une équipe de recherche a publié sur arXiv (réf. 2606.00576) DREAM, un framework de manipulation mobile robotique pour environnements intérieurs dynamiques, fonctionnant sans carte pré-construite. Le système construit en temps réel une mémoire voxel spatio-sémantique à partir d'observations RGB-D enregistrées par un backend SLAM hybride LiDAR-inertiel-visuel. Pour retrouver des objets cibles, DREAM combine retrieval 3D conditionné par le langage naturel, détection à vocabulaire ouvert, et vérification sémantique par un grand modèle de langage multimodal (MLLM). Sa contribution technique centrale est le RMP (Redundancy-Aware Memory Pruning), un mécanisme d'élagage conscient du pose-graph qui propage les corrections de pose aux observations historiques tout en maintenant l'empreinte mémoire bornée. Testé sur robot réel dans quatre scènes de laboratoire dynamiques, DREAM améliore les taux de succès sur tâches longue durée : de 40-60% avec le système de référence DynaMem à 55-70%, avec une empreinte mémoire de 0,37 à 0,63 Go et un temps de mise à jour de 0,43 à 0,53 seconde par scène. Ce résultat adresse un blocage fondamental de la manipulation mobile en conditions réelles : les systèmes existants supposent un environnement statique, des estimations de pose précises ou une carte pré-construite, trois hypothèses qui s'effondrent dès qu'un objet est déplacé ou qu'une correction de trajectoire intervient. DREAM répond à ce demo-to-real gap en propageant dynamiquement les corrections de pose à toute la mémoire historique, et en s'appuyant sur un MLLM pour la vérification sémantique plutôt qu'une simple correspondance géométrique. Nuance nécessaire toutefois : un taux de succès de 55-70% signifie encore 30-45% d'échecs en conditions de laboratoire contrôlées, et les tâches exactes testées ne sont pas détaillées dans l'abstract disponible, ce qui rend toute extrapolation à des environnements industriels ou domestiques réels prématurée. DynaMem constitue la référence directe de comparaison. La manipulation mobile autonome en milieu non-structuré est un axe actif chez plusieurs acteurs commerciaux : Figure avec son robot Figure 03, Physical Intelligence avec pi-zero et pi0.5, Boston Dynamics ou encore Agility Robotics. L'approche de DREAM, combinant SLAM dense, mémoire sémantique interrogeable en langage et vérification par LLM, s'inscrit dans la tendance VLA (Vision-Language-Action) qui cherche à combler le sim-to-real gap non par l'entraînement massif mais par une représentation du monde plus dynamique et cohérente. Aucune institution ni partenariat industriel n'est mentionné dans le résumé disponible, classant ce travail pour l'instant comme recherche académique pré-publication, sans timeline de déploiement annoncée.

RecherchePaper
1 source
MoMaStage : planification guidée par graphe d'états de compétences et exécution en boucle fermée pour la manipulation mobile intérieure à long horizon
4arXiv cs.RO 

MoMaStage : planification guidée par graphe d'états de compétences et exécution en boucle fermée pour la manipulation mobile intérieure à long horizon

MoMaStage est le nom d'un système de planification et d'exécution présenté dans un article scientifique publié sur arXiv sous l'identifiant 2603.08383, en version 2 remplaçant une publication antérieure, consacré à la manipulation mobile en intérieur sur des tâches à horizon long. Le système associe un modèle vision-langage (VLM) figé, c'est-à-dire non réentraîné, à l'exécution robotique via trois mécanismes complémentaires : une bibliothèque hiérarchique de compétences ancrées et exécutables couplée à une projection purement topologique d'un graphe d'état des compétences (Skill-State Graph, SSG) qui borne l'espace de planification du VLM ; un vérificateur SSG qui propage l'état des régions de la scène et l'occupation du préhenseur pour écarter les plans infaisables avant leur exécution ; et un moniteur événementiel qui ne déclenche une réparation du plan, ancrée dans le graphe, que lorsqu'un résultat observé invalide la suite prévue. Les auteurs ont évalué l'approche en simulation à physique réaliste ainsi que sur un robot mobile manipulateur réel. Le résumé ne fournit aucun chiffre précis de charge utile, de degrés de liberté, de temps de cycle ou de volume de déploiement : il annonce seulement une amélioration de la validité des plans et de la tenue en exécution longue par rapport aux méthodes de référence testées, avec une réduction de la latence et de la consommation de tokens. Le travail s'attaque à une faiblesse connue des architectures VLA/VLM en robotique mobile : ces modèles décomposent bien une instruction en séquence d'actions plausible, mais ne suivent pas fiablement les contraintes cumulatives d'état du robot ni ne révisent leur plan quand l'exécution diverge du prévu. Cela vient nuancer l'idée qu'un grand modèle de langage suffirait, seul, à piloter des tâches longues de manipulation mobile sans couche de vérification dédiée. Pour les intégrateurs qui évaluent des piles VLA pour l'entrepôt ou l'usine, l'intérêt est méthodologique : coupler un VLM figé à une vérification symbolique légère plutôt qu'une politique entraînée de bout en bout, pour gagner en fiabilité sans construire de carte dense de la scène ni alourdir le calcul embarqué. MoMaStage s'inscrit dans la lignée des travaux cherchant à combler l'écart entre la planification par VLM généraliste et les exigences de fiabilité de la robotique physique, un enjeu documenté depuis la montée d'architectures bout-en-bout comme Pi-0, GR00T N2 ou Helix. À la différence de ces politiques entraînées sur de larges corpus de démonstrations, MoMaStage garde le VLM figé et externalise la cohérence d'état dans un graphe symbolique léger, plus proche des méthodes de planification classique augmentées par des modèles de langage. L'article ne mentionne ni calendrier de déploiement industriel ni partenariat commercial : il s'agit d'une contribution de recherche testée en simulation et sur un unique robot en laboratoire, sans indication de passage à l'échelle vers une flotte ou un site client.

RecherchePaper
1 source