Aller au contenu principal
RecherchearXiv cs.RO 

Ne lâchez pas BATON : manipulation robotique étendue, sous-tâches exploratoires à base d'agents, mémoire des transitions

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (arXiv:2608.16889v1) une méthode nommée BATON pour la manipulation robotique "long-horizon", ces taches multi-étapes qui enchainent plusieurs compétences a contact physique. Le problème identifie: les modèles vision-langage-action (VLA) maitrisent de mieux en mieux des compétences isolées, mais les erreurs s'accumulent quand on les chaine, et une approche existante qui fige le VLA et confie la planification a un agent LLM voit son cout d'exploration exploser en T^K épisodes pour K étapes, sans pouvoir dire a quelle étape imputer un échec. BATON explore chaque sous-tache séparément en régime court, stocke sa solution en mémoire, puis compose la trajectoire complète a partir de ces briques, ramenant le cout a une forme additive T*K et permettant d'attribuer chaque échec a une étape précise. Un agent vérificateur contrôle via la camera de poignet le moment d'invoquer le VLA, tandis que des transitions de passation et d'anticipation assurent la cohérence entre sous-taches, sans aucune mise a jour de paramètres. Sur le benchmark RoboMemArena, BATON améliore le taux de réussite des taches de 11,6% et le taux de réussite cumulée de 14,9% par rapport a l'état de l'art.

Ce résultat cible le problème qui freine le déploiement industriel des robots manipulateurs sur des taches réelles: réussir des compétences isolées ne garantit pas la réussite d'une chaine complète, le fosse classique entre démonstration et déploiement effectif. En rendant le cout d'exploration additif plutôt que multiplicatif, BATON rend potentiellement viable l'apprentissage autonome de séquences longues sans explosion du nombre d'essais nécessaires, un frein pratique pour qui cherche a automatiser des taches d'assemblage ou de logistique complexes. L'approche souligne surtout que la gestion des transitions entre étapes, et non la seule qualité du VLA, reste souvent l'angle mort des annonces commerciales, qui privilégient des vidéos sélectionnées a des taux de réussite mesures sur benchmark reproductible.

Le travail prolonge les architectures combinant un VLA fige et un agent LLM planificateur, une piste déjà jugée prometteuse mais jusque-la bridée par le cout d'exploration sur les taches longues. A la différence des méthodes qui reentrainent ou affinent le VLA, BATON ne met a jour aucun paramètre et repose entièrement sur la mémoire et la composition de sous-solutions apprises séparément. Publie en aout 2026 sous forme de preprint arXiv et évalué uniquement sur le benchmark RoboMemArena, il reste a ce stade un résultat de recherche: aucun code public, aucun partenariat industriel ni déploiement pilote n'est mentionne.

À lire aussi

WeaveLA : mémoire latente inter-sous-tâches pilotée par événements pour la manipulation robotique répétitive
1arXiv cs.RO 

WeaveLA : mémoire latente inter-sous-tâches pilotée par événements pour la manipulation robotique répétitive

Des chercheurs ont publié WeaveLA (Weave Latent Memory for Vision-Language-Action Policies) sur arXiv (identifiant 2606.17463v1), un module de mémoire inter-sous-tâches qui se greffe sur un backbone VLA gelé, en l'occurrence π₀.₅ de Physical Intelligence, sans modifier ses poids. À chaque franchissement d'un sous-objectif, WeaveLA compresse le segment d'actions accompli en tokens latents via attention pooling guidé par requêtes, puis injecte ces tokens dans le chemin de génération d'actions du sous-objectif suivant. Évalué sur le benchmark RoboMME, le résultat le plus saillant porte sur la tranche "SwingXtimes" à N=3 répétitions : le taux de succès passe de 0 % à 47,8 %, tandis que les épisodes à exécution unique restent inchangés, confirmant que les gains sont strictement confinés aux tâches causalement dépendantes entre sous-objectifs. Ce résultat pointe une limite structurelle précise des VLA à fenêtre courte : l'absence d'un canal explicite pour propager l'état entre sous-tâches. Les architectures actuelles, qu'il s'agisse de π₀, OpenVLA ou des variantes à mémoire existantes, gèrent bien la manipulation pas-à-pas, mais peinent dès que la réussite d'une étape conditionne la suivante. WeaveLA montre qu'un module léger, déclenché uniquement sur les événements de complétion de sous-objectifs, suffit à corriger cette fragilité sans régression sur les tâches simples. C'est un signal favorable pour les intégrateurs industriels qui cherchent à déployer des politiques génériques sur des workflows multi-étapes sans réentraîner l'intégralité du modèle. Le backbone π₀.₅ utilisé est celui de Physical Intelligence, startup fondée à San Francisco en 2023 et ayant levé environ 400 millions de dollars, devenue référence de facto en manipulation généraliste. WeaveLA s'inscrit dans un courant visant à augmenter les VLA par des modules de mémoire externe plutôt que de les remplacer, une direction concurrente aux travaux de Google DeepMind (RT-2, RT-X), NVIDIA (GR00T N2) et Figure AI (Helix). Étant un preprint non relu par les pairs, le travail ne s'accompagne d'aucun calendrier de déploiement ni de partenariat annoncé, et ses résultats, obtenus en environnement simulé, restent à valider sur des plateformes réelles.

RechercheOpinion
1 source
De la réaction à l'anticipation : un graphe de tâches à base d'agents pour la reprise proactive en manipulation robotique
2arXiv cs.RO 

De la réaction à l'anticipation : un graphe de tâches à base d'agents pour la reprise proactive en manipulation robotique

Une équipe de recherche a publié en mai 2025 sur arXiv (identifiant 2605.11951) AgentChord, un système multi-agents qui anticipe les pannes de manipulation robotique avant l'exécution plutôt qu'en les traitant de manière réactive. L'architecture repose sur un graphe de tâches dirigé enrichi, en amont de toute exécution, de branches de récupération pré-compilées et contextualisées selon chaque étape critique. Trois agents spécialisés structurent ce pipeline : un "composer" modélise la tâche nominale, un "arranger" greffe les branches de récupération anticipées, et un "conductor" orchestre les transitions via des moniteurs à faible latence. Les expériences portent sur des tâches de manipulation bimanuelle à horizon long ; les auteurs rapportent une amélioration "substantielle" des taux de succès sans publier de métriques chiffrées précises dans l'abstract disponible. Le principal apport est d'éliminer la latence inhérente au pipeline classique "détecter-raisonner-récupérer", dans lequel chaque échec déclenche un nouvel appel à un LLM ou à un planificateur symbolique. En pré-compilant les correctifs avant le début de la tâche, AgentChord permet une réponse immédiate sans re-planification dès qu'un moniteur détecte une déviation. Pour les intégrateurs industriels qui automatisent des opérations en cellule non structurée, cette architecture de graphe anticipatif pourrait réduire les arrêts imprévus liés aux échecs de manipulation. L'approche présente néanmoins une limite structurelle : les branches pré-compilées ne couvrent que les pannes anticipées, non les défaillances inédites ou hors-modèle. La robustesse de la manipulation en conditions réelles reste l'un des goulots d'étranglement centraux de la robotique commerciale, que ce soit pour les bras industriels ou les humanoïdes en phase de déploiement comme Optimus de Tesla ou les robots de Figure AI. AgentChord s'inscrit dans un courant qui exploite les LLMs comme orchestrateurs de logique de haut niveau, en complément de politiques d'action de bas niveau. Des approches concurrentes comme les VLA Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA intègrent la récupération de manière implicite dans le réseau de politique, là où AgentChord opte pour une représentation explicite en graphe, plus transparente mais potentiellement moins générique face à la variabilité du monde réel. La page projet est accessible sur shengxu.net/AgentChord ; la validation hors banc de test académique reste la prochaine frontière.

RecherchePaper
1 source
Apprentissage d'une exécution robuste en manipulation robotique par apprentissage par renforcement à base d'agents
3arXiv cs.RO 

Apprentissage d'une exécution robuste en manipulation robotique par apprentissage par renforcement à base d'agents

Traduction en cours. Ce papier de recherche s'attaque à un problème central de la manipulation robotique : la fragilité d'exécution face à l'incertitude et aux tâches longues, où une petite déviation peut faire échouer toute une séquence d'actions. Les modèles vision-langage-action (VLA) actuels, malgré leurs bonnes capacités de généralisation, manquent de mécanismes explicites pour détecter qu'une exécution dérape et pour s'en remettre. Les auteurs proposent deux contributions complémentaires : des métriques permettant d'évaluer en temps réel la qualité de l'exécution, et un cadre d'apprentissage par renforcement dit "agentique", où une politique de haut niveau observe l'historique récent d'exécution et choisit parmi un petit ensemble de modes d'exécution pour réguler le comportement du robot. Plutôt que de réapprendre directement les actions bas niveau, cette politique déclenche des mécanismes de récupération qui ramènent le robot vers des états nominaux déjà visités, permettant à la tâche de reprendre son cours. Testée sur le benchmark LIBERO, la méthode améliore le taux de réussite jusqu'à 13,7% en conditions standards, et jusqu'à 39,2% en conditions perturbées. L'enjeu dépasse la simple performance chiffrée : c'est une réponse directe à l'écart entre démonstration et réalité qui pénalise l'industrie humanoïde et les intégrateurs. Un modèle VLA capable d'enchaîner des tâches en laboratoire s'effondre souvent dès qu'un objet glisse, qu'un capteur bruite, ou qu'une perturbation externe survient sur une ligne réelle. En ajoutant une couche de supervision qui détecte la dérive et enclenche une correction plutôt que de laisser le modèle bas niveau tenter d'improviser, cette approche s'attaque directement à la robustesse, le principal frein à la mise en production de bras manipulateurs et d'humanoïdes en environnement industriel non contrôlé. Le gain nettement plus marqué en conditions perturbées (39,2%) qu'en conditions standards (13,7%) suggère que le bénéfice réel se manifeste précisément là où les décideurs B2B en ont besoin: en présence d'aléas, pas en démo scriptée. Ce travail s'inscrit dans la lignée des recherches récentes sur les modèles VLA généralistes (dans la veine de Pi-0 ou GR00T N2), qui ont démontré une capacité de généralisation impressionnante mais restent critiqués pour leur manque de garanties d'exécution en conditions réelles. En séparant la décision de haut niveau (quel mode d'exécution adopter) de l'apprentissage bas niveau des actions, les auteurs évitent de devoir réentraîner l'ensemble du modèle VLA pour gagner en robustesse, une approche modulaire qui pourrait s'intégrer à des piles existantes plutôt que les remplacer. Reste à voir si cette architecture agentique se transpose au-delà du benchmark simulé LIBERO vers des déploiements physiques réels, où la latence de décision et la diversité des modes de défaillance sont bien plus complexes qu'en simulation.

RecherchePaper
1 source
4arXiv cs.RO 

GaussMemory : mémoire de scène en gaussiennes 3D pilotée par la tâche pour la manipulation robotique à long horizon

Un article de recherche publie sur arXiv le 18 aout 2026 (référence 2608.14986v1) présente GaussMemory, un système de mémoire spatiale pour la manipulation robotique a long horizon, construit sur le 3D Gaussian Splatting comme substrat géométrique persistant. A la différence des mémoires 3D existantes, qui enregistrent les observations selon des règles fixes en traitant chaque élément de la scene avec la même importance, GaussMemory apprend de bout en bout quels objets suivre précisément, a quelle fréquence les mettre a jour et quoi oublier. Sur les bancs d'essai LIBERO et VLABench, il depasse le système MemoryVLA sur les taches Goal et Long-10, et surpasse le modèle π0-FAST de 5,2 points sur la piste 1 et de 6,0 points sur la piste 6. Le problème vise est bien connu du secteur: les architectures vision-langage-action mémorisent généralement l'environnement de façon passive, sans distinguer ce qui compte pour la tache en cours, ce qui dégradé les performances des que les séquences de manipulation s'allongent. En unifiant mise a jour et lecture de la mémoire dans un seul mécanisme appris plutôt que des heuristiques écrites a la main, GaussMemory s'inscrit dans une tendance de fond visant a faire passer les VLA de démonstrations courtes en laboratoire vers des taches multi-étapes plus proches des besoins industriels réels. Pour les intégrateurs qui évaluent des piles VLA, des gains chiffres sur des benchmarks standardises comme LIBERO et VLABench offrent un point de comparaison plus solide qu'une simple vidéo de démonstration. Le travail se positionne explicitement face a deux références du domaine, MemoryVLA et π0-FAST, ce dernier dérivé du modèle π0 de Physical Intelligence, citées comme bases de comparaison directes plutôt que comme simples antécédents. Il s'inscrit dans la lignée des travaux sur le 3D Gaussian Splatting, technique de représentation de scènes issue de la vision par ordinateur, de plus en plus réutilisée comme mémoire de travail pour des agents robotiques. A ce stade, il s'agit d'une publication de recherche évaluée uniquement en simulation, sans déploiement matériel annonce ni partenaire industriel cite, et sans calendrier donne pour un transfert vers des robots physiques, ce qui distingue clairement cette contribution d'une annonce produit ou d'un pilote commercial.

RechercheActu
1 source