Aller au contenu principal
Retour sur la tâche de manipulation « Push-T » avec la robotique à base d'agents
RecherchearXiv cs.RO 

Retour sur la tâche de manipulation « Push-T » avec la robotique à base d'agents

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié le 20 août 2026 sur arXiv (référence 2608.18227v1) revisite Push-T, benchmark de référence pour l'apprentissage de politiques de manipulation par démonstration humaine, dans lequel un robot doit pousser un bloc en forme de T jusqu'à une pose cible en n'utilisant qu'un seul point de contact. Les auteurs ont chargé un agent de codage LLM, Claude Code associé au modèle Fable 5, de produire une solution algorithmique sans aucune donnée de démonstration. L'agent a retrouvé de lui-même la simulation 2D Gym du benchmark en ligne, mené des expériences simulées pour apprendre la mécanique de poussée, puis optimisé itérativement son code jusqu'à atteindre 100% de réussite avec 46% d'étapes en moins que la meilleure politique de diffusion entraînée sur 200 démonstrations humaines. Il a ensuite étendu la tâche à tout l'alphabet, de Push-A à Push-Z, via un curriculum auto-généré, et produit des simulations 3D avec retour visuel pour les bras robotiques Franka et UR5. Vidéos, politiques et détails complets doivent encore être publiés en ligne.

Ce résultat interroge une hypothèse centrale du secteur, selon laquelle la manipulation robotique fine passe nécessairement par l'apprentissage par imitation ou par des modèles vision-langage-action entraînés sur de vastes jeux de démonstrations, à l'image de Pi-0, GR00T N2 ou Helix. Ici, un agent de codage génère un contrôle explicite et interprétable qui surpasse une politique de diffusion apprise, sans collecte de données préalable, ce qui intéresse directement les intégrateurs et équipes de R&D cherchant à réduire le coût et le délai de déploiement sur des tâches bien spécifiées. Le succès reste toutefois circonscrit à un benchmark 2D très étudié : l'extension à des simulations 3D avec Franka et UR5 constitue un pas vers la généralisation, mais aucune validation sur robot physique réel n'est rapportée, ce qui limite la portée immédiate pour la production.

Push-T tire son origine des travaux sur la Diffusion Policy, qui en avaient fait un banc d'essai standard pour comparer les politiques de manipulation apprises. Ce court article se positionne dans le champ émergent de la « robotique agentique », où des agents de codage basés sur des LLM, comme Claude Code, sont testés comme alternative aux pipelines d'apprentissage par imitation qui dominent aujourd'hui la robotique humanoïde et les bras manipulateurs. Aucun laboratoire ni entreprise autre qu'Anthropic, via son modèle Fable 5, n'est cité dans le résumé, et aucune date de publication des vidéos et politiques associées n'est encore précisée. L'étude reste à ce stade une preuve de concept en simulation, sans pilote industriel ni déploiement matériel confirmé.

À lire aussi

De la réaction à l'anticipation : un graphe de tâches à base d'agents pour la reprise proactive en manipulation robotique
1arXiv cs.RO 

De la réaction à l'anticipation : un graphe de tâches à base d'agents pour la reprise proactive en manipulation robotique

Une équipe de recherche a publié en mai 2025 sur arXiv (identifiant 2605.11951) AgentChord, un système multi-agents qui anticipe les pannes de manipulation robotique avant l'exécution plutôt qu'en les traitant de manière réactive. L'architecture repose sur un graphe de tâches dirigé enrichi, en amont de toute exécution, de branches de récupération pré-compilées et contextualisées selon chaque étape critique. Trois agents spécialisés structurent ce pipeline : un "composer" modélise la tâche nominale, un "arranger" greffe les branches de récupération anticipées, et un "conductor" orchestre les transitions via des moniteurs à faible latence. Les expériences portent sur des tâches de manipulation bimanuelle à horizon long ; les auteurs rapportent une amélioration "substantielle" des taux de succès sans publier de métriques chiffrées précises dans l'abstract disponible. Le principal apport est d'éliminer la latence inhérente au pipeline classique "détecter-raisonner-récupérer", dans lequel chaque échec déclenche un nouvel appel à un LLM ou à un planificateur symbolique. En pré-compilant les correctifs avant le début de la tâche, AgentChord permet une réponse immédiate sans re-planification dès qu'un moniteur détecte une déviation. Pour les intégrateurs industriels qui automatisent des opérations en cellule non structurée, cette architecture de graphe anticipatif pourrait réduire les arrêts imprévus liés aux échecs de manipulation. L'approche présente néanmoins une limite structurelle : les branches pré-compilées ne couvrent que les pannes anticipées, non les défaillances inédites ou hors-modèle. La robustesse de la manipulation en conditions réelles reste l'un des goulots d'étranglement centraux de la robotique commerciale, que ce soit pour les bras industriels ou les humanoïdes en phase de déploiement comme Optimus de Tesla ou les robots de Figure AI. AgentChord s'inscrit dans un courant qui exploite les LLMs comme orchestrateurs de logique de haut niveau, en complément de politiques d'action de bas niveau. Des approches concurrentes comme les VLA Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA intègrent la récupération de manière implicite dans le réseau de politique, là où AgentChord opte pour une représentation explicite en graphe, plus transparente mais potentiellement moins générique face à la variabilité du monde réel. La page projet est accessible sur shengxu.net/AgentChord ; la validation hors banc de test académique reste la prochaine frontière.

RecherchePaper
1 source
Adaptation cinématique basée sur la force et le couple pour les tâches de manipulation robotique
2arXiv cs.RO 

Adaptation cinématique basée sur la force et le couple pour les tâches de manipulation robotique

Publié sur arXiv le 21 août 2026 (arXiv:2608.21592v1), l'article présente une méthode d'adaptation cinématique en ligne pour la manipulation robotique en contact riche, où la relation entre les articulations d'un robot et l'outil qu'il tient change à chaque prise, parfois presque instantanément lors des changements de mode de contact, notamment pour les mains multi-doigts dont les points de contact ne sont pas fixés à l'avance. Les auteurs dérivent une loi de mise à jour dont la stabilité est démontrée mathématiquement: elle identifie la cinématique d'un outil inconnu à partir des seules mesures articulaires et d'un capteur de force/couple monté au poignet, sans aucune mesure extéroceptive de la pointe de l'outil, aussi bien en rigide qu'avec un contrôleur de compliance en boucle interne. L'identification ne porte que sur les directions excitées par le mouvement: la longueur d'un outil reste inobservable lors d'une insertion rigide en ligne droite, mais devient partiellement observable via le relâchement passif d'une boucle compliante. Une formulation alternative en programme quadratique reproduit le terme de prédiction de cette loi mais échoue à reproduire son terme de suivi. La validation reste, pour l'instant, une simulation d'insertion cheville-trou. Ce travail cible un verrou concret pour l'industrie: la plupart des systèmes de manipulation supposent une cinématique outil-effecteur fixe et connue, ce qui impose de recalibrer le robot à chaque changement d'outil ou de préhenseur, un frein à la polyvalence recherchée par les intégrateurs et les concepteurs de mains robotiques multi-doigts. En rendant l'estimation purement proprioceptive, sans caméra ni capteur tactile dédié, l'approche réduit l'instrumentation nécessaire pour des tâches de prise pleine main où les points de contact varient à chaque saisie. Elle s'inscrit aussi dans un débat plus large de la recherche en robotique: découpler l'apprentissage de la politique de tâche, par exemple via apprentissage par renforcement, de l'adaptation aux spécificités physiques d'un robot, d'une main ou d'un outil donné, dans l'idée de faciliter le transfert de politiques apprises vers d'autres configurations matérielles sans réentraînement complet. Les auteurs présentent ce travail comme une première étape d'un programme de recherche plus large, et non comme une solution aboutie: aucune validation sur robot physique n'est rapportée, seulement une simulation simple d'insertion, ce qui laisse ouverte la question du passage à l'échelle sur des prises complexes et sur du matériel réel. Le résumé public n'identifie ni laboratoire ni entreprise, et aucun lien n'est établi avec des plateformes commerciales comme Figure ou Tesla Optimus, ni avec des modèles vision-langage-action tels que Pi-0 ou GR00T N2. La démarche s'inscrit dans la lignée des recherches sur la manipulation dextre adaptative et l'estimation en ligne de paramètres physiques, un axe exploré en parallèle par plusieurs laboratoires de robotique pour réduire la dépendance des politiques de manipulation à une calibration extéroceptive précise.

RecherchePaper
1 source
Recova : récupération sur échec guidée par des agents pour la manipulation robotique autonome
3arXiv cs.RO 

Recova : récupération sur échec guidée par des agents pour la manipulation robotique autonome

Des chercheurs présentent sur arXiv Recova, un cadre logiciel piloté par un agent qui traite les échecs de manipulation robotique, ces situations où la scène se retrouve dans un état dont la politique de tâche ne peut plus sortir. Le système développe conjointement l'exécution de la tâche et la récupération dans un jumeau numérique reconstruit de la scène. L'agent y diagnostique les pannes, teste des programmes correctifs et collecte des trajectoires réussies, pour la tâche comme pour la récupération, destinées à entraîner deux politiques distinctes. En déploiement, il surveille la progression, déclenche une récupération apprise ou programmée, vérifie que la scène est restaurée, puis reprend la tâche. Si aucune récupération adaptée n'existe, une démonstration humaine règle le cas et alimente la boucle d'apprentissage. Les essais réels et les démonstrations sont routés vers la politique concernée pour un entraînement DAgger. Sur six configurations LIBERO-Pro et quatre catégories MolmoSpaces, Recova atteint 78,8 % et 64,9 % de succès moyen, contre 71,7 % et 38,0 % pour les meilleures méthodes de référence. Sur quatre postes robotisés réels collectant en parallèle, le fine-tuning DAgger fait passer le succès moyen de 23,8 % à 77,5 %, et les compétences de récupération le portent à 87,5 %. Sur une tâche donnée, l'intervention humaine observée tombe de 87,5 % à 0 % en quatre cycles de collecte. L'enjeu dépasse la robustesse brute. La plupart des politiques VLA et des pipelines d'imitation sont évalués sur des trajectoires nominales, alors que le coût opérationnel d'un robot en production tient largement à ce qui se passe après l'échec : objet tombé, scène désordonnée, nécessité d'un opérateur. Recova propose de transformer chaque panne en capacité réutilisable et de réduire progressivement la supervision humaine, ce qui répond directement à la question du coût de téléopération et d'assistance à distance pour les intégrateurs et les exploitants. Le résultat le plus parlant est l'écart sur MolmoSpaces (64,9 % contre 38,0 %), plus marqué que sur LIBERO-Pro. Des réserves s'imposent toutefois : l'évaluation réelle repose sur peu de postes et de tâches, la baisse de l'intervention à 0 % ne concerne qu'une seule tâche, et rien n'est dit sur les temps de cycle, les coûts de reconstruction du jumeau numérique ou la généralisation à des scènes très différentes. Il s'agit d'un travail de recherche, sans produit livré ni déploiement industriel. Le travail s'inscrit dans la convergence entre agents LLM de planification, jumeaux numériques pour la génération de données et apprentissage par correction de type DAgger, une voie explorée pour limiter la dépendance à la collecte massive de démonstrations. Il se positionne face aux approches de fine-tuning de VLA et de simulation à grande échelle que poursuivent des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T) ou Figure (Helix), qui misent surtout sur davantage de données plutôt que sur une récupération explicite des échecs. LIBERO-Pro et MolmoSpaces servent ici de bancs d'essai standardisés. La suite logique serait de valider l'approche sur davantage de tâches, de postes et de durées d'exploitation, et de mesurer ses gains en conditions de production, ce que la page projet de l'équipe, liuisabella.com/Recova, ne détaille pas à ce stade.

RecherchePaper
1 source
Ne lâchez pas BATON : manipulation robotique étendue, sous-tâches exploratoires à base d'agents, mémoire des transitions
4arXiv cs.RO 

Ne lâchez pas BATON : manipulation robotique étendue, sous-tâches exploratoires à base d'agents, mémoire des transitions

Des chercheurs publient sur arXiv (arXiv:2608.16889v1) une méthode nommée BATON pour la manipulation robotique "long-horizon", ces taches multi-étapes qui enchainent plusieurs compétences a contact physique. Le problème identifie: les modèles vision-langage-action (VLA) maitrisent de mieux en mieux des compétences isolées, mais les erreurs s'accumulent quand on les chaine, et une approche existante qui fige le VLA et confie la planification a un agent LLM voit son cout d'exploration exploser en T^K épisodes pour K étapes, sans pouvoir dire a quelle étape imputer un échec. BATON explore chaque sous-tache séparément en régime court, stocke sa solution en mémoire, puis compose la trajectoire complète a partir de ces briques, ramenant le cout a une forme additive T*K et permettant d'attribuer chaque échec a une étape précise. Un agent vérificateur contrôle via la camera de poignet le moment d'invoquer le VLA, tandis que des transitions de passation et d'anticipation assurent la cohérence entre sous-taches, sans aucune mise a jour de paramètres. Sur le benchmark RoboMemArena, BATON améliore le taux de réussite des taches de 11,6% et le taux de réussite cumulée de 14,9% par rapport a l'état de l'art. Ce résultat cible le problème qui freine le déploiement industriel des robots manipulateurs sur des taches réelles: réussir des compétences isolées ne garantit pas la réussite d'une chaine complète, le fosse classique entre démonstration et déploiement effectif. En rendant le cout d'exploration additif plutôt que multiplicatif, BATON rend potentiellement viable l'apprentissage autonome de séquences longues sans explosion du nombre d'essais nécessaires, un frein pratique pour qui cherche a automatiser des taches d'assemblage ou de logistique complexes. L'approche souligne surtout que la gestion des transitions entre étapes, et non la seule qualité du VLA, reste souvent l'angle mort des annonces commerciales, qui privilégient des vidéos sélectionnées a des taux de réussite mesures sur benchmark reproductible. Le travail prolonge les architectures combinant un VLA fige et un agent LLM planificateur, une piste déjà jugée prometteuse mais jusque-la bridée par le cout d'exploration sur les taches longues. A la différence des méthodes qui reentrainent ou affinent le VLA, BATON ne met a jour aucun paramètre et repose entièrement sur la mémoire et la composition de sous-solutions apprises séparément. Publie en aout 2026 sous forme de preprint arXiv et évalué uniquement sur le benchmark RoboMemArena, il reste a ce stade un résultat de recherche: aucun code public, aucun partenariat industriel ni déploiement pilote n'est mentionne.

RecherchePaper
1 source