Aller au contenu principal
RecherchearXiv cs.RO 

Encore : découverte à base d'agents de stratégies de manipulation à partir de quelques démonstrations

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent ENCORE, un système où un agent de programmation apprend des stratégies de manipulation robotique à partir de quelques démonstrations, non pas comme données d'entraînement mais comme éléments à lire et analyser. Un « builder » déterministe transforme chaque démonstration en un dossier regroupant des images clés multi-vues, les événements du gripper, des bandes d'images et la trajectoire complète. L'agent étudie ce dossier, écrit un programme de politique de contrôle s'appuyant sur une API fixe de perception et d'action, l'affine sur quelques essais de développement, puis le fige avant une évaluation scellée qui ne révèle jamais le signal de succès. Sur LIBERO-PRO, le premier programme produit par l'agent réussit déjà la moitié des tâches perturbées lorsqu'il dispose de démonstrations, contre une seule tâche sans elles. Une fois figés, les programmes atteignent 96,3 % de réussite, contre 89,3 % pour le meilleur système agentique antérieur utilisant le même modèle de langage. Sur RoboDojo, dont les consignes ne précisent pas le but, aucun programme ne réussit sans démonstrations. Le système fonctionne aussi sur un robot bimanuel réel, qui apprend le passage de cube d'une main à l'autre et le retournement de tasse à partir de cinq démonstrations chacune.

L'intérêt tient à ce que ce travail déplace le problème. Les agents de code savent écrire et déboguer des programmes, mais une consigne en une phrase ne dit rien de la prise, de l'ordre des contacts ou de l'état final attendu, et l'agent en est réduit à l'essai-erreur. Les résultats sur RoboDojo montrent que ces informations ne se devinent pas : sans démonstration, le taux de réussite est nul. L'approche produit des politiques sous forme de code, donc lisibles et modifiables, ce qui attire les intégrateurs qui redoutent l'opacité des VLA. Le protocole d'évaluation scellé répond aussi à une critique fréquente sur les benchmarks agentiques, où le signal de succès peut fuiter vers l'agent. Il faut toutefois rester prudent : LIBERO-PRO est un banc de test simulé, l'écart de 7 points porte sur un seul modèle de langage, et la validation réelle se limite à deux tâches simples sur un seul robot.

Ce travail s'inscrit dans deux courants. D'un côté, les modèles VLA comme Pi-0 ou GR00T apprennent des politiques de bout en bout à partir de grands volumes de données. De l'autre, les systèmes agentiques qui génèrent du code de contrôle à partir de modèles de langage, dont ENCORE dépasse le meilleur représentant testé. La question qui reste ouverte est celle du passage à l'échelle : des tâches longues, des objets déformables, des scènes non structurées. L'article, publié sur arXiv (2609.37359), ne mentionne ni déploiement industriel ni calendrier de pilote.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

RAPID : programmation à base d'agents pour robots à partir de démonstrations
1arXiv cs.RO 

RAPID : programmation à base d'agents pour robots à partir de démonstrations

Une équipe de recherche présente RAPID (Robot Agentic Programming from Demonstrations) dans un preprint publié sur arXiv le 25 septembre 2026 (arXiv:2609.30249) : un système qui génère, vérifie et affine automatiquement un programme robotique complet à partir d'une seule démonstration visuelle humaine, sans corpus d'entraînement massif. La boucle agentique itérative infère elle-même, depuis cette démonstration, trois ingrédients clés : une spécification de tâche testable, des primitives d'action exécutables par le robot, et un environnement interactif pour exécuter et vérifier le programme. Pour rendre le résultat réutilisable au-delà du contexte filmé, RAPID exprime les primitives comme des programmes d'optimisation de trajectoire reproduisant l'effet de mouvement au niveau de l'objet, assemblés par des contraintes relationnelles qui capturent la géométrie de la scène au moment de l'exécution. Les chercheurs ont testé le système en simulation sur huit tâches de manipulation non préhensile riches en contacts (pousser, pivoter, basculer des objets) et sur des tâches préhensiles classiques du benchmark LIBERO-Pro, puis l'ont déployé sur un bras robotique Franka réel pour l'ensemble des huit tâches non préhensiles ; le projet est documenté sur yuyaoliu.me/projects/rapid. L'intérêt de RAPID tient à la difficulté qu'il attaque : transformer une démonstration unique en un programme réutilisable et généralisable, là où les politiques d'apprentissage par imitation ou les modèles vision-langage-action (VLA) exigent généralement des corpus de démonstrations massifs. En appliquant à la manipulation robotique la logique des agents de codage logiciel, capables d'itérer, tester et corriger leur propre production, RAPID parie que la synthèse de programmes symboliques explicites généralise mieux que des politiques paramétriques apprises, en particulier sur les tâches non préhensiles où la dynamique de contact et le frottement rendent la généralisation notoirement difficile. Les auteurs revendiquent une généralisation à la pose, la forme, le matériau et l'environnement des objets, une affirmation émanant pour l'instant d'une seule équipe sur un périmètre de tâches limité et non validée indépendamment ; le déploiement réel se cantonne d'ailleurs à un unique bras Franka et aux tâches non préhensiles, les tâches préhensiles de LIBERO-Pro n'ayant été testées qu'en simulation. Il s'agit donc d'un résultat de recherche prometteur mais encore au stade du preprint, pas d'un produit ou d'un pipeline prêt pour l'intégration industrielle. Le travail s'inscrit dans un mouvement plus large visant à transposer aux robots le paradigme des agents de codage popularisé en génie logiciel, plutôt que d'empiler les données pour entraîner des politiques de bout en bout. Il se positionne ainsi en alternative aux approches VLA dominantes du secteur, comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, qui apprennent des politiques directement à partir de grands ensembles de démonstrations plutôt que de synthétiser un programme symbolique explicite à partir d'un seul exemple ; aucun acteur français ou européen n'apparaît dans cette publication. À ce stade, RAPID reste un résultat académique diffusé via un preprint arXiv et un site de projet présentant des matériaux complémentaires, sans partenariat industriel, pilote de déploiement ni calendrier de commercialisation annoncés par les auteurs.

RecherchePaper
1 source
HoMMI : apprentissage de la manipulation mobile corps entier à partir de démonstrations humaines
2arXiv cs.RO 

HoMMI : apprentissage de la manipulation mobile corps entier à partir de démonstrations humaines

Une équipe de chercheurs a publié sur arXiv (arXiv:2603.03243v2) HoMMI, pour Whole-Body Mobile Manipulation Interface, un framework d'apprentissage par imitation permettant à un robot mobile de maîtriser la manipulation bimanuelle et la navigation à partir de démonstrations humaines réalisées sans robot. Le principe : un opérateur humain porte une interface portative héritée du projet UMI (Universal Manipulation Interface), enrichie d'une caméra égocentrique capturant le contexte global de la scène (position dans l'espace, état de l'environnement). Ces données brutes alimentent une politique apprise, transférée ensuite sur un robot à corps entier (bras, torse, base mobile) sans que celui-ci n'ait été présent lors de la collecte. La difficulté centrale que HoMMI cherche à résoudre est l'"embodiment gap" : la différence morphologique et sensorielle entre humain et robot rend le transfert de politique difficile, particulièrement en perception égocentrique où les champs de vue et hauteurs d'oeil divergent fortement. Les auteurs proposent trois briques techniques pour combler cet écart : une représentation visuelle agnostique à l'embodiment, une représentation d'action "head relaxed" qui neutralise les variations de mouvement de tête, et un contrôleur corps entier réalisant les trajectoires main-oeil sous contraintes physiques du robot. Ces choix permettent des tâches longue-séquence mobilisant navigation, perception active et coordination bimanuelle, le type de scénario que les architectures Vision-Language-Action (VLA) comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA visent également à résoudre. Les résultats, présentés sous forme de vidéos sur hommi-robot.github.io, restent à valider en conditions non contrôlées et sur des benchmarks standardisés. HoMMI s'inscrit dans la continuité directe du projet UMI (Columbia/Stanford, 2024), qui avait popularisé la collecte portable de démonstrations pour la manipulation fixe sur table. L'extension au robot mobile ajoute la dimension navigation, saut de complexité majeur pour le sim-to-real et la généralisation hors laboratoire. Les approches concurrentes incluent Mobile ALOHA (Stanford), les pipelines de distillation de données de Physical Intelligence, et les travaux de manipulation bimanuelle ALOHA/ACT de Berkeley. HoMMI reste à ce stade un preprint arXiv sans déploiement industriel annoncé ni métriques de taux de succès publiées, une limite habituelle des publications en robotique d'apprentissage avant revue par les pairs.

RecherchePaper
1 source
DynamicManip : permettre la manipulation dynamique à partir d'une seule démonstration statique
3arXiv cs.RO 

DynamicManip : permettre la manipulation dynamique à partir d'une seule démonstration statique

DynamicManip, présenté dans un article arXiv publié le 1er août 2026, s'attaque à un problème précis de la robotique manipulatrice : apprendre à un bras robotique à saisir des objets en mouvement ou nécessitant des ajustements rapides, sans avoir besoin de milliers de démonstrations. Le système repose sur deux briques. La première est un pipeline d'augmentation de données qui transforme une seule démonstration statique en une multitude de scénarios dynamiques synthétiques, contournant ainsi la complexité combinatoire habituellement nécessaire pour couvrir toutes les variations de trajectoire, vitesse et position d'un objet mobile. La seconde est une politique d'imitation dite "dynamic-aware", capable d'ajuster sa fréquence d'inférence en temps réel selon le niveau de dynamisme de la tâche, plutôt que d'interroger le modèle à cadence fixe. Les auteurs ont également construit un benchmark dédié à la manipulation dynamique, avec un système d'évaluation automatique permettant des tests reproductibles à grande échelle. En simulation comme en conditions réelles, DynamicManip affiche un taux de réussite moyen supérieur de 18,4 points de pourcentage à l'état de l'art, avec une latence de requête de politique réduite de 32,9 %. Ce résultat cible un angle mort connu du secteur : la plupart des politiques de manipulation par apprentissage par imitation (VLA compris) sont entraînées et validées sur des objets statiques ou des trajectoires prévisibles, et s'effondrent dès qu'il faut réagir à un mouvement imprévu, un scénario pourtant courant sur une ligne de production ou en logistique (convoyeurs, pièces qui glissent, tri en mouvement). En réduisant drastiquement le besoin de données réelles par démonstration, un seul exemple statique suffit à générer la diversité nécessaire, et en abaissant la latence d'inférence, DynamicManip répond directement à deux freins à l'industrialisation des politiques d'apprentissage : le coût de collecte de données et le temps de cycle. Pour les intégrateurs, cela ouvre la voie à des déploiements sur des tâches jusqu'ici jugées trop instables pour l'apprentissage par imitation, sans multiplier les heures de téléopération pour constituer un jeu de démonstrations. Le papier s'inscrit dans la lignée des travaux récents sur l'apprentissage par imitation efficace en données (few-shot, one-shot manipulation), un axe de recherche actif face au coût prohibitif de la collecte de démonstrations réelles pour les politiques VLA à grande échelle. Contrairement aux annonces commerciales de Figure, Physical Intelligence (Pi-0) ou NVIDIA (GR00T), il s'agit ici d'une contribution académique testée sur un benchmark maison plutôt que d'un déploiement industriel documenté ; les chiffres de performance, bien que précis, restent à confirmer sur des tâches et environnements tiers avant toute généralisation. Aucun acteur français ou européen n'est mentionné dans cette publication.

RecherchePaper
1 source
ASPIRE : découverte de compétences à base d'agents pour la robotique
4arXiv cs.RO 

ASPIRE : découverte de compétences à base d'agents pour la robotique

ASPIRE (Agentic Skill Programming through Iterative Robot Exploration) est un nouveau système d'apprentissage continu pour la robotique, décrit dans un article publié sur arXiv (2607.00272) début juillet 2026. Contrairement à la programmation robotique traditionnelle, qui impose de coder manuellement la perception multimodale, la gestion des contacts physiques et la diversité des échecs d'exécution, ASPIRE écrit et corrige lui-même ses programmes de contrôle selon le paradigme "code-as-policy", puis capitalise chaque correction validée dans une bibliothèque de compétences réutilisables. Le système s'appuie sur trois briques : un moteur d'exécution en boucle fermée qui expose des traces multimodales fines pour diagnostiquer les échecs et synthétiser des réparations ; une bibliothèque de compétences qui s'enrichit en continu de correctifs transférables ; et une recherche évolutionnaire qui génère des séquences de tâches et des programmes de contrôle variés, au-delà du simple raffinement trajectoire par trajectoire. Sur les bancs d'essai simulés, ASPIRE dépasse les méthodes précédentes de 77% sur les manipulations perturbées de LIBERO-Pro, 72% sur les transferts bimanuels de Robosuite, et 32% sur les tâches ménagères longues de BEHAVIOR-1K. Ce travail s'attaque directement à un point de friction connu du secteur : la difficulté à faire generaliser des politiques de contrôle robotique au-delà de la tâche pour laquelle elles ont été conçues, sans réentraînement lourd à chaque nouvelle configuration. La bibliothèque cumulative d'ASPIRE permet une généralisation zero-shot à des tâches longues jamais vues : 31% de réussite sur LIBERO-Pro Long, contre seulement 4% pour les meilleures méthodes concurrentes, qui pourtant s'appuient sur du raisonnement et des tentatives répétées au moment de l'exécution. Pour les intégrateurs et décideurs robotique, c'est un signal encourageant sur la viabilité de bibliothèques de compétences auto-construites plutôt que de politiques VLA monolithiques entraînées une fois pour toutes, mais les auteurs restent prudents : ils ne parlent que de "premières preuves" de transfert simulation-vers-réel, pas d'un problème résolu. Ce résultat s'inscrit dans la lignée des travaux récents sur les politiques de contrôle générées ou affinées par des grands modèles de langage, où l'enjeu principal est de dépasser le stade de la démonstration isolée pour atteindre une robustesse répétable en conditions réelles. Contrairement aux approches par apprentissage par renforcement pur ou aux VLA entraînés de bout en bout (type Pi-0 ou GR00T), ASPIRE mise sur l'exploration itérative et la mémoire de compétences pour réduire l'effort de programmation à chaque nouvel embodiment ou API robotique. Les auteurs annoncent vouloir approfondir la validation du transfert sim-to-real sur des plateformes physiques variées, une étape encore à venir puisque l'article ne documente pour l'instant que des résultats en simulation.

RecherchePaper
1 source