Aller au contenu principal
TaPeR : récupération probabiliste de graphes de précédence de tâches épars à partir de quelques démonstrations
RecherchearXiv cs.RO 

TaPeR : récupération probabiliste de graphes de précédence de tâches épars à partir de quelques démonstrations

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

La méthode TaPeR (Probabilistic Recovery of Sparse Task Precedence Graphs), décrite dans un article déposé sur arXiv le 24 août 2026 (arXiv:2608.21035v1), s'attaque à un problème central de l'apprentissage par démonstration en robotique manipulatrice : reconstruire l'ordre partiel d'une tâche longue à partir de quelques démonstrations humaines seulement. L'exemple donné par les auteurs est parlant : lors de l'assemblage d'un appareil électronique, la batterie et la carte électronique peuvent être installées dans n'importe quel ordre, mais l'une comme l'autre doivent être en place avant la fermeture du boîtier. Plutôt que de s'appuyer sur des prédicats symboliques annotés à la main, comme le font les approches existantes, TaPeR construit des graphes cinématiques simples et des distributions de poses relatives entre objets, à partir desquels il estime des probabilités de dépendance entre paires d'étapes. Ces probabilités initialisent les poids d'un graphe de précédence, ensuite affiné par un pipeline de filtrage pour produire le graphe final des dépendances de tâche. La méthode est testée sur un benchmark existant ainsi que sur un nouveau jeu de données de tâches plus longues et plus complexes créé par les chercheurs.

L'enjeu est directement industriel : le principal frein à l'apprentissage par démonstration à grande échelle est le coût de l'annotation symbolique, qui exige un ancrage explicite (grounding) difficile à obtenir hors laboratoire. En s'en passant, TaPeR promet de récupérer des structures de tâches plus précises avec moins de démonstrations que les méthodes concurrentes, un avantage direct pour les intégrateurs qui doivent programmer des séquences d'assemblage sans multiplier les sessions de téléopération. Autre point notable, les graphes obtenus permettent de générer plusieurs ordres d'exécution valides pour une même tâche, ouvrant la voie à une planification plus flexible plutôt qu'à une séquence figée.

Il s'agit toutefois d'un travail de recherche publié en preprint, évalué sur benchmarks et jeux de données contrôlés, sans déploiement industriel ni robot physique cité en conditions réelles. L'article se positionne comme une alternative aux approches hybrides temporel-symbolique existantes en apprentissage par démonstration, sans mention d'acteurs commerciaux ni de partenariats industriels à ce stade.

Dans nos dossiers

À lire aussi

Générer des mains robotiques à partir de démonstrations humaines
1arXiv cs.RO 

Générer des mains robotiques à partir de démonstrations humaines

Des chercheurs ont publié un framework de co-conception de mains robotiques guidé par les données (arXiv:2506.20549, juin 2025). Le problème visé est le co-design corps/contrôleur: optimiser simultanément la morphologie d'un effecteur et son contrôleur crée un espace combinatoire difficilement tractable. La solution exploite plus de 4 millions de frames de mouvements de bouts de doigts humains issus de manipulations quotidiennes pour optimiser des mains à structure arborescente, en utilisant une politique de contrôle minimale commune à la phase de recherche et à la phase opérationnelle: le suivi de position des fingertips par cinématique inverse (IK). Deux catégories de designs ont été produites: une main à 6 degrés de liberté (DoF) à usage général, et des mains spécialisées à 3 DoF équipées de joints "mimic" à quadrilatère articulé (four-bar spatial). Un acteur entraîné par apprentissage par renforcement (RL) accélère la recherche morphologique, réduisant le temps de calcul de plusieurs heures à quelques minutes; les structures finales sont fabriquées en impression 3D print-in-place, en une seule pièce articulée sans assemblage. En expériences réelles, la main 6-DoF dépasse des mains robotiques commerciales non identifiées sur la précision de suivi télé-opéré, tandis que les mains 3-DoF reproduisent des trajectoires structurées avec une complexité mécanique réduite. L'apport principal est la résolution d'un verrou de fond en co-design: en imposant la même politique IK simple pendant l'optimisation et après fabrication, les auteurs découplent la recherche morphologique de l'apprentissage d'un contrôleur complexe, rendant l'exploration de l'espace de design tractable à grande échelle. Ce résultat soutient une hypothèse émergente: des données massives de mouvement humain non conçues pour la robotique peuvent informer l'optimisation de l'embodiment physique d'un robot, et pas seulement son contrôleur. La comparaison avec des mains commerciales reste difficile à évaluer, le preprint ne précisant ni les références comparées ni les conditions d'évaluation; prudence sur ce point en l'absence de benchmark standardisé. Ce travail prolonge une tendance croissante qui vise à utiliser des données humaines non seulement pour entraîner des politiques robotiques (VLA, imitation learning), mais pour co-générer le hardware lui-même. Les approches concurrentes en evolutionary robotics et en simulation différentiable existent depuis des années mais restent coûteuses en calcul ou peu généralisables; l'originalité de cette contribution réside dans la décorrélation design/contrôle et dans l'usage du RL comme heuristique de recherche morphologique efficace. À ce stade, il s'agit d'un preprint non encore peer-reviewed, sans déploiement industriel ni partenaire commercial annoncé; les suites naturelles seraient une validation sur un spectre plus large de tâches de manipulation et une comparaison rigoureuse avec des benchmarks établis. Aucun acteur européen n'est impliqué dans ces travaux.

RecherchePaper
1 source
SPARC : annotation spatiale fiable à partir de démonstrations robotiques à grande échelle
2arXiv cs.RO 

SPARC : annotation spatiale fiable à partir de démonstrations robotiques à grande échelle

Des chercheurs du groupe Intuitive Robots ont publié sur arXiv (réf. 2606.13497) SPARC, acronyme de Spatial Annotations from Robot Demonstrations with Reliability Calibration. Il s'agit d'un pipeline automatique qui annote des démonstrations robotiques avec des métadonnées spatiales structurées -- boîtes englobantes, trajectoires d'objets, labels de phase de manipulation -- tout en attribuant à chaque annotation un score de fiabilité calibré. Évalué sur 1 700 démonstrations annotées manuellement, couvrant des morphologies et des scénarios variés, SPARC conserve trois fois plus d'échantillons aux points de fonctionnement haute précision par rapport aux pipelines de détection classiques, tout en surpassant ces mêmes baselines sur la précision de localisation. L'équipe introduit également IA-Bench (Interaction-Aware Bench), un benchmark dédié à mesurer la précision des modèles dans la localisation des objets manipulés au fil d'une démonstration. Le code, les données et les modèles sont disponibles publiquement. L'enjeu est directement lié à la scalabilité de l'entraînement des politiques robotiques et des modèles de fondation incarnés (embodied foundation models). Les pipelines d'annotation automatique existants produisent des labels en volume, mais sans signal de qualité fiable : la confiance du détecteur est mal calibrée pour prédire la correction d'une annotation, ce qui oblige les équipes ML à choisir entre bruit et perte de données. SPARC contourne ce dilemme en exploitant la structure spatio-temporelle propre aux tâches robotiques pour générer un signal de fiabilité intrinsèque. Les politiques entraînées sur ces annotations surpassent les baselines dans des scènes réelles encombrées et visuellement ambiguës, ce qui suggère que la qualité du signal d'annotation compte autant que le volume brut de données -- une hypothèse que le secteur commence seulement à tester systématiquement. Le problème de l'annotation à grande échelle est un goulot d'étranglement bien identifié dans la robotique d'apprentissage par imitation, notamment depuis l'émergence des Visual Language Action models (VLA) tels que pi-0 de Physical Intelligence ou OpenVLA de Berkeley. Ces architectures consomment des milliers de démonstrations annotées avec précision, et la vérification humaine ne passe pas à l'échelle. SPARC s'inscrit dans un effort plus large, parallèle aux travaux de Google DeepMind sur RoboAgent ou aux pipelines de données de Hugging Face LeRobot, pour industrialiser la production de datasets robotiques de qualité. La prochaine étape logique sera de valider SPARC sur des distributions d'environnements plus larges et sur des tâches de manipulation longue durée, deux axes où le sim-to-real gap reste ouvert.

UELes laboratoires européens (CEA-List, INRIA, universités) travaillant sur l'apprentissage par imitation peuvent directement exploiter ce pipeline open-source pour améliorer la qualité de leurs datasets robotiques sans coût d'annotation humaine supplémentaire.

RecherchePaper
1 source
RAPID : programmation à base d'agents pour robots à partir de démonstrations
3arXiv cs.RO 

RAPID : programmation à base d'agents pour robots à partir de démonstrations

Une équipe de recherche présente RAPID (Robot Agentic Programming from Demonstrations) dans un preprint publié sur arXiv le 25 septembre 2026 (arXiv:2609.30249) : un système qui génère, vérifie et affine automatiquement un programme robotique complet à partir d'une seule démonstration visuelle humaine, sans corpus d'entraînement massif. La boucle agentique itérative infère elle-même, depuis cette démonstration, trois ingrédients clés : une spécification de tâche testable, des primitives d'action exécutables par le robot, et un environnement interactif pour exécuter et vérifier le programme. Pour rendre le résultat réutilisable au-delà du contexte filmé, RAPID exprime les primitives comme des programmes d'optimisation de trajectoire reproduisant l'effet de mouvement au niveau de l'objet, assemblés par des contraintes relationnelles qui capturent la géométrie de la scène au moment de l'exécution. Les chercheurs ont testé le système en simulation sur huit tâches de manipulation non préhensile riches en contacts (pousser, pivoter, basculer des objets) et sur des tâches préhensiles classiques du benchmark LIBERO-Pro, puis l'ont déployé sur un bras robotique Franka réel pour l'ensemble des huit tâches non préhensiles ; le projet est documenté sur yuyaoliu.me/projects/rapid. L'intérêt de RAPID tient à la difficulté qu'il attaque : transformer une démonstration unique en un programme réutilisable et généralisable, là où les politiques d'apprentissage par imitation ou les modèles vision-langage-action (VLA) exigent généralement des corpus de démonstrations massifs. En appliquant à la manipulation robotique la logique des agents de codage logiciel, capables d'itérer, tester et corriger leur propre production, RAPID parie que la synthèse de programmes symboliques explicites généralise mieux que des politiques paramétriques apprises, en particulier sur les tâches non préhensiles où la dynamique de contact et le frottement rendent la généralisation notoirement difficile. Les auteurs revendiquent une généralisation à la pose, la forme, le matériau et l'environnement des objets, une affirmation émanant pour l'instant d'une seule équipe sur un périmètre de tâches limité et non validée indépendamment ; le déploiement réel se cantonne d'ailleurs à un unique bras Franka et aux tâches non préhensiles, les tâches préhensiles de LIBERO-Pro n'ayant été testées qu'en simulation. Il s'agit donc d'un résultat de recherche prometteur mais encore au stade du preprint, pas d'un produit ou d'un pipeline prêt pour l'intégration industrielle. Le travail s'inscrit dans un mouvement plus large visant à transposer aux robots le paradigme des agents de codage popularisé en génie logiciel, plutôt que d'empiler les données pour entraîner des politiques de bout en bout. Il se positionne ainsi en alternative aux approches VLA dominantes du secteur, comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, qui apprennent des politiques directement à partir de grands ensembles de démonstrations plutôt que de synthétiser un programme symbolique explicite à partir d'un seul exemple ; aucun acteur français ou européen n'apparaît dans cette publication. À ce stade, RAPID reste un résultat académique diffusé via un preprint arXiv et un site de projet présentant des matériaux complémentaires, sans partenariat industriel, pilote de déploiement ni calendrier de commercialisation annoncés par les auteurs.

RecherchePaper
1 source
Encore : découverte à base d'agents de stratégies de manipulation à partir de quelques démonstrations
4arXiv cs.RO 

Encore : découverte à base d'agents de stratégies de manipulation à partir de quelques démonstrations

Des chercheurs présentent ENCORE, un système où un agent de programmation apprend des stratégies de manipulation robotique à partir de quelques démonstrations, non pas comme données d'entraînement mais comme éléments à lire et analyser. Un « builder » déterministe transforme chaque démonstration en un dossier regroupant des images clés multi-vues, les événements du gripper, des bandes d'images et la trajectoire complète. L'agent étudie ce dossier, écrit un programme de politique de contrôle s'appuyant sur une API fixe de perception et d'action, l'affine sur quelques essais de développement, puis le fige avant une évaluation scellée qui ne révèle jamais le signal de succès. Sur LIBERO-PRO, le premier programme produit par l'agent réussit déjà la moitié des tâches perturbées lorsqu'il dispose de démonstrations, contre une seule tâche sans elles. Une fois figés, les programmes atteignent 96,3 % de réussite, contre 89,3 % pour le meilleur système agentique antérieur utilisant le même modèle de langage. Sur RoboDojo, dont les consignes ne précisent pas le but, aucun programme ne réussit sans démonstrations. Le système fonctionne aussi sur un robot bimanuel réel, qui apprend le passage de cube d'une main à l'autre et le retournement de tasse à partir de cinq démonstrations chacune. L'intérêt tient à ce que ce travail déplace le problème. Les agents de code savent écrire et déboguer des programmes, mais une consigne en une phrase ne dit rien de la prise, de l'ordre des contacts ou de l'état final attendu, et l'agent en est réduit à l'essai-erreur. Les résultats sur RoboDojo montrent que ces informations ne se devinent pas : sans démonstration, le taux de réussite est nul. L'approche produit des politiques sous forme de code, donc lisibles et modifiables, ce qui attire les intégrateurs qui redoutent l'opacité des VLA. Le protocole d'évaluation scellé répond aussi à une critique fréquente sur les benchmarks agentiques, où le signal de succès peut fuiter vers l'agent. Il faut toutefois rester prudent : LIBERO-PRO est un banc de test simulé, l'écart de 7 points porte sur un seul modèle de langage, et la validation réelle se limite à deux tâches simples sur un seul robot. Ce travail s'inscrit dans deux courants. D'un côté, les modèles VLA comme Pi-0 ou GR00T apprennent des politiques de bout en bout à partir de grands volumes de données. De l'autre, les systèmes agentiques qui génèrent du code de contrôle à partir de modèles de langage, dont ENCORE dépasse le meilleur représentant testé. La question qui reste ouverte est celle du passage à l'échelle : des tâches longues, des objets déformables, des scènes non structurées. L'article, publié sur arXiv (2609.37359), ne mentionne ni déploiement industriel ni calendrier de pilote.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source