Aller au contenu principal
Un robot apprend en 5 minutes des tâches complexes de 12 étapes et replanifie en cas d'imprévu
RechercheInteresting Engineering 

Un robot apprend en 5 minutes des tâches complexes de 12 étapes et replanifie en cas d'imprévu

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs de l'Université de Pennsylvanie (Penn Engineering) ont présenté SymSkill, un système qui permet à un bras robotique d'exécuter des tâches allant jusqu'à 12 étapes après seulement cinq minutes de démonstrations vidéo. Le travail, mené par Yifei Simon Shao, doctorant dans le laboratoire de Nadia Figueroa, a été validé en simulation et sur un bras robotique physique. Le scénario type consiste à sortir une banane d'une casserole fermée : le robot retire le couvercle, saisit la banane et la dépose sur une assiette. Il continue lorsqu'une personne l'interrompt ou qu'une tentative échoue. Les séquences de 12 étapes n'ont fait l'objet d'aucune démonstration dédiée : le système recombine des compétences élémentaires apprises séparément. L'architecture repose sur deux niveaux. Un planificateur symbolique représente objets, actions et relations pour déduire l'ordre des opérations nécessaires à un objectif. En dessous, une approche par systèmes dynamiques gère l'exécution du mouvement et permet de réagir en temps réel aux perturbations, comme un humain qui se place dans la trajectoire.

L'intérêt tient à la voie choisie. La tendance dominante en manipulation, notamment avec les modèles VLA (vision-langage-action), consiste à accroître les volumes de données de téléopération pour couvrir toujours plus de cas. SymSkill adopte la logique inverse : apprendre peu de primitives, puis composer. Pour un intégrateur, la promesse est de réduire le coût de programmation ou de collecte de données à chaque nouvelle séquence, et d'obtenir une reprise après échec sans relancer toute la tâche, point sensible dans les environnements partagés avec des opérateurs. Les réserves sont néanmoins réelles : aucun taux de réussite, temps de cycle ni nombre d'essais n'est communiqué, les tâches restent des démonstrations de laboratoire (une banane, une casserole) et un seul bras a été utilisé. Rien ne dit encore comment le planificateur symbolique gère des scènes encombrées, des objets inconnus ou des prédicats mal perçus, ce qui fait traditionnellement la fragilité des approches symboliques hors du laboratoire.

Ce travail s'inscrit dans la recherche du laboratoire de Nadia Figueroa, professeure assistante en génie mécanique et mécanique appliquée à Penn Engineering, sur la réutilisation de mouvements appris. Une autre brique, Gaussian Graph, transforme des mouvements démontrés en carte de trajectoires possibles dans l'espace de travail, afin de générer des chemins jamais montrés au robot. Face aux approches à grande échelle de données telles que Pi-0 de Physical Intelligence, GR00T de NVIDIA ou Helix de Figure, SymSkill relève d'une voie néo-symbolique, plus économe en données et plus interprétable, mais non comparée à ces modèles dans ce qui est publié. La suite annoncée est académique : couplage avec des modèles de langage pour interpréter les instructions humaines, puis extension aux robots bimanuels, aux humanoïdes et aux manipulateurs mobiles. Aucun pilote industriel ni calendrier de transfert n'est mentionné à ce stade.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

L'apprentissage par robot en contexte simplifié : une recette accessible pour les tâches de manipulation
1arXiv cs.RO 

L'apprentissage par robot en contexte simplifié : une recette accessible pour les tâches de manipulation

Des chercheurs proposent SimpleICL, un cadre minimaliste et reproductible pour l'apprentissage en contexte (ICL, in-context learning) en robotique. Le principe est de laisser un robot déduire puis exécuter une tâche à partir de démonstrations visuelles, sans réentraînement. L'étude, publiée sur arXiv (2609.38173v1), commence par corriger un défaut de formulation. Une démonstration visuelle mélange trajectoires d'actions, sémantique des objets, affordances de manipulation, relations spatiales et but de la tâche. On ne sait donc pas ce que le robot doit réellement imiter. Les auteurs définissent explicitement la cible d'apprentissage pour lever cette ambiguïté du prompt visuel. Sur cette base, ils construisent SimpleICL, qui associe un encodeur de prompt visuel à un protocole de collecte de données à faible coût. Selon eux, il n'exige ni pré-entraînement massif ni infrastructure de données spécialisée. Ils annoncent de bonnes performances en simulation et en environnement réel. Le résumé ne donne ni score, ni taux de réussite, ni plateforme robotique, ni volume de données, et ces points restent à vérifier dans l'article complet. Les expériences mettent en évidence quatre propriétés de l'ICL robotique : la discrimination des actions, de la sémantique, de la composition et des affordances. Les données et le pipeline d'entraînement doivent être publiés en open source. L'intérêt tient moins à un résultat chiffré qu'à la remise à plat du problème. Une grande partie des travaux sur les VLA (vision-language-action, modèles qui transforment images et instructions en actions) repose sur des instructions textuelles et des volumes de pré-entraînement très élevés. L'ICL par démonstration visuelle promet une autre logique : montrer une fois la tâche plutôt que reprogrammer ou affiner un modèle. Pour un intégrateur, cela pourrait réduire le coût de changement de série ou de poste. Si l'approche se confirme sans données massives, elle abaisse la barrière d'entrée pour les laboratoires et les PME, et fournit une base de comparaison reproductible dans un domaine où les protocoles divergent. La définition de la cible d'apprentissage donne aussi un cadre pour évaluer ce que le robot a compris d'une démonstration, ce qui manque souvent aux démos spectaculaires. Ce texte reste un travail de recherche. Il ne décrit ni produit livré ni déploiement industriel, et l'écart entre laboratoire et atelier reste entier. Ces travaux s'inscrivent dans la suite de l'ICL apparu avec les grands modèles de langage, puis transposé à la manipulation robotique par imitation à un ou peu de coups. Les grands acteurs des modèles fondation, comme Physical Intelligence avec Pi-0, NVIDIA avec GR00T ou Figure avec Helix, misent sur des volumes de données et de calcul importants. SimpleICL vise une voie plus légère et ouverte, dont la pertinence dépendra de la généralisation à des tâches longues, à d'autres robots et à des scènes non vues. La suite dépend de la publication effective du code et des données, promise mais pas encore vérifiable. Une réplication indépendante, notamment par des laboratoires européens, serait le vrai test.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Tâche hiérarchique de planification et de compétences : planification robotique hiérarchique avec des compétences en boîte noire
2arXiv cs.RO 

Tâche hiérarchique de planification et de compétences : planification robotique hiérarchique avec des compétences en boîte noire

Des chercheurs publient sur arXiv (version 3, remplaçant une précédente) une méthode baptisée TASP (Task and Skill Planning), qui étend la planification hiérarchique de tâches et de mouvements (TAMP) pour intégrer des compétences robotiques hétérogènes déjà existantes : politiques apprises, contrôleurs à retour de force, et modules « boîte noire ». L'approche s'appuie sur les Composable Interaction Primitives (CIP) pour générer automatiquement des plans de mouvement de transition, en amont et en aval de chaque compétence, qui relient deux savoir-faire consécutifs entre eux. Ces primitives permettent d'ajuster la trajectoire aussi bien au moment de la planification qu'en cours d'exécution. Les auteurs valident leur système par des expériences réelles sur un manipulateur bimanuel et un manipulateur mobile, en résolvant des tâches longues et complexes, y compris des scénarios de manipulation mobile sur plusieurs pièces avec une structure de tâche non monotone, c'est-à-dire nécessitant de revenir en arrière ou de réordonner des sous-objectifs. L'intérêt pour l'industrie tient au fait que les méthodes TAMP classiques supposaient jusqu'ici que chaque action robotique se ramène à de la planification de mouvement cinématique pure, ce qui limitait leur usage aux tâches purement géométriques. En montrant qu'un planificateur hiérarchique peut combiner des compétences de nature très différente tout en conservant un raisonnement sur les échecs centré sur les objets, TASP ouvre une voie modulaire : un intégrateur peut assembler des politiques déjà entraînées séparément, sans devoir tout réentraîner dans un modèle unique. Cela nourrit le débat entre l'approche « tout-en-un » portée par les grands modèles vision-langage-action et une approche composite où des briques spécialisées restent pilotées par un planificateur symbolique classique, potentiellement plus robuste et plus facile à déboguer en environnement industriel. Ce travail s'inscrit dans une tendance récente de la recherche en robotique consistant à hybrider TAMP et contrôleurs en boucle fermée ou compétences apprises, plutôt que de s'en tenir à la planification de mouvement pure. Il se positionne en alternative modulaire face aux modèles génériques de type Pi-0, GR00T N2 ou Helix, qui visent au contraire une politique unique bout-en-bout. Il s'agit ici d'un article de recherche académique, sans annonce de produit commercial ni de calendrier de déploiement : les résultats montrent une faisabilité réelle sur deux plateformes robotiques distinctes, mais restent à ce stade du domaine expérimental plutôt qu'industriel.

RecherchePaper
1 source
Récupérer, Découvrir, Planifier : apprendre des compétences et des concepts à partir des échecs des robots
3arXiv cs.RO 

Récupérer, Découvrir, Planifier : apprendre des compétences et des concepts à partir des échecs des robots

Des chercheurs ont publié le 18 juin 2026 sur arXiv (2606.18328) un article présentant ReSYNC, pour Recovery-Driven Synthesis of Relational Concepts, un système d'apprentissage robotique capable d'extraire automatiquement des abstractions conceptuelles à partir de ses propres erreurs. Le principe repose sur un double cycle d'apprentissage incrémental : une phase d'apprentissage de compétences, où le robot utilise le renforcement (RL) pour récupérer d'échecs observés durant l'entraînement, et une phase d'apprentissage de concepts, où il construit et raffine des prédicats relationnels, c'est-à-dire des règles symboliques décrivant les états du monde pertinents pour éviter ces mêmes échecs. Testé sur quatre domaines simulés incluant des tâches de manipulation non préhensile (pousser, faire glisser des objets sans saisie ferme), ReSYNC surpasse les méthodes de référence de plus de 50 % sur des problèmes à horizon long et non vus à l'entraînement. Un transfert sim-to-réel est également démontré, avec exécution de comportements de manipulation en conditions physiques réelles. L'enjeu industriel central que pointe ce travail est l'inefficacité structurelle du RL classique face à la diversité des pannes : entraîner une politique distincte pour chaque mode d'échec ne passe pas à l'échelle. ReSYNC propose une alternative en transformant des récupérations locales, apprises sur des tâches spécifiques, en capacité d'évitement global sur des scénarios inédits. Pour les intégrateurs industriels ou les équipes de robotique mobile, cela suggère un chemin vers des robots capables de se "réparer" conceptuellement sans intervention humaine entre chaque environnement de déploiement. Le transfert sim-to-réel reste cependant présenté sur des tâches de manipulation relativement contraintes, et les vidéos de démonstration sélectionnées dans un preprint ne permettent pas encore d'évaluer la robustesse sur des cycles de production réels. ReSYNC s'inscrit dans un courant de recherche qui tente de réconcilier planification symbolique classique (TAMP, PDDL) et apprentissage par renforcement, un problème ouvert depuis plus d'une décennie. Des approches concurrentes incluent les méthodes guidées par LLM pour la génération de prédicats (Code as Policies, SayCan) ainsi que les travaux sur la découverte automatique de prédicats en TAMP (LEGO, GROOT). Ce qui distingue ReSYNC est son ancrage explicite dans l'expérience d'échec plutôt que dans des démonstrations d'expert. Le code et les environnements de simulation ne semblent pas encore publics au moment de la soumission, et aucun partenaire industriel ni calendrier de déploiement n'est mentionné, ce qui classe ce travail comme une contribution académique prometteuse plutôt qu'un produit opérationnel.

RecherchePaper
1 source
Apprentissage unifié de la structure temporelle des tâches et du timing des actions pour la manipulation bimanuelle en robotique
4arXiv cs.RO 

Apprentissage unifié de la structure temporelle des tâches et du timing des actions pour la manipulation bimanuelle en robotique

Une publication mise à jour sur arXiv (2603.06538, version 2) présente une méthode pour la manipulation bimanuelle robotique qui unifie deux niveaux de raisonnement temporel jusqu'ici traités séparément : la structure symbolique d'une tâche (quelles actions précèdent, suivent ou chevauchent les autres) et le calage concret de chaque main (instant de déclenchement, durée). Le système apprend ces contraintes à partir de démonstrations humaines et en dérive des plans d'exécution paramétrés dans le temps pour un robot à deux bras. Il combine trois briques : une représentation en trois dimensions des délais fondée sur des modèles de mélange gaussien multivariés pour le niveau subsymbolique, un algorithme dérivé de Davis-Putnam-Logemann-Loveland qui classe tous les assignements sans contradiction des relations d'Allen, correspondant aux différents modes d'exécution possibles d'une tâche, et un planificateur par optimisation qui fusionne ces contraintes symboliques et subsymboliques. Les auteurs montrent quantitativement que les contraintes symboliques inférées sont plus précises que celles d'approches heuristiques antérieures, et que les plans générés se rapprochent davantage des démonstrations humaines que la démonstration la plus caractéristique prise comme référence, avec des essais qualitatifs menés en simulation et sur robots réels dont le nombre et les spécifications ne sont pas détaillés. Coordonner deux bras exige de savoir non seulement quel geste doit en précéder un autre, mais exactement quand le déclencher et combien de temps lui accorder, faute de quoi les mouvements se désynchronisent ou entrent en collision, un problème central pour tout intégrateur déployant des cellules bimanuelles en assemblage ou en logistique. La plupart des pipelines existants séparaient la planification symbolique de haut niveau du calage bas niveau des trajectoires, créant une rupture entre la tâche planifiée et son exécution physique ; en réunissant les deux couches dans un cadre appris par démonstration, ce travail cible un angle mort fréquent de l'apprentissage par imitation, qui reproduit souvent des gestes isolés sans capturer la logique de coordination entre bras. Si les résultats se confirment hors laboratoire, cela réduirait le travail manuel de programmation des séquences et des temporisations, un poste coûteux dans le déploiement de robots à deux bras, et fournirait un argument concret face au scepticisme ambiant sur l'écart entre démonstrations soignées et robustesse en conditions réelles. La méthode s'inscrit dans la lignée des travaux de planification robotique s'appuyant sur l'algèbre des intervalles d'Allen, un formalisme classique pour raisonner sur des relations temporelles qualitatives, combiné ici à des modèles de mélange gaussien déjà employés en apprentissage par démonstration pour encoder la variabilité des trajectoires humaines. Les auteurs situent leur contribution par rapport à des approches heuristiques antérieures pour l'extraction de contraintes symboliques, sans nommer de système concurrent précis ni d'institution, le résumé publié restant volontairement générique sur les auteurs et le matériel robotique utilisé. À ce stade, il s'agit d'une contribution de recherche en prépublication, validée en simulation et sur banc réel, sans indication de transfert vers un produit commercial ou un pilote industriel identifié, ni de calendrier de suite annoncé.

RecherchePaper
1 source