Aller au contenu principal
RecherchearXiv cs.RO 

RoboAware : apprendre à coordonner des compétences d'IA incarnée à partir de résultats contrefactuels

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

RoboAware, un framework décrit dans l'article arXiv 2610.11480, apprend à un agent de code embarqué à choisir quelle famille de politiques mobiliser selon l'état physique courant. Il ne réentraîne ni l'agent de code ni les politiques de bas niveau, qui restent figés. Seul un coordinateur de « responsabilité », conditionné par l'état, est appris. Les compétences du robot, qu'il s'agisse de modules classiques ou de politiques end-to-end gelées (type VLA), sont organisées dans un schéma baptisé P^5, qui les range en cinq étapes sémantiques communes pour les rendre comparables. Pour pallier l'absence de résultats contrefactuels dans les travaux existants, les auteurs introduisent le State-Locked Counterfactual Branching (SCB). Cette méthode restaure le même état d'entraînement, génère et exécute un bloc de code pour chaque famille admissible, et révèle ainsi ce qui se serait passé avec les branches non choisies. L'Execution-Aware Learning (EAL) combine ensuite recherche arborescente Monte Carlo et Q-learning pour distiller ces issues en valeurs conditionnées par la famille. Au déploiement, le coordinateur choisit la famille d'après le contexte observable, puis l'agent de code figé écrit le prochain bloc local. Sur 100 tâches, en évaluation à épisode unique, le système atteint 77,0 % de succès global, avec des moyennes annoncées comme state of the art de 90,0 % sur RoboSuite, 73,8 % sur les clusters LIBERO-Pro et 90,0 % sur les tâches bimanuelles RoboTwin.

L'intérêt pour l'industrie tient à un problème que les intégrateurs connaissent bien : combiner des briques modulaires fiables et des politiques VLA plus généralistes, sans savoir à l'avance laquelle réussira dans une situation donnée. Le papier propose de traiter ce choix comme un problème d'apprentissage explicite plutôt que comme une heuristique codée à la main ou un jugement laissé au modèle de langage. L'approche est peu coûteuse, puisqu'elle laisse intacts les composants déjà validés, ce qui séduit dans un contexte où requalifier une politique est lourd. Elle suggère aussi que les gains de la composition viennent autant de l'aiguillage que des politiques elles-mêmes. Il faut toutefois rester prudent : tous les résultats sont obtenus en simulation (RoboSuite, LIBERO-Pro, RoboTwin), aucun test sur robot physique n'est mentionné, et le coût du branching contrefactuel, qui multiplie les exécutions par famille de politiques, n'est pas chiffré. Le score global de 77,0 % montre aussi qu'environ une tâche sur quatre échoue encore, et la comparaison porte sur des baselines choisies par les auteurs, sans validation indépendante.

Ce travail s'inscrit dans la lignée des approches « code-as-policy », où un modèle de langage écrit du code appelant des primitives robotiques, et des harnais autour de VLA comme Pi-0. Les auteurs s'inspirent du succès des boucles REPL pour les agents de code, en les étendant à l'embodiment. Les concurrents directs sont ces deux familles, jugées trop dépendantes d'un choix de politique non informé par l'état physique. Il s'agit d'un préprint arXiv sans relecture par les pairs, sans annonce de code ni de pilote industriel à ce stade. La suite logique serait une validation sur matériel réel, avec des contraintes de temps de cycle et de sécurité que la simulation ne reproduit pas.

À lire aussi

Récupérer, Découvrir, Planifier : apprendre des compétences et des concepts à partir des échecs des robots
1arXiv cs.RO 

Récupérer, Découvrir, Planifier : apprendre des compétences et des concepts à partir des échecs des robots

Des chercheurs ont publié le 18 juin 2026 sur arXiv (2606.18328) un article présentant ReSYNC, pour Recovery-Driven Synthesis of Relational Concepts, un système d'apprentissage robotique capable d'extraire automatiquement des abstractions conceptuelles à partir de ses propres erreurs. Le principe repose sur un double cycle d'apprentissage incrémental : une phase d'apprentissage de compétences, où le robot utilise le renforcement (RL) pour récupérer d'échecs observés durant l'entraînement, et une phase d'apprentissage de concepts, où il construit et raffine des prédicats relationnels, c'est-à-dire des règles symboliques décrivant les états du monde pertinents pour éviter ces mêmes échecs. Testé sur quatre domaines simulés incluant des tâches de manipulation non préhensile (pousser, faire glisser des objets sans saisie ferme), ReSYNC surpasse les méthodes de référence de plus de 50 % sur des problèmes à horizon long et non vus à l'entraînement. Un transfert sim-to-réel est également démontré, avec exécution de comportements de manipulation en conditions physiques réelles. L'enjeu industriel central que pointe ce travail est l'inefficacité structurelle du RL classique face à la diversité des pannes : entraîner une politique distincte pour chaque mode d'échec ne passe pas à l'échelle. ReSYNC propose une alternative en transformant des récupérations locales, apprises sur des tâches spécifiques, en capacité d'évitement global sur des scénarios inédits. Pour les intégrateurs industriels ou les équipes de robotique mobile, cela suggère un chemin vers des robots capables de se "réparer" conceptuellement sans intervention humaine entre chaque environnement de déploiement. Le transfert sim-to-réel reste cependant présenté sur des tâches de manipulation relativement contraintes, et les vidéos de démonstration sélectionnées dans un preprint ne permettent pas encore d'évaluer la robustesse sur des cycles de production réels. ReSYNC s'inscrit dans un courant de recherche qui tente de réconcilier planification symbolique classique (TAMP, PDDL) et apprentissage par renforcement, un problème ouvert depuis plus d'une décennie. Des approches concurrentes incluent les méthodes guidées par LLM pour la génération de prédicats (Code as Policies, SayCan) ainsi que les travaux sur la découverte automatique de prédicats en TAMP (LEGO, GROOT). Ce qui distingue ReSYNC est son ancrage explicite dans l'expérience d'échec plutôt que dans des démonstrations d'expert. Le code et les environnements de simulation ne semblent pas encore publics au moment de la soumission, et aucun partenaire industriel ni calendrier de déploiement n'est mentionné, ce qui classe ce travail comme une contribution académique prometteuse plutôt qu'un produit opérationnel.

RecherchePaper
1 source
Track-and-Complete : apprendre des compétences humanoïdes à partir d'une seule vidéo humaine ratée
2arXiv cs.RO 

Track-and-Complete : apprendre des compétences humanoïdes à partir d'une seule vidéo humaine ratée

Des chercheurs proposent TRACC (Track-and-Complete), un pipeline qui permet à un humanoïde d'apprendre une compétence à partir d'une seule vidéo d'humain en situation d'échec, sans aucune démonstration réussie. La méthode se déroule en deux temps. Elle imite d'abord la partie exploitable de la trajectoire, c'est-à-dire le préfixe de mouvement observé avant que la tentative ne tourne mal. Elle infère ensuite le résultat visé par la tâche, puis utilise une récompense d'accomplissement pour que la politique apprenne à finir le travail après le point de rupture. Le préfixe sert d'a priori jusqu'à l'échec, la récompense prend le relais ensuite. L'évaluation porte sur six tâches humaines « in the wild » en échec, tirées du jeu de données Oops!, une collection de vidéos amateurs de ratés. L'étude est publiée sur arXiv (2609.36924v1) et présente des résultats jugés positifs par les auteurs. Le résumé ne donne ni taux de réussite, ni comparaison chiffrée, ni précision sur le robot utilisé ou sur un éventuel transfert vers du matériel réel. L'intérêt tient au coût de la donnée. L'apprentissage de compétences humanoïdes par imitation vidéo suppose en général une démonstration réussie, souvent collectée sur mesure : téléopération, capture de mouvement ou scènes scriptées. Or le web regorge de tentatives ratées, que la robotique traite d'ordinaire comme de simples exemples négatifs. Si l'approche tient à plus grande échelle, un corpus jusque-là écarté devient une source de supervision, ce qui réduit le goulot d'étranglement des données que rencontrent les acteurs des politiques généralistes de type VLA. Une réserve s'impose toutefois. Six tâches sont un échantillon très mince, et la robustesse de l'inférence du but à partir d'une vidéo ambiguë reste à démontrer. Le résumé ne dit pas non plus si l'apprentissage se fait uniquement en simulation. La question du passage au réel, le fameux sim-to-real, n'est pas tranchée par ce texte. Ce travail s'inscrit dans un mouvement plus large de retargeting de mouvements humains vers des humanoïdes et d'apprentissage par renforcement guidé par vidéo, où la plupart des méthodes supposent des démonstrations propres. Les grands acteurs de la course humanoïde, de Figure à Tesla avec Optimus, en passant par les modèles fondation comme Pi-0 ou GR00T, misent surtout sur la téléopération et la simulation à grande échelle pour alimenter leurs politiques. TRACC propose une voie complémentaire, moins coûteuse en collecte, qui reste académique et sans produit ni déploiement annoncé. Les prochaines étapes à surveiller sont l'extension à davantage de tâches et de morphologies, la validation sur robot physique et la confrontation avec des méthodes exploitant des démonstrations réussies.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Deliberate Practice : Apprendre des Compétences Robotiques sous Contrainte de Budget
3arXiv cs.RO 

Deliberate Practice : Apprendre des Compétences Robotiques sous Contrainte de Budget

Un article publié le 14 août 2026 sur arXiv (identifiant 2608.13415v1) décrit un nouvel algorithme d'apprentissage actif de compétences robotiques baptisé Deliberate Practice (DP), conçu pour des robots devant apprendre sous un budget de pratique limité. DP calcule ce que les auteurs qualifient d'allocation "budget-optimale": il détermine quelles compétences entraîner en priorité pour maximiser la récompense cumulée attendue, tout en s'assurant qu'elles restent effectivement maîtrisables dans le temps imparti. L'algorithme estime conjointement le temps nécessaire pour maîtriser chaque compétence et la récompense cumulée des plans de tâches qu'elle permet de débloquer ensuite. Sa contribution technique centrale est un programme bilinéaire, résolu avec des solveurs commerciaux standards, capable de calculer cette allocation de manière exacte malgré le nombre combinatoire de plans de compétences possibles sur un budget de pratique étendu. Les auteurs testent l'approche en simulation et sur robot réel, sur des tâches de manipulation à horizon long. Le problème visé est concret pour l'industrie: un robot physique ne peut pas pratiquer indéfiniment, entre usure mécanique, supervision humaine coûteuse et temps machine limité, ce qui rend crucial le choix des compétences à entraîner en priorité pour des tâches séquentielles complexes. Là où l'apprentissage par renforcement classique explore sans contrainte budgétaire explicite, DP formalise ce compromis avec une garantie d'optimalité prouvée, un argument qui pourrait intéresser des intégrateurs cherchant à réduire les fenêtres de mise en service ou de recalibration de robots manipulateurs en environnement industriel. Ce travail se positionne en complément, et non en remplacement, des modèles vision langage action de type Pi-0 ou GR00T N2, qui apprennent des politiques mais ne raisonnent pas explicitement sur l'ordonnancement de la pratique sous contrainte de temps. Il s'agit d'une publication académique déposée sur arXiv, sans communiqué d'entreprise ni nom de laboratoire mis en avant dans le résumé, et sans annonce de déploiement industriel ou de partenariat pilote à ce stade. Le texte ne précise ni le nombre de compétences testées, ni la plateforme robotique réelle utilisée, ni de calendrier de publication du code associé. Il s'inscrit dans la lignée des recherches en apprentissage curriculaire et en planification de tâches à long horizon, un axe distinct mais complémentaire des efforts actuels de scaling des modèles génératifs de politiques robotiques.

RecherchePaper
1 source
Nouvelles tâches par compétences réutilisables : experts compositionnels pour l'apprentissage continu incarné
4arXiv cs.RO 

Nouvelles tâches par compétences réutilisables : experts compositionnels pour l'apprentissage continu incarné

Des chercheurs ont publié en juin 2026 sur arXiv (2606.15685) un framework appelé SCE (Skill-Compositional Experts), conçu pour permettre à des robots manipulateurs d'apprendre de nouvelles tâches en continu sans effacer les comportements déjà maîtrisés. L'approche repose sur deux blocs : un mécanisme de Compositional Skill Grounding (CSG) qui décompose des démonstrations en primitives réutilisables, puis un système DETE (Dual Execution-and-Transition Experts) à deux branches, l'une assurant l'exécution de chaque skill et l'autre pilotant les transitions entre eux pour produire un comportement cohérent. Les évaluations portent sur les benchmarks LIBERO (manipulation en simulation) ainsi que sur des tâches en environnement réel, avec des gains de rétention et de performance globale par rapport aux méthodes de référence. Le problème visé, le "catastrophic forgetting" en boucle fermée, est nettement plus sévère qu'en continual learning classique : sous contrôle séquentiel, la dérive des représentations internes (feature drift) s'accumule et dégrade progressivement les comportements antérieurs. Pour les industriels déployant des bras robotiques multi-tâches en logistique, assemblage ou alimentation, c'est un verrou réel : introduire une nouvelle tâche risque d'invalider les précédentes, imposant des revalidations coûteuses. SCE propose de structurer explicitement les skills en une base réutilisable, ce qui pourrait, si cela tient à l'échelle, réduire ce surcoût d'intégration. À noter cependant : il s'agit d'un preprint non encore évalué par les pairs, et les résultats en environnement réel restent peu détaillés dans l'abstract. L'Embodied Continual Learning a gagné en visibilité avec l'essor des politiques robotiques généralisables, notamment sous l'influence des Visual Language Action models (VLA) et des travaux de sim-to-real transfer. Les benchmarks LIBERO sont devenus une référence pour évaluer la généralisation des politiques de manipulation. Les approches concurrentes, comme SkillDiffuser ou les méthodes à mémoire épisodique, traitent la même problématique sans structurer explicitement les transitions entre skills, ce qui constitue la contribution centrale de SCE. Les auteurs publient une page projet mais n'annoncent ni partenariat industriel ni timeline de déploiement, ce qui situe ce travail à la frontière entre preuve de concept académique et transfert applicatif.

RecherchePaper
1 source