Aller au contenu principal
RecherchearXiv cs.RO 

Compétences de manipulation à très long horizon en robotique grâce à la génération de code continue guidée par l'humain

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent LYRA, un cadre de génération de code robotique qui apprend des compétences de manière continue à partir des retours humains. Il vise les tâches de manipulation dites « ultra-longues », où l'enchaînement d'actions dépasse ce qu'un grand modèle de langage (LLM) sait produire de façon fiable en une seule passe. Le système distille chaque correction humaine en compétences modulaires et réutilisables, puis étend leurs fonctionnalités au fil des interactions sans écraser les comportements déjà acquis. Une mémoire externe stocke ces compétences et des exemples d'exécution. Une récupération augmentée (RAG) sélectionne les connaissances pertinentes pour chaque tâche. Quand cette récupération ne suffit pas, l'utilisateur donne un indice pour orienter la réutilisation. Les auteurs annoncent un taux de succès de 0,93, jusqu'à 27 % au-dessus des méthodes de référence, et un gain de 42 % en efficacité de correction, c'est-à-dire en nombre d'interventions humaines nécessaires. Les tests couvrent les benchmarks Ravens, Franka Kitchen, LIBERO-long et MetaWorld, ainsi que des tâches en conditions réelles. LYRA réussit notamment la tâche « construire une maison », qui exige de planifier plus de 20 primitives.

Ce travail s'attaque à un point faible connu de la robotique pilotée par LLM. Les modèles traduisent bien une consigne en code, mais l'ambiguïté des instructions, le bruit des générations et la fenêtre de contexte limitée rendent les longues séquences peu fiables. Les boucles fermées qui reposent seulement sur le retour d'un LLM ne règlent pas le problème, car ces modèles raisonnent mal sur l'état physique d'un robot, même quand l'erreur saute aux yeux d'un humain. L'intérêt pour un intégrateur est concret : plutôt que de réentraîner un modèle ou de réécrire des prompts à chaque correction, l'opérateur enrichit une bibliothèque de compétences qui se transmet d'une tâche à l'autre. Cela limite l'oubli catastrophique, fréquent quand les retours s'accumulent dans des représentations qui généralisent mal. L'approche est une alternative à bas coût aux modèles vision-langage-action (VLA) entraînés de bout en bout, mais elle déplace la charge vers l'humain dans la boucle. Les résultats sont à lire avec prudence : il s'agit d'un preprint sans validation par les pairs. Les benchmarks sont en grande partie simulés. L'article ne donne pas de temps de cycle, de robot industriel ni de volume de déploiement. Le gain de 27 % est relatif aux méthodes de référence choisies par les auteurs.

Le papier arrive en version 3 sur arXiv (2509.18597), ce qui indique plusieurs cycles de révision depuis la première soumission de septembre 2025. Il s'inscrit dans la lignée des approches de génération de code pour la robotique, comme Code as Policies, qui font du LLM un planificateur écrivant des appels à des primitives. Il s'oppose à la voie des VLA généralistes (Pi-0, GR00T, Helix), qui encodent la compétence dans les poids du modèle. Aucun partenaire industriel, calendrier de pilote ni publication de code n'est mentionné dans le résumé. La suite logique serait un test sur bras industriels avec des opérateurs non experts, et une mesure de la façon dont la bibliothèque de compétences se comporte à grande échelle, quand la récupération doit trier des centaines de compétences.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

PACE : manipulation robotique cohérente par étapes sur de longs horizons grâce à un contexte aligné sur la progression
1arXiv cs.RO 

PACE : manipulation robotique cohérente par étapes sur de longs horizons grâce à un contexte aligné sur la progression

Des chercheurs proposent PACE (Progress-Aligned Context for Execution), une méthode destinée aux politiques robotiques conditionnées par démonstration, dans le cadre de la manipulation longue durée. Le problème visé porte le nom de « stage confusion » : lorsque des états visuellement proches reviennent à différentes étapes d'une tâche, ou lorsque la démonstration et l'exécution n'avancent pas à la même vitesse, la politique perd le fil et se trompe d'étape. PACE compresse la démonstration complète en jetons de prompt multimodaux ordonnés, et s'appuie, pendant l'entraînement uniquement, sur une supervision d'attention « à double arête » (dual-edge) pour faire apparaître la structure latente des étapes. À l'exécution, une mémoire à poids rapides (fast-weight), propre à l'épisode, encode de façon causale les transitions action-observation réellement effectuées et module la cross-attention sur le prompt. Un expert d'action unifié, basé sur la diffusion, reçoit ainsi un contexte aligné sur la progression, sans étiquettes d'étape au test ni politiques spécifiques à chaque étape. Sur LIBERO-Gen, le taux de réussite passe de 88,9 % à 94,0 % sur Goal Chain, et de 79,1 % à 83,3 % sur Spatial Combination. Sur les tâches Block Routing en deux étapes, il bondit de 33,3 % à 73,3 %. L'intérêt tient moins au gain sur les benchmarks LIBERO, déjà proches de la saturation et modestes (+5,1 et +4,2 points), qu'au diagnostic posé : une part notable des échecs des politiques VLA et des politiques à diffusion sur les tâches séquentielles viendrait d'une mauvaise localisation dans la tâche, et non d'un déficit de dextérité ou de perception. Le doublement du succès sur Block Routing, où les états se répètent entre les étapes, va dans ce sens, et l'analyse d'échecs des auteurs indique que l'alignement structuré de la démonstration et la mémoire causale contribuent conjointement. Pour les intégrateurs, la promesse est de spécifier un comportement par une démonstration unique sans réentraîner de politique par étape, ce qui réduit le coût de mise en production d'enchaînements d'assemblage ou de tri. Les réserves sont nettes : les résultats proviennent de simulation, d'une seule version préprint, sans validation sur robot réel ni mesure de latence ajoutée par la mémoire. Le gain sur Block Routing part en outre d'une base très basse, ce qui en amplifie l'effet apparent. PACE s'inscrit dans la lignée des politiques généralistes de type VLA (Pi-0, GR00T, Helix) et des approches par imitation conditionnée sur démonstration, qui peinent sur les horizons longs faute de mémoire d'exécution explicite. Il rejoint les travaux sur les mémoires épisodiques et les couches à poids rapides pour la robotique. Les auteurs ne citent pas de déploiement industriel ni de calendrier. Les prochaines étapes logiques sont des tests sur robots physiques, des comparaisons directes avec les grands VLA du marché et une évaluation sur des tâches plus longues que deux étapes. Aucun acteur français ou européen n'est mentionné dans cette publication.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
SAKI : assemblage de compétences et imitation cinématique à partir de vidéos humaines pour la manipulation mobile à long horizon
2arXiv cs.RO 

SAKI : assemblage de compétences et imitation cinématique à partir de vidéos humaines pour la manipulation mobile à long horizon

Des chercheurs, dont l'équipe derrière la page aus.bot, présentent SAKI (Skill Assembly and Kinematic Imitation), un framework qui relie trois briques: l'acquisition de compétences à partir de vidéos humaines, l'assemblage de ces compétences issues de démonstrations différentes, et l'exécution en boucle fermée sur l'ensemble du corps du robot. Il s'agit d'une publication de recherche (arXiv, version 1), sans produit ni déploiement commercial. Le système prépare des compétences réutilisables centrées sur l'objet, qui conservent les interactions critiques pour la tâche tout en laissant s'adapter les trajectoires de transfert. À partir d'un objectif et de dépendances de tâches fournies, SAKI sélectionne et ordonne les compétences, associe leurs rôles d'objets à la scène courante et transmet l'estimation de la scène et la configuration du robot d'une compétence à la suivante. Une imitation cinématique du corps entier génère des mouvements coordonnés de la base, du bras et de la pince. En exécution, des estimations d'objets persistantes maintiennent les références de la tâche malgré les changements de point de vue, et le retour visuel met à jour les trajectoires restantes. Les tests sur robot réel couvrent le rangement et l'essuyage, avec réutilisation des compétences d'une disposition à l'autre. Le résumé ne donne aucun taux de réussite chiffré, ni nombre d'essais, ni plateforme robotique précisée. L'enjeu est de sortir l'apprentissage par vidéos humaines du cadre de la table, où il est le plus démontré, pour l'appliquer à la manipulation mobile longue durée, là où les erreurs se cumulent entre étapes et où la base mobile déplace sans cesse le référentiel. Le résultat le plus instructif est l'ablation: à optimisation du corps entier et retour visuel constants, la préparation des références conditionnée par la tâche améliore nettement l'achèvement des tâches longues. Autrement dit, le goulot n'est pas seulement le contrôle bas niveau mais la qualité de la représentation des compétences apprises. Pour un intégrateur, c'est une piste vers des robots reprogrammés par démonstration humaine filmée plutôt que par téléopération coûteuse. Les limites restent claires: les dépendances de tâches sont fournies par l'opérateur et non déduites, les scénarios sont des démonstrations de laboratoire, et l'écart entre une vidéo de démonstration et une fiabilité industrielle reste entier. SAKI s'inscrit dans la course à la manipulation mobile généraliste, où les approches dominantes reposent sur des modèles vision-langage-action (VLA) entraînés sur de la téléopération, comme Pi-0 ou Helix, ou sur des pipelines robotiques modulaires. Ici, le choix est hybride: composition explicite de compétences et optimisation cinématique, plutôt qu'une politique de bout en bout. Cette voie prolonge les travaux sur l'imitation à partir de vidéos humaines, dont l'avantage est de contourner le goulot des données robotiques. Les prochaines étapes probables seraient l'inférence automatique des dépendances de tâches, des évaluations chiffrées sur davantage de scénarios et des essais hors laboratoire. Les vidéos de démonstration sont disponibles sur la page du projet, mais l'échantillon présenté n'est, par nature, pas représentatif des échecs.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
SeeQ : entraîner des fonctions de valeur généralistes pour la manipulation robotique à long horizon
3arXiv cs.RO 

SeeQ : entraîner des fonctions de valeur généralistes pour la manipulation robotique à long horizon

Des chercheurs présentent SeeQ (Subtask-elicited Q-functions) dans un preprint publié sur arXiv sous la référence 2609.22085v1, classé comme soumission nouvelle. La méthode s'attaque à un problème connu des politiques robotiques généralistes : leur fragilité sur des tâches longues et multi-étapes qui exigent plusieurs tentatives et une délibération répétée sur une même sous-étape avant de réussir. Plutôt que d'apprendre une fonction de valeur Q sur la récompense globale de la tâche, ce qui impose un horizon de crédit-assignation très long et des mises à jour de Bellman difficiles à stabiliser, SeeQ apprend une valeur Q pour la sous-tâche activement en cours, ce qui raccourcit l'horizon de prédiction et rend possible un apprentissage par différence temporelle efficace. Pendant l'entraînement, des annotations de sous-tâches déjà présentes dans des jeux de données robotiques hors ligne fournissent la décomposition, permettant d'exploiter des données larges et potentiellement sous-optimales. Au moment de l'inférence, aucune annotation humaine ni module séparé de prédiction de sous-tâche n'est nécessaire : l'architecture, construite sur un socle vision-langage, prédit d'abord de manière autorégressive la sous-tâche active en langage naturel avant d'en estimer la valeur, puis est pré-entraînée sur des données ouvertes de manipulation robotique et affinée sur les tâches cibles. Les auteurs rapportent des essais sur quatre tâches de manipulation réelles, menées sur deux plateformes robotiques bimanuelles, avec une amélioration jugée substantielle du pilotage de politique en best-of-N, sans toutefois donner de chiffres précis de taux de réussite ni d'écart avec les méthodes de référence, une imprécision qu'il convient de relever. Cette approche cible un point de friction central pour les politiques génératives de type vision-langage-action (VLA) : leur capacité à enchaîner plusieurs étapes sans dérive ni blocage répété sur la même sous-tâche. Les fonctions de valeur Q sont déjà utilisées pour classer des actions candidates ou guider l'amélioration d'une politique, mais leur entraînement sur des récompenses éparses au niveau de la tâche entière se heurte à des coûts de calcul et de couverture de données prohibitifs. En ramenant le problème à une valeur par sous-tâche et en supprimant le besoin d'un module de prédiction de sous-tâche séparé au moment du déploiement, SeeQ propose une piste concrète pour rendre le pilotage de politiques exploitable par des intégrateurs qui s'appuient sur des politiques VLA pré-entraînées, sans pipeline d'annotation supplémentaire côté production. SeeQ s'inscrit dans un courant de recherche qui cherche à doter les politiques VLA généralistes, dans la lignée de travaux comme Pi-0 ou GR00T N2, de mécanismes de vérification et de guidage complémentaires plutôt que de s'appuyer uniquement sur l'imitation. Il s'agit d'un preprint de recherche académique, non d'un produit commercial ni d'un déploiement industriel : aucune entreprise, aucun nom de robot commercial ni calendrier de mise sur le marché n'apparaît dans l'article, et les expériences restent limitées à deux plateformes bimanuelles en conditions de laboratoire. La suite logique, non précisée par les auteurs, serait une extension à davantage de plateformes et de tâches ainsi qu'un chiffrage plus détaillé des gains, avant toute intégration envisageable dans des piles logicielles de production.

RecherchePaper
1 source
Robots acquièrent des compétences de manipulation en secondes grâce à une seule vidéo humaine
4arXiv cs.RO 

Robots acquièrent des compétences de manipulation en secondes grâce à une seule vidéo humaine

Des chercheurs ont présenté HOST (Human-to-robot One-Shot Skill AcquisiTion), un framework permettant à un robot d'acquérir une nouvelle compétence de manipulation à partir d'une seule vidéo humaine, en 29 secondes en moyenne au moment de l'inférence. Le système fonctionne par une cascade de prédictions auto-référencées : il estime d'abord la progression du robot dans la tâche démontrée, traduit cette progression en observations futures propres à l'embodiment du robot, puis en déduit les actions à exécuter. L'entraînement de cette cascade s'appuie sur une correspondance entre la trajectoire du robot et la vidéo de démonstration, projetées sur une même variété de progression de tâche, ce qui permet d'aligner les cibles d'apprentissage sur le déroulé futur de la vidéo. Sur les tâches testées, HOST atteint un taux de réussite moyen de 62%, soit 45 points de plus qu'une baseline zero-shot, tout en conservant les compétences déjà maîtrisées par le robot. Ce résultat s'attaque directement à un goulot d'étranglement connu du secteur de la robotique manipulatrice : les méthodes actuelles d'apprentissage de compétences reposent sur des boucles d'entraînement lourdes et coûteuses, qui en plus dégradent souvent les compétences précédemment acquises à chaque nouvel apprentissage (le problème dit du "catastrophic forgetting"). En affichant des performances supérieures à une baseline fine-tunée sur 50 démonstrations robot par tâche, tout en n'utilisant qu'une seule vidéo humaine et 507 fois moins de temps d'acquisition, HOST illustre une piste concrète pour réduire drastiquement le coût de déploiement des VLA (vision-language-action models) en environnement industriel réel, un enjeu central pour les intégrateurs qui doivent reconfigurer rapidement des cellules robotiques sur de nouvelles références produit sans campagne de collecte de données coûteuse. Cette approche s'inscrit dans la lignée des travaux récents sur l'apprentissage par imitation cross-embodiment, où des modèles comme GR00T N2 ou Pi-0 cherchent également à exploiter des données humaines ou hétérogènes pour accélérer l'apprentissage robotique. La contribution spécifique de HOST réside dans sa capacité à opérer en one-shot, à l'inférence, sans réentraînement du modèle sous-jacent, et sans effacer les compétences déjà en mémoire du robot. Les auteurs renvoient vers un site du projet pour des démonstrations complémentaires ; il s'agit à ce stade de résultats de recherche publiés sur arXiv, non d'un produit ou d'un déploiement industriel.

RecherchePaper
1 source