Aller au contenu principal
RecherchearXiv cs.RO 

SkillWeave : tisser des démonstrations hétérogènes en compétences de manipulation à long horizon

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv SkillWeave, un cadre de démonstrations hétérogènes pour la manipulation dextre à long horizon. Il associe deux modes de collecte selon le type d'interaction. La téléopération couvre les phases larges d'approche et de transport. L'enseignement kinesthésique, où l'opérateur guide physiquement le bras, couvre les gestes de précision riches en contacts. Ce second mode crée un décalage visuel, puisque l'humain apparaît dans les images d'entraînement. L'équipe y répond par une politique de diffusion conditionnée par un masque d'objet. L'entraînement utilise une segmentation d'objets réalisée hors ligne. Au déploiement, un prédicteur de masque léger la remplace, ce qui évite la segmentation en ligne et l'inpainting d'images. Un second mécanisme, le « successor-aware terminal steering », traite la dérive de distribution entre sous-politiques entraînées séparément. Il choisit, parmi des actions échantillonnées par la politique prédécesseur, celle qui mène vers des états couverts par la distribution d'états initiaux de la politique successeur. Sur trois tâches réelles à long horizon, le taux de réussite de bout en bout moyen atteint 27 %. Les sous-tâches dextres, avec politiques kinesthésiques à masque, atteignent 65 % en moyenne. L'efficacité de composition des transitions entre politiques atteint 87 % en moyenne. Le code et les vidéos sont publiés.

L'intérêt tient à ce que ces chiffres montrent sur le goulot d'étranglement de la manipulation longue. Un taux de bout en bout de 27 % reste très loin d'un niveau exploitable en production. Il confirme aussi que l'enchaînement de compétences multiplie les erreurs : avec 65 % par sous-tâche dextre, la réussite s'érode vite sur trois tâches. La contribution est donc surtout diagnostique. Elle indique que la jonction entre politiques pèse autant que la qualité de chaque politique, avec 87 % de composition efficace. Elle suggère aussi qu'une modalité de collecte unique, souvent la téléopération seule, est mal adaptée aux contacts fins. Pour un intégrateur, la leçon est pratique : le coût de collecte de données se répartit mieux si l'on réserve le guidage physique aux seuls gestes critiques. Les limites sont à garder en tête. Ni les tâches, ni la plateforme robotique, ni le nombre d'essais ne figurent dans le résumé, et aucune comparaison avec des modèles généralistes n'y est donnée. Les résultats restent ceux d'un laboratoire, sans déploiement industriel.

Le contexte est celui d'un champ qui cherche à sortir des démonstrations courtes. Les politiques de diffusion et les modèles vision-langage-action (VLA) comme Pi-0 ou GR00T progressent sur des tâches isolées. Ils restent fragiles dès que la séquence s'allonge. La téléopération à grande échelle est l'approche dominante pour collecter des données. Le teaching kinesthésique, plus lent mais plus précis, est resté marginal à cause du biais visuel que cet article cherche à corriger. Le travail s'inscrit dans les approches de décomposition en compétences, qui visent à composer des primitives plutôt qu'à entraîner une politique monolithique. La suite logique serait de tester la méthode sur davantage de tâches et d'embodiments. Il faudrait aussi la confronter à des VLA généralistes sur les mêmes séquences. Le caractère reproductible du code publié le permettra.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Compétences de manipulation à très long horizon en robotique grâce à la génération de code continue guidée par l'humain
1arXiv cs.RO 

Compétences de manipulation à très long horizon en robotique grâce à la génération de code continue guidée par l'humain

Des chercheurs proposent LYRA, un cadre de génération de code robotique qui apprend des compétences de manière continue à partir des retours humains. Il vise les tâches de manipulation dites « ultra-longues », où l'enchaînement d'actions dépasse ce qu'un grand modèle de langage (LLM) sait produire de façon fiable en une seule passe. Le système distille chaque correction humaine en compétences modulaires et réutilisables, puis étend leurs fonctionnalités au fil des interactions sans écraser les comportements déjà acquis. Une mémoire externe stocke ces compétences et des exemples d'exécution. Une récupération augmentée (RAG) sélectionne les connaissances pertinentes pour chaque tâche. Quand cette récupération ne suffit pas, l'utilisateur donne un indice pour orienter la réutilisation. Les auteurs annoncent un taux de succès de 0,93, jusqu'à 27 % au-dessus des méthodes de référence, et un gain de 42 % en efficacité de correction, c'est-à-dire en nombre d'interventions humaines nécessaires. Les tests couvrent les benchmarks Ravens, Franka Kitchen, LIBERO-long et MetaWorld, ainsi que des tâches en conditions réelles. LYRA réussit notamment la tâche « construire une maison », qui exige de planifier plus de 20 primitives. Ce travail s'attaque à un point faible connu de la robotique pilotée par LLM. Les modèles traduisent bien une consigne en code, mais l'ambiguïté des instructions, le bruit des générations et la fenêtre de contexte limitée rendent les longues séquences peu fiables. Les boucles fermées qui reposent seulement sur le retour d'un LLM ne règlent pas le problème, car ces modèles raisonnent mal sur l'état physique d'un robot, même quand l'erreur saute aux yeux d'un humain. L'intérêt pour un intégrateur est concret : plutôt que de réentraîner un modèle ou de réécrire des prompts à chaque correction, l'opérateur enrichit une bibliothèque de compétences qui se transmet d'une tâche à l'autre. Cela limite l'oubli catastrophique, fréquent quand les retours s'accumulent dans des représentations qui généralisent mal. L'approche est une alternative à bas coût aux modèles vision-langage-action (VLA) entraînés de bout en bout, mais elle déplace la charge vers l'humain dans la boucle. Les résultats sont à lire avec prudence : il s'agit d'un preprint sans validation par les pairs. Les benchmarks sont en grande partie simulés. L'article ne donne pas de temps de cycle, de robot industriel ni de volume de déploiement. Le gain de 27 % est relatif aux méthodes de référence choisies par les auteurs. Le papier arrive en version 3 sur arXiv (2509.18597), ce qui indique plusieurs cycles de révision depuis la première soumission de septembre 2025. Il s'inscrit dans la lignée des approches de génération de code pour la robotique, comme Code as Policies, qui font du LLM un planificateur écrivant des appels à des primitives. Il s'oppose à la voie des VLA généralistes (Pi-0, GR00T, Helix), qui encodent la compétence dans les poids du modèle. Aucun partenaire industriel, calendrier de pilote ni publication de code n'est mentionné dans le résumé. La suite logique serait un test sur bras industriels avec des opérateurs non experts, et une mesure de la façon dont la bibliothèque de compétences se comporte à grande échelle, quand la récupération doit trier des centaines de compétences.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
2arXiv cs.RO 

ManiUnit : un jeu de données et un banc d'essai de compétences de manipulation pour les tâches à long horizon

ManiUnit est un jeu de données et un benchmark de compétences de manipulation, construit à partir de 50 activités du simulateur BEHAVIOR-1K et publié sur arXiv en octobre 2026. Le jeu de données compte 137 899 segments répartis sur 21 types de compétences et 417 sous-tâches, tandis que le benchmark comprend 1 260 instances de test. Chaque segment est associé à une instruction explicite de sous-tâche. Le benchmark mesure aussi la sensibilité à des perturbations de la position initiale de la base mobile ou de la configuration articulaire du robot. Il restaure des états intermédiaires du simulateur et définit des conditions de succès locales, ce qui permet d'évaluer chaque compétence sans exécuter les étapes qui la précèdent. Sur deux activités à long horizon, une politique de compétence entraînée sur les segments ManiUnit atteint 78,7 % de succès local en manipulation, contre 49,3 % pour une politique de tâche entraînée sur des démonstrations complètes. Une fois coordonnées par un planificateur, politiques de tâche et de compétence font passer le succès sur la tâche complète de 4,0 % à 18,0 %. L'enjeu est de rendre diagnostiquables les échecs de la manipulation mobile à long horizon, où un robot doit traverser plusieurs pièces et enchaîner des compétences à partir d'une seule consigne en langage naturel. Les auteurs identifient trois difficultés. D'abord, des observations proches sous une même consigne rendent la sélection de la compétence ambiguë. Ensuite, même lorsqu'une compétence réussit, l'état du robot qu'elle transmet à la suivante peut s'écarter des états de départ démontrés et dégrader l'exécution. Enfin, les métriques au niveau de la tâche masquent les causes d'échec, puisqu'une défaillance précoce empêche de tester les étapes suivantes. Les évaluations de politiques vision-langage-action (VLA) représentatives montrent que des scores agrégés similaires peuvent cacher des écarts importants d'une compétence à l'autre. Sur le benchmark complet, les perturbations articulaires réduisent le taux de succès d'environ 56 % par rapport aux états de départ démontrés. Ce résultat appelle à la prudence face aux démonstrations de VLA mesurées sur des conditions initiales propres. Il faut toutefois relativiser la portée de ces chiffres : tout est mesuré en simulation, sur un nombre limité d'activités pour la comparaison compétence contre tâche, et un succès de 18,0 % sur la tâche complète reste très éloigné d'un seuil industriel. Les auteurs ne nomment pas ici les modèles VLA évalués. ManiUnit s'inscrit dans la lignée de BEHAVIOR-1K, benchmark de tâches domestiques de longue durée, et d'une tendance à décomposer les tâches en compétences réutilisables pilotées par un planificateur, plutôt qu'à entraîner une politique monolithique. Le gain obtenu avec le planificateur suggère que cette approche modulaire est plus prometteuse, mais elle dépend de la robustesse de chaque compétence face aux états hérités. Le jeu de données et le benchmark sont des ressources de recherche, sans calendrier de déploiement ni transfert vers le matériel réel annoncé dans le résumé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
SAKI : assemblage de compétences et imitation cinématique à partir de vidéos humaines pour la manipulation mobile à long horizon
3arXiv cs.RO 

SAKI : assemblage de compétences et imitation cinématique à partir de vidéos humaines pour la manipulation mobile à long horizon

Des chercheurs, dont l'équipe derrière la page aus.bot, présentent SAKI (Skill Assembly and Kinematic Imitation), un framework qui relie trois briques: l'acquisition de compétences à partir de vidéos humaines, l'assemblage de ces compétences issues de démonstrations différentes, et l'exécution en boucle fermée sur l'ensemble du corps du robot. Il s'agit d'une publication de recherche (arXiv, version 1), sans produit ni déploiement commercial. Le système prépare des compétences réutilisables centrées sur l'objet, qui conservent les interactions critiques pour la tâche tout en laissant s'adapter les trajectoires de transfert. À partir d'un objectif et de dépendances de tâches fournies, SAKI sélectionne et ordonne les compétences, associe leurs rôles d'objets à la scène courante et transmet l'estimation de la scène et la configuration du robot d'une compétence à la suivante. Une imitation cinématique du corps entier génère des mouvements coordonnés de la base, du bras et de la pince. En exécution, des estimations d'objets persistantes maintiennent les références de la tâche malgré les changements de point de vue, et le retour visuel met à jour les trajectoires restantes. Les tests sur robot réel couvrent le rangement et l'essuyage, avec réutilisation des compétences d'une disposition à l'autre. Le résumé ne donne aucun taux de réussite chiffré, ni nombre d'essais, ni plateforme robotique précisée. L'enjeu est de sortir l'apprentissage par vidéos humaines du cadre de la table, où il est le plus démontré, pour l'appliquer à la manipulation mobile longue durée, là où les erreurs se cumulent entre étapes et où la base mobile déplace sans cesse le référentiel. Le résultat le plus instructif est l'ablation: à optimisation du corps entier et retour visuel constants, la préparation des références conditionnée par la tâche améliore nettement l'achèvement des tâches longues. Autrement dit, le goulot n'est pas seulement le contrôle bas niveau mais la qualité de la représentation des compétences apprises. Pour un intégrateur, c'est une piste vers des robots reprogrammés par démonstration humaine filmée plutôt que par téléopération coûteuse. Les limites restent claires: les dépendances de tâches sont fournies par l'opérateur et non déduites, les scénarios sont des démonstrations de laboratoire, et l'écart entre une vidéo de démonstration et une fiabilité industrielle reste entier. SAKI s'inscrit dans la course à la manipulation mobile généraliste, où les approches dominantes reposent sur des modèles vision-langage-action (VLA) entraînés sur de la téléopération, comme Pi-0 ou Helix, ou sur des pipelines robotiques modulaires. Ici, le choix est hybride: composition explicite de compétences et optimisation cinématique, plutôt qu'une politique de bout en bout. Cette voie prolonge les travaux sur l'imitation à partir de vidéos humaines, dont l'avantage est de contourner le goulot des données robotiques. Les prochaines étapes probables seraient l'inférence automatique des dépendances de tâches, des évaluations chiffrées sur davantage de scénarios et des essais hors laboratoire. Les vidéos de démonstration sont disponibles sur la page du projet, mais l'échantillon présenté n'est, par nature, pas représentatif des échecs.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
SeeQ : entraîner des fonctions de valeur généralistes pour la manipulation robotique à long horizon
4arXiv cs.RO 

SeeQ : entraîner des fonctions de valeur généralistes pour la manipulation robotique à long horizon

Des chercheurs présentent SeeQ (Subtask-elicited Q-functions) dans un preprint publié sur arXiv sous la référence 2609.22085v1, classé comme soumission nouvelle. La méthode s'attaque à un problème connu des politiques robotiques généralistes : leur fragilité sur des tâches longues et multi-étapes qui exigent plusieurs tentatives et une délibération répétée sur une même sous-étape avant de réussir. Plutôt que d'apprendre une fonction de valeur Q sur la récompense globale de la tâche, ce qui impose un horizon de crédit-assignation très long et des mises à jour de Bellman difficiles à stabiliser, SeeQ apprend une valeur Q pour la sous-tâche activement en cours, ce qui raccourcit l'horizon de prédiction et rend possible un apprentissage par différence temporelle efficace. Pendant l'entraînement, des annotations de sous-tâches déjà présentes dans des jeux de données robotiques hors ligne fournissent la décomposition, permettant d'exploiter des données larges et potentiellement sous-optimales. Au moment de l'inférence, aucune annotation humaine ni module séparé de prédiction de sous-tâche n'est nécessaire : l'architecture, construite sur un socle vision-langage, prédit d'abord de manière autorégressive la sous-tâche active en langage naturel avant d'en estimer la valeur, puis est pré-entraînée sur des données ouvertes de manipulation robotique et affinée sur les tâches cibles. Les auteurs rapportent des essais sur quatre tâches de manipulation réelles, menées sur deux plateformes robotiques bimanuelles, avec une amélioration jugée substantielle du pilotage de politique en best-of-N, sans toutefois donner de chiffres précis de taux de réussite ni d'écart avec les méthodes de référence, une imprécision qu'il convient de relever. Cette approche cible un point de friction central pour les politiques génératives de type vision-langage-action (VLA) : leur capacité à enchaîner plusieurs étapes sans dérive ni blocage répété sur la même sous-tâche. Les fonctions de valeur Q sont déjà utilisées pour classer des actions candidates ou guider l'amélioration d'une politique, mais leur entraînement sur des récompenses éparses au niveau de la tâche entière se heurte à des coûts de calcul et de couverture de données prohibitifs. En ramenant le problème à une valeur par sous-tâche et en supprimant le besoin d'un module de prédiction de sous-tâche séparé au moment du déploiement, SeeQ propose une piste concrète pour rendre le pilotage de politiques exploitable par des intégrateurs qui s'appuient sur des politiques VLA pré-entraînées, sans pipeline d'annotation supplémentaire côté production. SeeQ s'inscrit dans un courant de recherche qui cherche à doter les politiques VLA généralistes, dans la lignée de travaux comme Pi-0 ou GR00T N2, de mécanismes de vérification et de guidage complémentaires plutôt que de s'appuyer uniquement sur l'imitation. Il s'agit d'un preprint de recherche académique, non d'un produit commercial ni d'un déploiement industriel : aucune entreprise, aucun nom de robot commercial ni calendrier de mise sur le marché n'apparaît dans l'article, et les expériences restent limitées à deux plateformes bimanuelles en conditions de laboratoire. La suite logique, non précisée par les auteurs, serait une extension à davantage de plateformes et de tâches ainsi qu'un chiffrage plus détaillé des gains, avant toute intégration envisageable dans des piles logicielles de production.

RecherchePaper
1 source