SkillWeave : tisser des démonstrations hétérogènes en compétences de manipulation à long horizon
Des chercheurs publient sur arXiv SkillWeave, un cadre de démonstrations hétérogènes pour la manipulation dextre à long horizon. Il associe deux modes de collecte selon le type d'interaction. La téléopération couvre les phases larges d'approche et de transport. L'enseignement kinesthésique, où l'opérateur guide physiquement le bras, couvre les gestes de précision riches en contacts. Ce second mode crée un décalage visuel, puisque l'humain apparaît dans les images d'entraînement. L'équipe y répond par une politique de diffusion conditionnée par un masque d'objet. L'entraînement utilise une segmentation d'objets réalisée hors ligne. Au déploiement, un prédicteur de masque léger la remplace, ce qui évite la segmentation en ligne et l'inpainting d'images. Un second mécanisme, le « successor-aware terminal steering », traite la dérive de distribution entre sous-politiques entraînées séparément. Il choisit, parmi des actions échantillonnées par la politique prédécesseur, celle qui mène vers des états couverts par la distribution d'états initiaux de la politique successeur. Sur trois tâches réelles à long horizon, le taux de réussite de bout en bout moyen atteint 27 %. Les sous-tâches dextres, avec politiques kinesthésiques à masque, atteignent 65 % en moyenne. L'efficacité de composition des transitions entre politiques atteint 87 % en moyenne. Le code et les vidéos sont publiés.
L'intérêt tient à ce que ces chiffres montrent sur le goulot d'étranglement de la manipulation longue. Un taux de bout en bout de 27 % reste très loin d'un niveau exploitable en production. Il confirme aussi que l'enchaînement de compétences multiplie les erreurs : avec 65 % par sous-tâche dextre, la réussite s'érode vite sur trois tâches. La contribution est donc surtout diagnostique. Elle indique que la jonction entre politiques pèse autant que la qualité de chaque politique, avec 87 % de composition efficace. Elle suggère aussi qu'une modalité de collecte unique, souvent la téléopération seule, est mal adaptée aux contacts fins. Pour un intégrateur, la leçon est pratique : le coût de collecte de données se répartit mieux si l'on réserve le guidage physique aux seuls gestes critiques. Les limites sont à garder en tête. Ni les tâches, ni la plateforme robotique, ni le nombre d'essais ne figurent dans le résumé, et aucune comparaison avec des modèles généralistes n'y est donnée. Les résultats restent ceux d'un laboratoire, sans déploiement industriel.
Le contexte est celui d'un champ qui cherche à sortir des démonstrations courtes. Les politiques de diffusion et les modèles vision-langage-action (VLA) comme Pi-0 ou GR00T progressent sur des tâches isolées. Ils restent fragiles dès que la séquence s'allonge. La téléopération à grande échelle est l'approche dominante pour collecter des données. Le teaching kinesthésique, plus lent mais plus précis, est resté marginal à cause du biais visuel que cet article cherche à corriger. Le travail s'inscrit dans les approches de décomposition en compétences, qui visent à composer des primitives plutôt qu'à entraîner une politique monolithique. La suite logique serait de tester la méthode sur davantage de tâches et d'embodiments. Il faudrait aussi la confronter à des VLA généralistes sur les mêmes séquences. Le caractère reproductible du code publié le permettra.
Pas d\'impact direct sur la France/UE
Dans nos dossiers



