RecherchearXiv cs.RO 9 juin 2026

CLASP : sélection et composition de compétences robotiques pilotées par le langage avec apprentissage paramétré par la tâche

1 source couvre ce sujet·Source originale ↗·

Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (2606.08169) CLASP, une architecture modulaire permettant à un bras manipulateur à 7 degrés de liberté d'exécuter des tâches robotiques à partir de commandes en langage naturel, avec seulement 2 à 5 démonstrations kinesthésiques par compétence. Le système repose sur deux briques : des primitives de mouvement noyau paramétrées par tâche (TP-KMPs), héritées des méthodes d'imitation de données, et un modèle vision-langage (VLM) préentraîné, utilisé sans fine-tuning. Lors de la phase d'apprentissage, le VLM génère des schémas de compétences décrivant les paramètres nécessaires et les préconditions d'exécution. À l'exécution, il sélectionne la compétence adaptée, résout les liaisons de paramètres, et compose des comportements inédits via une pondération par covariance. Lorsqu'aucune compétence existante ne suffit, le système identifie automatiquement la lacune et sollicite une démonstration ciblée. Les taux de succès rapportés vont de 73,3 % à 100 % selon les scénarios testés (sélection, composition, apprentissage actif).

Ce résultat est notable parce qu'il attaque un problème structurel du déploiement industriel : les modèles vision-langage-action (VLA) de nouvelle génération, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, atteignent des performances impressionnantes mais exigent des volumes de données d'entraînement massifs, difficilement compatibles avec les contraintes de production réelle. À l'inverse, les méthodes d'imitation efficaces en données, comme les TP-GMMs de Stefan Calinon, restent rigides face à des instructions non anticipées. CLASP propose une voie intermédiaire : déléguer le raisonnement symbolique au VLM sans le ré-entraîner, et garder la motricité dans un espace probabiliste compact. La boucle d'apprentissage actif intégrée est particulièrement pertinente pour les intégrateurs industriels : le robot peut signaler ce qu'il ne sait pas faire plutôt que d'échouer silencieusement.

Les primitives de mouvement paramétrées par tâche ont une longue trajectoire académique, popularisées notamment par les travaux de Calinon et Billard depuis les années 2010. CLASP s'inscrit dans la vague actuelle qui cherche à greffer la compréhension du langage sur ces méthodes sans sacrifier leur frugalité en données, une direction également explorée par des équipes comme celles de CMU, ETH Zurich ou l'INRIA en France. La validation reste limitée à un manipulateur en laboratoire, les scénarios présentés sont sélectionnés, et les taux de succès ne sont pas contextualisés par rapport à la complexité des tâches ni à la variabilité environnementale. La prochaine étape évidente serait une évaluation sur des tâches de manipulation non structurées, voire un transfert vers une plateforme mobile ou humanoïde.

Impact France/UE

L'INRIA est cité parmi les équipes explorant des directions similaires (langage sur primitives de mouvement frugales en données), positionnant la France comme contributeur actif à cette vague de recherche, sans impact industriel direct à court terme.

Dans nos dossiers

IA physique & VLA NVIDIA GR00T Physical Intelligence — π0 arXiv cs.RO

À lire aussi

1arXiv cs.RO

Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche

Des chercheurs ont mis en ligne une nouvelle version (v2) de leur article "Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation" sur arXiv (2512.18368), présentant AtomSkill, un framework d'apprentissage par imitation pour la manipulation robotique multi-tâches. La méthode s'attaque à trois obstacles connus de l'apprentissage par démonstration à grande échelle : démonstrations sous-optimales, multi-modalité des comportements et interférences destructrices entre tâches lorsqu'un même modèle doit apprendre plusieurs compétences simultanément. AtomSkill découpe les démonstrations en compétences atomiques de longueur variable, alignées sémantiquement grâce à un objectif contrastif qui impose à la fois cohérence sémantique et cohérence temporelle, formant une bibliothèque de compétences compacte et réutilisable. La politique apprise prédit à la fois la position finale (keypose) d'une compétence et les actions immédiates, ce qui permet des transitions fluides entre compétences en fonction de la progression. Lors de l'inférence, un échantillonneur par diffusion génère des séquences de compétences plausibles, tandis que les keyposes prédites déclenchent automatiquement l'enchaînement. Les auteurs annoncent des résultats supérieurs aux méthodes de référence en imitation learning et aux approches par compétences existantes, en simulation comme en conditions réelles. L'enjeu dépasse la seule prouesse technique : la plupart des bibliothèques de compétences actuelles sont soit trop dépendantes de la structure du langage utilisé pour les décrire, soit mal alignées sémantiquement d'une tâche à l'autre, ce qui limite leur capacité à généraliser. Résoudre ce compromis conditionne directement la viabilité des politiques multi-tâches pour des applications industrielles comme le picking, l'assemblage ou la manutention, où un même robot doit enchaîner des gestes variés sans réapprentissage complet à chaque nouvelle tâche. C'est aussi un signal dans le débat actuel sur les modèles vision-langage-action (VLA) : la promesse d'une politique unique capable de généraliser à grande échelle reste difficile à tenir, et des architectures hiérarchiques par compétences comme AtomSkill pourraient constituer une alternative plus robuste que les VLA monolithiques. L'article s'inscrit dans une lignée de recherche en concurrence directe avec des approches VLA de bout en bout telles que Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. Contrairement à ces annonces industrielles très médiatisées, il s'agit ici d'une publication académique sans chiffres de benchmark détaillés ni précisions sur le matériel utilisé dans l'abstract, et sans affiliation commerciale indiquée. Les auteurs renvoient vers une page de projet (atom-skill.github.io) pour le code et les démonstrations vidéo ; la validation à plus grande échelle sur robots physiques reste, comme souvent à ce stade de publication, la prochaine étape à surveiller.

RecherchePaper

1 source

2arXiv cs.RO

Apprentissage de compétences motrices transférables pour des tâches robotiques adaptées à la géométrie des surfaces

Des chercheurs ont déposé sur arXiv (référence 2605.24881) un cadre modulaire visant à améliorer la robotique de surface sur des tâches comme la peinture par pulvérisation ou le soudage. L'idée centrale : séparer la planification géométrique du chemin et l'exécution experte du mouvement, deux problèmes que les approches actuelles couplent trop étroitement. Le savoir-faire opérateur est formalisé comme un vocabulaire de règles motrices atomiques interprétables - scaling de vitesse, offsets d'orientation - appliquées en surcouche d'un chemin planifié classiquement. Un réseau de neurones multimodal apprend à inférer les paramètres de ces règles à partir de trajectoires cinématiques et de géométrie CAO. L'évaluation porte sur des objets en L et en forme de fenêtre en simulation dynamique, où le modèle extrait correctement les règles de vitesse et d'orientation sur les deux topologies. L'enjeu est direct pour les intégrateurs industriels : la peinture et le soudage robotisés restent des domaines où les opérateurs experts surpassent les robots sur la qualité de surface. Le principal apport de l'approche est la transferabilité géométrique - une limitation connue du learning from demonstration, où les modèles entraînés sur une pièce échouent généralement sur des géométries différentes. En découplant expertise et géométrie, le framework permet théoriquement d'appliquer des règles apprises sur une forme simple à des pièces variées sans réentraînement complet. La représentation interprétable par règles atomiques offre également un levier de validation pour les ingénieurs procédés, critère souvent déterminant en aéronautique et automobile où les certifications imposent une traçabilité des décisions système. Cette publication s'inscrit dans la lignée des travaux sur les primitives motrices (DMP, ProDMP) mais avec une couche d'inférence CAO explicite, une direction explorée aussi par des équipes à Berkeley, ETH Zurich et l'INRIA. À noter que l'évaluation reste entièrement en simulation - aucun résultat sur robot physique n'est présenté, ce qui limite les conclusions sur le transfert sim-to-real effectif. Les prochaines étapes naturelles seraient une validation sur bras 6-DOF (UR10, FANUC) et un test sur des surfaces courbées continues, bien plus représentatives des conditions industrielles réelles que les géométries à arêtes vives utilisées ici.

UELa recherche sur les primitives motrices transférables appliquées à la peinture et au soudage intéresse directement les intégrateurs robotiques européens (aéronautique, automobile), et l'INRIA travaille sur des directions similaires, mais l'absence totale de validation sur robot physique limite l'impact opérationnel immédiat.

RecherchePaper

1 source

3arXiv cs.RO

L'apprentissage conjoint de prédicats et d'actions permet la composition zéro-shot de compétences

Des chercheurs ont publié le 21 mai 2026 sur arXiv un préprint intitulé "Jointly Learning Predicates and Actions Enables Zero-Shot Skill Composition", introduisant PACTS (Predicate Action Skills), une nouvelle classe de politiques visuomotrices en boucle fermée pour la robotique. Le problème posé est précis : les approches actuelles d'apprentissage par démonstration (LfD) permettent à un robot d'acquérir des compétences isolées, mais échouent à les recombiner de façon inédite sans réentraînement. PACTS y répond en modélisant chaque compétence comme un processus génératif joint sur deux flux simultanés : les trajectoires d'action et les trajectoires de croyance prédicative, c'est-à-dire des représentations symboliques de l'état du monde induites par chaque action. Un seul modèle produit ainsi des séquences action-résultat cohérentes, sans pipeline séparé. L'enjeu est structurel pour la robotique industrielle et de service : la capacité de composition zéro-shot signifie qu'un robot formé sur des briques de base peut enchaîner des tâches nouvelles sans nouvelle collecte de données ni réentraînement, ce qui est un verrou majeur dans le déploiement à grande échelle. Les politiques génératives modernes, notamment les VLA (Vision-Language-Action models) comme pi-0 de Physical Intelligence ou les modèles de diffusion appliqués aux trajectoires, ne modélisent que la distribution des actions, sans raisonnement explicite sur les états symboliques intermédiaires. PACTS utilise les prédictions de prédicats en ligne comme interface symbolique pour séquencer les compétences et surveiller leur exécution, s'approchant ainsi d'une forme de planification symbolique intégrée. Les auteurs montrent que la génération jointe améliore à la fois la qualité des actions produites et la classification des prédicats, deux métriques qui se renforçaient rarement dans les approches précédentes. Ce travail s'inscrit dans un débat actif entre approches purement neuronales (end-to-end) et approches hybrides neuro-symboliques pour la manipulation robotique. Les méthodes de Task and Motion Planning (TAMP) classiques atteignent une bonne compositionnalité mais nécessitent des modèles symboliques prédéfinis ; les politiques d'imitation modernes générealisent mal sans représentation intermédiaire explicite. PACTS tente de combler les deux, en apprenant les symboles depuis les données de démonstration plutôt qu'en les codant manuellement. Le code et les expériences sont annoncés sur le site du projet (planpacts.github.io), mais le préprint n'est pas encore évalué par des pairs, et aucun résultat de déploiement terrain ni partenaire industriel n'est mentionné à ce stade.

RechercheOpinion

1 source

4arXiv cs.RO

ReinforceGen : politiques de compétences hybrides avec génération automatisée de données et apprentissage par renforcement

Une équipe de recherche en robotique publie ReinforceGen, un système combinant décomposition de tâches, génération automatisée de données, apprentissage par imitation et planification de mouvement, le tout affiné par apprentissage par renforcement. Le principe consiste à segmenter une tâche de manipulation longue en plusieurs compétences localisées, reliées entre elles par un planificateur de mouvement. Ces compétences sont d'abord entraînées par imitation à partir d'un jeu de données généré depuis seulement 10 démonstrations humaines, puis affinées via adaptation en ligne et renforcement. Sur le benchmark Robosuite, ReinforceGen atteint 80% de taux de réussite sur l'ensemble des tâches en contrôle visuomoteur, dans la configuration la plus exigeante de réinitialisation des positions de départ. Des études d'ablation montrent que les étapes de fine-tuning apportent un gain de performance moyen de 89%. Le système a également été testé en conditions réelles, avec des améliorations significatives rapportées après affinage. Vidéos et résultats complémentaires sont disponibles sur le site du projet. La manipulation longue durée reste l'un des obstacles majeurs en robotique manipulative: enchaîner plusieurs sous-tâches sans dérive d'erreur cumulative est difficile pour l'imitation pure, tandis que le renforcement seul peine à converger sur des horizons longs sans démonstration initiale. En combinant les deux, ReinforceGen s'inscrit dans un mouvement plus large cherchant à réduire la dépendance aux données humaines coûteuses (ici seulement 10 démonstrations) tout en conservant une robustesse comparable à des méthodes plus gourmandes. Le passage réussi vers des évaluations réelles, au-delà de la simulation, est le point le plus significatif pour les acteurs industriels: il suggère que l'écart simulation-réel, souvent le talon d'Achille des politiques visuomotrices, peut être réduit par cette architecture hybride plutôt que par du pur scaling de données. Le papier, publié sur arXiv (version révisée, v2), s'appuie sur le benchmark Robosuite, référence standard pour comparer les politiques de manipulation robotique en simulation. Le score de 80% est annoncé dans le réglage le plus difficile testé, un détail à garder en tête: les performances dans des configurations moins contraignantes ne sont pas précisées dans le résumé. Aucun acteur commercial ni institution n'est nommé dans l'abstract, ce travail relevant pour l'instant de la recherche académique plutôt que d'un produit destiné à un déploiement industriel immédiat.

RecherchePaper

1 source