Aller au contenu principal
Sélectionner ou ne pas sélectionner : distillation de la prédiction de compétences robotiques en petit ensemble
RecherchearXiv cs.RO 

Sélectionner ou ne pas sélectionner : distillation de la prédiction de compétences robotiques en petit ensemble

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie en mai 2026 un preprint (arXiv:2605.21242) portant sur la prédiction automatique de compétences robotiques dans les flottes hétérogènes. À partir d'une description de tâche en langage naturel, le système identifie quelles capacités physiques sont requises parmi six catégories: vol, roues, pattes, navigation en surface aquatique, navigation sous-marine et manipulation avec mains. Faute de données labellisées existantes pour ce mapping, les auteurs ont construit un dataset synthétique via génération assistée par LLM et audit ciblé des étiquettes. Un ensemble de deux encodeurs de phrases fine-tunés (mpnet + MiniLM, environ 133 millions de paramètres au total) atteint 83,5 % de précision sur un jeu de test stratifié de 200 tâches, dépassant Kimi K2 (1 000 milliards de paramètres, architecture MoE) à 72,0 %, GPT-OSS-120B à 71,5 %, et Llama-4-Scout-17B à 69,0 %, tous évalués en zero-shot avec le même prompt.

Ce résultat expose une asymétrie opérationnelle significative: un modèle de 133 millions de paramètres déployable localement surclasse des LLMs un millier de fois plus volumineux sur une tâche de routage de flotte. Pour les intégrateurs gérant des flottes mixtes (humanoïdes, quadrupèdes, drones, rovers), l'assignation automatique de la bonne plateforme à la bonne tâche reste un problème non résolu en production. Une limite mérite d'être soulignée: le jeu d'évaluation de 200 tâches synthétiques a été produit par les auteurs eux-mêmes, ce qui appelle une validation indépendante sur des scénarios réels avant de tirer des conclusions définitives.

La gestion de flottes robotiques hétérogènes s'est intensifiée avec la multiplication des plateformes commerciales (Boston Dynamics Spot, Unitree B2, humanoïdes Figure ou Agility Digit, drones industriels), et les approches actuelles de routage reposent encore sur des règles manuelles peu scalables. Les auteurs s'inscrivent dans la tendance de distillation de capacités LLM vers des modèles compacts (famille SetFit, sentence-transformers), appliquée ici pour la première fois à la sélection de plateforme robotique. Ce preprint ne mentionne ni déploiement terrain ni partenariat industriel, mais l'utilisation de mpnet et MiniLM, disponibles en open-source sur Hugging Face, abaisse la barrière à une validation industrielle rapide.

À lire aussi

CLASP : sélection et composition de compétences robotiques pilotées par le langage avec apprentissage paramétré par la tâche
1arXiv cs.RO 

CLASP : sélection et composition de compétences robotiques pilotées par le langage avec apprentissage paramétré par la tâche

Des chercheurs ont publié sur arXiv (2606.08169) CLASP, une architecture modulaire permettant à un bras manipulateur à 7 degrés de liberté d'exécuter des tâches robotiques à partir de commandes en langage naturel, avec seulement 2 à 5 démonstrations kinesthésiques par compétence. Le système repose sur deux briques : des primitives de mouvement noyau paramétrées par tâche (TP-KMPs), héritées des méthodes d'imitation de données, et un modèle vision-langage (VLM) préentraîné, utilisé sans fine-tuning. Lors de la phase d'apprentissage, le VLM génère des schémas de compétences décrivant les paramètres nécessaires et les préconditions d'exécution. À l'exécution, il sélectionne la compétence adaptée, résout les liaisons de paramètres, et compose des comportements inédits via une pondération par covariance. Lorsqu'aucune compétence existante ne suffit, le système identifie automatiquement la lacune et sollicite une démonstration ciblée. Les taux de succès rapportés vont de 73,3 % à 100 % selon les scénarios testés (sélection, composition, apprentissage actif). Ce résultat est notable parce qu'il attaque un problème structurel du déploiement industriel : les modèles vision-langage-action (VLA) de nouvelle génération, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, atteignent des performances impressionnantes mais exigent des volumes de données d'entraînement massifs, difficilement compatibles avec les contraintes de production réelle. À l'inverse, les méthodes d'imitation efficaces en données, comme les TP-GMMs de Stefan Calinon, restent rigides face à des instructions non anticipées. CLASP propose une voie intermédiaire : déléguer le raisonnement symbolique au VLM sans le ré-entraîner, et garder la motricité dans un espace probabiliste compact. La boucle d'apprentissage actif intégrée est particulièrement pertinente pour les intégrateurs industriels : le robot peut signaler ce qu'il ne sait pas faire plutôt que d'échouer silencieusement. Les primitives de mouvement paramétrées par tâche ont une longue trajectoire académique, popularisées notamment par les travaux de Calinon et Billard depuis les années 2010. CLASP s'inscrit dans la vague actuelle qui cherche à greffer la compréhension du langage sur ces méthodes sans sacrifier leur frugalité en données, une direction également explorée par des équipes comme celles de CMU, ETH Zurich ou l'INRIA en France. La validation reste limitée à un manipulateur en laboratoire, les scénarios présentés sont sélectionnés, et les taux de succès ne sont pas contextualisés par rapport à la complexité des tâches ni à la variabilité environnementale. La prochaine étape évidente serait une évaluation sur des tâches de manipulation non structurées, voire un transfert vers une plateforme mobile ou humanoïde.

UEL'INRIA est cité parmi les équipes explorant des directions similaires (langage sur primitives de mouvement frugales en données), positionnant la France comme contributeur actif à cette vague de recherche, sans impact industriel direct à court terme.

RecherchePaper
1 source
CoralPlan : sélection et exécution de compétences d'observation pour l'inspection robotique sous-marine
2arXiv cs.RO 

CoralPlan : sélection et exécution de compétences d'observation pour l'inspection robotique sous-marine

Une équipe de recherche présente CoralPlan, un système vision-langage conçu pour l'inspection robotique sous-marine de colonies coralliennes, décrit dans un preprint publié sur arXiv (2609.31211v1). Le système sélectionne une compétence d'observation à partir d'une image de caméra courante et d'une consigne textuelle fournie par un "manifeste d'épisode". Une interface de mouvement commune exécute ensuite trois primitives de trajectoire relatives à la cible, orbite, patch ou survey (balayage), les autres champs du plan servant de guide pour l'opérateur humain. Deux critères de succès sont définis: la complétion de l'observation, qui exige le maintien de la cible dans le champ et une couverture propre à chaque primitive, et le succès conjoint, qui exige en plus que la compétence choisie corresponde à la référence enregistrée. Le système a été évalué sur 144 épisodes simulés et 36 paires appariées simulation-matériel, réalisées dans une piscine à eau claire avec des poses de référence de cible mesurées par un système externe. Sur matériel réel, le taux de complétion d'observation atteint 77,8% et le taux de succès conjoint 63,9%. Ce travail illustre un enjeu concret pour les opérateurs de robotique sous-marine (inspection de récifs, aquaculture, infrastructures immergées) : reconnaître une cible ne suffit pas, le robot doit aussi choisir le bon type de mouvement d'observation selon la tâche demandée, une décision jusqu'ici largement câblée en dur dans les trajectoires pré-programmées des AUV et ROV. En étendant les systèmes vision-langage-action, jusqu'ici concentrés sur la manipulation et les humanoïdes terrestres, au cadrage caméra sous-marin, l'étude teste la portée de cette approche hors de son terrain habituel. L'écart entre les 144 épisodes simulés et les seules 36 paires testées sur matériel, ainsi que la chute du taux de succès conjoint à 63,9% par rapport à la complétion d'observation à 77,8%, rappelle que le passage de la simulation au réel reste un point de friction, même pour une tâche de perception plutôt que de manipulation fine. Les auteurs documentent eux-mêmes des cas d'échec, complétions ne correspondant pas à la référence ou observations incomplètes malgré une sélection de compétence correcte, une transparence qui tranche avec l'emphase habituelle des annonces du secteur. La surveillance automatisée des récifs coralliens gagne en importance face à leur dégradation, mais les robots sous-marins existants suivent le plus souvent des trajectoires fixes plutôt que des mouvements d'observation adaptés à la tâche. CoralPlan s'inscrit dans la vague plus large des modèles vision-langage-action appliqués jusqu'à présent surtout à la manipulation robotique terrestre, en la transposant à des décisions de cadrage caméra sur une plateforme non humanoïde évoluant en milieu aquatique. Il s'agit d'un travail de recherche publié en preprint, non encore relu par les pairs, testé en piscine à eau claire et non lors de déploiements réels sur récif, ce qui limite pour l'instant sa portée à une preuve de concept en conditions contrôlées. Les auteurs pointent eux-mêmes les cas où la sélection correspond à la référence sans que l'observation soit complète, ouvrant la voie à des travaux futurs visant à combler cet écart avant d'envisager des essais en eau trouble ou sur site naturel.

RecherchePaper
1 source
Exploration des espaces de préhension robotique tenant compte de la connectivité
3arXiv cs.RO 

Exploration des espaces de préhension robotique tenant compte de la connectivité

Des chercheurs publient sur arXiv (arXiv:2609.22983v1, prépublication non encore évaluée par les pairs) une étude sur la structure spatiale des prises robotiques réussies dans l'espace SE(3), c'est-à-dire l'ensemble à six degrés de liberté des positions et orientations possibles d'un préhenseur. Plutôt que de traiter chaque pose de saisie comme un problème binaire isolé (valide ou non), les auteurs s'intéressent à la façon dont les prises réussies s'organisent entre elles au sein de cet espace. En exploitant un jeu de données de saisie à grande échelle, ils montrent que les ensembles de prises valides forment, pour un objet donné, une structure de connectivité hétérogène mais reproductible d'un objet à l'autre. Ils introduisent ensuite une stratégie d'échantillonnage dite « connectivity-aware », qui explore de façon incrémentale l'espace de prise observé en priorisant quatre types de candidats : les ponts potentiels entre composantes déconnectées, les frontières structurelles, les extensions de bordure et la nouveauté géométrique. Dans des expériences de reconstruction contrôlées, cette méthode retrouve la topologie des ensembles de prises réussies nettement plus vite que les deux références standard du domaine, l'échantillonnage aléatoire et le farthest-point sampling. Pour l'industrie de la manipulation robotique, bin-picking, pick-and-place industriel, l'enjeu est la réduction du nombre d'essais physiques ou simulés nécessaires pour cartographier les prises viables d'un nouvel objet, un poste de coût récurrent pour les intégrateurs. Les auteurs testent aussi si la structure de connectivité apprise sous viabilité partiellement masquée accélère la découverte de nouvelles prises, et si l'expérience structurelle acquise sur des objets déjà explorés se transfère à des objets inédits, une piste pertinente pour généraliser sans réentraîner à chaque nouvelle référence produit. Il s'agit toutefois de résultats de recherche en environnement contrôlé, pas d'un système déployé en usine. Ce travail s'inscrit dans la lignée des détecteurs de prise par apprentissage et des planificateurs par échantillonnage, qui évaluent traditionnellement des poses candidates indépendamment les unes des autres sans modéliser leur organisation géométrique collective. En pointant une structure exploitable au-delà de la viabilité individuelle de chaque pose, l'étude ouvre la voie à des méthodes d'exploration sensibles à la géométrie de l'espace d'action, avec des travaux futurs attendus sur le passage à des objets réels et des scènes de manipulation plus complexes.

RecherchePaper
1 source
Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche
4arXiv cs.RO 

Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche

Des chercheurs ont mis en ligne une nouvelle version (v2) de leur article "Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation" sur arXiv (2512.18368), présentant AtomSkill, un framework d'apprentissage par imitation pour la manipulation robotique multi-tâches. La méthode s'attaque à trois obstacles connus de l'apprentissage par démonstration à grande échelle : démonstrations sous-optimales, multi-modalité des comportements et interférences destructrices entre tâches lorsqu'un même modèle doit apprendre plusieurs compétences simultanément. AtomSkill découpe les démonstrations en compétences atomiques de longueur variable, alignées sémantiquement grâce à un objectif contrastif qui impose à la fois cohérence sémantique et cohérence temporelle, formant une bibliothèque de compétences compacte et réutilisable. La politique apprise prédit à la fois la position finale (keypose) d'une compétence et les actions immédiates, ce qui permet des transitions fluides entre compétences en fonction de la progression. Lors de l'inférence, un échantillonneur par diffusion génère des séquences de compétences plausibles, tandis que les keyposes prédites déclenchent automatiquement l'enchaînement. Les auteurs annoncent des résultats supérieurs aux méthodes de référence en imitation learning et aux approches par compétences existantes, en simulation comme en conditions réelles. L'enjeu dépasse la seule prouesse technique : la plupart des bibliothèques de compétences actuelles sont soit trop dépendantes de la structure du langage utilisé pour les décrire, soit mal alignées sémantiquement d'une tâche à l'autre, ce qui limite leur capacité à généraliser. Résoudre ce compromis conditionne directement la viabilité des politiques multi-tâches pour des applications industrielles comme le picking, l'assemblage ou la manutention, où un même robot doit enchaîner des gestes variés sans réapprentissage complet à chaque nouvelle tâche. C'est aussi un signal dans le débat actuel sur les modèles vision-langage-action (VLA) : la promesse d'une politique unique capable de généraliser à grande échelle reste difficile à tenir, et des architectures hiérarchiques par compétences comme AtomSkill pourraient constituer une alternative plus robuste que les VLA monolithiques. L'article s'inscrit dans une lignée de recherche en concurrence directe avec des approches VLA de bout en bout telles que Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. Contrairement à ces annonces industrielles très médiatisées, il s'agit ici d'une publication académique sans chiffres de benchmark détaillés ni précisions sur le matériel utilisé dans l'abstract, et sans affiliation commerciale indiquée. Les auteurs renvoient vers une page de projet (atom-skill.github.io) pour le code et les démonstrations vidéo ; la validation à plus grande échelle sur robots physiques reste, comme souvent à ce stade de publication, la prochaine étape à surveiller.

RecherchePaper
1 source