Aller au contenu principal
RecherchearXiv cs.RO 

Skill-SLM : des petits modèles de langage pilotés par des compétences d'agent pour une opération robotique fiable

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent Skill-SLM, un cadre qui confie à de petits modèles de langage (SLM) embarqués sur le robot la tâche de décomposer une instruction en langage naturel en sous-tâches, de choisir les compétences adaptées dans une bibliothèque, puis de les orchestrer en opérations exécutables. Le travail, publié sur arXiv (2610.10812v1), repose sur trois briques. Une grammaire non contextuelle (CFG) tenant compte des compétences opérationnelles du robot sert à extraire celles qui sont nécessaires et à construire la bibliothèque. Des LLM « enseignants » induisent et synthétisent ensuite les jeux de données d'entraînement des SLM. Enfin, une stratégie d'orchestration progressive vise à fiabiliser l'exécution de chaque compétence et l'opération dans son ensemble. Les tests portent sur des tâches de drones (UAV), puis sur des véhicules terrestres. Le résumé ne donne ni taille de modèle, ni nombre de tâches, ni taux de réussite chiffrés.

L'enjeu est de s'attaquer à un point faible des approches actuelles de SLM embarqués, surtout fondées sur la distillation. Elles supposent d'énumérer des paires tâche-solution représentatives, ce qui rend la construction des jeux de données coûteuse et généralise mal, car le nombre de formes de tâches possibles croît très vite. Raisonner en compétences réutilisables plutôt qu'en exemples de tâches complètes déplace le problème vers la composition. Selon les auteurs, cela améliore nettement les résultats face aux références par distillation, surtout sur des tâches inédites. Pour un intégrateur, l'intérêt est de pouvoir faire tourner un modèle léger directement sur la machine, sans dépendre d'un LLM distant, avec un comportement plus prévisible. Il faut toutefois rester prudent. Il s'agit d'une préimpression sans relecture par les pairs. Les gains annoncés sont relatifs à des baselines choisies par les auteurs, et l'essai sur véhicule terrestre sert surtout à illustrer la portabilité, non à prouver un passage à l'échelle. Rien n'indique de test sur robot réel en conditions industrielles, ni de mesure de latence ou de consommation sur matériel embarqué.

Cette approche s'inscrit dans le mouvement qui rapproche les modèles de langage de la robotique, avec des planificateurs à base de compétences (dans la lignée de SayCan) et la génération de code par LLM. Elle se démarque des modèles vision-langage-action de bout en bout, qui apprennent directement des actions à partir de démonstrations. Ici, la couche de compétences reste explicite et vérifiable, ce qui peut faciliter l'audit. La limite probable est que la qualité du système dépend de la couverture de la bibliothèque et de la grammaire, et donc d'une ingénierie initiale propre à chaque plateforme. Les prochaines étapes naturelles seraient des validations sur matériel réel, des comparaisons directes avec des politiques VLA et des mesures sur calculateurs embarqués. Le code et les jeux de données ne sont pas mentionnés dans le résumé.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

DROM : un cadre de diffusion guidé par le langage pour la manipulation robotique multi-compétences
1arXiv cs.RO 

DROM : un cadre de diffusion guidé par le langage pour la manipulation robotique multi-compétences

DROM, un cadre génératif décrit dans un préprint arXiv (v1), vise un problème classique de la manipulation robotique : apprendre à partir de peu de démonstrations des politiques robustes, capables d'enchaîner plusieurs compétences sur des tâches longues. Les auteurs utilisent des Dynamic Movement Primitives (DMP) pour multiplier un petit nombre de démonstrations expertes en jeux de données multi-compétences. Ils affirment que cela réduit la collecte de données et étend la généralisation spatiale au-delà de la zone démontrée. Le modèle prolonge Motion Planning Diffusion (MPD) avec une attention croisée conditionnée par le langage. Un seul réseau génère alors des trajectoires cohérentes pour plusieurs primitives, y compris des comportements sensibles à l'orientation, difficiles à programmer avec un planificateur classique ou un contrôleur codé en dur. Pour les tâches longues, un grand modèle de langage (LLM) découpe la demande d'un opérateur en séquence de compétences exécutables. La validation a eu lieu sur un Franka Emika Panda, un FANUC CRX25ia et en simulation MuJoCo. Selon les auteurs, DROM dépasse les références MPD et Behavior Cloning. Le résumé ne donne aucun chiffre : ni taux de réussite, ni nombre de démonstrations, ni nombre de compétences, ni temps de cycle. Les jeux de données, les environnements de simulation et le code sont publiés sur GitHub. L'intérêt tient d'abord à la combinaison de trois briques déjà connues, DMP, diffusion et LLM, dans une architecture unique et exploitable en atelier. Pour un intégrateur, la promesse est de réduire le coût de programmation et de téléopération à chaque nouvelle variante de tâche. Un opérateur pourrait piloter une cellule en langage naturel, sans écrire de trajectoires. La présence d'un FANUC CRX25ia, cobot industriel de 25 kg de charge, est un signal plus pertinent que le seul Panda, plateforme de laboratoire. Elle indique une volonté de transfert vers du matériel de production. Il faut toutefois rester prudent. Sans métriques publiées, sans précision sur le sim-to-real, sur la robustesse face aux perturbations ni sur la latence d'inférence de la diffusion, le gain sur les références reste invérifiable à ce stade. L'écart entre une démonstration de laboratoire et une cadence industrielle n'est pas comblé. Ce travail s'inscrit dans une course où dominent les modèles vision-langage-action (VLA) entraînés sur de grands volumes de données, comme Pi-0, GR00T ou Helix. DROM prend le parti inverse : un pipeline modulaire et frugal en données, où le LLM planifie et la diffusion exécute, avec des trajectoires plus interprétables. Ce compromis intéressera les cellules à faible volume et à forte variété. La suite dépendra de la reproduction par des tiers, grâce au dépôt ouvert, et d'essais sur des tâches réelles plus contraintes que celles d'un banc de test académique. Aucun pilote industriel ni calendrier n'est annoncé.

RecherchePaper
1 source
Récupération hiérarchique de compétences pour l'adaptation efficiente des modèles vision-langage-action
2arXiv cs.RO 

Récupération hiérarchique de compétences pour l'adaptation efficiente des modèles vision-langage-action

Des chercheurs présentent Hierarchical Skill Retrieval (HSR), un framework de récupération de démonstrations pour adapter plus efficacement les modèles Vision-Language-Action (VLA) à de nouvelles tâches de manipulation robotique avec peu de données spécifiques. Plutôt que de chercher des correspondances de tâches complètes, rares dans les jeux de données existants, HSR décompose une tâche cible en séquences de compétences candidates, évalue chaque plan selon sa plausibilité sémantique et la fiabilité des compétences estimée à partir du jeu de données préalable, puis combine récupération de langage au niveau sous-tâche et reclassement par caractéristiques comportementales pour sélectionner des démonstrations pertinentes et compatibles. La politique est ensuite adaptée via un pipeline en deux étapes séparant acquisition générale de compétences et finetuning spécifique à la tâche. Sur le benchmark LIBERO et sur plusieurs tâches de manipulation en conditions réelles, HSR améliore le taux de succès moyen de 10,3% et 21,3% respectivement par rapport à la meilleure méthode de référence. Vidéos et code sont disponibles sur le site du projet. Ce travail s'attaque à un problème très concret pour l'industrie robotique : les modèles VLA préentraînés sur de vastes jeux de données de démonstrations perdent en performance dès qu'on les confronte à des tâches nouvelles avec peu d'exemples, un frein majeur au déploiement rapide chez les intégrateurs. En structurant la récupération autour de compétences réutilisables plutôt que de tâches entières, HSR propose une piste pour réduire le coût de collecte de données lors du transfert vers de nouveaux environnements ou de nouvelles chaînes de production, un enjeu central pour quiconque cherche à industrialiser des bras robotiques ou des humanoïdes au-delà des démonstrations en laboratoire. Le gain plus marqué en conditions réelles (21,3%) qu'en simulation (10,3%) suggère que l'approche hiérarchique compense particulièrement bien le bruit et la variabilité du monde physique, un point souvent négligé par les méthodes de récupération fondées sur la seule similarité visuelle ou l'appariement de langage au niveau tâche. HSR s'inscrit dans la lignée des travaux récents sur l'adaptation efficace des modèles VLA de type Pi-0 ou GR00T, où la question centrale reste de savoir comment tirer parti de grands jeux de données hétérogènes sans réentraînement coûteux pour chaque nouvelle tâche. Les auteurs positionnent leur méthode par rapport aux approches de récupération existantes basées sur la similarité visuelle, les représentations état-action ou l'appariement de langage au niveau tâche, qu'ils jugent insuffisantes face à la structure hiérarchique des tâches de manipulation à long horizon. Le code et les vidéos de démonstration étant publiés en accès libre, la validation par la communauté sur d'autres benchmarks et plateformes robotiques déterminera si ces gains se généralisent au-delà de LIBERO et des tâches réelles testées par les auteurs.

RechercheOpinion
1 source
Ancrage sémantique tenant compte des risques pour une planification robotique fiable basée sur les LLM
3arXiv cs.RO 

Ancrage sémantique tenant compte des risques pour une planification robotique fiable basée sur les LLM

Des chercheurs proposent un cadre de « Risk-Aware Semantic Grounding » (ancrage sémantique sensible au risque) pour fiabiliser les robots de navigation pilotés par un grand modèle de langage (LLM), et publient sur arXiv (2609.37554v1) un banc d'essai associé, TRUST-NAV. Le problème visé est connu : lorsqu'un LLM sert de planificateur de haut niveau, ses sorties deviennent peu fiables si l'instruction est ambiguë, sans support dans l'environnement ou incohérente sur le plan sémantique. L'architecture estime donc, avant toute planification, trois risques distincts : l'ambiguïté, l'hallucination et le conflit sémantique. Selon ce score, le système choisit entre trois issues : exécuter l'instruction, demander une clarification ou la rejeter. TRUST-NAV réunit des tâches de navigation standard et des scénarios d'instructions volontairement piégées. Les résultats rapportés indiquent que les planificateurs LLM classiques performent bien sur les tâches valides, alors que le cadre proposé améliore nettement la détection d'ambiguïté et le rejet des conflits sémantiques. Le résumé ne fournit ni chiffres, ni modèles testés, ni robot réel : il s'agit d'un travail académique évalué sur benchmark, sans déploiement ni produit. L'intérêt tient au déplacement de la métrique. Jusqu'ici, la plupart des travaux sur les planificateurs LLM et les modèles vision-langage-action (VLA) optimisent la génération de plans et se jugent sur le taux de réussite des tâches. Les auteurs soutiennent qu'un robot fiable se mesure aussi à sa capacité à reconnaître qu'il ne doit pas agir. Pour un intégrateur ou un responsable d'exploitation, c'est un critère de sécurité concret : un AMR ou un humanoïde qui exécute avec assurance une consigne ambiguë ou impossible est un risque opérationnel, pas seulement une erreur de performance. L'approche est aussi modulaire, puisque le filtrage précède la planification et pourrait en principe se greffer sur des planificateurs existants. Il faut toutefois rester prudent : l'absence de chiffres publiés, l'évaluation sur un benchmark créé par les mêmes auteurs et l'écart habituel entre simulation et terrain limitent la portée des conclusions, en particulier sur le coût en fausses alertes, c'est-à-dire les refus ou demandes de clarification inutiles qui ralentissent une exploitation. Ce travail s'inscrit dans la vague des LLM employés comme planificateurs de haut niveau en navigation et en manipulation, où les hallucinations et l'ancrage dans l'environnement restent des points faibles reconnus. Les approches concurrentes reposent sur l'estimation d'incertitude, la prédiction conforme pour déclencher des demandes d'aide, ou des couches de vérification et de garde-fous, tandis que les grands modèles fondation robotiques cherchent surtout à augmenter le taux de réussite. La suite dépendra de la disponibilité de TRUST-NAV pour la communauté, de la reproduction des résultats par des tiers et d'un test sur robot physique, étape que la version 1 du préprint ne mentionne pas.

RecherchePaper
1 source
Génération d'arbres de comportement multimodaux : un petit modèle vision-langage pour la planification de tâches robotiques
4arXiv cs.RO 

Génération d'arbres de comportement multimodaux : un petit modèle vision-langage pour la planification de tâches robotiques

Une nouvelle version (v2) d'un article de recherche publié sur arXiv (2603.06084) détaille un pipeline pour entraîner des modèles vision-langage (VLM) compacts à générer des arbres de comportement (Behavior Trees, BT) exécutables et compatibles ROS2 pour la planification de tâches robotiques. Les auteurs ont converti 1 622 épisodes du corpus Open X-Embodiment via un pipeline enseignant multi-étapes, produisant un jeu de données augmenté de 2 433 exemples multimodaux associant images, instructions et BT. Ce jeu de données a servi à affiner, par fine-tuning efficace en paramètres (PEFT), des VLM open source allant de 500 millions à 4 milliards de paramètres. Les BT générés ont été évalués hors ligne sur leur validité syntaxique, puis exécutés sur 15 tâches domestiques dans l'environnement de simulation BEHAVIOR-1K. Le meilleur modèle, Gemma-3 4B, atteint une validité syntaxique parfaite et un taux de réussite de 87%, devançant Claude Opus 4.8 et approchant GPT-5, tout en tournant entièrement en local. Ce résultat nourrit le débat récurrent sur l'écart entre démonstration et réalité dans la planification robotique pilotée par IA: un modèle compact, exécutable sans API propriétaire ni connexion cloud, égale voire dépasse des modèles fermés bien plus massifs sur une tâche concrète. Pour les intégrateurs et décideurs industriels, c'est un signal en faveur d'une planification embarquée, sans latence réseau ni coûts d'inférence récurrents, un critère souvent déterminant pour un déploiement à grande échelle. Les ablations confirment aussi une hypothèse centrale du secteur: l'ancrage visuel est décisif, le taux de réussite passant de 40% en texte seul à 87% avec observations visuelles. L'augmentation de données, elle, fait grimper la validité syntaxique des BT de 65% à 100%, rappelant que la qualité des données d'entraînement prime souvent sur la taille du modèle. Ces travaux prolongent une lignée de recherches utilisant les Behavior Trees, formalisme hiérarchique déjà répandu en robotique industrielle via ROS2, comme cible de génération pour les grands modèles de langage. Jusqu'ici, ces approches restaient soit purement textuelles, soit dépendantes de VLM propriétaires massifs, faute de jeu de données public reliant observations visuelles et BT exécutables, un manque que ce travail cherche explicitement à combler. La comparaison directe avec Claude Opus 4.8 et GPT-5 positionne cette contribution académique comme une tentative de démocratiser la planification VLM face aux modèles propriétaires. Aucun partenariat industriel ni déploiement sur robot physique n'est mentionné: l'évaluation reste cantonnée à la simulation BEHAVIOR-1K, ce qui invite à la prudence avant toute extrapolation vers un usage en environnement réel.

RechercheOpinion
1 source