Skill-SLM : des petits modèles de langage pilotés par des compétences d'agent pour une opération robotique fiable
Des chercheurs proposent Skill-SLM, un cadre qui confie à de petits modèles de langage (SLM) embarqués sur le robot la tâche de décomposer une instruction en langage naturel en sous-tâches, de choisir les compétences adaptées dans une bibliothèque, puis de les orchestrer en opérations exécutables. Le travail, publié sur arXiv (2610.10812v1), repose sur trois briques. Une grammaire non contextuelle (CFG) tenant compte des compétences opérationnelles du robot sert à extraire celles qui sont nécessaires et à construire la bibliothèque. Des LLM « enseignants » induisent et synthétisent ensuite les jeux de données d'entraînement des SLM. Enfin, une stratégie d'orchestration progressive vise à fiabiliser l'exécution de chaque compétence et l'opération dans son ensemble. Les tests portent sur des tâches de drones (UAV), puis sur des véhicules terrestres. Le résumé ne donne ni taille de modèle, ni nombre de tâches, ni taux de réussite chiffrés.
L'enjeu est de s'attaquer à un point faible des approches actuelles de SLM embarqués, surtout fondées sur la distillation. Elles supposent d'énumérer des paires tâche-solution représentatives, ce qui rend la construction des jeux de données coûteuse et généralise mal, car le nombre de formes de tâches possibles croît très vite. Raisonner en compétences réutilisables plutôt qu'en exemples de tâches complètes déplace le problème vers la composition. Selon les auteurs, cela améliore nettement les résultats face aux références par distillation, surtout sur des tâches inédites. Pour un intégrateur, l'intérêt est de pouvoir faire tourner un modèle léger directement sur la machine, sans dépendre d'un LLM distant, avec un comportement plus prévisible. Il faut toutefois rester prudent. Il s'agit d'une préimpression sans relecture par les pairs. Les gains annoncés sont relatifs à des baselines choisies par les auteurs, et l'essai sur véhicule terrestre sert surtout à illustrer la portabilité, non à prouver un passage à l'échelle. Rien n'indique de test sur robot réel en conditions industrielles, ni de mesure de latence ou de consommation sur matériel embarqué.
Cette approche s'inscrit dans le mouvement qui rapproche les modèles de langage de la robotique, avec des planificateurs à base de compétences (dans la lignée de SayCan) et la génération de code par LLM. Elle se démarque des modèles vision-langage-action de bout en bout, qui apprennent directement des actions à partir de démonstrations. Ici, la couche de compétences reste explicite et vérifiable, ce qui peut faciliter l'audit. La limite probable est que la qualité du système dépend de la couverture de la bibliothèque et de la grammaire, et donc d'une ingénierie initiale propre à chaque plateforme. Les prochaines étapes naturelles seraient des validations sur matériel réel, des comparaisons directes avec des politiques VLA et des mesures sur calculateurs embarqués. Le code et les jeux de données ne sont pas mentionnés dans le résumé.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




