Aller au contenu principal
Prompting d'équipes de robots en langage naturel
RecherchearXiv cs.RO 

Prompting d'équipes de robots en langage naturel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent un framework permettant de piloter des équipes de robots multiples via des instructions en langage naturel de haut niveau, sans avoir besoin d'appeler un grand modèle de langage au moment du déploiement. La méthode exploite les capacités de raisonnement d'un LLM pour décomposer une tâche collective en sous-tâches, mais uniquement en amont : cette logique est ensuite distillée dans un réseau de neurones récurrent (RNN) minuscule, capable d'encoder un automate fini déterministe (DFA) représentant la séquence et les conditions de la tâche. Pour l'exécution décentralisée, chaque robot s'appuie sur un réseau de neurones sur graphe (GNN) conditionné par les états cachés du RNN et par les embeddings du langage, ce qui permet une prise de décision locale en temps réel sans communication centralisée. Le travail, publié sur arXiv (2509.24575v2, version révisée), a été évalué en simulation et sur des tâches multi-robots réelles nécessitant un comportement séquentiel et collaboratif, avec une démonstration disponible sur le site du projet (sites.google.com/view/prompting-teams).

L'intérêt principal est de contourner un problème concret pour l'industrie robotique : les grands modèles de langage interprètent bien des consignes ambiguës, mais leur latence, leur coût de calcul et leur dépendance réseau les rendent inadaptés à l'embarqué temps réel sur des flottes de robots opérant en entrepôt, sur chantier ou en zone sans connectivité fiable. En distillant le raisonnement du LLM dans un modèle RNN léger exécutable à bord, les auteurs proposent de combiner compréhension du langage naturel et contrôle décentralisé robuste, sans le point de défaillance unique d'une architecture centralisée ni la fragilité d'un pipeline interrogeant un LLM à chaque étape. Pour les intégrateurs de flottes multi-robots, cela teste une hypothèse encore peu validée dans le secteur : transférer la sémantique d'un LLM vers un contrôle embarqué temps réel sans perte de robustesse, moyennant un travail d'ingénierie de distillation propre à chaque tâche.

Ce travail s'inscrit dans une recherche en robotique multi-agents visant à exploiter les LLM pour la planification de haut niveau tout en conservant un contrôle bas niveau classique et vérifiable, une tension déjà abordée par des approches combinant LLM et machines à états ou logique temporelle. Contrairement aux architectures interrogeant un modèle de fondation à chaque décision, cette proposition mise sur une distillation en amont, proche des méthodes de compression de politiques utilisées pour déployer des agents de renforcement complexes sur du matériel contraint. Publié en tant que "replace" sur arXiv, l'article laisse ouvertes les questions de généralisation à des vocabulaires de tâches plus larges et de passage à l'échelle au-delà des équipes testées en laboratoire, étapes nécessaires avant toute adoption industrielle.

Dans nos dossiers

À lire aussi

Robots relationnels : des graphes de scène pour comprendre les commandes en langage naturel
1arXiv cs.RO 

Robots relationnels : des graphes de scène pour comprendre les commandes en langage naturel

Des chercheurs proposent une méthode pour améliorer la capacité des robots à comprendre des commandes en langage naturel en enrichissant les graphes de scène 3D (3D scene graphs, 3DSG) de relations spatiales explicites entre objets. L'étude, publiée sur arXiv (2602.04635v2), combine deux pipelines construits à partir de modèles existants : un pipeline basé sur un grand modèle de langage (LLM) pour identifier l'objet cible à partir d'une commande en vocabulaire ouvert, et un pipeline basé sur un modèle vision-langage (VLM) qui ajoute des relations spatiales en vocabulaire ouvert au graphe de scène à partir d'images capturées pendant la cartographie du lieu. Les auteurs ont testé deux LLM sur 14 scènes différentes, avec 905 énoncés en langage naturel (786 générés de façon procédurale, 119 rédigés par des humains), pour évaluer la tâche d'ancrage de l'objet cible (target object grounding). Le résultat principal est que l'ajout de relations spatiales explicites améliore mesurablement la capacité des LLM à identifier le bon objet dans l'environnement, comblant un manque fréquent des 3DSG existants qui omettent ces relations alors que les humains s'appuient dessus pour décrire leur environnement. Pour les concepteurs de robots domestiques, d'entrepôt ou d'assistance, cela touche directement au goulot d'étranglement entre compréhension du langage et action physique concrète, un enjeu central pour les modèles vision-langage-action (VLA) et l'interaction homme-robot en conditions réelles plutôt qu'en démonstration contrôlée. L'étude montre aussi que générer ces relations spatiales en vocabulaire ouvert via un VLM est faisable directement depuis les images capturées par le robot, sans supervision manuelle. Ce travail s'inscrit dans la lignée des recherches sur les graphes de scène sémantiques pour la robotique cognitive, où la représentation de l'environnement sert de pont entre perception et planification d'actions. Les auteurs notent toutefois que leur analyse ne permet pas de trancher entre relations en vocabulaire ouvert ou fermé, une question qui reste ouverte pour les travaux futurs. Il s'agit d'une contribution académique à un stade de recherche, sans déploiement produit ni partenaire industriel annoncé.

RecherchePaper
1 source
Robots d'assistance personnalisés par LLM : apprentissage des préférences en langage naturel pour personnes paralysées
2arXiv cs.RO 

Robots d'assistance personnalisés par LLM : apprentissage des préférences en langage naturel pour personnes paralysées

Une équipe de chercheurs a publié sur arXiv (réf. 2604.01463) un cadre d'apprentissage des préférences conçu pour personnaliser les robots d'assistance physique à partir de retours en langage naturel, sans imposer de charge cognitive aux utilisateurs atteints de paralysie. Le système, entièrement hors ligne, traduit des commentaires vocaux non structurés en politiques de contrôle robotique déterministes. La validation a été menée avec 10 adultes tétraplégiques dans une étude simulée de préparation de repas. Le pipeline s'appuie sur des grands modèles de langage (LLM) ancrés dans l'Occupational Therapy Practice Framework (OTPF), référentiel clinique standard de l'ergothérapie américaine, pour déchiffrer les réactions subjectives des utilisateurs en besoins physiques et psychologiques explicites, puis les convertir en arbres de décision lisibles. Une étape de vérification automatisée, dite "LLM-as-a-Judge", contrôle la sûreté structurelle du code généré avant tout déploiement. L'enjeu est direct pour les intégrateurs de robotique d'assistance : les méthodes classiques d'apprentissage des préférences, notamment les comparaisons par paires exhaustives issues du paradigme RLHF, sont pratiquement inapplicables à des utilisateurs présentant des déficiences motrices sévères, tant la fatigue physique et cognitive est élevée. Ce travail propose une alternative qui réduit significativement la charge utilisateur selon les mesures rapportées, et dont les politiques générées ont été jugées sûres et fidèles aux préférences des patients par des ergothérapeutes certifiés. L'ancrage dans un cadre clinique structuré, plutôt qu'une simple inférence LLM libre, est le point différenciant : il impose une traçabilité entre le discours du patient et les paramètres de contrôle robot. Les arbres de décision produits restent interprétables, ce qui facilite la validation réglementaire. Le cadre s'inscrit dans une littérature croissante sur la personnalisation des robots d'assistance, domaine où Physical Intelligence (pi.ai) ou des acteurs académiques comme Stanford et Carnegie Mellon explorent les politiques VLA généralisables. Ici, l'approche est délibérément ciblée et offline, ce qui la distingue des pipelines end-to-end en ligne. La taille de l'étude reste limitée (10 participants, environnement simulé), et aucune timeline de déploiement clinique réel n'est annoncée, ce qui maintient ce travail au stade de la preuve de concept prometteuse plutôt que d'un produit shipped. La prochaine étape naturelle serait une validation en environnement réel avec un robot physique instrumenté.

RecherchePaper
1 source
QuASH : interroger des cartes robotiques vision-langage grâce à des heuristiques en langage naturel
3arXiv cs.RO 

QuASH : interroger des cartes robotiques vision-langage grâce à des heuristiques en langage naturel

Le papier QuASH (arXiv:2510.14546, version 2, publié en remplacement d'une version antérieure) s'attaque à un problème central de la cartographie robotique par embeddings visuo-langagiers : une fois qu'un modèle de type CLIP encode la scène en vecteurs sémantiques, comment déterminer précisément quelles zones de l'environnement correspondent réellement à une requête textuelle libre ("trouve la porte rouge", par exemple) plutôt que de se contenter d'un simple score de similarité cosinus. Les auteurs proposent d'exploiter les synonymes et antonymes du terme recherché dans l'espace d'embedding, via des heuristiques, pour estimer la zone linguistique pertinente autour de la requête. Cette estimation sert ensuite à entraîner un classifieur léger qui partitionne l'environnement entre correspondances et non-correspondances, au lieu de s'appuyer sur un seuil de similarité brut. La méthode a été testée à la fois sur des cartes robotiques et sur des benchmarks d'images standards, avec des gains mesurés en "queryability" (capacité à retrouver correctement les objets ou zones demandés). L'intérêt pratique dépasse la seule démonstration académique : la plupart des systèmes de cartographie sémantique open-vocabulary (VLMaps, CLIP-Fields, NLMap et équivalents) souffrent aujourd'hui d'un écart entre la richesse du vocabulaire qu'ils prétendent gérer et la fiabilité réelle des requêtes en conditions variées. En proposant une couche de classification entraînable, agnostique au type d'encodeur et à la représentation de carte utilisée, QuASH offre un correctif générique et peu coûteux en données d'entraînement, potentiellement intégrable a posteriori sur des pipelines existants sans réentraîner le modèle visuo-langagier de base. Pour les équipes qui développent des systèmes de navigation ou de manipulation guidés par le langage naturel, c'est un signal que le goulot d'étranglement se déplace de la génération d'embeddings vers l'interprétation fine des requêtes. Le travail s'inscrit dans la lignée des recherches sur les cartes sémantiques ouvertes issues des progrès des VLM depuis 2022-2023, où l'enjeu est passé de la simple détection d'objets étiquetés à une compréhension de scène en vocabulaire libre. Aucune plateforme robotique ni déploiement industriel spécifique n'est mentionné dans cette publication, qui reste à ce stade une contribution méthodologique validée sur benchmarks plutôt qu'un système déployé sur le terrain.

RecherchePaper
1 source
SR-Platform : un pipeline à base d'agents pour la synthèse d'environnements de simulation robotique en langage naturel
4arXiv cs.RO 

SR-Platform : un pipeline à base d'agents pour la synthèse d'environnements de simulation robotique en langage naturel

SR-Platform est un pipeline agentique, publié en preprint arXiv (2605.14700) en mai 2026, qui convertit des descriptions en langage naturel en environnements de simulation MuJoCo exécutables et physiquement valides. Le système décompose la génération de scènes en quatre étapes : un orchestrateur LLM qui structure l'intention utilisateur en plan de scène ; un "asset forge" qui récupère des géométries en cache ou en génère de nouvelles via synthèse LLM-CadQuery ; un "layout architect" qui assigne les poses des objets et vérifie les contraintes spatiales ; et une couche bridge qui assemble le fichier MJCF final en intégrant le modèle de robot cible. Déployé comme stack Docker à neuf services (MinIO pour les meshes, Qdrant pour la récupération sémantique d'assets, Redis pour l'état des jobs, InfluxDB pour la télémétrie), SR-Platform affiche une latence médiane d'environ 50 secondes pour des scènes à cinq objets, tombant à 30-40 secondes avec cache d'assets actif, sur une base de 611 appels LLM réussis en 30 jours de production. Le taux de retry de l'asset forge atteint 11,3 %, avec récupération automatique. Construire manuellement une scène MuJoCo prête à l'entraînement exige une expertise croisée en modélisation 3D, spécification MJCF, gestion des collisions et intégration robot, un processus qui représente typiquement plusieurs heures par scène. Ramener cette étape à moins d'une minute via une invite en langage naturel est un levier direct pour produire des environnements d'entraînement plus variés, facteur clé de la généralisation sim-to-real des politiques robotiques. Pour les équipes de robot learning, cette friction de configuration est réelle et souvent sous-estimée dans les pipelines de données synthétiques. Les métriques publiées portent cependant sur des scènes limitées à cinq objets dans un cadre contrôlé, et la robustesse du pipeline sur des configurations plus complexes ou des descriptions ambiguës reste à démontrer. La génération automatisée d'environnements de simulation est un goulot d'étranglement reconnu dans les pipelines de robot learning, que ce soit pour le reinforcement learning, l'imitation learning ou l'entraînement de modèles vision-langage-action (VLA). MuJoCo, maintenu par DeepMind, est le moteur physique de référence pour ces travaux. NVIDIA Isaac Lab et le framework open-source Genesis couvrent également cet espace ; Physical Intelligence (pi.ai) mise de son côté sur des pipelines d'entraînement à très large échelle. SR-Platform se positionne en amont, sur la génération de scènes plutôt que de politiques, avec un accent sur l'accessibilité via le langage naturel. Son code source n'est pas publié en open-source et le contexte précis du déploiement qualifié de "production" n'est pas explicité dans le preprint.

RecherchePaper
1 source