Aller au contenu principal
RecherchearXiv cs.RO 

Structured LLM Reasoning for Zero-Shot Human-Robot Coordination Under Hidden Goals

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent une architecture structurée à base de grands modèles de langage (LLM) pour la coordination homme-robot en zero-shot, c'est-à-dire sans apprentissage préalable spécifique à la tâche, quand chaque partenaire ne dispose que d'une vue privée de l'objectif commun. Formalisée comme un Dec-POMDP (processus de décision markovien partiellement observable et décentralisé), l'architecture décompose la prise de décision en cinq étapes : inférence de théorie de l'esprit conditionnée à l'action, planification hiérarchique, interprétation de la conversation, vérification des actions, et replanification à partir des retours. Testée sur une tâche de construction coopérative où robot et humain ne voient chacun qu'une partie de l'objectif final, la méthode est comparée à deux références : une version sans le module de théorie de l'esprit, et une politique d'apprentissage par renforcement multi-agent entraînée hors ligne sur de nombreuses paires d'objectifs. Lors d'expériences avec des participants humains, la méthode complète a nécessité moins d'étapes d'interaction et obtenu de meilleures notes de confiance post-interaction que les deux références.

Ces résultats intéressent directement la recherche en interaction homme-robot : ils suggèrent qu'un LLM peut servir de substitut praticable à des calculs d'inférence et de planification autrement intraitables, tout en conservant une couche de vérification classique pour garantir la faisabilité physique des actions. Le gain ne vient pas d'un modèle bout-en-bout mais d'une décomposition explicite du problème de décision d'équipe, où le LLM traite seulement les sous-tâches de raisonnement social et de langage. Pour les équipes travaillant sur des robots collaboratifs ou des tâches à information partagée incomplète, cela plaide pour des architectures modulaires plutôt que des politiques entraînées de bout en bout, coûteuses à généraliser à de nouveaux objectifs.

Le travail s'inscrit dans la recherche sur la théorie de l'esprit computationnelle et la coordination multi-agents, un champ où les politiques de renforcement multi-agent peinent traditionnellement à généraliser en zero-shot à des objectifs ou partenaires inédits. En ancrant leur architecture dans le cadre théorique du Dec-POMDP, les auteurs la rattachent à des décennies de recherche en planification sous incertitude partagée. L'article ne mentionne aucun calendrier de déploiement industriel : il s'agit d'une preuve de concept en laboratoire, qui ouvre la voie à des tests sur des tâches physiques plus complexes et des équipes homme-robot élargies.

À lire aussi

Identification et exploitation de la structure dans la co-conception de robots
1arXiv cs.RO 

Identification et exploitation de la structure dans la co-conception de robots

Une équipe de recherche publie une nouvelle analyse du co-design robotique, c'est-à-dire l'optimisation conjointe de la morphologie d'un robot et de son système de contrôle, un problème de recherche en haute dimension particulièrement coûteux à résoudre. Les auteurs ont étudié les paysages de co-design de quatre tâches, deux de locomotion en robotique souple et deux de manipulation, et ont identifié trois régularités communes à ces espaces de recherche. D'abord, au sein d'une même région, la qualité des solutions varie principalement le long d'une variété de faible dimension, avec très peu de variation dans les directions orthogonales, ce qui réduit de fait la dimensionnalité effective à explorer. Ensuite, dans les régions de meilleure qualité, cette variance se répartit sur davantage de dimensions, ce qui oblige la recherche à élargir progressivement son périmètre à mesure que la qualité progresse. Enfin, dans ces mêmes régions de haute qualité, les variations dépendent de dimensions conjointes morphologie-contrôle, imposant une exploration couplée des deux paramètres plutôt que séparée. À partir de ces observations, les chercheurs ont conçu un algorithme de co-design qui exploite explicitement cette structure. Les résultats mesurés sont significatifs pour le secteur : l'algorithme proposé produit des co-designs 36 % meilleurs que ceux des méthodes de référence actuelles, et ces méthodes concurrentes nécessitent environ dix fois plus d'évaluations de fonction pour atteindre une qualité comparable. Pour les équipes qui conçoivent des robots souples ou des systèmes de manipulation, cela représente un gain direct en coût de calcul et en temps d'itération, un facteur souvent limitant quand chaque évaluation implique une simulation physique coûteuse. Le travail apporte surtout une preuve que la performance des algorithmes de co-design ne tient pas qu'à la puissance de calcul brute, mais à la capacité à repérer et exploiter la géométrie sous-jacente du problème, un point utile face à l'hypothèse répandue que plus d'évaluations suffit à compenser une recherche non structurée. Le co-design morphologie-contrôle reste un domaine de recherche actif, car les approches historiques traitent souvent la forme du robot et sa commande comme deux problèmes séparés, optimisés en alternance ou séquentiellement, ce qui ignore leurs interactions. Les auteurs situent leur contribution par rapport aux algorithmes de recherche évolutionnaire et bayésienne existants, qu'ils utilisent comme lignes de base, et valident leur approche par une étude d'ablation qui isole l'apport de chacun des trois principes identifiés. La publication, une version révisée déposée sur arXiv, ouvre la voie à des méthodes de co-design applicables à des plateformes robotiques réelles, où la réduction du nombre de simulations nécessaires pourrait accélérer sensiblement les cycles de conception.

RecherchePaper
1 source
IndoorR2X : coordination robot-vers-tout en intérieur pilotée par LLM
2arXiv cs.RO 

IndoorR2X : coordination robot-vers-tout en intérieur pilotée par LLM

Un article de recherche arXiv (2603.20182v4) présente IndoorR2X, un benchmark et un framework de simulation pour la planification multi-robots pilotée par des grands modèles de langage (LLM), avec perception et communication de type "Robot-to-Everything" (R2X) en environnement intérieur. Le système combine les observations de robots mobiles avec celles de capteurs IoT statiques déjà présents dans de nombreux bâtiments, comme des caméras, pour construire un état sémantique global de la scène. Cette architecture permet une compréhension de l'environnement à l'échelle du bâtiment, dépassant ce qu'un seul robot ou même une flotte en communication robot-à-robot (R2R) peut percevoir. Le framework propose des environnements de simulation configurables, des dispositions de capteurs, des compositions d'équipes robotiques et des suites de tâches, afin d'évaluer systématiquement différentes stratégies de coordination sémantique via planification LLM. L'enjeu principal que cible IndoorR2X est un problème connu de la robotique multi-agents : la communication R2R seule ne résout pas l'observabilité partielle sans exploration coûteuse ou sans multiplier le nombre de robots déployés. En exploitant des capteurs IoT déjà installés (caméras de bâtiment notamment), l'approche réduit l'exploration redondante et améliore l'efficacité et la fiabilité de la coordination, selon les auteurs. Pour les intégrateurs et opérateurs de flottes AMR en entrepôt ou en environnement industriel, cela ouvre une piste concrète pour réduire les coûts d'infrastructure robotique en réutilisant l'instrumentation IoT existante plutôt que de multiplier les capteurs embarqués. Ce travail s'inscrit dans la vague de recherche récente combinant LLM et planification robotique multi-agents, où la coordination sémantique de haut niveau reste un défi ouvert face aux limites de perception embarquée. Il s'agit ici d'un outil de recherche et de benchmarking, pas d'un système commercial déployé : les auteurs eux-mêmes documentent les modes d'échec observés dans leurs expériences, signe que la coordination LLM-robots-IoT reste à un stade exploratoire. Le projet, dont le code et les détails sont disponibles sur une page dédiée, vise à devenir une référence pour comparer les futures stratégies de coordination sémantique entre robots et capteurs ambiants.

RecherchePaper
1 source
Contact-Driven Localization dans une structure robotique auto-assemblée en forme libre
3arXiv cs.RO 

Contact-Driven Localization dans une structure robotique auto-assemblée en forme libre

Des chercheurs publient sur arXiv (référence 2608.02895, soumission nouvelle début août 2026) une méthode de localisation pour robots modulaires en essaim, conçue pour fonctionner sans aucune infrastructure de suivi externe. Le système s'appuie uniquement sur un signal de contact binaire : chaque module sait s'il est physiquement accosté (docké) ou non à ses voisins. Pour en déduire les positions relatives, les auteurs proposent un cadre de « forces virtuelles » : chaque robot affine itérativement sa pose, attiré vers les voisins connectés et repoussé de ceux qui ne le sont pas. Aucun capteur coûteux ni caméra de motion capture n'est requis, seulement une détection de contact embarquée minimale. La méthode est validée en simulation sur l'assemblage de structures libres, tours et porte-à-faux (cantilevers), avec une localisation jugée précise et stable à mesure que la structure grossit. Dans les systèmes modulaires auto-reconfigurables, la localisation reste un goulot d'étranglement connu : les démonstrations actuelles reposent surtout sur du motion capture en laboratoire ou des capteurs embarqués haut de gamme, difficiles à généraliser à un essaim de dizaines ou centaines d'unités low-cost opérant hors laboratoire. Une méthode purement locale, fondée sur un simple signal « connecté / non connecté », changerait l'équation de coût et de scalabilité en supprimant le besoin d'infrastructure externe, un prérequis pour des usages de terrain comme la construction robotique ou les structures déployables. L'étude reste toutefois cantonnée à la simulation, sans preuve de robustesse face au bruit de capteurs réels ou aux erreurs mécaniques de docking d'un système physique. Le travail s'inscrit dans le champ de la robotique en essaim et des systèmes auto-reconfigurables, où la localisation décentralisée est un obstacle récurrent au passage à l'échelle, des premiers modules type CONRO et M-TRAN aux essaims plus récents comme Kilobot ou TERMES. Les approches concurrentes combinent généralement vision embarquée, mesures de distance inter-robots ou tracking externe, avec des compromis de coût variables. Publiée sans affiliation industrielle ni partenariat mentionné, cette contribution relève pour l'instant de la recherche amont : aucun calendrier de validation sur plateforme physique n'est communiqué à ce stade.

RecherchePaper
1 source
UniLM-Nav : un cadre unifié pour la navigation zero-shot du dernier kilomètre
4arXiv cs.RO 

UniLM-Nav : un cadre unifié pour la navigation zero-shot du dernier kilomètre

Des chercheurs présentent UniLM-Nav, un framework unifie pour la navigation dite du dernier mètre en manipulation mobile, capable de fonctionner en zero-shot sur du vocabulaire ouvert. Le problème vise: un robot peut atteindre les abords d'un objet ou d'un meuble cible sans que sa position finale permette réellement de le manipuler. UniLM-Nav décompose la tache en trois étapes traitées par un seul modèle multimodal de langage (MLLM): sélection de la vue de référence parmi les observations récemment collectées, identification du point d'affordance pertinent pour la tache dans cette vue puis projection dans le repère du robot, et calcul d'une pose de base compatible avec sa géométrie. Sur le benchmark OVMM, la méthode dépasse l'état de l'art précédent, MoTo, de 3,13 points de pourcentage. Les auteurs ont aussi teste le système sur un robot réel, un quadrupède Unitree B2 équipe d'un bras manipulateur Unitree Z1 a 6 degrés de liberté (DoF), validant l'approche au-delà de la simulation. Ce travail s'attaque a un maillon souvent néglige de la manipulation mobile: s'approcher d'une cible ne suffit pas si la pose finale rend la prise instable ou impossible. Les méthodes existantes réglaient ce problème via une annotation manuelle des poses ou un entrainement spécifique a chaque tache, deux approches couteuses qui passent mal a l'échelle en vocabulaire ouvert. En s'appuyant sur un MLLM partage pour résoudre sélection de vue, ancrage d'affordance et raisonnement géométrique, UniLM-Nav illustre une tendance de fond: les grands modèles multimodaux remplacent progressivement des modules géométriques spécialisés construits a la main. Les auteurs notent que le choix du MLLM sous-jacent a un effet substantiel sur la performance, un point a surveiller pour tout intégrateur voulant reproduire l'approche. Le passage de la simulation a un robot physique réduit un peu l'écart persistant entre démonstrations en laboratoire et déploiement réel qui marque encore la recherche en robotique mobile. Le problème du dernier mètre est identifie de longue date dans la littérature sur la manipulation mobile, la plupart des pipelines de navigation s'arrêtant a une proximité grossière de la cible sans garantir une pose exploitable pour le bras. La comparaison avec MoTo, présente comme la référence précédente sur OVMM (Open Vocabulary Mobile Manipulation), situe UniLM-Nav dans une lignée de travaux visant a généraliser la manipulation mobile a des objets et environnements non vus a l'entrainement. Le choix du matériel de validation, un quadrupède associe a un bras a 6 DoF, s'inscrit dans une tendance plus large a coupler locomotion a pattes et manipulation pour des environnements non structures. Publie sur arXiv (2607.06537), l'article ne mentionne aucun calendrier de commercialisation: il s'agit a ce stade d'une contribution de recherche, dont la reproduction sur d'autres plateformes testera sa robustesse au-delà du benchmark.

RecherchePaper
1 source