Aller au contenu principal
RecherchearXiv cs.RO 

Résoudre activement l'incertitude contextuelle dans les tâches sous-spécifiées en langage naturel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent CLUE (Closed-Loop contextual Uncertainty rEsolution), un framework permettant à un robot d'exécuter des tâches formulées en langage naturel de façon incomplète, sans carte préalable de l'environnement. Le système combine une politique dérivée d'un grand modèle de langage, qui formule des hypothèses sur les concepts pertinents et les plans d'action possibles, avec une carte enrichie sémantiquement construite en temps réel pendant que le robot se déplace. Les hypothèses sont testées séquentiellement via une interaction en boucle fermée avec l'environnement, le robot affinant son plan à mesure qu'il collecte de nouvelles informations. L'équipe a déployé CLUE sur un robot quadrupède Spot de Boston Dynamics, dans trois environnements réels, intérieurs et extérieurs, couvrant 15 tâches exigeant de désambiguïser des objets, d'inférer leur fonction ou de raisonner sur des occlusions visuelles. Le système atteint un taux de réussite à seulement 7 points de pourcentage d'une politique oracle (référence quasi parfaite) et surpasse d'un facteur 4 un planificateur basé sur un LLM sans boucle de rétroaction.

Ce travail s'attaque à une limite concrète des politiques robotiques actuelles pilotées par le langage, qui présupposent généralement des consignes bien définies et une carte de l'environnement fournie à l'avance, une hypothèse rarement vraie hors laboratoire. Pour les intégrateurs et les décideurs qui envisagent des robots autonomes en environnement non cartographié, la démonstration importante n'est pas seulement la performance de CLUE, mais la contre-preuve qu'il apporte : construire puis interroger passivement une carte enrichie par le langage ne suffit pas, cette approche alternative n'atteint qu'un tiers du taux de réussite de CLUE tout en consommant plus de dix fois plus de tokens de modèle vision-langage. Cela nuance l'idée selon laquelle empiler des cartes sémantiques et de gros modèles suffirait à résoudre l'ambiguïté contextuelle: l'interaction active et itérative avec l'environnement reste nécessaire.

Le papier, publié sur arXiv (identifiant 2609.30428), s'inscrit dans la lignée des travaux combinant modèles de fondation et navigation robotique par cartes sémantiques construites en ligne, un domaine où les politiques conditionnées par le langage progressent rapidement mais restent souvent testées dans des conditions arrangées. En comparant explicitement CLUE à une politique oracle et à un planificateur LLM classique, les auteurs situent leur contribution comme une réponse au fossé entre démonstrations et déploiement réel plutôt que comme un produit commercial. Le code et des ressources supplémentaires sont partagés via une page de projet dédiée, mais aucune indication n'est donnée sur un déploiement industriel ou un calendrier de commercialisation, l'travail restant à ce stade une preuve de concept académique.

À lire aussi

Coordination multirobot pour la planification sous incertitude contextuelle
1arXiv cs.RO 

Coordination multirobot pour la planification sous incertitude contextuelle

Un article de recherche publié sur arXiv (2603.13748v3, version révisée) s'attaque à un problème central pour les flottes de robots mobiles : comment agir efficacement quand la priorité des objectifs dépend d'un contexte opérationnel inconnu au départ. Les auteurs formalisent ce problème sous le nom de MR-CUSSP (Multi-Robot Context-Uncertain Stochastic Shortest Path), un cadre qui modélise la collecte d'informations contextuelles via des observations conjointes prises à des états repères ("landmark states"). Leur solution se décompose en deux étages : CIMOP (Coordinated Inference for Multi-Objective Planning), qui calcule des plans guidant les robots vers ces points informatifs pour inférer rapidement le contexte réel, puis LCBS (Lexicographic Conflict-Based Search), un planificateur multi-robot sans collision qui hiérarchise les objectifs selon l'ordre de préférence induit par ce contexte. L'équipe valide son approche sur trois domaines simulés, puis sur un déploiement physique impliquant cinq robots mobiles dans un scénario appelé "salp domain". L'enjeu pratique est réel pour tout opérateur de flottes robotiques évoluant dans des environnements où les règles du jeu changent selon la situation : un robot logistique en entrepôt, un AMR en usine ou un essaim d'exploration peut avoir des priorités radicalement différentes selon un contexte non observable directement (urgence, présence humaine, type de charge). Agir sur la base d'une hypothèse de contexte erronée peut produire un comportement mal aligné, voire dangereux. Ce travail illustre une tendance de fond en planification multi-robot : coupler explicitement l'inférence active (où aller pour lever l'incertitude) et l'optimisation lexicographique des tâches, plutôt que de traiter ces deux problèmes séparément. C'est un signal utile pour les équipes de recherche en coordination multi-agents, même si la validation physique reste limitée à cinq unités et un scénario contrôlé, loin d'un déploiement industriel à grande échelle. Ce travail s'inscrit dans la lignée des recherches sur la planification de chemins multi-robot sous contrainte (le "Conflict-Based Search" est une famille d'algorithmes bien établie dans ce domaine) et sur la prise de décision séquentielle dans l'incertitude (les Stochastic Shortest Path problems). La contribution spécifique ici est l'ajout d'une dimension de préférences lexicographiques dépendantes du contexte, une brique qui pourrait intéresser des acteurs académiques et industriels travaillant sur des flottes hétérogènes en environnement partiellement observable. Le fait qu'il s'agisse d'une version "replace" sur arXiv suggère un article déjà en révision, potentiellement en vue d'une soumission à une conférence de robotique majeure, sans qu'aucune date de publication définitive ne soit précisée.

RecherchePaper
1 source
Correction d'actions sans réentraînement pour les échecs des modèles VLA, via retour en langage naturel
2arXiv cs.RO 

Correction d'actions sans réentraînement pour les échecs des modèles VLA, via retour en langage naturel

Des chercheurs ont publié fin août 2026 sur arXiv (2608.29967) CorrectVLA, une méthode qui corrige les échecs des modèles Vision-Language-Action (VLA) sans réentraînement. Le principe : un humain formule une seule consigne de correction en langage naturel, traduite en ajustements additifs de l'amplitude des actions et appliquée uniformément à tous les essais suivants, sans toucher aux poids de la politique. En simulation sur le benchmark LIBERO-90, CorrectVLA récupère des échecs de désalignement d'exécution aussi bien sur des tâches connues que sur des tâches inédites (out-of-distribution). Sur un bras robotique réel UFactory xArm7 soumis à un changement d'environnement, la méthode restaure un taux de réussite quasi parfait là où la politique de base échoue presque totalement, et généralise à de nouvelles positions et identités d'objets. Ce travail s'attaque à l'un des points faibles connus des VLA en déploiement : l'écart entre démonstrations impressionnantes et robustesse réelle sur le terrain. Pour les intégrateurs et décideurs industriels, l'intérêt est opérationnel : plutôt que de réentraîner un modèle coûteux à chaque échec observé, une simple instruction textuelle suffirait à corriger certains comportements erronés sur une flotte déjà déployée. Mais l'apport le plus utile est la taxonomie des échecs établie sur LIBERO-90 : seuls les échecs de désalignement d'exécution, où le robot vise la bonne cible mais mal calibre l'amplitude de son geste, sont corrigibles par ce biais. Quand la compréhension sémantique de la tâche elle-même fait défaut, la méthode échoue, ce qui fixe une limite opérationnelle claire et tempère l'idée que le feedback en langage suffirait à résoudre tous les problèmes de généralisation des VLA. Ce résultat s'inscrit dans la course aux modèles VLA généralistes (Pi-0, GR00T N2, Helix) de plus en plus déployés sur bras industriels et humanoïdes, où la question du contrôle post-déploiement face aux échecs en conditions réelles reste ouverte. Contrairement à un réentraînement complet ou à du fine-tuning, CorrectVLA se positionne comme une méthode d'intervention à l'inférence, complémentaire aux approches existantes de correction de politique. Les auteurs présentent ce travail comme une première délimitation empirique des cas où la correction sans réentraînement fonctionne, la piste des échecs de compréhension sémantique restant un chantier ouvert.

RecherchePaper
1 source
Traduction du langage temporel linéaire par raisonnement auto-contraint inspiré de l'humain pour la spécification de tâches robotiques
3arXiv cs.RO 

Traduction du langage temporel linéaire par raisonnement auto-contraint inspiré de l'humain pour la spécification de tâches robotiques

Une équipe de recherche présente Self-Constrained Reasoning (SCR), un framework destiné à traduire des instructions en langage naturel vers la Logique Temporelle Linéaire (LTL), le formalisme utilisé pour spécifier de manière vérifiable les sous-objectifs, contraintes et séquencements temporels des tâches robotiques. L'article, publié sur arXiv sous la référence 2608.28435v1, décrit une architecture qui combine une représentation structurelle des contraintes avec une formulation de décision hiérarchique, permettant au modèle d'intégrer les règles du domaine directement dans son processus de raisonnement plutôt que de les appliquer après coup comme un filtre externe. Les auteurs rapportent, via des expériences, une amélioration simultanée du respect des contraintes du domaine et de la capacité de généralisation à des instructions inédites, sans préciser dans le résumé les jeux de données, les taux de réussite chiffrés ni les architectures de modèles de langage utilisées comme base. Pour les intégrateurs et concepteurs de systèmes robotiques, ce travail cible un problème concret : les opérateurs humains formulent des tâches en langage ambigu et sous-spécifié, alors que l'exécution sûre et vérifiable exige des spécifications formelles précises. Les traducteurs existants basés sur des grands modèles de langage souffrent d'un compromis connu, un raisonnement ouvert peut enfreindre les contraintes du domaine, tandis qu'un filtrage strict après génération peut casser la capacité du modèle à traiter des instructions nouvelles. SCR se positionne comme une réponse à ce dilemme précis, ce qui, si les résultats se confirment à plus grande échelle, intéresserait directement les architectes de piles logicielles robotiques cherchant à garantir formellement le comportement d'un robot tout en conservant la flexibilité du langage naturel en entrée. Ce travail s'inscrit dans un courant de recherche plus large sur l'usage des LLM comme interface entre commande humaine et exécution robotique vérifiable, un axe distinct des approches VLA (Vision-Language-Action) de bout en bout comme Pi-0 ou GR00T N2, puisqu'il vise la génération de spécifications formelles plutôt que le contrôle moteur direct. L'abstract ne mentionne ni laboratoire, ni affiliation institutionnelle, ni plateforme robotique de validation, ni calendrier de publication du code ou de suites expérimentales, ce qui limite à ce stade la portée de l'annonce à une contribution méthodologique publiée en prépublication, sans déploiement ni pilote industriel associé.

RecherchePaper
1 source
À qui est cet objet ? Inférence contextuelle de propriété par questionnement sous incertitude
4arXiv cs.RO 

À qui est cet objet ? Inférence contextuelle de propriété par questionnement sous incertitude

Des chercheurs ont publié sur arXiv (arXiv:2605.28087) un framework appelé COIN, Context-Aware Object Ownership Inference with Uncertainty-Guided Questioning, conçu pour permettre aux robots de service d'inférer à qui appartient un objet. L'objectif est de résoudre des instructions courantes comme "apporte-moi ma tasse", qui supposent que le robot sache distinguer les objets selon leur propriétaire. Le système combine un grand modèle de langage (LLM) pour estimer des scores de propriété à partir de l'historique d'utilisation des objets et des profils des utilisateurs présents, avec une couche de prédiction conforme (conformal prediction) qui construit un ensemble de propriétaires plausibles. Quand l'incertitude dépasse un seuil, le robot génère activement des questions pour lever l'ambiguïté. Les expériences, menées en environnement domestique simulé, rapportent un Subset Accuracy de 0,988 et un Mean Jaccard Index de 0,991, y compris dans des scénarios de partage temporaire ou de copropriété. Ce travail s'attaque à un problème structurel de la robotique de service : la propriété d'un objet est un attribut latent, non observable directement, et les approches existantes reposent typiquement sur le seul critère de l'utilisation récente, ce qui les rend fragiles dès qu'un objet change de main temporairement. L'intégration d'un LLM pour le raisonnement contextuel, combinée à une gestion explicite de l'incertitude via la prédiction conforme, représente une architecture plus robuste pour des déploiements réels. Pour un intégrateur travaillant sur des robots d'assistance à domicile ou en Ehpad, c'est un signal que les systèmes de compréhension sémantique des instructions deviennent suffisamment fiables pour envisager des scénarios multi-utilisateurs. À noter que les résultats sont obtenus en simulation uniquement, et qu'aucune validation sur robot physique n'est mentionnée dans l'article. Ce gap sim-to-real reste la principale inconnue. La robotique de service domestique connaît une accélération des travaux en HRI (Human-Robot Interaction), avec des acteurs comme 1X, Apptronik, ou encore le français Enchanted Tools sur le segment des robots conversationnels. Le projet dispose d'une page dédiée, ce qui suggère une poursuite des travaux, mais aucune timeline de déploiement ni partenariat industriel n'est annoncé à ce stade.

UEEnchanted Tools est cité comme exemple d'acteur français dans le segment des robots conversationnels, mais ce travail de recherche n'implique pas directement d'entités françaises ou européennes.

RecherchePaper
1 source