Résoudre activement l'incertitude contextuelle dans les tâches sous-spécifiées en langage naturel
Des chercheurs présentent CLUE (Closed-Loop contextual Uncertainty rEsolution), un framework permettant à un robot d'exécuter des tâches formulées en langage naturel de façon incomplète, sans carte préalable de l'environnement. Le système combine une politique dérivée d'un grand modèle de langage, qui formule des hypothèses sur les concepts pertinents et les plans d'action possibles, avec une carte enrichie sémantiquement construite en temps réel pendant que le robot se déplace. Les hypothèses sont testées séquentiellement via une interaction en boucle fermée avec l'environnement, le robot affinant son plan à mesure qu'il collecte de nouvelles informations. L'équipe a déployé CLUE sur un robot quadrupède Spot de Boston Dynamics, dans trois environnements réels, intérieurs et extérieurs, couvrant 15 tâches exigeant de désambiguïser des objets, d'inférer leur fonction ou de raisonner sur des occlusions visuelles. Le système atteint un taux de réussite à seulement 7 points de pourcentage d'une politique oracle (référence quasi parfaite) et surpasse d'un facteur 4 un planificateur basé sur un LLM sans boucle de rétroaction.
Ce travail s'attaque à une limite concrète des politiques robotiques actuelles pilotées par le langage, qui présupposent généralement des consignes bien définies et une carte de l'environnement fournie à l'avance, une hypothèse rarement vraie hors laboratoire. Pour les intégrateurs et les décideurs qui envisagent des robots autonomes en environnement non cartographié, la démonstration importante n'est pas seulement la performance de CLUE, mais la contre-preuve qu'il apporte : construire puis interroger passivement une carte enrichie par le langage ne suffit pas, cette approche alternative n'atteint qu'un tiers du taux de réussite de CLUE tout en consommant plus de dix fois plus de tokens de modèle vision-langage. Cela nuance l'idée selon laquelle empiler des cartes sémantiques et de gros modèles suffirait à résoudre l'ambiguïté contextuelle: l'interaction active et itérative avec l'environnement reste nécessaire.
Le papier, publié sur arXiv (identifiant 2609.30428), s'inscrit dans la lignée des travaux combinant modèles de fondation et navigation robotique par cartes sémantiques construites en ligne, un domaine où les politiques conditionnées par le langage progressent rapidement mais restent souvent testées dans des conditions arrangées. En comparant explicitement CLUE à une politique oracle et à un planificateur LLM classique, les auteurs situent leur contribution comme une réponse au fossé entre démonstrations et déploiement réel plutôt que comme un produit commercial. Le code et des ressources supplémentaires sont partagés via une page de projet dédiée, mais aucune indication n'est donnée sur un déploiement industriel ou un calendrier de commercialisation, l'travail restant à ce stade une preuve de concept académique.
Dans nos dossiers




