Aller au contenu principal
Connaître le moment de demander : résoudre l'incertitude dans la planification conjointe humain-robot via dialogue explicite et indices d'intention implicites
RecherchearXiv cs.RO 

Connaître le moment de demander : résoudre l'incertitude dans la planification conjointe humain-robot via dialogue explicite et indices d'intention implicites

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a publié une version révisée sur arXiv (2603.07822v2) d'un système de planification homme-robot conjointe pour savoir quand interroger l'humain plutôt qu'agir seul. Il combine deux modules : un dialogue de clarification, où un LLM ancre les instructions ambiguës, une recherche A* augmentée d'hypothèses évalue la traversabilité du terrain, et une politique de questionnement par programmation dynamique ne pose que les questions dont la réponse change le plan ; et une lecture d'intention implicite, qui infère par probabilité l'intention latente de l'humain à partir de signaux spatiaux et directionnels, sans échange verbal. Testé en simulation Gazebo et sur drones réels, avec interface vocale et perception sémantique 3D par modèle vision-langage, le système réduit le coût d'interaction de 51,9% pour 100% de réussite, et accélère de 25,4% l'exécution des tâches coopératives face aux méthodes de référence.

La plupart des systèmes homme-robot actuels ne communiquent que dans un sens, le robot exécutant des ordres sans jamais interroger l'humain sur les points réellement ambigus, ce qui provoque soit des erreurs d'exécution soit une sursollicitation par des questions superflues. En chiffrant une politique de questionnement optimale sur le coût, ces travaux montrent qu'on peut réduire fortement la charge de communication sans perdre en fiabilité, un compromis rarement quantifié avec cette précision. Pour les intégrateurs de flottes de drones ou de robots mobiles évoluant aux côtés d'humains, le résultat suggère qu'un LLM contraint par une structure de planification formelle réduit les frictions d'usage sans multiplier les interruptions, plutôt qu'un simple chatbot greffé sur la pile de navigation.

Ce travail prolonge une tendance de recherche qui dépasse les architectures purement réactives, où le robot agit sans jamais signaler son incertitude, au profit de systèmes qui raisonnent sur ce qu'ils ignorent et sur le coût de le découvrir, en traitant l'humain comme un coéquipier conversationnel actif plutôt qu'un simple superviseur. Le choix du drone comme plateforme, plutôt qu'un bras manipulateur ou un robot humanoïde, souligne un enjeu propre aux environnements 3D ouverts, où l'ambiguïté sur la traversabilité coûte cher à corriger par essai erreur. S'agissant d'une révision d'un article déjà soumis, aucun calendrier de transfert commercial n'est mentionné, situant la publication au stade de la recherche académique.

Dans nos dossiers

À lire aussi

HINT-Plan : planification de tâches robotiques tenant compte de l'intention humaine dans des environnements riches en contexte, via des modèles vision-langage
1arXiv cs.RO 

HINT-Plan : planification de tâches robotiques tenant compte de l'intention humaine dans des environnements riches en contexte, via des modèles vision-langage

Des chercheurs ont présenté HINT-Plan, un système de planification de tâches robotiques qui intègre la prédiction des intentions humaines dans la prise de décision, selon un article publié sur arXiv (référence 2609.17771v1, catégorie "new") en septembre 2026. Le système utilise des modèles vision-langage (VLM) pour anticiper les intentions humaines de haut niveau à partir d'observations d'images à la troisième personne, puis convertit ces intentions en états-objectifs exploitables pour résoudre des problèmes de planification conjointe homme-robot. Pour représenter l'environnement, HINT-Plan s'appuie sur des graphes de scène hiérarchiques (Scene Graphs) qui traduisent la topologie des lieux et les connaissances actionnables en un langage de planification formel garantissant des plans exécutables. Évalué dans un environnement de simulation photoréaliste, le système atteint un taux de réussite global de 69,71 % en planification conjointe homme-robot, dépassant les méthodes de référence de jusqu'à 35,29 points, tout en réduisant les conflits fonctionnels entre agents humain et robotique. Ce travail s'attaque à un angle mort documenté du secteur de la robotique mobile: la quasi-totalité des approches dites "conscientes de l'humain" se limitent aujourd'hui à l'évitement de collision au niveau de la planification de mouvement bas niveau, sans anticiper le comportement humain à un niveau décisionnel supérieur. En démontrant qu'un VLM peut inférer des intentions humaines exploitables pour une planification multi-agents formelle, l'étude apporte un argument empirique en faveur des architectures VLA appliquées non plus seulement au contrôle moteur, mais à la coordination stratégique entre humains et robots dans des espaces partagés, un enjeu direct pour les AMR et robots collaboratifs en entrepôt ou en environnement domestique. Il s'agit toutefois d'une validation en simulation uniquement, sans déploiement matériel ni test en conditions réelles, ce qui limite la portée immédiate des résultats. Le papier s'inscrit dans la lignée des travaux combinant graphes de scène et planification symbolique, en réponse aux limites des baselines existantes qui ignorent l'anticipation comportementale. Les auteurs ne précisent pas de calendrier de transfert vers le réel ni de partenariat industriel; la validation sur robot physique reste l'étape logique suivante pour confirmer la robustesse de l'approche hors simulation.

RecherchePaper
1 source
Distill : comprendre les intentions réelles dans la communication humain-robot
2arXiv cs.RO 

Distill : comprendre les intentions réelles dans la communication humain-robot

Une équipe de chercheurs présente dans un article déposé sur arXiv en mai 2026 (arXiv:2605.14262) une approche baptisée Distill, conçue pour extraire l'intention réelle d'un utilisateur lorsqu'il formule une tâche à un robot. Le problème de départ est bien documenté : le langage naturel, aussi intuitif soit-il, reste ambigu et imprécis, tandis que la programmation par l'utilisateur final tend à l'inverse à être trop littérale, incapable de capturer la généralité de ce que l'utilisateur souhaite réellement accomplir. Distill opère en trois étapes sur une spécification de tâche fournie par l'utilisateur : il supprime les étapes superflues, généralise le sens derrière chaque étape individuelle, et relâche les contraintes d'ordonnancement entre ces étapes. L'approche a été implémentée sous forme d'interface web et évaluée via une étude crowdsourcée auprès d'utilisateurs réels. L'enjeu pour l'industrie robotique est concret : la distance entre ce qu'un opérateur dit et ce qu'il veut réellement constitue l'un des principaux freins au déploiement de robots autonomes dans des environnements non structurés. Les interfaces à langage naturel prolifèrent, portées par les modèles VLA (Vision-Language-Action) et les LLMs embarqués dans des plateformes comme Figure 02, Spot ou les robots collaboratifs industriels, mais elles buttent systématiquement sur cette ambiguïté sémantique. Une approche capable de distiller l'intention générale derrière une instruction floue ou sur-spécifiée réduirait le besoin de reformulation itérative et abaisserait la barrière d'adoption pour des opérateurs non-experts en programmation. Ce type de raffinement d'intention est également utile pour la génération automatique de programmes comportementaux dans des architectures de type task planning. Ce travail s'inscrit dans une vague de recherches visant à combler le fossé entre langage humain et représentations formelles exploitables par les robots, un champ actif impliquant des laboratoires comme Stanford, MIT CSAIL ou le groupe Human-Robot Interaction de l'Inria en France. Les approches concurrentes incluent la correction de programme par retour utilisateur (LLM Repair), la programmation par démonstration (PbD) et les interfaces de dialogue multi-tours. Distill se distingue par son orientation vers la généralisation automatique plutôt que la simple transcription ou la correction d'erreurs. Les prochaines étapes attendues concernent l'intégration sur des plateformes robotiques physiques et l'évaluation de robustesse face à des tâches à longue séquence ou à contraintes temporelles strictes. Il s'agit pour l'instant d'un preprint non évalué par les pairs, sans déploiement industriel annoncé.

UEL'Inria (groupe Human-Robot Interaction) est cité comme acteur du même champ de recherche, positionnant la France dans les travaux sur l'interprétation d'intention en robotique, sans implication directe dans ce preprint.

RecherchePaper
1 source
IA incarnée, HumAIN : la navigation sociale implicite du robot conscient des humains
3arXiv cs.RO 

IA incarnée, HumAIN : la navigation sociale implicite du robot conscient des humains

Des chercheurs présentent HumAIN (Human-Aware Implicit Social Robot Navigation), un nouveau framework publié sur arXiv (arXiv:2607.07357v1) qui vise à rendre la navigation des robots sociaux plus sensible aux comportements humains. Le système repose sur un modèle enseignant de type transformer qui fusionne plusieurs sources de données : images historiques, points clés du squelette humain (keypoints), état du robot et objectif de destination, afin d'apprendre des représentations robustes pour planifier la trajectoire future du robot. Cette connaissance est ensuite distillée dans un modèle élève beaucoup plus léger, optimisé conjointement pour reconstruire la trajectoire et aligner ses caractéristiques latentes sur celles de l'enseignant, ce qui permet un déploiement en temps réel. Lors des tests, HumAIN améliore les métriques de prédiction de trajectoire de 29,8% en moyenne sur l'ensemble des métriques évaluées, par rapport aux meilleures méthodes existantes. L'enjeu principal de ces travaux est de combler l'écart entre prédiction et planification, un problème récurrent dans la navigation robotique en environnement humain : beaucoup de systèmes prédisent bien le mouvement des piétons mais peinent à traduire cette prédiction en trajectoire exploitable en temps réel, surtout sur du matériel aux ressources limitées. En s'appuyant sur des indices sociaux implicites, comme la démarche ou l'orientation du corps, plutôt que sur des règles explicites ou des modèles de forces sociales classiques, cette approche pourrait rendre les robots mobiles (AMR, robots de service, plateformes embarquées) plus fluides et prévisibles dans des espaces partagés avec des humains, un facteur clé pour l'acceptabilité et la sécurité de ces systèmes en usage réel, notamment en logistique ou en environnement industriel où humains et robots cohabitent. Ce travail s'inscrit dans la lignée des recherches sur la navigation sociale des robots, un domaine qui cherche depuis plusieurs années à dépasser les modèles purement géométriques d'évitement d'obstacles pour intégrer une compréhension plus fine du comportement humain. La technique de distillation de connaissances, empruntée à l'apprentissage profond, est ici appliquée pour rendre exploitables sur des plateformes à ressources contraintes des représentations normalement coûteuses à calculer. Les auteurs positionnent HumAIN par rapport à des méthodes de l'état de l'art en prédiction de trajectoire, et les prochaines étapes attendues porteraient sur une validation au-delà de la simulation, sur des robots physiques en conditions réelles.

RecherchePaper
1 source
Planification robotique sous contraintes de ressources face à une incertitude mixte
4arXiv cs.RO 

Planification robotique sous contraintes de ressources face à une incertitude mixte

Des chercheurs présentent le CMDPST (Consumption Markov Decision Process with Set-valued Transitions), un cadre formel inédit permettant à un robot de planifier ses actions en tenant compte simultanément de deux types d'incertitudes : le bruit probabiliste mesurable et les inconnues structurellement non-quantifiables, tout en garantissant que le système ne tombe jamais à court de ressources opérationnelles (batterie, capacité de charge, quota de déplacements). Publiée sur arXiv en mai 2026 (réf. 2605.05797), la contribution couple ce modèle à une spécification de tâche exprimée en LTLf (logique temporelle linéaire sur traces finies), un formalisme permettant d'encoder des objectifs complexes avec des contraintes temporelles précises. Les auteurs proposent deux algorithmes de synthèse de stratégie : une méthode directe par déroulage d'états et une version optimisée par élagage de l'espace d'états, plus efficace en temps de calcul. Les expériences sont conduites sur un réseau de transport en entrepôt simulé, sans validation sur hardware réel à ce stade. La contribution adresse un angle mort récurrent dans la planification robotique industrielle : la plupart des approches existantes traitent soit l'incertitude probabiliste via les MDP classiques, soit les contraintes de ressources, rarement les deux ensemble. Dans les déploiements AMR (autonomous mobile robots) d'entrepôt, où une flotte doit honorer des missions tout en gérant niveaux de batterie et pannes imprévisibles, cette dualité est pourtant critique. Le cadre CMDPST offre aux intégrateurs une garantie formelle : la stratégie synthétisée ne laissera jamais un robot en panne sèche, même face à des perturbations non modélisées. C'est un argument solide pour des environnements industriels où l'interruption de service a un coût direct et mesurable. Ce type de planification sous contraintes mixtes s'inscrit dans un corpus plus large incluant la vérification probabiliste de modèles (outils PRISM, Storm) et la planification formelle par MDP. Les acteurs de la logistique automatisée comme Exotec (France) ou Hai Robotics, dont les flottes AMR évoluent dans des environnements partiellement inconnus, sont directement concernés par ces avancées théoriques. Côté alternatives académiques, le reinforcement learning robuste et le model predictive control probabiliste existent, mais sans les garanties formelles d'épuisement de ressources que revendique cette approche. La prochaine étape attendue est une implémentation sur robot physique pour évaluer concrètement le gap sim-to-real.

UEExotec (France) est explicitement citée comme acteur directement concerné par ces avancées théoriques, ses flottes AMR en entrepôt étant précisément le cas d'usage visé par les garanties formelles de non-épuisement des ressources du cadre CMDPST.

RecherchePaper
1 source