Quand un robot défaillant doit-il demander de l'aide : dialogue correctif homme-robot à partir de preuves capteur auditées
Publiée le 21 septembre 2026 sur arXiv (2609.21942), une étude construit un banc d'essai simulé aux causes de panne robotique connues par injection, pour mesurer, sans fuite de données, ce que révèle chaque capteur. Certaines défaillances ne se diagnostiquent qu'à partir des données de force du robot, avec une précision de 0,99, contre 0,55 au mieux pour les méthodes fondées sur l'image seule. Sur six modèles vision-langage (VLM) open source testés à choisir entre agir, consulter un capteur ou interroger un humain, déplacer l'option de refus du dernier au premier rang de la liste de réponses fait chuter le taux de refus de 78-100% à 0-6% dans trois cas sur six. Leur précision par image reste pourtant au niveau de la classe majoritaire, leur confiance déclarée ne prédit aucune justesse, et donner les mêmes données de force en dix lignes de texte brut fait émerger les premiers diagnostics utiles chez quatre modèles sur six, une seule question à un humain remontant alors leur fiabilité entre 0,70 et 0,81.
Ce résultat a une portée directe pour les intégrateurs déployant des VLM dans la prise de décision autonome: les taux de refus et de sollicitation humaine ne suivent pas la politique optimale déductible de leur propre précision mesurée, mais réagissent à des artefacts de mise en forme du prompt. Ils ignorent même un quadruplement du coût d'une question posée à l'humain, ce qui contredit l'hypothèse d'un arbitrage intelligent entre autonomie et supervision. L'essentiel du déficit de diagnostic vient donc d'un accès insuffisant aux bonnes données de capteurs, pas d'un manque de capacité de raisonnement. Pour un décideur B2B, la confiance affichée par un VLM ne doit donc jamais servir de signal de décision opérationnelle.
Ce travail s'inscrit dans la recherche sur le dialogue correctif homme-robot, longtemps éclipsée par les annonces commerciales centrées sur la fluidité d'exécution des architectures vision-langage-action comme GR00T N2, Pi-0 ou Helix. En posant le choix comme un problème à trois actions dont la politique optimale découle de la précision mesurée, les auteurs livrent un cadre d'audit reproductible, sans partenariat industriel ni calendrier de déploiement annoncés à ce stade.
Dans nos dossiers




