Corrigible : réponse pragmatico-pédagogique optimale en une seule manche
Des chercheurs proposent une nouvelle approche pour résoudre les « jeux d'assistance », le cadre formel qui modélise la collaboration homme-robot lorsque l'humain connaît l'objectif à atteindre mais que le robot doit le déduire par observation et interaction. Calculer une stratégie optimale en temps réel dans ce cadre est en général intraitable, car cela exige une planification complète dans un POMDP (processus de décision markovien partiellement observable), une classe de problèmes réputée pour son coût de calcul prohibitif. Les auteurs identifient une catégorie de jeux d'assistance dans laquelle un raisonnement dit « pragmatico-pédagogique » lève l'incertitude sur l'objectif en une seule étape temporelle, ce qui rend le jeu intégralement soluble via une procédure de meilleure réponse calculable en pratique, sans recourir à une planification sur tout l'horizon. L'équipe valide sa démonstration théorique et sa méthode sur un exemple simple de construction collaborative de blocs.
Le résultat cible un problème concret pour les systèmes d'assistance robotique : les méthodes classiques de contrôle optimal inverse, utilisées pour déduire les intentions humaines à partir de leurs actions, se heurtent selon les auteurs à un « plafond d'inférence » qui limite leur capacité à s'aligner correctement sur l'objectif humain. Le raisonnement pragmatico-pédagogique proposé contourne cette limite en privilégiant des actions qui, bien qu'équivalentes du point de vue de l'exécution de la tâche, permettent de lever immédiatement l'ambiguïté sur le but poursuivi, un peu comme un humain choisirait un geste plus explicite pour se faire comprendre. Pour les concepteurs de robots assistants et de systèmes multi-agents, cela ouvre une piste vers une inférence d'intention plus rapide et plus fiable, sans multiplier les interactions ou les démonstrations nécessaires. La validation reste toutefois limitée à un cas d'école, loin de la complexité des tâches de manipulation réelles.
Les jeux d'assistance s'inscrivent dans la lignée des travaux sur l'apprentissage par renforcement inverse coopératif, qui cherchent à formaliser mathématiquement la collaboration homme-machine sous incertitude, un champ de recherche actif en alignement de l'IA et en interaction homme-robot. L'article s'appuie aussi sur la littérature du raisonnement pragmatique et pédagogique, qui étudie comment un agent peut choisir ses gestes non seulement pour accomplir une tâche mais aussi pour informer un observateur sur ses intentions. La suite logique de ces travaux consisterait à étendre la méthode au-delà du cas jouet présenté, vers des tâches de manipulation plus riches et des environnements robotiques réels, où l'inférence d'intention en temps limité demeure un verrou pour déployer des assistants véritablement collaboratifs.




