HygieneRoboBench : un banc d'essai pour la planification tenant compte de l'hygiène chez les robots domestiques
Un groupe de chercheurs publie sur arXiv HygieneRoboBench, un banc d'essai de 624 instances réparties en 134 familles de tâches, conçu pour évaluer la planification « consciente de l'hygiène » des robots domestiques. Le scénario : un robot dispose de deux pinces et manipule des objets partagés. Chaque contact avec un objet contaminé peut propager un danger via les pinces, les outils ou les surfaces, et chaque nouveau contact peut rendre caduc un plan jusque-là sûr. Le planificateur reçoit un historique d'exécution et doit en déduire les risques, puis proposer une suite sûre, en tenant compte des coûts de traitement (nettoyage, désinfection), des priorités de l'utilisateur et de limites de temps et de ressources. L'évaluation combine des comparaisons contrôlées (historique, profil utilisateur, événements de contact) et une évaluation indépendante des plans. Les auteurs proposent aussi Hygiene-NSP, une méthode neuro-symbolique qui associe un LLM pour l'ancrage des tâches, la reconstruction de l'historique de contacts et le solveur CP-SAT pour planifier conjointement traitements d'hygiène et exécution. Elle atteint 94,4 % de résolution sûre et 90,4 % de résolution sûre optimale, des taux supérieurs à ceux des planificateurs de référence, LLM ou symboliques, sur l'ensemble du jeu de données.
L'intérêt tient à un constat précis : terminer une tâche sans danger ne signifie pas le faire au moindre coût selon les priorités de l'utilisateur. Un planificateur prudent mais gaspilleur, qui nettoie systématiquement tout, reste un mauvais produit pour un foyer. Le résultat renforce aussi une tendance : pour les contraintes de sécurité à long horizon, l'attelage d'un LLM (compréhension et ancrage) et d'un solveur d'optimisation exact surpasse les approches purement génératives. C'est un argument pour les intégrateurs qui visent la manipulation domestique ou la santé, où la traçabilité des décisions compte. Précaution toutefois : il s'agit d'un benchmark en simulation, avec un historique fourni et non perçu. Il ne dit rien de la détection réelle de la contamination par la perception, qui reste le maillon dur. Les 94,4 % valent sur ce jeu de données conçu par les auteurs, pas en conditions réelles.
Ce travail s'inscrit dans la série des benchmarks de planification pour robots domestiques, qui évaluent surtout la complétion de tâches, rarement la sécurité sanitaire cumulative. Il complète les approches de type VLA (Pi-0, GR00T, Helix), centrées sur la dextérité et la généralisation de la manipulation plutôt que sur le raisonnement sur l'état d'hygiène. Les suites logiques sont l'intégration d'une perception de la contamination, le test sur robot physique et l'extension à plus de deux manipulateurs. La page du projet est publiée, mais aucun partenaire industriel ni pilote de déploiement n'est annoncé à ce stade.
Dans nos dossiers




