Aller au contenu principal
RecherchearXiv cs.RO 

HygieneRoboBench : un banc d'essai pour la planification tenant compte de l'hygiène chez les robots domestiques

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un groupe de chercheurs publie sur arXiv HygieneRoboBench, un banc d'essai de 624 instances réparties en 134 familles de tâches, conçu pour évaluer la planification « consciente de l'hygiène » des robots domestiques. Le scénario : un robot dispose de deux pinces et manipule des objets partagés. Chaque contact avec un objet contaminé peut propager un danger via les pinces, les outils ou les surfaces, et chaque nouveau contact peut rendre caduc un plan jusque-là sûr. Le planificateur reçoit un historique d'exécution et doit en déduire les risques, puis proposer une suite sûre, en tenant compte des coûts de traitement (nettoyage, désinfection), des priorités de l'utilisateur et de limites de temps et de ressources. L'évaluation combine des comparaisons contrôlées (historique, profil utilisateur, événements de contact) et une évaluation indépendante des plans. Les auteurs proposent aussi Hygiene-NSP, une méthode neuro-symbolique qui associe un LLM pour l'ancrage des tâches, la reconstruction de l'historique de contacts et le solveur CP-SAT pour planifier conjointement traitements d'hygiène et exécution. Elle atteint 94,4 % de résolution sûre et 90,4 % de résolution sûre optimale, des taux supérieurs à ceux des planificateurs de référence, LLM ou symboliques, sur l'ensemble du jeu de données.

L'intérêt tient à un constat précis : terminer une tâche sans danger ne signifie pas le faire au moindre coût selon les priorités de l'utilisateur. Un planificateur prudent mais gaspilleur, qui nettoie systématiquement tout, reste un mauvais produit pour un foyer. Le résultat renforce aussi une tendance : pour les contraintes de sécurité à long horizon, l'attelage d'un LLM (compréhension et ancrage) et d'un solveur d'optimisation exact surpasse les approches purement génératives. C'est un argument pour les intégrateurs qui visent la manipulation domestique ou la santé, où la traçabilité des décisions compte. Précaution toutefois : il s'agit d'un benchmark en simulation, avec un historique fourni et non perçu. Il ne dit rien de la détection réelle de la contamination par la perception, qui reste le maillon dur. Les 94,4 % valent sur ce jeu de données conçu par les auteurs, pas en conditions réelles.

Ce travail s'inscrit dans la série des benchmarks de planification pour robots domestiques, qui évaluent surtout la complétion de tâches, rarement la sécurité sanitaire cumulative. Il complète les approches de type VLA (Pi-0, GR00T, Helix), centrées sur la dextérité et la généralisation de la manipulation plutôt que sur le raisonnement sur l'état d'hygiène. Les suites logiques sont l'intégration d'une perception de la contamination, le test sur robot physique et l'extension à plus de deux manipulateurs. La page du projet est publiée, mais aucun partenaire industriel ni pilote de déploiement n'est annoncé à ce stade.

Dans nos dossiers

À lire aussi

Ancrage sémantique tenant compte des risques pour une planification robotique fiable basée sur les LLM
1arXiv cs.RO 

Ancrage sémantique tenant compte des risques pour une planification robotique fiable basée sur les LLM

Des chercheurs proposent un cadre de « Risk-Aware Semantic Grounding » (ancrage sémantique sensible au risque) pour fiabiliser les robots de navigation pilotés par un grand modèle de langage (LLM), et publient sur arXiv (2609.37554v1) un banc d'essai associé, TRUST-NAV. Le problème visé est connu : lorsqu'un LLM sert de planificateur de haut niveau, ses sorties deviennent peu fiables si l'instruction est ambiguë, sans support dans l'environnement ou incohérente sur le plan sémantique. L'architecture estime donc, avant toute planification, trois risques distincts : l'ambiguïté, l'hallucination et le conflit sémantique. Selon ce score, le système choisit entre trois issues : exécuter l'instruction, demander une clarification ou la rejeter. TRUST-NAV réunit des tâches de navigation standard et des scénarios d'instructions volontairement piégées. Les résultats rapportés indiquent que les planificateurs LLM classiques performent bien sur les tâches valides, alors que le cadre proposé améliore nettement la détection d'ambiguïté et le rejet des conflits sémantiques. Le résumé ne fournit ni chiffres, ni modèles testés, ni robot réel : il s'agit d'un travail académique évalué sur benchmark, sans déploiement ni produit. L'intérêt tient au déplacement de la métrique. Jusqu'ici, la plupart des travaux sur les planificateurs LLM et les modèles vision-langage-action (VLA) optimisent la génération de plans et se jugent sur le taux de réussite des tâches. Les auteurs soutiennent qu'un robot fiable se mesure aussi à sa capacité à reconnaître qu'il ne doit pas agir. Pour un intégrateur ou un responsable d'exploitation, c'est un critère de sécurité concret : un AMR ou un humanoïde qui exécute avec assurance une consigne ambiguë ou impossible est un risque opérationnel, pas seulement une erreur de performance. L'approche est aussi modulaire, puisque le filtrage précède la planification et pourrait en principe se greffer sur des planificateurs existants. Il faut toutefois rester prudent : l'absence de chiffres publiés, l'évaluation sur un benchmark créé par les mêmes auteurs et l'écart habituel entre simulation et terrain limitent la portée des conclusions, en particulier sur le coût en fausses alertes, c'est-à-dire les refus ou demandes de clarification inutiles qui ralentissent une exploitation. Ce travail s'inscrit dans la vague des LLM employés comme planificateurs de haut niveau en navigation et en manipulation, où les hallucinations et l'ancrage dans l'environnement restent des points faibles reconnus. Les approches concurrentes reposent sur l'estimation d'incertitude, la prédiction conforme pour déclencher des demandes d'aide, ou des couches de vérification et de garde-fous, tandis que les grands modèles fondation robotiques cherchent surtout à augmenter le taux de réussite. La suite dépendra de la disponibilité de TRUST-NAV pour la communauté, de la reproduction des résultats par des tiers et d'un test sur robot physique, étape que la version 1 du préprint ne mentionne pas.

RecherchePaper
1 source
HINT-Plan : planification de tâches robotiques tenant compte de l'intention humaine dans des environnements riches en contexte, via des modèles vision-langage
2arXiv cs.RO 

HINT-Plan : planification de tâches robotiques tenant compte de l'intention humaine dans des environnements riches en contexte, via des modèles vision-langage

Des chercheurs ont présenté HINT-Plan, un système de planification de tâches robotiques qui intègre la prédiction des intentions humaines dans la prise de décision, selon un article publié sur arXiv (référence 2609.17771v1, catégorie "new") en septembre 2026. Le système utilise des modèles vision-langage (VLM) pour anticiper les intentions humaines de haut niveau à partir d'observations d'images à la troisième personne, puis convertit ces intentions en états-objectifs exploitables pour résoudre des problèmes de planification conjointe homme-robot. Pour représenter l'environnement, HINT-Plan s'appuie sur des graphes de scène hiérarchiques (Scene Graphs) qui traduisent la topologie des lieux et les connaissances actionnables en un langage de planification formel garantissant des plans exécutables. Évalué dans un environnement de simulation photoréaliste, le système atteint un taux de réussite global de 69,71 % en planification conjointe homme-robot, dépassant les méthodes de référence de jusqu'à 35,29 points, tout en réduisant les conflits fonctionnels entre agents humain et robotique. Ce travail s'attaque à un angle mort documenté du secteur de la robotique mobile: la quasi-totalité des approches dites "conscientes de l'humain" se limitent aujourd'hui à l'évitement de collision au niveau de la planification de mouvement bas niveau, sans anticiper le comportement humain à un niveau décisionnel supérieur. En démontrant qu'un VLM peut inférer des intentions humaines exploitables pour une planification multi-agents formelle, l'étude apporte un argument empirique en faveur des architectures VLA appliquées non plus seulement au contrôle moteur, mais à la coordination stratégique entre humains et robots dans des espaces partagés, un enjeu direct pour les AMR et robots collaboratifs en entrepôt ou en environnement domestique. Il s'agit toutefois d'une validation en simulation uniquement, sans déploiement matériel ni test en conditions réelles, ce qui limite la portée immédiate des résultats. Le papier s'inscrit dans la lignée des travaux combinant graphes de scène et planification symbolique, en réponse aux limites des baselines existantes qui ignorent l'anticipation comportementale. Les auteurs ne précisent pas de calendrier de transfert vers le réel ni de partenariat industriel; la validation sur robot physique reste l'étape logique suivante pour confirmer la robustesse de l'approche hors simulation.

RecherchePaper
1 source
HEART : coordination d'agents experts hétérogènes pour la planification de tâches robotiques ancrée dans le réel
3arXiv cs.RO 

HEART : coordination d'agents experts hétérogènes pour la planification de tâches robotiques ancrée dans le réel

Une équipe de chercheurs publie sur arXiv (réf. 2606.25404) HEART, un framework de planification robotique qui distribue le raisonnement entre plusieurs LLM spécialisés plutôt que de confier l'ensemble de la tâche à un seul modèle. Le principe : décomposer une instruction complexe en sous-tâches atomiques (vérification des capacités du robot, analyse de l'atteignabilité des objets, respect des contraintes logiques et temporelles), puis allouer chacune à un agent LLM dédié, le tout sous une contrainte de budget en tokens pour rester viable sur du matériel embarqué ou en communication limitée. La synthèse finale produit un plan d'actions physiquement exécutable, validé avant transmission au robot. Les expériences sur plusieurs benchmarks de scénarios domestiques montrent une amélioration consistante du taux de succès face aux planificateurs mono-LLM et aux approches à base de règles, sans que l'abstract disponible détaille de chiffres absolus. La contribution centrale de HEART est d'intégrer une couche de validation physique avant la génération du plan, un angle mort chronique des approches LLM-only. Les modèles de langage généralisent bien le raisonnement symbolique mais peinent avec les contraintes géométriques réelles : objet hors de portée, séquence d'actions physiquement impossible, outil absent. En déléguant ces vérifications à des agents rôle-spécialisés, le framework réduit le taux de plans invalides ou incomplets. Pour les intégrateurs travaillant sur l'automatisation de tâches non-structurées en environnement domestique ou industriel léger, c'est un signal pertinent : la spécialisation des agents LLM par type de contrainte commence à produire des gains mesurables sur les benchmarks standard. Ce travail s'inscrit dans un courant de recherche actif qui cherche à dépasser les limites du "single LLM as planner", avec des approches comme SayPlan, LLM+P ou Code as Policies comme antécédents directs. Aucun acteur industriel ni déploiement terrain n'est mentionné, et le papier reste un preprint non relu par les pairs. L'absence de métriques chiffrées précises dans l'abstract (taux de succès, nombre de benchmarks, configurations matérielles testées) rend l'évaluation externe difficile. Les prochaines étapes naturelles seraient une validation sur robot physique réel et une comparaison contre des frameworks VLA (Vision-Language-Action) comme pi-0 ou GR00T N2, qui intègrent déjà un raisonnement ancré dans la perception sensorielle.

RecherchePaper
1 source
GraphThink : une planification robotique guidée par un graphe de raisonnement pour les tâches longues
4arXiv cs.RO 

GraphThink : une planification robotique guidée par un graphe de raisonnement pour les tâches longues

Des chercheurs présentent GraphThink, un nouveau framework de planification pour agents robotiques pilotés par des grands modèles de langage (LLM), détaillé dans un article publié le 7 août 2026 sur arXiv (2608.07905v1). Le système combine deux structures de données : un graphe de tâches (task graph), qui guide le raisonnement du LLM via un prompting contextuel et un raffinement itératif pour limiter les hallucinations de planification, et un graphe de scène (scene graph), qui sert de mémoire environnementale pour déclencher une replanification en boucle fermée dès qu'un événement imprévu survient. L'entraînement du planificateur s'appuie sur GRPO (Group Relative Policy Optimization), avec une conception de récompense calquée sur le graphe de tâches. Sur le benchmark ALFRED, référence standard pour l'exécution de tâches ménagères instruites en langage naturel par un agent virtuel, GraphThink atteint l'état de l'art : son module de haut niveau dépasse les LLM propriétaires accessibles par API, aussi bien sur l'ensemble de validation que sur des tâches longues inédites (held-out long-horizon tasks), avec une bonne généralisation zero-shot et few-shot à des environnements et tâches jamais vus. Ce résultat cible un problème central pour l'industrie de la robotique humanoïde et des agents incarnés : les planificateurs fondés sur des LLM génériques hallucinent souvent des actions physiquement impossibles et perdent en cohérence sur des séquences de tâches longues, un écart classique entre démonstration et usage réel. En ancrant le raisonnement dans une représentation structurée de l'environnement plutôt que dans le seul texte, GraphThink illustre une piste concrète pour fiabiliser les architectures de type VLA (vision-language-action) utilisées par des systèmes comme GR00T N2 ou Helix, sans dépendre uniquement de modèles propriétaires massifs. Il s'agit toutefois d'un résultat de recherche évalué en simulation sur ALFRED, non d'un déploiement sur robot physique. Le champ des planificateurs LLM pour la robotique s'est développé depuis des approches comme SayCan ou Code as Policies, et la comparaison de GraphThink aux LLM API démontre surtout un gain méthodologique en environnement contrôlé ; sa validation sur du matériel réel reste l'étape suivante attendue.

RecherchePaper
1 source