
ReactHuman : un référentiel ancré dans la physique pour une prise de décision réactive et humaine des LLM multimodaux incarnés
Une équipe de recherche publie ReactHuman, décrit comme le premier benchmark ancré dans la physique pour évaluer la prise de décision réactive de type humain chez les modèles multimodaux de grande taille (MLLM) utilisés comme cerveau décisionnel de robots domestiques. Présenté dans un article arXiv (2609.10895v1) daté de septembre 2026, le système place le MLLM évalué aux commandes d'un humanoïde simulé confronté à des dangers domestiques soudains, comme une assiette qui glisse ou un couteau qui tombe. Le benchmark couvre 17 familles d'événements et plus de 1 000 scènes reproductibles bit à bit, avec une vérité terrain exacte générée par une simulation de corps rigides à 240 Hz, sans annotation manuelle. Il inclut des objets délibérément trompeurs dont l'apparence contredit les propriétés physiques réelles, comme une enclume en mousse ou une pomme en acier. Chaque plan d'action retenu par le modèle est exécuté physiquement dans la simulation, et noté par une suite de cinq métriques évaluant si la réaction est raisonnable, sûre et physiquement cohérente. Sept MLLM représentatifs ont été testés via ce dispositif, et le jeu de données est publié sur Hugging Face.
Les résultats montrent que la sécurité réactive reste loin d'être résolue: les modèles gèrent mal environ un danger sur trois, réagissent à partir de dispositions figées plutôt qu'à partir de l'observation réelle de la scène, font confiance à l'apparence des objets plutôt qu'à leur trajectoire, et manquent les points d'interception à l'échelle du mètre même lorsque l'action choisie est correcte. Point notable pour le secteur, ces défaillances ne diminuent pas avec l'augmentation de la taille des modèles, ce qui contredit l'hypothèse selon laquelle le scaling suffirait à résoudre le raisonnement physique embarqué. Pour les intégrateurs et laboratoires travaillant sur des robots domestiques, cela signale un écart net entre compréhension physique passive et action de sécurité immédiate.
Les benchmarks existants se limitaient jusqu'ici à des questions-réponses passives sur des vidéos de physique intuitive, ou à des tâches délibérées et longues comme la navigation et le rangement, sans jamais mesurer la capacité à transformer une compréhension physique en action immédiate et critique pour la sécurité. ReactHuman se positionne comme un outil de diagnostic fin et un signal d'entraînement destiné à faire progresser les agents incarnés vers plus de rigueur physique et de conscience de la sécurité, sans annonce de déploiement matériel ni de partenariat industriel à ce stade.
Dans nos dossiers




