Évaluer la pilotabilité comportementale des modèles fondation de comportement
Une équipe de chercheurs publie sur arXiv RoboSteer, présenté comme le premier benchmark dédié à la « steerabilité comportementale » des Behavior Foundation Models (BFM). Ces modèles servent à convertir des intentions humaines en comportements exécutables par des humanoïdes. Les auteurs définissent la steerabilité comme la capacité d'un BFM à produire fidèlement des comportements qui respectent les intentions de l'utilisateur. Le benchmark la décompose en trois niveaux hiérarchiques : le pilotage conditionnel (Conditional Steering), le pilotage sous contraintes (Constraint Steering) et le pilotage compositionnel (Compositional Steering). Il s'appuie sur un cadre d'évaluation unifié et sur un vaste corpus de mouvements multimodaux. Les auteurs ont mené avec cet outil ce qu'ils décrivent comme la première étude empirique à grande échelle de la steerabilité, sur 9 BFM existants. Le résumé publié ne donne ni la taille du corpus, ni les scores, ni le classement des modèles évalués.
L'enjeu est de déplacer l'évaluation des BFM. Jusqu'ici, la qualité de la génération de mouvement (réalisme, fluidité, suivi de trajectoire) tenait lieu de mesure de progrès. RoboSteer pose une autre question, plus proche des besoins d'un intégrateur ou d'un responsable d'exploitation : le robot fait-il ce qu'on lui demande, y compris sous contraintes, et en enchaînant plusieurs consignes ? Un humanoïde capable de gestes fluides mais incapable de respecter une contrainte ou de composer deux instructions reste difficile à déployer hors démonstration. Un benchmark standardisé offre aussi un terrain commun pour comparer des modèles aujourd'hui évalués avec des protocoles hétérogènes, et pour repérer les écarts entre ce que montrent les vidéos de démonstration et la fiabilité mesurée. Il faut toutefois rester prudent. Il s'agit d'un preprint, sans relecture par les pairs, et la valeur du benchmark dépendra de la diversité de son corpus, de la robustesse de ses métriques et de leur adoption par d'autres équipes.
Ce travail s'inscrit dans la montée en puissance des modèles fondation pour le contrôle d'humanoïdes. Les approches de génération de mouvement conditionnées par le texte ou par des signaux multimodaux se sont multipliées, parallèlement aux modèles vision-langage-action (VLA) généralistes. Les benchmarks existants portent surtout sur la qualité du mouvement ou sur le suivi de tâches, rarement sur la fidélité à l'intention. RoboSteer vise cette lacune et intéresse autant les laboratoires académiques que les industriels qui développent des humanoïdes. Les auteurs présentent l'ensemble comme une base pour la « réalisation d'intention » au service d'une intelligence incarnée généraliste. La suite dépendra de la publication du code, des données et d'un classement public. La question à suivre est de savoir si les modèles récents résistent au niveau compositionnel, le plus exigeant des trois.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




