Aller au contenu principal
RecherchearXiv cs.RO 

Évaluer la pilotabilité comportementale des modèles fondation de comportement

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie sur arXiv RoboSteer, présenté comme le premier benchmark dédié à la « steerabilité comportementale » des Behavior Foundation Models (BFM). Ces modèles servent à convertir des intentions humaines en comportements exécutables par des humanoïdes. Les auteurs définissent la steerabilité comme la capacité d'un BFM à produire fidèlement des comportements qui respectent les intentions de l'utilisateur. Le benchmark la décompose en trois niveaux hiérarchiques : le pilotage conditionnel (Conditional Steering), le pilotage sous contraintes (Constraint Steering) et le pilotage compositionnel (Compositional Steering). Il s'appuie sur un cadre d'évaluation unifié et sur un vaste corpus de mouvements multimodaux. Les auteurs ont mené avec cet outil ce qu'ils décrivent comme la première étude empirique à grande échelle de la steerabilité, sur 9 BFM existants. Le résumé publié ne donne ni la taille du corpus, ni les scores, ni le classement des modèles évalués.

L'enjeu est de déplacer l'évaluation des BFM. Jusqu'ici, la qualité de la génération de mouvement (réalisme, fluidité, suivi de trajectoire) tenait lieu de mesure de progrès. RoboSteer pose une autre question, plus proche des besoins d'un intégrateur ou d'un responsable d'exploitation : le robot fait-il ce qu'on lui demande, y compris sous contraintes, et en enchaînant plusieurs consignes ? Un humanoïde capable de gestes fluides mais incapable de respecter une contrainte ou de composer deux instructions reste difficile à déployer hors démonstration. Un benchmark standardisé offre aussi un terrain commun pour comparer des modèles aujourd'hui évalués avec des protocoles hétérogènes, et pour repérer les écarts entre ce que montrent les vidéos de démonstration et la fiabilité mesurée. Il faut toutefois rester prudent. Il s'agit d'un preprint, sans relecture par les pairs, et la valeur du benchmark dépendra de la diversité de son corpus, de la robustesse de ses métriques et de leur adoption par d'autres équipes.

Ce travail s'inscrit dans la montée en puissance des modèles fondation pour le contrôle d'humanoïdes. Les approches de génération de mouvement conditionnées par le texte ou par des signaux multimodaux se sont multipliées, parallèlement aux modèles vision-langage-action (VLA) généralistes. Les benchmarks existants portent surtout sur la qualité du mouvement ou sur le suivi de tâches, rarement sur la fidélité à l'intention. RoboSteer vise cette lacune et intéresse autant les laboratoires académiques que les industriels qui développent des humanoïdes. Les auteurs présentent l'ensemble comme une base pour la « réalisation d'intention » au service d'une intelligence incarnée généraliste. La suite dépendra de la publication du code, des données et d'un classement public. La question à suivre est de savoir si les modèles récents résistent au niveau compositionnel, le plus exigeant des trois.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Robots qui apprennent à évaluer des modèles de comportement collectif
1arXiv cs.RO 

Robots qui apprennent à évaluer des modèles de comportement collectif

Des chercheurs ont publié sur arXiv (référence 2604.07303) un cadre méthodologique inédit permettant d'évaluer la fidélité de modèles comportementaux animaux via un robot biomimétique en interaction fermée. L'équipe a utilisé un poisson robot, baptisé RoboFish, contrôlé par des politiques d'apprentissage par renforcement entraînées en simulation sur quatre modèles de comportement de poissons réels : une baseline constante de suivi simple, deux modèles à règles explicites, et un modèle neuronal convolutif (CNN) ancré biologiquement. Ces politiques entraînées en simulation ont ensuite été transférées au RoboFish physique, qui a interagi en temps réel avec de vrais poissons. L'écart sim-to-real a été quantifié via la distance de Wasserstein entre les distributions simulées et réelles de métriques comportementales : performance d'atteinte de cible, distances inter-individuelles, interactions avec les parois de l'aquarium, et alignement de nage. Le modèle CNN s'est révélé le plus fidèle, affichant le plus faible écart sim-to-real sur la majorité des métriques mesurées. Ce travail résout un problème méthodologique persistant en robotique bio-inspirée et en éthologie computationnelle : jusqu'ici, les modèles comportementaux étaient validés uniquement par comparaison offline sur des trajectoires enregistrées, sans confrontation dynamique avec les animaux réels. En introduisant une évaluation en boucle fermée, les auteurs montrent que le classement des modèles change lorsqu'on passe d'une comparaison statique à une interaction incarnée, ce qui implique que de nombreux modèles publiés ont pu être surévalués. Pour la robotique de swarm et les systèmes multi-agents bio-inspirés, ce type de benchmark incarné constitue un outil de validation bien plus discriminant que les métriques classiques. Ce travail s'inscrit dans un courant de recherche croissant sur le sim-to-real en robotique comportementale, porté par des laboratoires comme celui de Maurizio Porfiri (NYU) qui travaille depuis plusieurs années sur RoboFish comme outil d'étude du comportement collectif animal. Le cadre proposé est explicitement généraliste : les auteurs suggèrent qu'il peut s'appliquer à d'autres espèces et d'autres plateformes robotiques. Les prochaines étapes naturelles incluent des tests sur des comportements collectifs plus complexes (bancs de plusieurs individus) et l'extension à d'autres espèces sociales. Aucun partenaire industriel ni financement spécifique n'est mentionné dans le préprint.

RecherchePaper
1 source
Modèle fondation de comportement perceptif : adapter les a priori de mouvement humain au terrain robotique
2arXiv cs.RO 

Modèle fondation de comportement perceptif : adapter les a priori de mouvement humain au terrain robotique

Publiée sur arXiv en juin 2026 (2606.08059), l'architecture Perceptive Behavior Foundation Model (Perceptive BFM) s'attaque à une limite structurelle des modèles fondamentaux de comportement humanoïde : l'hypothèse implicite que les mouvements de référence humains sont physiquement compatibles avec l'environnement du robot. En pratique, quand démonstrateur et robot se trouvent dans des contextes différents, la motion capture ne fournit ni les appuis au sol précis, ni les hauteurs de franchissement, ni les timings de contact requis sur terrain accidenté. Perceptive BFM conserve les références cinématiques brutes comme interface comportementale, tout en intégrant une perception locale du terrain pour adapter dynamiquement contacts, posture et timing. La méthode clé est le TCRS (terrain-conformal reference synthesis) : il retransforme des séquences de mouvement humain en références cohérentes avec le sol via construction d'appuis adaptatifs, optimisation des phases de balancement, reconstruction cinématique et réparation de collisions. L'entraînement suit une architecture enseignant-étudiant : un teacher aveugle apprend les comportements conformes au terrain, puis transfère ce savoir à un student déployé sur références brutes. L'apport concret pour les intégrateurs est une séparation nette entre intention comportementale et adaptation terrain, ce qui rend le système scalable sans motion capture annotée sol par sol. Le student, un Transformer tracker à gating d'identité, n'active les corrections terrain que via des voies résiduelles initialisées à ne rien modifier, ce qui préserve la robustesse du prior de mouvement original. C'est une réponse partielle au débat sur le sim-to-real gap en locomotion humanoïde : l'adaptation repose sur la perception locale plutôt que sur une modélisation globale ou une planification externe, ce qui simplifie le déploiement en environnement non structuré. Ce travail s'inscrit dans l'effervescence des behaviour foundation models pour humanoïdes : Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, ou les politiques corps entier issues de CMU et Stanford sont autant de points de comparaison directs. La question du fossé entre motion priors humains et locomotion réelle avait été partiellement adressée par les travaux sur l'imitation par RL (PHC, AMP, ASE), mais l'extension à des modèles fondamentaux déployables reste ouverte. L'article ne mentionne ni partenariat industriel ni validation hardware publiée : Perceptive BFM est pour l'instant une contribution de recherche sans déploiement terrain confirmé.

RechercheOpinion
1 source
Vers VLA-Dreamer : affiner le comportement des modèles VLA grâce aux modèles du monde
3arXiv cs.RO 

Vers VLA-Dreamer : affiner le comportement des modèles VLA grâce aux modèles du monde

Un article publié sur arXiv fin septembre 2026 sous la référence 2609.31313, intitulé "Towards VLA-Dreamer: Refining VLA Behavior Using World Models", propose une nouvelle architecture pour les modèles vision-langage-action (VLA) utilisés en contrôle robotique. Les auteurs suggèrent d'entraîner un modèle du monde prédictif directement sur l'espace d'embedding de l'encodeur visuel du VLA, plutôt que sur l'espace des pixels comme le font les modèles du monde classiques. L'hypothèse centrale est que ces embeddings, déjà utilisés pour décider des actions du robot, contiennent aussi l'information nécessaire pour anticiper l'évolution future de la scène. La perte d'apprentissage est calculée dans cet espace de représentation, une approche proche des architectures JEPA (joint embedding prédictive architecture). Le modèle du monde ainsi obtenu pourrait ensuite servir à de la planification à court terme, en générant des actions candidates à partir d'une image représentant l'objectif à atteindre. L'enjeu dépasse la simple curiosité académique. Les VLA actuels, tels que Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, exigent des volumes massifs de données de démonstration par apprentissage par imitation, ce qui reste le principal frein économique à leur déploiement à grande échelle chez les intégrateurs industriels. L'absence de modèle du monde explicite dans ces architectures alimente aussi un doute persistant sur leur capacité réelle à comprendre la dynamique physique plutôt qu'à reproduire des trajectoires mémorisées. Si les embeddings visuels s'avèrent effectivement prédictifs, cela apporterait un argument empirique en faveur de la piste "réduction des données" tant recherchée par le secteur ; dans le cas contraire, cela confirmerait une limite structurelle largement soupçonnée des VLA. Il s'agit à ce stade d'un "concept paper", c'est-à-dire d'une proposition architecturale sans résultats expérimentaux chiffrés rapportés dans le résumé, à ne pas confondre avec un système validé ou déployé. Elle s'inscrit dans la lignée des travaux JEPA popularisés par Meta AI et Yann LeCun, et vise, selon les auteurs, à mesurer la richesse prédictive des embeddings VLA et à réduire leurs besoins en données via ce module de planification additionnel.

RechercheOpinion
1 source
RynnValue : faire passer à l'échelle les modèles fondation de valeur robotique par la distance temporelle
4arXiv cs.RO 

RynnValue : faire passer à l'échelle les modèles fondation de valeur robotique par la distance temporelle

RynnValue s'attaque au goulot d'étranglement des modèles de récompense pour l'apprentissage robotique en remplaçant les ancrages classiques (préférences, progression normalisée) par la distance temporelle : le coût-à-parcourir dirigé entre une observation et un objectif spécifié en langage naturel. Comme ces étiquettes se déduisent directement des horodatages, le modèle open source s'entraîne sur plus de 7 000 heures et environ 3 millions de clips conditionnés par instruction, sans annotation de préférence ni de progression. Trois techniques stabilisent l'apprentissage à cette échelle : échantillonnage temporel aléatoire, mélange de l'ordre temporel et attention à isolation de valeur, qui empêchent le modèle de trouver des raccourcis insensibles aux échecs et régressions. Résultat : un Kendall's tau_a moyen de 0,675 sur le benchmark RBM-EVAL-OOD, devant l'état de l'art entièrement supervisé par préférences (0,655) et plus du double d'un équivalent entraîné uniquement sur la progression (0,292), avec généralisation zero-shot à des tâches, embodiments et points de vue inédits. Converti en récompense dense via un potential-based shaping, il fait grimper le taux de succès de politiques robotiques réelles de 52,5% à 72,5% en ligne, et de 63,8% à 82,5% hors ligne. Pour les intégrateurs et décideurs robotique, ce résultat pèse dans le débat sur le passage à l'échelle des modèles VLA : il suggère qu'un signal de supervision dérivé automatiquement des timestamps peut remplacer l'annotation manuelle coûteuse (préférences, jugements de progression) tout en généralisant mieux à des robots et environnements jamais vus à l'entraînement. C'est une preuve concrète que le goulot d'étranglement des reward models, souvent cité comme frein au reinforcement learning robotique à grande échelle, peut être contourné par un signal purement temporel plutôt que par plus d'annotation humaine. L'amélioration mesurée du taux de succès en conditions réelles, et pas seulement sur benchmark hors ligne, distingue ce travail d'une simple démonstration académique et le rend directement pertinent pour qui cherche à industrialiser des politiques génératives de contrôle robotique. RynnValue s'inscrit dans la lignée des modèles de fondation pour la robotique de type VLA (vision-langage-action), aux côtés d'approches comme Pi-0 ou GR00T N2, qui cherchent toutes à exploiter des corpus hétérogènes multi-embodiments pour généraliser au-delà d'un seul robot ou d'une seule tâche. Contrairement aux méthodes appuyées sur des préférences annotées ou une progression normalisée par tâche, difficilement transférables entre plateformes et sources de données, RynnValue mise sur un signal universel et bon marché à produire. Le fait que le modèle et vraisemblablement son code soient publiés en open source (arXiv, août 2026) facilite sa reproduction et son intégration par des laboratoires tiers pour du reward shaping en apprentissage par renforcement. Les prochaines étapes attendues concernent l'extension à davantage d'embodiments et de tâches en conditions réelles, ainsi que la comparaison avec d'autres modèles de récompense émergents dans un secteur où la fiabilité du reward model conditionne directement la vitesse d'entraînement des politiques.

RecherchePaper
1 source