Aller au contenu principal
Comment choisir un modèle fondation pour son robot : pour un cadre d'évaluation communautaire des robots sociaux
RecherchearXiv cs.RO 

Comment choisir un modèle fondation pour son robot : pour un cadre d'évaluation communautaire des robots sociaux

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article de recherche publié sur arXiv sous la référence 2608.06898v1 propose un cadre communautaire d'évaluation pour les modèles de fondation utilisés dans les robots sociaux. Les auteurs constatent que les leaderboards publics existants ignorent les exigences de l'interaction sociale incarnée en temps réel, tandis que les évaluations directes avec robots restent trop coûteuses à mener à grande échelle, faute de temps de participants, de robots et d'expérimentateurs disponibles. Ils identifient cinq dimensions clés à évaluer : la compétence conversationnelle, la sécurité de l'utilisateur, le caractère incarné du robot, l'efficacité dans la scène ciblée et l'adéquation au public visé. Leur solution est un entonnoir en trois paliers, du filtrage par métriques générales peu coûteuses jusqu'aux tests spécifiques sur robot, en passant par des interactions simulées.

Cette démarche met en lumière un manque structurel pour l'industrie : les modèles de fondation généralistes, de type VLA ou conversationnels, s'imposent de plus en plus dans les robots sociaux destinés à l'accueil, l'assistance ou l'éducation, mais aucun standard ne permet de les comparer sur des critères pertinents pour l'interaction physique et humaine, contrairement aux benchmarks textuels classiques. Pour les intégrateurs et décideurs B2B, cela signifie que le choix d'un modèle repose encore largement sur des essais empiriques coûteux plutôt que sur des références partagées. En structurant l'évaluation en paliers progressifs, les auteurs visent à rendre la sélection plus rapide et mieux informée sans exiger systématiquement des études utilisateurs complètes, limitant ainsi les déploiements bâtis sur des démonstrations sélectionnées ou des métriques peu représentatives.

Cette proposition s'inscrit dans une tendance plus large de la robotique sociale, qui délaisse les systèmes de dialogue scriptés au profit de modèles de fondation préentraînés, une évolution parallèle à celle des humanoïdes industriels s'appuyant sur des modèles comme GR00T N2 ou Helix. À la différence de ces annonces produits, il s'agit ici d'un travail de recherche amont, sans robot ni entreprise commerciale nommés, qui cherche à bâtir une méthodologie commune avant que le secteur ne se disperse en benchmarks propriétaires incompatibles. Aucun calendrier n'est précisé, mais les auteurs lancent un appel explicite à la communauté pour combler les méthodes d'évaluation manquantes, notamment sur la sécurité utilisateur et l'adéquation au public, deux dimensions jugées encore insuffisamment couvertes.

Dans nos dossiers

À lire aussi

Le fossé de l'incarnation dans les modèles fondation pour robots
1arXiv cs.RO 

Le fossé de l'incarnation dans les modèles fondation pour robots

Une étude publiée sur arXiv sous la référence 2608.18433v1, intitulée « The Embodiment Gap in Robot Foundation Models », dresse un état des lieux critique des modèles de fondation pour la robotique (RFM), dont les politiques vision-langage-action (VLA). Le papier part d'un constat simple : un modèle peut généraliser sur le papier tout en nécessitant un travail d'adaptation important avant de tourner sur un robot physique donné. Les auteurs baptisent cet écart le « embodiment gap », soit le fossé entre des modèles, représentations ou jeux de données réutilisables et leur mise en œuvre effective sur le robot cible. La contribution centrale est une cartographie à deux axes qui classe les méthodes existantes selon le type de structure partagée et le stade d'adaptation requis avant exécution. L'étude passe ensuite en revue trois axes de recherche qui se recoupent : le partage de sémantique et de perception, le partage de données et d'interfaces robotiques, et l'apprentissage de correspondances entre différents types de corps robotiques. Elle propose enfin un cadre de reporting destiné à documenter ce travail d'adaptation, jugé invisible si l'on ne regarde que le taux de réussite final. Pour les intégrateurs et décideurs B2B du secteur, ce travail vient nuancer le récit dominant selon lequel la simple mise à l'échelle (plus de données, plus de paramètres, plus de benchmarks) suffirait à résoudre le transfert d'un modèle d'un robot à un autre. En creux, l'étude interroge la promesse d'un VLA générique qui s'appliquerait tel quel à n'importe quelle plateforme, qu'il s'agisse d'un bras industriel, d'un robot mobile ou d'un humanoïde. Elle rappelle qu'un taux de réussite affiché sur une démonstration ne dit rien du travail d'ingénierie (recalibrage, réentraînement partiel, adaptation d'interface) nécessaire pour porter un modèle d'un embodiment à un autre. Pour une industrie où plusieurs politiques VLA sont présentées comme quasi prêtes à l'emploi, ce cadre offre une grille de lecture plus rigoureuse pour distinguer généralisation en laboratoire et déploiement réel sur une nouvelle chaîne robotique. Ce travail s'inscrit dans la vague de modèles de fondation robotiques apparue dans le sillage des grands modèles de langage, portée par des acteurs comme Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2 ou Figure AI avec Helix, qui revendiquent tous une forme de généralisation entre tâches et parfois entre robots. En pointant l'absence de cadre commun pour mesurer ce qui reste réellement à faire lors d'un transfert d'embodiment, les auteurs comblent un vide méthodologique plutôt qu'ils ne proposent un nouveau modèle concurrent. La suite logique consisterait en une adoption de ce cadre de reporting par la communauté pour comparer les futures publications sur une base homogène, ainsi qu'en des études de cas documentant le coût d'adaptation d'un même modèle sur plusieurs corps robotiques distincts, question que les auteurs identifient explicitement comme ouverte pour de futurs travaux.

RecherchePaper
1 source
Modèle fondation à l'échelle pour robots humanoïdes
2arXiv cs.RO 

Modèle fondation à l'échelle pour robots humanoïdes

Une nouvelle publication arXiv (2607.15163v1, soumission de type "new") propose un modèle de fondation comportemental (Behavior Foundation Model, BFM) pour le contrôle de robots humanoïdes, baptisé Humanoid Transformer. Les auteurs affirment avoir identifié la recette manquante pour faire monter en puissance ces modèles, en coordonnant trois leviers : un nouveau paradigme d'apprentissage qui reformule le contrôle humanoïde comme la reproduction de comportements corporels intégrés dans le référentiel global plutôt que local ; un équilibrage stratégique entre le volume de déploiements en ligne (on-policy rollouts) et la diversité des mouvements de référence utilisés à l'entraînement ; et l'architecture Humanoid Transformer elle-même, conçue pour faire émerger naturellement des représentations structurées du comportement. Testée à la fois en simulation et en conditions réelles, l'approche réduit l'erreur moyenne par point clé (Mean Per-Keypoint Position Error, MPKPE) de plus de 10% en mode local et de 82% en mode global par rapport aux contrôleurs humanoïdes existants. Ce travail répond à un flou méthodologique réel du secteur : malgré l'engouement croissant pour les BFM comme brique de base des agents incarnés généralistes, personne n'avait jusqu'ici établi de façon rigoureuse comment coordonner données, architecture et paradigme d'entraînement pour obtenir un gain de performance qui tienne la route au passage à l'échelle. Le saut de 82% en mode global est le chiffre qui compte vraiment pour les intégrateurs : c'est la capacité à maintenir une cohérence corporelle dans le référentiel monde, condition nécessaire pour des tâches où le robot doit coordonner déplacement et manipulation sans dérive, un point faible classique des contrôleurs entraînés uniquement en référentiel local. Si les résultats se confirment à plus grande échelle, ils renforcent l'hypothèse que le contrôle humanoïde généraliste peut suivre une trajectoire de scaling comparable à celle des grands modèles de langage, plutôt que de rester cantonné à des politiques spécialisées par tâche. L'article s'inscrit dans la vague de recherche académique qui a suivi l'essor des politiques vision-langage-action (VLA) et des BFM ces deux dernières années, sans rattacher la méthode à un robot ou un laboratoire commercial précis : il s'agit d'une contribution méthodologique comparée à des "contrôleurs humanoïdes existants" pris comme référence, sans nommer de plateforme physique spécifique. La suite logique serait une validation sur du matériel humanoïde tiers et à plus grande échelle de données, pour confirmer que le gain en mode global se maintient hors du cadre expérimental des auteurs.

RechercheActu
1 source
Vers des métriques fondées sur les données pour l'évaluation comparative de la navigation sociale des robots
3arXiv cs.RO 

Vers des métriques fondées sur les données pour l'évaluation comparative de la navigation sociale des robots

Une équipe de recherche a publié une métrique d'évaluation entièrement pilotée par les données pour la navigation robotique en environnement social, baptisée SN26. Le travail s'appuie sur un jeu de données de 4427 trajectoires, dont 182 enregistrées sur des robots réels et 4245 générées en simulation, notées ensuite par des évaluateurs humains selon des critères de qualité et d'acceptabilité sociale. Après un contrôle qualité des annotations, 4402 trajectoires notées ont été retenues pour entraîner le modèle. Les auteurs présentent des résultats qualitatifs et quantitatifs, dont la perte de test obtenue, une comparaison directe avec les métriques manuelles utilisées jusqu'ici dans le domaine, ainsi qu'une étude d'ablation détaillant la contribution de chaque composante. L'ensemble des données, du code et des poids du modèle a été rendu public. Cette publication répond à un problème concret pour les équipes qui développent des robots mobiles autonomes destinés à évoluer parmi des humains, entrepôts, hôpitaux, espaces commerciaux : l'absence de métrique standardisée et fiable pour juger si une trajectoire de navigation est socialement acceptable. Jusqu'ici, les métriques reposaient sur des règles conçues à la main, distance minimale aux piétons, vitesse, fluidité, qui peinent à capturer la perception humaine réelle du confort ou de l'intrusion. Une métrique apprise à partir de données réelles et d'annotations humaines pourrait devenir un outil de référence pour comparer objectivement des politiques de navigation, y compris celles entraînées par apprentissage par renforcement, et accélérer le passage de la démonstration en simulation au déploiement en conditions réelles, un des points de friction classiques du secteur robotique. Le sujet s'inscrit dans un effort collectif de la communauté de recherche en navigation sociale, où plusieurs benchmarks et simulateurs concurrents coexistent sans consensus sur la métrique d'évaluation à privilégier. En rendant public le dataset, le code et les poids du modèle SN26, les auteurs cherchent explicitement à fournir une base commune réutilisable par d'autres laboratoires et industriels, plutôt qu'un outil propriétaire fermé. Les prochaines étapes attendues concernent l'élargissement du dataset à davantage de trajectoires réelles et l'adoption de cette métrique par d'autres équipes pour valider sa généralisation au-delà du corpus initial.

RecherchePaper
1 source
Modèles fondation vérifiables pour la sécurité des robots
4arXiv cs.RO 

Modèles fondation vérifiables pour la sécurité des robots

Une équipe de chercheurs présente FEARL (Foundation-Enabled Assured Robot Learning), un cadre publié en juin 2026 sur arXiv (2606.23754), conçu pour rendre les modèles de fondation utilisés en robotique formellement vérifiables. L'architecture repose sur une décomposition en deux modules : un grand Contrôleur (C) qui gère la perception haute dimension et le raisonnement sur les tâches, et un petit module de Sécurité (S) alimenté par des capteurs dédiés basse dimension et un embedding contextuel borné fourni par C, qui produit l'action finale. La vérification formelle s'applique uniquement à S, un composant compact dont les contraintes de sécurité, évitement de collision, limites d'espace de travail, peuvent s'exprimer sur des observations de faible dimension. Le cadre a été évalué sur trois domaines robotiques simulés, en intégrant des VLA (Vision-Language-Action) pré-entraînés disponibles sur étagère, et le transfert vers un robot physique a été validé. Ce découplage répond à un blocage concret pour les intégrateurs et équipes de certification industrielle. Des VLA comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA sont performants mais formellement opaques, ce qui les rend incompatibles avec les outils de vérification existants et freine leur déploiement dans des environnements à risque. FEARL propose un compromis : le Contrôleur conserve sa pleine expressivité pour le raisonnement, tandis que S reste vérifiable. Le transfert sim-to-real réussi indique que l'interface basse dimension ne dégrade pas les performances réelles, ce qui nuance l'hypothèse selon laquelle la richesse sensorielle serait indispensable à un contrôle fiable. Les approches antérieures pour sécuriser les politiques robotiques reposaient sur le reinforcement learning contraint ou des moniteurs d'exécution superposés, sans garanties formelles sur l'ensemble du pipeline. FEARL s'inscrit dans le champ de l'assured autonomy et constitue l'une des premières architectures à intégrer des VLA pré-entraînés dans une boucle vérifiable. Des acteurs comme Enchanted Tools (France) ou Wandercraft, qui développent des systèmes embarqués à contraintes de sécurité fortes, pourraient directement bénéficier de ce type d'approche. Les prochaines étapes naturelles seraient une validation sur des benchmarks de safety formels (IEC 61508, DO-178C) et des tests sur des manipulateurs industriels en environnement non structuré.

UEEnchanted Tools et Wandercraft, acteurs français développant des robots à fortes contraintes de sécurité embarquée, sont explicitement identifiés comme bénéficiaires directs de cette architecture de vérification formelle des VLA.

RecherchePaper
1 source