Aller au contenu principal
RecherchearXiv cs.RO 

CrossBFM : distiller un espace latent de comportements partagé entre plusieurs morphologies de robots humanoïdes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

CrossBFM, publié sur arXiv (2609.38087), propose de distiller un espace latent de comportements partagé entre plusieurs humanoïdes. Les Behavior Foundation Models (BFM) offrent à un humanoïde une politique pilotable par un simple vecteur latent, qui peut désigner un mouvement à imiter, une pose à atteindre ou une récompense à maximiser. Les représentations Forward-Backward produisent bien de tels espaces, mais elles demandent des centaines d'heures GPU pour un seul robot. Entraînées pour un second robot, elles génèrent un espace distinct, sans lien avec le premier. CrossBFM utilise le retargeting, qui fournit une correspondance image par image entre morphologies, pour entraîner un encodeur unifié sans paramètre propre à un robot. Cet encodeur distille l'espace en moins d'une heure GPU pour tous les robots d'entraînement à la fois. Des contrôleurs conditionnés par le latent, entraînés en PPO classique, ajoutent environ 10 heures GPU. Sur trois humanoïdes, les trois modes de prompt fonctionnent. Le suivi de mouvement perd seulement 0,025 rad par rapport à une politique conditionnée directement sur les articulations. L'atteinte de poses se fait sans chute, et les 41 prompts de récompense testés sont tous optimisés.

Pour l'industrie, le résultat déplace le coût du problème. Au lieu de refaire un entraînement de plusieurs centaines d'heures GPU pour chaque nouvelle plateforme, l'espace de comportements devient un actif réutilisable, et le passage à un nouveau robot ne coûte plus qu'une distillation légère et un entraînement de tracker. Pour un intégrateur ou un fabricant qui décline plusieurs modèles d'humanoïdes, c'est un argument économique direct. Deux résultats d'ablation nuancent la portée. Entraîner l'encodeur sur un quart seulement du corpus de mouvements ne coûte que 5 % de performance de suivi. Sur un robot jamais vu à l'entraînement, l'encodeur récupère jusqu'à 89 % de la performance des robots vus. Ce transfert reste toutefois limité aux morphologies proches, et « jusqu'à » désigne le meilleur cas, pas une moyenne. Les auteurs affirment aussi avoir validé la chaîne sur des robots réels pour les trois modes de prompt, y compris avec des latents générés par modèle à flux. L'article ne détaille pas ici la nature des robots ni l'ampleur de ces essais.

Ces travaux s'inscrivent dans la lignée des modèles de comportement fondés sur les représentations Forward-Backward, dont le principal frein était le coût d'entraînement propre à chaque robot. Ils se distinguent des approches de politiques généralistes de type VLA, qui visent le langage et la vision plutôt qu'un espace de contrôle bas niveau partagé. Il s'agit d'une préimpression non relue par des pairs, et le site du projet est dotdandung.github.io/crossbfm. Les prochaines étapes à surveiller sont l'extension à des morphologies plus éloignées, l'ampleur des tests sur matériel réel et une éventuelle adoption par les constructeurs d'humanoïdes.

Dans nos dossiers

À lire aussi

Vers un contrôle adaptatif des robots humanoïdes par distillation multi-comportements et affinage renforcé
1arXiv cs.RO 

Vers un contrôle adaptatif des robots humanoïdes par distillation multi-comportements et affinage renforcé

Une équipe de chercheurs propose Adaptive Humanoid Control (AHC), un framework de contrôle locomoteur pour humanoïdes publié sur arXiv (2511.06371v3). Le problème de départ est structurel : les méthodes dominantes entraînent une politique séparée pour chaque compétence (se relever, marcher, courir, sauter), générant des contrôleurs rigides qui échouent dès que le terrain devient irrégulier. AHC y répond en deux phases : d'abord, plusieurs politiques primaires sont entraînées puis fusionnées par distillation multi-comportements en un contrôleur unique capable de commuter dynamiquement selon le contexte ; ensuite, un affinage par renforcement avec retours en ligne consolide l'adaptabilité sur terrains variés. Le système est validé en simulation et en conditions réelles sur le robot Unitree G1 d'Unitree Robotics. Pour les intégrateurs et les décideurs industriels, la promesse est concrète : un seul contrôleur couvrant l'ensemble des comportements locomoteurs réduit la complexité opérationnelle et supprime les transitions manuelles entre modes. Du côté de la recherche, le résultat le plus notable est que la distillation combinée à un fine-tuning par RL en ligne permet de réduire partiellement le sim-to-real gap sans ré-entraînement complet. La réserve à formuler : le papier ne publie pas de métriques quantitatives détaillées (taux de succès par terrain, fréquence de chute), ce qui rend difficile la comparaison objective avec d'autres approches. Le Unitree G1 (1,27 m, environ 35 kg, 16 000 dollars) est devenu depuis 2024 une plateforme de recherche de référence pour ce type de travaux. AHC s'inscrit dans une compétition internationale où Physical Intelligence (Pi-0), NVIDIA (GR00T N2), Figure (Helix) et Boston Dynamics cherchent tous à produire des politiques locomotrices généralisables hors environnement contrôlé. L'approche par distillation multi-politiques rappelle les travaux de curriculum learning menés à Berkeley et CMU, et l'affinage par RL en ligne emprunte aux méthodologies RLHF adaptées à la robotique physique. Aucun partenariat industriel ni calendrier de déploiement n'est annoncé ; le projet en est au stade de la démonstration académique.

RecherchePaper
1 source
CrossSafe : vers des filtres de sécurité latents transférables entre morphologies robotiques
2arXiv cs.RO 

CrossSafe : vers des filtres de sécurité latents transférables entre morphologies robotiques

Un article publié sur arXiv le 25 septembre 2026 (2609.28984v1), intitulé "CrossSafe: Towards Cross-Embodiment Latent Safety Filters", propose un filtre de sécurité conditionné par la morphologie du robot et partageable entre plusieurs embodiments. La méthode applique une analyse de type Hamilton-Jacobi reachability directement dans un espace latent construit à partir d'une représentation morphology-aware du robot et de son environnement, plutôt que dans l'espace d'action brut de l'effecteur terminal qu'utilisent la plupart des modèles VLA (vision-language-action). L'approche est évaluée sur cinq embodiments de robots bimanuels et cinq tâches de manipulation, avec des contraintes d'évitement de collision portant sur l'ensemble du corps du robot. Une politique unique, entraînée conjointement sur les cinq tâches et quatre des cinq embodiments, généralise en zero-shot au cinquième embodiment laissé de côté à l'entraînement, réduisant le taux de collision par rapport à la politique nominale sans filtre; les auteurs montrent aussi que multiplier les embodiments à l'entraînement améliore cette généralisation. Ce résultat vise un angle mort des politiques de manipulation généralistes de type VLA, dans la lignée de modèles comme Pi-0, GR00T N2 ou Helix: elles apprennent des actions dans un espace commun d'effecteur terminal sans capturer explicitement comment la sécurité dépend de la morphologie et de la cinématique propres à chaque robot, alors qu'une même action peut être sûre pour un bras et dangereuse pour un autre. Pour des intégrateurs qui déploient une même politique sur des flottes hétérogènes, cela suggère que le raisonnement de sécurité, détecter un obstacle puis décider de l'éviter, peut être mutualisé entre plateformes tout en restant conditionné à la morphologie de chacune, sans nécessiter un filtre réentraîné robot par robot. C'est un indice supplémentaire que la généralisation cross-embodiment, déjà démontrée pour les compétences de manipulation, s'étend à l'évitement de collision, un prérequis pour tout déploiement de VLA en environnement partagé avec des humains. Le travail s'inscrit dans la recherche en apprentissage cross-embodiment et dans les méthodes de contrôle sûr par reachability Hamilton-Jacobi, historiquement coûteuses en calcul et limitées à des systèmes de faible dimension, une contrainte que l'encodage latent proposé ici cherche justement à contourner. Il s'agit à ce stade d'un article académique déposé sur arXiv, sans produit ni robot commercial nommé, et sans acteur français ou européen cité: les cinq embodiments bimanuels testés ne sont pas identifiés publiquement dans le résumé disponible. Aucun calendrier de déploiement réel ni partenariat industriel n'est communiqué; les auteurs indiquent vouloir étendre l'évaluation à davantage d'embodiments et de tâches pour confirmer la courbe de généralisation observée.

RecherchePaper
1 source
Pilotage des politiques dans l'espace latent : un cadre efficace et flexible pour le transfert entre morphologies
3arXiv cs.RO 

Pilotage des politiques dans l'espace latent : un cadre efficace et flexible pour le transfert entre morphologies

Un article déposé sur arXiv en septembre 2026 (2609.22521) présente Latent Policy Steering (LPS), un cadre destiné à réduire le coût de collecte de démonstrations pour l'apprentissage de politiques visuomotrices en robotique. Le principe repose sur une phase de pré-entraînement agnostique à l'embodiment : un modèle du monde (World Model, WM) basé sur l'image est entraîné avec du flux optique sur des données issues de plusieurs types de robots et d'humains, pour capturer la dynamique visuelle commune de la façon dont le monde réagit au mouvement. Ce WM est ensuite affiné sur l'embodiment cible avec de véritables actions robotiques, puis utilisé pour orienter la politique de base en recherchant, dans son espace latent, des plans proches des données de fine-tuning. LPS est présenté comme agnostique à la politique, donc compatible avec différents algorithmes sans nécessiter leur réentraînement. Sur les benchmarks Robomimic et en conditions réelles, les auteurs rapportent des gains relatifs de performance de 16% et 62% pour Diffusion Policy, et de 8% et 14% pour Pi0.5, obtenus avec seulement 50 démonstrations sur un embodiment cible jamais vu à l'entraînement. Ces résultats visent un point de blocage central de la robotique apprenante : les écarts d'embodiment et les espaces d'action incompatibles empêchent aujourd'hui de réutiliser directement les grands jeux de données robotiques et humains disponibles, obligeant chaque plateforme à collecter ses propres démonstrations coûteuses. Si les gains se confirment au-delà des conditions de test des auteurs, une méthode capable d'améliorer une politique existante avec seulement 50 démonstrations et sans réentraînement réduirait sensiblement le coût d'intégration pour les fabricants qui adaptent un modèle générique à un nouveau bras ou une nouvelle pince. Il s'agit toutefois d'un article de recherche non encore relu par les pairs, dont les chiffres reposent sur les évaluations propres des auteurs ; l'ampleur du gain de 62% en conditions réelles mérite d'être lue avec prudence tant qu'elle n'a pas été reproduite indépendamment. Le travail s'inscrit dans la lignée des politiques génératives comme Diffusion Policy et des modèles vision-langage-action tels que Pi0.5, utilisés ici comme bases à améliorer plutôt que comme concurrents directs. Il répond à une problématique déjà identifiée par les laboratoires travaillant sur des modèles généralistes multi-robots, où le transfert cross-embodiment reste un obstacle au passage à l'échelle malgré la multiplication des jeux de données publics. L'article ne mentionne aucun acteur industriel ni feuille de route de déploiement : LPS reste, à ce stade, une contribution méthodologique validée en simulation et sur un nombre limité de plateformes réelles, sans calendrier annoncé pour une intégration en dehors du cadre académique.

RecherchePaper
1 source
Robot Sensor : préhension guidée par le langage dans des scènes complexes à plusieurs morphologies
4arXiv cs.RO 

Robot Sensor : préhension guidée par le langage dans des scènes complexes à plusieurs morphologies

Des chercheurs du Intelligent Systems Lab de l'Université de Toronto ont publié SeededGrasp, un nouveau framework de saisie robotique guidée par le langage, capable de fonctionner dans des scènes encombrées avec plusieurs types de robots (multi-embodiment). Plutôt que de demander à un modèle vision-langage (VLM) de prédire directement la prise à effectuer, ce qui limite sa compréhension spatiale, ou d'entraîner un VLM conjointement avec le modèle de saisie, ce qui exige un volume de données et de calcul considérable, l'équipe découple les deux étapes : le VLM se contente de désigner un point d'amorçage (seed point) sur l'objet cible, qui sert ensuite de conditionnement à un modèle de génération de prise léger et spécialisé. Pour entraîner cette architecture, les chercheurs publient également le premier jeu de données de saisie multi-embodiment sur table, comprenant plus de 2,5 millions de prises annotées dans des scènes encombrées. Les résultats expérimentaux font état de 72% de réussite en simulation et 78% en conditions réelles, surpassant les approches de référence existantes. Le code et les données sont disponibles sur le site du projet (uoft-isl.github.io/seeded-grasp). Pour les intégrateurs et les équipes de recherche en robotique, l'intérêt de SeededGrasp tient à son efficacité en données : en séparant le raisonnement sémantique de haut niveau (comprendre quel objet saisir et pourquoi) de l'exécution géométrique de bas niveau (calculer une prise stable), la méthode évite l'entraînement de bout en bout très coûteux qu'exigent les modèles VLA (vision-langage-action) intégrés. Elle permet aussi de réutiliser le même module de perception sémantique sur différents robots et pinces, un problème récurrent pour l'industrie qui doit aujourd'hui redévelopper des pipelines de saisie spécifiques à chaque plateforme. Le fait que le taux de réussite en réel (78%) dépasse celui en simulation (72%) est notable : il suggère que le découplage limite l'écart classique entre démonstration simulée et déploiement physique, plutôt que de le masquer par une simulation trop favorable. Cette publication s'inscrit dans un mouvement plus large de recherche sur les modèles vision-langage-action appliqués à la manipulation robotique, aux côtés de travaux comme RT-2, OpenVLA ou les approches de saisie zero-shot guidée par instructions textuelles, qui cherchent toutes à rapprocher la compréhension du langage naturel et le contrôle physique des robots. La contribution principale de SeededGrasp reste ici la mise à disposition ouverte d'un dataset de grande échelle spécifiquement conçu pour la généralisation entre plusieurs types de robots, une ressource rare dans le domaine et qui pourrait accélérer les travaux d'autres laboratoires sur la saisie en environnement encombré. Aucune date de déploiement industriel n'est mentionnée : il s'agit pour l'instant d'une contribution de recherche académique, publiée sur arXiv, sans partenariat commercial annoncé.

RechercheOpinion
1 source