Aller au contenu principal
Fiatlux : un banc d'essai à long horizon pour l'escalade d'échelle et le remplacement d'ampoule par un robot humanoïde
RecherchearXiv cs.RO 

Fiatlux : un banc d'essai à long horizon pour l'escalade d'échelle et le remplacement d'ampoule par un robot humanoïde

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2609.38216) Fiatlux, un benchmark de simulation bâti sur NVIDIA Isaac Lab, où un humanoïde Unitree G1 doit remplacer une ampoule en un seul épisode. Le robot place un escabeau sous un plafonnier ou une applique murale, grimpe dessus, retire l'ampoule usagée de sa douille, en visse une neuve, puis dépose l'ancienne dans une caisse de rebut. L'épisode est découpé en douze environnements de sous-tâches, notés par des « portes » pondérées selon leur difficulté. Le succès exige que la nouvelle ampoule soit bien vissée, que l'ancienne soit jetée, qu'aucune ne tombe et qu'un seuil de fragilité ne soit pas dépassé. Un crédit partiel est accordé aux essais incomplets. Deux modes d'observation coexistent : un mode standard, limité aux signaux qu'un robot réel pourrait mesurer ou estimer, et un mode privilégié qui expose l'état exact du simulateur. Les auteurs fournissent des références : RSL-RL PPO, des modèles VLA (vision-langage-action) NVIDIA GR00T N1.7 en zero-shot, et des contrôleurs corps entier. Ils publient aussi les enregistrements téléopérés ayant servi à définir et vérifier les critères de réussite. Code et données sont disponibles sur fiatlux-bench.github.io.

L'intérêt tient à ce que les benchmarks actuels séparent la manipulation sur table, les tâches domestiques à plat et la locomotion ou manipulation humanoïde. Aucun ne combine mobilité verticale et travail dextre sur une charge fragile dans un même épisode long. C'est pourtant le profil de nombreuses tâches de maintenance en bâtiment ou en site industriel : accéder en hauteur, stabiliser le corps, manipuler un objet délicat. La séparation entre modes standard et privilégié permet de mesurer l'écart entre ce qu'un robot réel perçoit et ce que le simulateur sait, donc une partie du fossé sim-to-real. Il faut toutefois rester prudent. L'article annonce des implémentations de référence, mais l'extrait ne fournit aucun taux de réussite. On ignore donc si les modèles VLA en zero-shot franchissent ne serait-ce que les premières portes. Il s'agit d'un banc d'essai en simulation, sans validation sur matériel réel ni déploiement.

Le G1 de Unitree, humanoïde compact et relativement abordable, est devenu une plateforme courante de recherche, ce qui explique ce choix. GR00T N1.7 s'inscrit dans la famille de modèles fondation de NVIDIA pour humanoïdes, face à des approches concurrentes comme Pi-0 de Physical Intelligence ou Helix de Figure. Isaac Lab, de son côté, sert de socle standard pour l'apprentissage par renforcement en simulation. La suite logique consiste à voir si des équipes soumettent des résultats sur Fiatlux, et si des politiques entraînées sur ces douze sous-tâches se transfèrent sur un robot physique. Cela dépendra aussi de la fidélité de la simulation des contacts avec l'ampoule et la douille.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

LadderMan : apprentissage de l'escalade d'échelles par un humanoïde perceptif
1arXiv cs.RO 

LadderMan : apprentissage de l'escalade d'échelles par un humanoïde perceptif

Des chercheurs ont publié le 5 juin 2026 sur arXiv (preprint 2606.05873) un système baptisé LadderMan, conçu pour permettre à des robots humanoïdes de grimper des échelles de géométries variées et d'effectuer des tâches de manipulation en position perchée. L'architecture repose sur un pipeline d'apprentissage en deux étapes : une phase de suivi de mouvement hybride extrait plusieurs politiques d'escalade expertes à partir d'une seule motion de référence, puis une phase de distillation fusionne ces experts en une politique visuomotrice unifiée, pilotée par caméra de profondeur, via une combinaison d'imitation et de renforcement. Pour combler l'écart simulation-réel sur la perception de profondeur, l'équipe exploite des modèles de vision fondationnels. La manipulation en hauteur est gérée par une formulation dite "dual-agent" : un agent dédié à la stabilité sur l'échelle, un autre à la manipulation, avec télé-opération comme signal superviseur. Les expériences rapportent un transfert zéro-shot vers le hardware réel, sans fine-tuning supplémentaire. L'escalade d'échelle constitue l'un des tests les plus discriminants pour les humanoïdes : les points d'appui sont rares et fixes, la coordination corps entier est critique, et la moindre erreur de perception ou de contrôle peut provoquer une chute. Le transfert zéro-shot réussi de la simulation au réel est ici le résultat le plus significatif : il suggère que les modèles de vision fondationnels permettent d'atténuer suffisamment le sim-to-real gap sur des tâches perceptivo-motrices contraintes, une hypothèse longtemps débattue dans la communauté. La capacité à manipuler des objets depuis une position instable ouvre des perspectives concrètes pour l'inspection industrielle, la maintenance en hauteur et les chantiers de construction. Il convient cependant de souligner qu'il s'agit d'un preprint de recherche, non d'un produit commercialisé, et que les vidéos publiées sur ladderman-robot.github.io restent sélectionnées par les auteurs. Ce travail s'inscrit dans une vague active de recherche poussant les humanoïdes vers des environnements contraints et à risque élevé. Aucune entreprise commerciale n'est identifiée dans le preprint, ce qui suggère une origine académique. Sur le plan concurrentiel, aucun constructeur humanoïde majeur, ni Boston Dynamics (Atlas), ni Figure (Figure 03), ni Tesla (Optimus Gen 3), ni Agility Robotics (Digit), n'a à ce jour publié de démonstration d'escalade d'échelle à ce niveau de robustesse et de transfert zéro-shot. Les prochaines étapes logiques seraient un test sur une gamme plus large de robots humanoïdes commerciaux et une intégration de la manipulation autonome, sans télé-opération.

RecherchePaper
1 source
DWMP : exploiter deux modèles du monde pour le franchissement d'obstacles par un robot humanoïde
2arXiv cs.RO 

DWMP : exploiter deux modèles du monde pour le franchissement d'obstacles par un robot humanoïde

Un preprint publié sur arXiv (2609.12347v1) présente DWMP (Dual World Model Policy), un système permettant à un robot humanoïde de franchir des champs d'obstacles grâce à deux modèles du monde distincts plutôt qu'une fusion unique des capteurs. Un module fondé sur la théorie de Koopman transforme les signaux proprioceptifs (articulations, capteurs internes) en un espace où leur évolution devient quasi linéaire malgré la dynamique non linéaire du robot. Un second module, de type RSSM, compresse les images de profondeur de la caméra embarquée en états compacts qui conservent la géométrie des obstacles. Une politique fusionne les deux pour générer les commandes. L'approche a été testée en simulation puis sur un Unitree G1 réel, avec obstacles disposés aléatoirement, sans qu'aucun chiffre de performance (taux de réussite, temps de cycle) ne soit donné dans le résumé. Cette séparation vise une limite connue des politiques de locomotion actuelles, qui traitent souvent de façon indifférenciée des flux aux propriétés opposées: la proprioception, bas-dimensionnelle mais très non linéaire, et la vision, haut-dimensionnelle, bruitée et redondante. Pour les chercheurs et intégrateurs en humanoïdes, l'intérêt tient surtout à la démonstration d'un fonctionnement sur matériel physique réel et non en simulation seule, un point sensible tant l'écart simulation-réel freine encore la commercialisation. Il s'agit néanmoins d'un résultat académique limité à une plateforme unique, le Unitree G1, sans partenaire industriel annoncé, et sans acteur français ou européen impliqué. Le travail s'inscrit dans la lignée des "world models" de l'apprentissage par renforcement: l'opérateur de Koopman sert depuis plusieurs années à linéariser la dynamique de robots complexes, tandis que l'architecture RSSM, popularisée par la famille Dreamer, a d'abord servi à l'apprentissage à partir d'images en environnement virtuel avant d'être adaptée ici à une caméra de profondeur embarquée. Le choix du Unitree G1 confirme son rôle de plateforme de référence pour la recherche en locomotion humanoïde, face à des acteurs commerciaux comme Figure, Boston Dynamics ou Agility Robotics qui explorent des approches d'apprentissage comparables. Classé comme nouvelle soumission, l'article ne mentionne ni conférence de publication, ni code ouvert, ni essai hors laboratoire: une contribution méthodologique, pas encore une étape de déploiement industriel.

RecherchePaper
1 source
Modèle fondation à l'échelle pour robots humanoïdes
3arXiv cs.RO 

Modèle fondation à l'échelle pour robots humanoïdes

Une nouvelle publication arXiv (2607.15163v1, soumission de type "new") propose un modèle de fondation comportemental (Behavior Foundation Model, BFM) pour le contrôle de robots humanoïdes, baptisé Humanoid Transformer. Les auteurs affirment avoir identifié la recette manquante pour faire monter en puissance ces modèles, en coordonnant trois leviers : un nouveau paradigme d'apprentissage qui reformule le contrôle humanoïde comme la reproduction de comportements corporels intégrés dans le référentiel global plutôt que local ; un équilibrage stratégique entre le volume de déploiements en ligne (on-policy rollouts) et la diversité des mouvements de référence utilisés à l'entraînement ; et l'architecture Humanoid Transformer elle-même, conçue pour faire émerger naturellement des représentations structurées du comportement. Testée à la fois en simulation et en conditions réelles, l'approche réduit l'erreur moyenne par point clé (Mean Per-Keypoint Position Error, MPKPE) de plus de 10% en mode local et de 82% en mode global par rapport aux contrôleurs humanoïdes existants. Ce travail répond à un flou méthodologique réel du secteur : malgré l'engouement croissant pour les BFM comme brique de base des agents incarnés généralistes, personne n'avait jusqu'ici établi de façon rigoureuse comment coordonner données, architecture et paradigme d'entraînement pour obtenir un gain de performance qui tienne la route au passage à l'échelle. Le saut de 82% en mode global est le chiffre qui compte vraiment pour les intégrateurs : c'est la capacité à maintenir une cohérence corporelle dans le référentiel monde, condition nécessaire pour des tâches où le robot doit coordonner déplacement et manipulation sans dérive, un point faible classique des contrôleurs entraînés uniquement en référentiel local. Si les résultats se confirment à plus grande échelle, ils renforcent l'hypothèse que le contrôle humanoïde généraliste peut suivre une trajectoire de scaling comparable à celle des grands modèles de langage, plutôt que de rester cantonné à des politiques spécialisées par tâche. L'article s'inscrit dans la vague de recherche académique qui a suivi l'essor des politiques vision-langage-action (VLA) et des BFM ces deux dernières années, sans rattacher la méthode à un robot ou un laboratoire commercial précis : il s'agit d'une contribution méthodologique comparée à des "contrôleurs humanoïdes existants" pris comme référence, sans nommer de plateforme physique spécifique. La suite logique serait une validation sur du matériel humanoïde tiers et à plus grande échelle de données, pour confirmer que le gain en mode global se maintient hors du cadre expérimental des auteurs.

RechercheActu
1 source
RobotDancing : l'apprentissage par renforcement à action résiduelle permet un suivi robuste des mouvements humanoïdes sur le long terme
4arXiv cs.RO 

RobotDancing : l'apprentissage par renforcement à action résiduelle permet un suivi robuste des mouvements humanoïdes sur le long terme

Des chercheurs présentent RobotDancing, une méthode d'apprentissage par renforcement en une seule étape pour faire exécuter à des robots humanoïdes des mouvements de danse longs et dynamiquement exigeants, avec une robustesse accrue face aux erreurs d'accumulation. Le principe : plutôt que de demander à la politique de recréer entièrement un mouvement de référence retargeté (transposé depuis une capture humaine vers la cinématique du robot), RobotDancing prédit des corrections résiduelles sur les cibles articulaires. La politique se concentre ainsi sur la compensation des écarts dynamiques entre la référence et le robot réel (limites d'actionneurs, latence, friction, inertie) plutôt que sur la resynthèse complète du geste. Une politique est entraînée par séquence de référence, avec une recette d'entraînement et de déploiement commune réutilisée entre mouvements et plateformes. L'équipe a évalué la méthode sur huit chorégraphies issues du jeu de données LAFAN1, exécutées sur le robot Unitree G1, avec des expériences complémentaires de transfert inter-plateforme sur les Unitree H1 et H1-2. Le problème ciblé est central dans la robotique humanoïde actuelle : les mouvements retargetés depuis des captures humaines sont cinématiquement plausibles mais dynamiquement incohérents avec le robot réel, ce qui fait dériver le suivi de trajectoire sur les séquences longues et finit par déstabiliser le contrôleur. En montrant des politiques G1 capables d'exécuter des comportements longs et énergétiques directement sur matériel, sans ajustement au moment du test, RobotDancing apporte un signal concret sur la viabilité du transfert simulation-vers-réel pour du contrôle whole-body à haute dynamique, un point souvent démontré en vidéo mais rarement quantifié avec rigueur dans la littérature. Le travail s'inscrit dans la lignée des méthodes de motion tracking par RL pour humanoïdes, où LAFAN1 sert de banc d'essai de référence pour les mouvements complexes. La publication, une version révisée sur arXiv (2509.20717v2), inclut des clips qualitatifs sur H1 et H1-2 pour illustrer la généralisation inter-plateforme, sans toutefois fournir de métriques chiffrées équivalentes à celles obtenues sur le G1, ce qui invite à la prudence sur l'ampleur réelle du transfert démontré.

RecherchePaper
1 source