Aller au contenu principal
FADA : adaptation de domaine few-shot par alignement des dynamiques pour le contrôle humanoïde
RecherchearXiv cs.RO 

FADA : adaptation de domaine few-shot par alignement des dynamiques pour le contrôle humanoïde

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du LECAR Lab (Learning, Computing and Autonomous Robots) ont publié le 30 juin 2026 sur arXiv (référence 2506.28476) un préprint décrivant FADA, un cadre d'adaptation en quelques exemples pour le contrôle de robots humanoïdes. L'architecture, baptisée Planner-IDM (Planner, Inverse Dynamics Model), fonctionne en trois étapes : entraînement d'une politique oracle avec accès à des informations privilégiées (état complet du simulateur), distillation de ce comportement dans un modèle étudiant déployable via DAgger, puis fine-tuning ciblé du seul module IDM à partir d'environ deux minutes de données collectées dans l'environnement réel. La supervision ne requiert ni démonstrations expertes ni signal de récompense : uniquement les paires (actions, observations) enregistrées lors de ces brefs rollouts. Les expériences montrent que FADA surpasse les baselines d'adaptation in-context et d'adaptation end-to-end sur des tâches whole-body à haute précision exécutées sur robot physique.

L'enjeu pratique est réel : le "dynamics mismatch", écart entre les dynamiques simulées et celles du domaine cible dues aux variations de terrain, de charge utile ou de réponse actionneur, reste l'un des principaux freins au déploiement industriel des humanoïdes. Les approches actuelles forcent un compromis inconfortable entre la randomisation de domaine (zero-shot, mais sous-spécialisée) et le recalibrage complet du modèle ou le ré-entraînement de politique (précis, mais coûteux en données et en temps). Deux minutes de rollouts pour aligner un IDM représentent un point d'équilibre opérationnellement crédible pour des intégrateurs qui ne peuvent pas interrompre une ligne de production plusieurs heures. Cela dit, les vidéos hardware présentées sur le site du projet sont sélectionnées par les auteurs ; aucune évaluation statistique robuste sur variété de terrains ou charges n'est encore disponible dans ce préprint non relu par les pairs.

Le sim-to-real gap est un problème structurel que l'ensemble de l'écosystème humanoïde, Figure (02/03), Tesla Optimus, Boston Dynamics Atlas, Physical Intelligence (pi-zero), tente de résoudre, principalement par randomisation massive en simulation ou par apprentissage en contexte (in-context RL). FADA s'inscrit dans une troisième voie, plus proche des travaux sur l'adaptation rapide de politiques (MAML, RMA) mais appliquée à l'architecture Planner-IDM. Le LECAR Lab, affilié à l'Université de Californie San Diego, capitalise ici sur des travaux antérieurs en locomotion et manipulation whole-body. Prochaine étape attendue : validation sur une plus large variété de dynamiques et de morphologies robotiques, ainsi qu'une soumission à conférence (ICRA ou CoRL) pour passer le filtre de la revue par les pairs.

À lire aussi

ORPA : adaptation résiduelle en ligne des politiques pour le contrôle de manipulation robotique par retour humain
1arXiv cs.RO 

ORPA : adaptation résiduelle en ligne des politiques pour le contrôle de manipulation robotique par retour humain

Publié le 19 août 2026 sur arXiv (2608.17323v1), un article de recherche présente ORPA (Online Residual Policy Adaptation), une méthode qui corrige en temps réel les erreurs d'un bras manipulateur sans réentraîner sa politique de contrôle. Le problème ciblé : les politiques entraînées par apprentissage par imitation, comme ACT (Action Chunking with Transformers), performent bien en conditions idéales mais deviennent fragiles face à de petites erreurs d'exécution ou des écarts de distribution. ORPA ajoute à une politique déjà entraînée un module léger, piloté par un retour humain, qui prédit des corrections résiduelles dans l'espace des articulations. Testé sur la plateforme bimanuelle ALOHA sur des tâches de précision, il améliore le taux de réussite et la récupération après perturbation par rapport aux politiques de base et aux corrections classiques par cinématique inverse. L'enjeu dépasse ce seul papier : corriger un échec de politique de manipulation exige normalement une agrégation de nouvelles données puis un réentraînement complet, coûteux et incompatible avec un usage en temps réel en production. En proposant une couche de correction légère activée au vol par un simple retour humain, ORPA s'attaque à l'écart persistant entre les démonstrations impressionnantes de l'apprentissage par imitation en laboratoire et sa robustesse réelle une fois déployée hors distribution. La question touche potentiellement les approches vision-langage-action actuelles, de Pi-0 à GR00T N2 en passant par Helix, qui partagent la même sensibilité aux erreurs cumulatives. Pour des intégrateurs cherchant à industrialiser des bras entraînés par imitation, cela esquisse une piste pour réduire le coût des cycles de correction, même si l'étude reste limitée à des tâches spécifiques sur une seule plateforme. ORPA prolonge une lignée de travaux qui cherchent à corriger les limites de l'apprentissage par imitation sans repasser par un cycle complet d'agrégation de données de type DAgger, une méthode efficace mais lourde à opérer en continu. La plateforme ALOHA, issue des travaux de Stanford et devenue un banc d'essai courant pour la manipulation bimanuelle à faible coût, sert ici de terrain d'évaluation. Il s'agit à ce stade d'une contribution académique déposée sur arXiv, sans lien avec un produit commercial ou un déploiement industriel, et sans calendrier de suite communiqué.

RecherchePaper
1 source
ViBe : adaptation du comportement visuel pour le contrôle du corps entier des humanoïdes perceptifs
2arXiv cs.RO 

ViBe : adaptation du comportement visuel pour le contrôle du corps entier des humanoïdes perceptifs

Un preprint publié sur arXiv (2609.09918) décrit ViBe (Visual Behavior Adaptation), un framework de post-entraînement qui ajoute une perception visuelle aux contrôleurs de suivi de mouvement pour humanoïdes à corps complet. La méthode réutilise des encodeurs visuels pré-entraînés via un module extracteur multi-requêtes, injecte ce retour perceptif dans le tracker par des adaptateurs low-rank (LoRA) pour un réglage économe en paramètres, puis ajuste l'ensemble par optimisation de politique à partir d'un reward de tâche et d'un jeu de données de référence. Sur quatre tâches, la marche perceptive sur trottoirs et parcours type parkour, le repositionnement d'un cube (Repose Cube), la locomotion-manipulation d'objets variés et l'esquive de balles (dodgeball), le transfert sim-to-real s'effectue en zero-shot et reste robuste en extérieur, en faible luminosité et face à des distracteurs visuels RGB, y compris pour une variante orientée objectif de Repose Cube résolue avec un planificateur volontairement simple. L'apport ne se limite pas à la démonstration technique. Les trackers de mouvement actuels, entraînés en simulation par imitation de trajectoires, n'intègrent aucune perception extéroceptive et dépendent donc d'un planificateur de haut niveau pour réagir à l'environnement. Les contrôleurs perceptifs existants comblaient ce manque en entraînant des encodeurs purement géométriques depuis zéro, plus faciles à transférer en réel mais pauvres en sémantique, et en passant par une distillation élève-enseignant propre à chaque tâche, coûteuse à répéter. En réutilisant des encodeurs visuels pré-entraînés et en cantonnant l'adaptation à des modules low-rank, ViBe suggère que le goulot d'étranglement du contrôle humanoïde perceptif se déplace de la simulation physique, déjà largement maîtrisée, vers l'intégration efficace de la perception sémantique, un point clé pour les intégrateurs qui cherchent à sortir ces robots des environnements contrôlés d'usine. Le travail s'inscrit dans la lignée de l'apprentissage par renforcement à grande échelle pour la locomotion humanoïde, où le transfert sim-to-real reste le paradigme dominant, et se distingue des architectures vision-langage-action de bout en bout comme Pi-0 ou GR00T N2 en proposant une adaptation légère d'un tracker déjà entraîné plutôt qu'une politique généraliste entraînée sur un large corpus de démonstrations. Publié comme contribution académique, sans partenariat industriel ni plateforme commerciale nommée à ce stade, l'article n'évoque aucun déploiement réel. La suite logique consisterait à valider la méthode sur des humanoïdes commerciaux et à la comparer directement, en coût d'entraînement et en robustesse, aux pipelines de distillation élève-enseignant aujourd'hui utilisés par les acteurs du secteur.

RecherchePaper
1 source
EgoPriMo : génération de mouvement égocentrique pour le contrôle interactif d'humanoïdes
3arXiv cs.RO 

EgoPriMo : génération de mouvement égocentrique pour le contrôle interactif d'humanoïdes

Des chercheurs ont publié le 9 juin 2026 sur arXiv (réf. 2606.08495) EgoPriMo, un cadre unifié d'apprentissage de prior de mouvement pour robots humanoïdes, entraîné exclusivement à partir de démonstrations humaines en vue égocentrique (caméra portée sur la personne). Le système prend en entrée une séquence vidéo égocentrique et un prompt texte, puis reconstruit, génère ou prédit des mouvements corps entier au format SMPL (Skinned Multi-Person Linear model, le standard académique de représentation du squelette humain). L'architecture centrale est un Triple-stream Diffusion Transformer (DiT) qui modélise conjointement la dynamique corporelle, le contexte visuel égocentriique et le langage naturel via un seul checkpoint partagé, des masques de conditionnement de tâche routant les trois cas d'usage sans architecture distincte. Évalué sur les datasets Nymeria et EgoExo4D, EgoPriMo surpasse UniEgoMotion sur la génération égocentrique, et les trajectoires SMPL produites ont été exécutées avec succès sur le contrôleur humanoïde Unitree (probablement G1 ou H1). Il s'agit d'un papier de recherche, pas d'un déploiement industriel. L'intérêt de cette approche tient à son vecteur de données : les vidéos égocentrique humaines (Nymeria, EgoExo4D) sont disponibles à grande échelle, contrairement aux démonstrations téléopérées sur robots qui restent coûteuses et lentes à collecter. En utilisant le langage comme signal de contrôle haut niveau plutôt que comme spécification complète du mouvement, EgoPriMo vise la généralisation comportementale sans avoir à décrire exhaustivement chaque trajectoire, ce qui est l'un des verrous historiques des systèmes VLA (Vision-Language-Action). Le fait qu'un seul checkpoint gère reconstruction, génération et prévision simplifie le déploiement et réduit la dette de maintenance. La validation sur Unitree démontre une transition sim-to-real partielle, bien qu'aucun chiffre de robustesse en environnement non contrôlé ne soit communiqué dans l'abstract. Ce travail s'inscrit dans une compétition dense autour des priors de mouvement pour humanoïdes. Physical Intelligence (Pi-0), NVIDIA (GR00T N2) et Figure (03) investissent massivement dans des pipelines VLA capables de généraliser à des tâches variées. L'originalité d'EgoPriMo est de contourner la dépendance aux données robot en exploitant l'observation humaine égocentrique, une direction explorée également par des travaux issus de CMU et Stanford sur l'imitation via vidéo. Le choix de Unitree comme cible hardware est cohérent avec sa diffusion large dans les labos académiques. Les prochaines étapes naturelles seraient une validation en environnement semi-industriel et une intégration dans une boucle de contrôle fermée, deux dimensions absentes de ce preprint.

RechercheOpinion
1 source
CMoE : mélange d'experts contrastif pour le contrôle de mouvement et l'adaptation au terrain des robots humanoïdes
4arXiv cs.RO 

CMoE : mélange d'experts contrastif pour le contrôle de mouvement et l'adaptation au terrain des robots humanoïdes

Une équipe de recherche présente CMoE (Contrastive Mixture of Experts), un framework d'apprentissage par renforcement en une seule étape pour la locomotion de robots humanoïdes sur terrains complexes. L'article, référencé arXiv:2603.03067v2 et publié en version révisée, part d'un constat technique : dans une architecture classique de mixture of experts (MoE), le réseau de gating censé activer sélectivement des experts selon le terrain finit en pratique par répartir presque uniformément l'activation entre eux, annulant l'intérêt de la spécialisation. CMoE corrige ce défaut par une contrainte d'apprentissage contrastif qui rend les activations d'experts cohérentes sur un même type de terrain tout en les différenciant d'un terrain à l'autre. Testée sur le robot humanoïde Unitree G1, la méthode permet de franchir des marches continues jusqu'à 20 cm de haut et des espaces jusqu'à 80 cm de large, avec une démarche jugée robuste et naturelle sur des terrains mixtes, des résultats présentés comme supérieurs aux méthodes existantes. Le code est publié en accès libre. Pour l'industrie robotique, ce travail cible un goulot d'étranglement précis : la généralisation de la locomotion sur terrain non structuré, condition nécessaire à tout déploiement hors laboratoire. L'architecture MoE gagne du terrain pour doter un même modèle de comportements moteurs spécialisés, mais l'étude montre que sa spécialisation théorique ne se matérialise pas sans mécanisme correctif dédié, un avertissement pour les équipes qui empilent des experts sans vérifier leur activation réelle. Les chiffres de franchissement donnent un repère concret pour comparer les capacités locomotrices annoncées par différents laboratoires, mais restent des résultats obtenus en conditions expérimentales contrôlées sur une seule plateforme, sans validation en déploiement réel. CMoE s'inscrit dans la lignée des travaux adaptant les architectures mixture of experts, popularisées par les grands modèles de langage, au contrôle moteur des robots à pattes et humanoïdes, un domaine où plusieurs équipes cherchent à dépasser les limites des politiques de marche uniques entraînées par renforcement. Le choix du Unitree G1 confirme le rôle de ce robot chinois disponible dans le commerce comme banc d'essai de référence pour la recherche académique en locomotion humanoïde. En publiant leur code, les auteurs visent à permettre à la communauté de reproduire et d'étendre leurs résultats, sans annoncer de partenariat industriel, de pilote commercial ni de calendrier de transfert vers un produit, ce qui situe ce travail au stade de la recherche plutôt que du déploiement.

RecherchePaper
1 source