Aller au contenu principal
RecherchearXiv cs.RO 

BAT : concilier agilité et stabilité par commutation de politiques en ligne pour le contrôle du corps entier d'un robot humanoïde sur de longs horizons

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent BAT, un cadre de commutation de politiques en ligne pour le contrôle du corps entier d'humanoïdes sur de longs enchaînements de mouvements. Le travail, publié sur arXiv (2604.01064, version 2), part d'un constat : les approches existantes suivent deux paradigmes. Les politiques couplées coordonnent tout le corps de façon globale, tandis que les politiques découplées traitent chaque module séparément pour gagner en précision. BAT choisit dynamiquement entre deux contrôleurs généralistes entraînés par apprentissage par renforcement, l'un couplé et l'autre découplé, selon le contexte du mouvement en cours. Deux prédicteurs de commutation travaillent en parallèle. OpVQ-VAE s'appuie sur des « tokens » de mouvement et généralise bien. OpHRL est un prédicteur en boucle fermée qui tient compte de l'état du robot. Un routeur de familiarité des tokens (Token-Familiarity Router) arbitre lorsque les deux divergent : il privilégie OpHRL pour les séquences de tokens connues et OpVQ-VAE pour les séquences inédites. Les auteurs annoncent 85,2 % de réussite sur des combinaisons de mouvements longues déjà vues à l'entraînement, et 71,3 % sur des mouvements jamais rencontrés. Ils rapportent aussi de meilleurs résultats que les contrôleurs corps entier existants sur les mouvements pris isolément, ainsi qu'un déploiement zéro-shot sur le Unitree G1.

L'intérêt pratique tient au compromis que les équipes rencontrent sans cesse. Une politique couplée donne des gestes dynamiques et agiles, comme des sauts ou des mouvements amples, mais elle perd en précision. Une politique découplée manipule ou positionne mieux, mais elle devient moins robuste quand le mouvement exige une coordination globale. Plutôt que de chercher un contrôleur unique qui concilie tout, BAT montre qu'on peut combiner des spécialistes et basculer entre eux à l'exécution. Le point à surveiller est l'écart entre mouvements vus et inédits : 85,2 % contre 71,3 %, soit près de 14 points perdus, ce qui reste loin de la fiabilité attendue en production. Ces chiffres viennent de benchmarks de recherche, sans durée de tâche, nombre d'essais ni conditions détaillés dans le résumé. Le transfert zéro-shot sur G1 est encourageant, mais rien ne dit qu'il couvre toute la distribution de mouvements testée en simulation.

Ce travail s'inscrit dans la vague des contrôleurs généralistes corps entier pour humanoïdes, nourrie par l'apprentissage par renforcement en simulation et l'imitation de mouvements humains. Le Unitree G1, peu coûteux et très répandu dans les laboratoires, sert désormais de plateforme de référence pour valider ces méthodes. Les auteurs ne se positionnent pas ici face aux modèles VLA commerciaux (Figure, Tesla, NVIDIA), car BAT agit à la couche basse de contrôle, pas au niveau du raisonnement ou de la planification. Cette couche reste pourtant un goulot d'étranglement pour passer des démonstrations à des tâches longues et enchaînées. La version 2 laisse penser que l'article a été révisé après relecture. Les suites logiques seraient des tests sur d'autres plateformes, des tâches de manipulation plus longues et une mesure de la robustesse hors laboratoire. Aucun calendrier de déploiement industriel n'est annoncé.

Dans nos dossiers

À lire aussi

ORPA : adaptation résiduelle en ligne des politiques pour le contrôle de manipulation robotique par retour humain
1arXiv cs.RO 

ORPA : adaptation résiduelle en ligne des politiques pour le contrôle de manipulation robotique par retour humain

Publié le 19 août 2026 sur arXiv (2608.17323v1), un article de recherche présente ORPA (Online Residual Policy Adaptation), une méthode qui corrige en temps réel les erreurs d'un bras manipulateur sans réentraîner sa politique de contrôle. Le problème ciblé : les politiques entraînées par apprentissage par imitation, comme ACT (Action Chunking with Transformers), performent bien en conditions idéales mais deviennent fragiles face à de petites erreurs d'exécution ou des écarts de distribution. ORPA ajoute à une politique déjà entraînée un module léger, piloté par un retour humain, qui prédit des corrections résiduelles dans l'espace des articulations. Testé sur la plateforme bimanuelle ALOHA sur des tâches de précision, il améliore le taux de réussite et la récupération après perturbation par rapport aux politiques de base et aux corrections classiques par cinématique inverse. L'enjeu dépasse ce seul papier : corriger un échec de politique de manipulation exige normalement une agrégation de nouvelles données puis un réentraînement complet, coûteux et incompatible avec un usage en temps réel en production. En proposant une couche de correction légère activée au vol par un simple retour humain, ORPA s'attaque à l'écart persistant entre les démonstrations impressionnantes de l'apprentissage par imitation en laboratoire et sa robustesse réelle une fois déployée hors distribution. La question touche potentiellement les approches vision-langage-action actuelles, de Pi-0 à GR00T N2 en passant par Helix, qui partagent la même sensibilité aux erreurs cumulatives. Pour des intégrateurs cherchant à industrialiser des bras entraînés par imitation, cela esquisse une piste pour réduire le coût des cycles de correction, même si l'étude reste limitée à des tâches spécifiques sur une seule plateforme. ORPA prolonge une lignée de travaux qui cherchent à corriger les limites de l'apprentissage par imitation sans repasser par un cycle complet d'agrégation de données de type DAgger, une méthode efficace mais lourde à opérer en continu. La plateforme ALOHA, issue des travaux de Stanford et devenue un banc d'essai courant pour la manipulation bimanuelle à faible coût, sert ici de terrain d'évaluation. Il s'agit à ce stade d'une contribution académique déposée sur arXiv, sans lien avec un produit commercial ou un déploiement industriel, et sans calendrier de suite communiqué.

RecherchePaper
1 source
Uni-VLaT : adaptation tactile du corps entier des politiques VLA pour la loco-manipulation humanoïde
2arXiv cs.RO 

Uni-VLaT : adaptation tactile du corps entier des politiques VLA pour la loco-manipulation humanoïde

Des chercheurs publient Uni-VLaT, une méthode qui greffe un sens du toucher distribué sur tout le corps à des politiques VLA (vision-langage-action) préentraînées pour piloter un humanoïde en loco-manipulation. Le principe est d'ajouter une voie tactile dont l'état latent n'est pas seulement entraîné à produire des actions, mais aussi à prédire les représentations tactiles, proprioceptives et visuelles futures. Ce second objectif construit un contexte multimodal ancré dans le tactile. Les auteurs testent le système sur cinq tâches réelles : locomotion déclenchée par le toucher, interaction physique prolongée, contact avec un humain et loco-manipulation. Le taux de réussite moyen atteint 75 %, soit 43 points de plus qu'une base sans entrée tactile et 7 points de plus qu'une base tactile sans supervision prédictive. Sur deux architectures VLA préentraînées, le balayage de table gagne 30 points sur chacune, et la tâche « Back-Tap Walking » (marcher en réponse à une tape dans le dos) progresse de 85 à 90 points. Les ablations indiquent que la prédiction tactile contextualisée et les cibles futures absolues sont déterminantes. L'enjeu est de combler un angle mort des VLA actuels, qui reposent sur la vision et la proprioception. Quand la zone de contact est masquée, par exemple un bras qui frotte une surface ou une main humaine posée sur le dos, ces deux signaux ne suffisent pas à caractériser l'interaction. Contrairement aux capteurs de force ou de couple placés en quelques points prédéfinis, une peau tactile distribuée conserve la cartographie spatiale du contact sur tout le corps. Le résultat le plus parlant pour un intégrateur est la distinction entre simple ajout d'un capteur et apprentissage prédictif : la modalité brute apporte 36 points sur les 43 gagnés, mais la supervision prédictive rend la fusion plus robuste. Cela suggère que les politiques généralistes peuvent être étendues à de nouvelles modalités sans repartir de zéro, un point utile pour la cobotique humanoïde en contact avec des opérateurs. Les limites sont nettes : cinq tâches seulement, un robot de laboratoire, aucun chiffre sur les temps de cycle, la robustesse à long terme ou la durabilité des capteurs. Ce n'est ni un produit ni un déploiement. Ce travail s'inscrit dans la montée en puissance des modèles VLA pour humanoïdes, dont Pi-0, GR00T ou Helix, pour l'essentiel centrés sur la vision, le langage et la proprioception. Le tactile reste le parent pauvre de ces architectures, freiné par le coût, la fragilité et le câblage des peaux électroniques. La question d'une sensibilité corps entier concerne aussi des acteurs européens comme Wandercraft ou Enchanted Tools, dont les robots opèrent près des humains, même si l'article ne cite aucun partenaire industriel. Les prochaines étapes probables sont une validation sur davantage de plateformes et de capteurs, puis une comparaison avec des approches de contrôle en force, avant tout transfert industriel.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
SwingBot : un robot humanoïde apprend la brachiation en contrôle corps entier
3arXiv cs.RO 

SwingBot : un robot humanoïde apprend la brachiation en contrôle corps entier

Publié sur arXiv (2609.10283) en septembre 2026, SwingBot est un système d'apprentissage permettant à un robot humanoïde muni de crochets passifs aux poignets de traverser des barres en continu par brachiation, en se balançant de l'une à l'autre comme un primate. Le défi tenait à coordonner une longue séquence lâcher-balancement-rattrapage mobilisant tout le corps, sans mesure fiable de la position des segments ni de l'état de contact du crochet. La méthode combine des keyframes biomimétiques et une estimation d'état récurrente fournissant des latents de position et de contact pour le déploiement. Les essais matériels démontrent une traversée continue robuste aux charges utiles, aux perturbations et à l'espacement des barres, sans que l'abstract précise la plateforme ni de chiffres comme le nombre de degrés de liberté. Cette avancée importe parce qu'elle ouvre un mode de locomotion complémentaire à la marche bipède, utile quand le sol est encombré, dangereux ou impraticable, par exemple sur un chantier, en zone sinistrée ou en hauteur. La recherche en locomotion humanoïde se concentre surtout sur la marche au sol ; élargir le répertoire de mouvement au haut du corps reste peu exploré. Que la démonstration ait eu lieu sur matériel réel, et non seulement en simulation, est notable dans un secteur où beaucoup de démonstrations restent cantonnées à la vidéo, et suggère que le transfert simulation-vers-réel, ardu ici faute de capteurs fiables sur l'état de contact, reste gérable. Pour les intégrateurs, ce travail demeure toutefois un résultat de recherche précoce, sans déploiement ni pilote commercial annoncé. La brachiation, étudiée en biomécanique animale, avait déjà inspiré des robots grimpeurs spécialisés de type gibbon, dédiés à cette seule tâche. L'étendre à des humanoïdes à haut nombre de degrés de liberté, qui gèrent un élan corporel plus complexe et des contacts alternés impliquant tout le corps, distingue SwingBot de ces travaux antérieurs. L'article ne mentionne aucun acteur commercial du secteur des humanoïdes ; il s'agit d'une contribution académique, sans calendrier de pilote industriel ni de suite commerciale évoquée, présentée comme une démonstration de faisabilité ouvrant la voie à de futurs travaux sur l'intégration de la brachiation dans des humanoïdes polyvalents.

RecherchePaper
1 source
KINO : une interface à images-clés pour la planification par VLM et le contrôle du corps entier en loco-manipulation humanoïde
4arXiv cs.RO 

KINO : une interface à images-clés pour la planification par VLM et le contrôle du corps entier en loco-manipulation humanoïde

Des chercheurs présentent KINO (arXiv:2609.18869v1), un framework hiérarchique pour la loco-manipulation de robots humanoïdes qui insère des « keyframes » de mouvement comme représentation intermédiaire entre un modèle vision-langage (VLM) chargé de la planification et un contrôleur par renforcement (RL) chargé de l'exécution corps entier. Chaque keyframe encode une pose cible pour l'ensemble du corps du robot et, si nécessaire, la pose de l'objet manipulé. À partir d'une instruction en langage naturel, d'observations de la scène et d'un retour d'exécution, le VLM sélectionne successivement des keyframes pertinentes dans une bibliothèque prédéfinie ; ces keyframes sont ensuite réajustées à la scène courante pour tenir compte de la position et des dimensions des objets, avant qu'une politique conditionnée par keyframe ne génère les actions articulaires. Les auteurs introduisent une stratégie d'échantillonnage de keyframes basée sur la saillance pour l'entraînement de la politique bas niveau, qui fait passer le taux de réussite de bout en bout de 44 % à 92 % lorsque le VLM ne fournit que des keyframes éparses. Le système a été évalué sur des tâches de prise, transport et dépose d'objets, en simulation et sur un humanoïde Unitree G1, avec manipulation à une et deux mains. Ce résultat s'inscrit dans un débat central du secteur robotique : comment relier des modèles vision-langage capables de raisonner sur des instructions abstraites à des contrôleurs bas niveau capables de produire des mouvements corps entier stables. Plutôt que de miser sur une architecture VLA (vision-language-action) de bout en bout, à l'image de Pi-0, GR00T N2 ou Helix, KINO mise sur une représentation intermédiaire discrète et interprétable, ce qui pourrait faciliter le débogage et le contrôle qualité pour des intégrateurs industriels tout en limitant la fréquence des appels au VLM, coûteux en calcul. Le saut de 44 % à 92 % de succès reste toutefois une mesure obtenue en conditions contrôlées de recherche, pas un chiffre de déploiement industriel, et mériterait d'être confirmé sur des tâches plus variées. Le travail s'inscrit dans la vague de recherches académiques cherchant à rendre les humanoïdes capables de manipulation généraliste sans réentraînement massif pour chaque nouvelle scène, un axe exploré en parallèle par les architectures VLA de Physical Intelligence, NVIDIA ou Figure. Le choix du Unitree G1, plateforme humanoïde accessible et déjà utilisée dans de nombreux laboratoires, en fait un banc d'essai plutôt qu'un produit fini : aucun partenariat industriel ni calendrier de commercialisation n'est mentionné dans l'article. Les auteurs indiquent que le système généralise à des emplacements de dépose non vus pendant l'entraînement, un point clé pour juger de sa robustesse au-delà des démonstrations sélectionnées, mais le nombre d'essais et les conditions exactes de ces tests de généralisation ne sont pas précisés.

RecherchePaper
1 source