Aller au contenu principal
RecherchearXiv cs.RO 

VioLA : apprendre des politiques de contrôle humanoïde généralistes à partir de données humaines

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

VioLA, un travail déposé sur arXiv (2610.12435), propose une politique généraliste pour humanoïdes qui ne prédit plus des commandes articulaires mais des « latents » de mouvement du corps et des mains. Un contrôleur de corps et un contrôleur de mains, pré-entraînés, exécutent ensuite ces latents sur le robot. Des encodeurs de mouvement projettent les mouvements humains et robotiques dans les mêmes espaces latents. Un enregistrement humain se retrouve donc étiqueté directement dans l'espace d'action de la politique. Le pool de démonstrations atteint 140,6 millions de trames, dont 93,2 % sont d'origine humaine. Sur robot réel, VioLA suit des consignes de locomotion en zero-shot, sans réglage fin par tâche, avec 100 % de réussite. GR00T N1.7 plafonne à 16,7 % et Ψ₀ à 0 %. En manipulation, la politique atteint 88,6 % de réussite, toujours sans réglage fin spécifique. La méthode a été testée sur trois architectures : deux VLA (vision-langage-action) et un modèle monde-action. Le code et les checkpoints doivent être publiés, mais ils ne le sont pas encore.

L'enjeu est la rareté des données. Les politiques généralistes actuelles pour humanoïdes exigent un réglage fin sur des démonstrations téléopérées de chaque tâche avant déploiement, ce qui est lent et coûteux. Ici, une politique entraînée uniquement sur des démonstrations humaines réalise des tâches de locomotion en zero-shot sur le robot réel. Cela suggère que l'on peut contourner le goulot d'étranglement de la téléopération en passant par une représentation intermédiaire partagée entre humain et robot. Les cadres d'intégration y gagneraient : des vidéos et des captures de mouvement, bien plus abondantes, pourraient alimenter l'entraînement. Le fait que l'approche fonctionne sur trois backbones différents laisse penser que le gain vient de l'espace d'action, pas d'un modèle particulier. Quelques réserves s'imposent. Le papier est un preprint non évalué par les pairs. Les protocoles de test (nombre d'essais, diversité des consignes, robot utilisé) ne sont pas détaillés dans le résumé. Le score de 100 % en locomotion porte probablement sur un jeu de consignes restreint, et le résultat de 88,6 % en manipulation n'est accompagné d'aucune comparaison de référence.

VioLA s'inscrit dans la course aux modèles fondation pour humanoïdes. GR00T de NVIDIA, Helix de Figure et la famille Pi de Physical Intelligence reposent surtout sur de la téléopération, de la simulation ou des mélanges de données, avec un réglage fin par tâche. L'idée de contrôleurs de bas niveau entraînés en simulation puis pilotés par un espace latent de mouvement prolonge les travaux sur le suivi de mouvement humain en humanoïde, où le contrôle du corps entier et des doigts restait un point dur. Les auteurs ne donnent aucun calendrier de diffusion hors de la promesse de publication du code. La suite à surveiller sera la reproduction indépendante des résultats sur d'autres plateformes, et l'extension à des tâches de manipulation à longue portée, pour savoir si le passage par les latents tient hors du laboratoire.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Workhorse : apprendre la loco-manipulation humanoïde robuste du corps entier à partir de données humaines
1arXiv cs.RO 

Workhorse : apprendre la loco-manipulation humanoïde robuste du corps entier à partir de données humaines

Des chercheurs présentent Workhorse, un système qui apprend la loco-manipulation du corps entier pour humanoïdes à partir de démonstrations humaines enregistrées sans robot (arXiv 2610.09117). L'architecture sépare deux politiques. Un planificateur visuel, alimenté par des images RGB égocentriques et la proprioception, prédit cinq cibles de liens : le torse, les deux poignets et les deux pieds. Un contrôleur de suivi du corps entier, entraîné par apprentissage par renforcement, exécute ensuite ces poses sur le robot. Les deux politiques sont entraînées séparément sur les mêmes poses humaines, sans retargeting vers la morphologie du robot. Chacune est aussi entraînée sur des données augmentées qui imitent les erreurs de l'autre au déploiement. Sur un Unitree G1 réel, le système trie des boîtes avec les mains et un coup de pied, attrape une boîte lancée, puis fait basculer une valise et grimpe dessus. Il récupère aussi après une poussée ou le retrait de la boîte par une personne. Dans une copie simulée de la salle de démonstration, le tri aboutit dans 77 % des épisodes, et dans 64 % sous poussées de 40 N.s. Avec les deux politiques réentraînées sur les mêmes démonstrations, un second humanoïde simulé atteint 83 % sans poussées. L'intérêt tient à la façon de contourner deux goulets d'étranglement. Les humanoïdes peinent à planifier des manipulations riches en contacts, où le corps entier participe, à partir de la seule vision embarquée. Et la téléopération robot, qui produit l'essentiel des données d'entraînement actuelles, coûte cher et passe mal à l'échelle. Utiliser des démonstrations humaines brutes, sans passer par le retargeting, simplifie la collecte et ouvre la voie à des corpus plus larges. L'interface à cinq liens est un compromis lisible : assez abstraite pour être indépendante de l'embodiment, assez riche pour porter des gestes comme un coup de pied. Le résultat sur un second humanoïde, obtenu par simple réentraînement, suggère que l'approche se transfère. Il faut toutefois relativiser les chiffres. Les taux de 77 % et 64 % sont mesurés en simulation, dans une salle répliquée, et ne disent rien de la fiabilité sur le robot réel, qui n'est démontré que par des séquences qualitatives. Les tâches restent des démonstrations de laboratoire, loin des cadences et de la robustesse qu'exige un site industriel. Le travail s'inscrit dans la course aux politiques corps entier pour humanoïdes. Les grands modèles VLA (Pi-0, GR00T N2, Helix) visent des compétences généralistes, tandis que les approches de suivi de mouvement par apprentissage par renforcement se sont multipliées sur le G1, plateforme académique de référence en raison de son coût relativement bas. Workhorse relève d'une troisième voie hiérarchique, avec un planificateur appris sur données humaines et un contrôleur bas niveau robuste. Il s'agit d'une publication de recherche (v1) et non d'un produit : aucun déploiement, calendrier ni partenaire industriel n'est annoncé. La suite logique serait de quantifier les taux de réussite sur matériel réel, d'élargir la diversité des tâches et d'évaluer le passage à l'échelle avec davantage de données humaines.

RecherchePaper
1 source
X-Loco : vers un contrôle généraliste de la locomotion humanoïde par distillation synergique de politiques
2arXiv cs.RO 

X-Loco : vers un contrôle généraliste de la locomotion humanoïde par distillation synergique de politiques

Publié sur arXiv (2603.03733) en 2025, X-Loco est un framework d'entraînement d'une politique de locomotion généraliste basée sur la vision pour robots humanoïdes. L'approche repose sur une distillation synergétique : plusieurs politiques expertes sont entraînées séparément pour des compétences distinctes - locomotion bipède stable, récupération après chute, coordination corps entier, franchissement de terrains variés - puis une politique unique guidée par entrée visuelle est distillée à partir de ces experts via un mécanisme de sélection adaptative au cas par cas. X-Loco opère uniquement sur des commandes de vitesse, sans recours à des mouvements de référence issus de captures de mouvement. Les auteurs revendiquent une première dans l'intégration simultanée de toutes ces compétences dans une seule politique vision - affirmation à prendre avec les précautions d'usage pour un preprint non encore évalué par les pairs. Ce travail s'attaque à un verrou technique central : entraîner une politique unique qui maîtrise des comportements aux dynamiques radicalement différentes et aux objectifs de contrôle parfois contradictoires. Une telle politique simplifie le déploiement opérationnel en éliminant les modules de commutation entre comportements. L'absence de dépendance aux données de mocap rend également le pipeline d'entraînement plus scalable, puisqu'il ne requiert pas de bibliothèques de mouvements spécifiques à chaque compétence cible. Les études d'ablation incluses renforcent la crédibilité des choix architecturaux, mais les résultats restent cantonnés à la simulation et au laboratoire, sans validation sur hardware réel à grande échelle. X-Loco s'inscrit dans une dynamique de recherche intense sur la locomotion humanoïde, portée par des équipes comme Berkeley Humanoid, CMU et les labos gravitant autour d'Unitree. La distillation enseignant-étudiant est un paradigme établi en apprentissage par renforcement, mais son application à un spectre aussi large de compétences reste un défi ouvert. Côté commercialisation, Tesla (Optimus Gen 2), Figure AI, Boston Dynamics (Atlas) et 1X Technologies travaillent sur des problèmes similaires avec des ressources bien supérieures. La suite logique pour X-Loco serait une validation sim-to-real convaincante sur hardware physique, étape non encore franchie selon le papier.

RecherchePaper
1 source
Robot humanoïde : apprendre des interventions de sécurité personnalisées pour le contrôle partagé haptique humain-robot
3arXiv cs.RO 

Robot humanoïde : apprendre des interventions de sécurité personnalisées pour le contrôle partagé haptique humain-robot

Traduction de l'article demandée. Un système de retour haptique personnalisé permet désormais aux robots partagés en téléopération d'apprendre les préférences de sécurité individuelles d'un utilisateur à partir de démonstrations limitées, plutôt que d'imposer des réglages génériques prédéfinis. L'approche, baptisée Learning from Haptics (LfH), s'appuie sur une couche d'optimisation différentiable fondée sur des fonctions de barrière de contrôle (Control Barrier Function, CBF), un outil mathématique classique pour garantir qu'un système reste dans une zone d'état sûre. Concrètement, l'opérateur n'a plus besoin de régler manuellement les paramètres du contrôleur par essais-erreurs: il montre au système comment il souhaite que celui-ci intervienne pendant la téléopération, et l'algorithme ajuste automatiquement les paramètres de sécurité sous-jacents pour reproduire ce comportement démontré. Les auteurs ont validé le cadre à la fois en simulation et sur un banc matériel réel, montrant que le système apprend des interventions personnalisées à partir de peu de données utilisateur et réduit l'écart entre le retour haptique généré et les préférences réellement démontrées. Cette avancée s'attaque à une limite connue des systèmes de guidage haptique en contrôle partagé humain-robot: les stratégies d'intervention prédéfinies ne s'adaptent ni aux préférences individuelles des opérateurs, ni aux spécificités de chaque scénario applicatif (chirurgie assistée, téléopération industrielle, exosquelettes, manipulation à distance). Pour les intégrateurs et concepteurs de systèmes à contrôle partagé, cela signifie potentiellement moins de temps de calibration terrain et une meilleure acceptabilité utilisateur, un facteur souvent négligé mais déterminant dans l'adoption réelle de ces interfaces. Le résultat conforte aussi une tendance plus large en robotique interactive: remplacer le réglage manuel de paramètres de contrôle par de l'apprentissage à partir de démonstrations éparses, une approche qui gagne du terrain face aux méthodes classiques de tuning expert. Le travail s'inscrit dans la lignée des recherches sur le contrôle partagé haptique et les CBF, deux domaines matures séparément mais rarement combinés de façon apprenante. Les CBF sont largement utilisés en robotique de sécurité (véhicules autonomes, manipulateurs collaboratifs) pour garantir formellement l'évitement de zones dangereuses, mais leurs paramètres restent généralement fixés à la main par des experts. En les rendant différentiables et ajustables par apprentissage, les auteurs ouvrent la voie à des systèmes de téléopération qui s'adaptent utilisateur par utilisateur. L'article, publié sur arXiv fin juillet 2026, ne précise pas de partenaire industriel ni de calendrier de déploiement au-delà des expériences en laboratoire, ce qui en fait pour l'instant un travail de recherche fondamentale plutôt qu'une solution prête à l'intégration.

RecherchePaper
1 source
Track-and-Complete : apprendre des compétences humanoïdes à partir d'une seule vidéo humaine ratée
4arXiv cs.RO 

Track-and-Complete : apprendre des compétences humanoïdes à partir d'une seule vidéo humaine ratée

Des chercheurs proposent TRACC (Track-and-Complete), un pipeline qui permet à un humanoïde d'apprendre une compétence à partir d'une seule vidéo d'humain en situation d'échec, sans aucune démonstration réussie. La méthode se déroule en deux temps. Elle imite d'abord la partie exploitable de la trajectoire, c'est-à-dire le préfixe de mouvement observé avant que la tentative ne tourne mal. Elle infère ensuite le résultat visé par la tâche, puis utilise une récompense d'accomplissement pour que la politique apprenne à finir le travail après le point de rupture. Le préfixe sert d'a priori jusqu'à l'échec, la récompense prend le relais ensuite. L'évaluation porte sur six tâches humaines « in the wild » en échec, tirées du jeu de données Oops!, une collection de vidéos amateurs de ratés. L'étude est publiée sur arXiv (2609.36924v1) et présente des résultats jugés positifs par les auteurs. Le résumé ne donne ni taux de réussite, ni comparaison chiffrée, ni précision sur le robot utilisé ou sur un éventuel transfert vers du matériel réel. L'intérêt tient au coût de la donnée. L'apprentissage de compétences humanoïdes par imitation vidéo suppose en général une démonstration réussie, souvent collectée sur mesure : téléopération, capture de mouvement ou scènes scriptées. Or le web regorge de tentatives ratées, que la robotique traite d'ordinaire comme de simples exemples négatifs. Si l'approche tient à plus grande échelle, un corpus jusque-là écarté devient une source de supervision, ce qui réduit le goulot d'étranglement des données que rencontrent les acteurs des politiques généralistes de type VLA. Une réserve s'impose toutefois. Six tâches sont un échantillon très mince, et la robustesse de l'inférence du but à partir d'une vidéo ambiguë reste à démontrer. Le résumé ne dit pas non plus si l'apprentissage se fait uniquement en simulation. La question du passage au réel, le fameux sim-to-real, n'est pas tranchée par ce texte. Ce travail s'inscrit dans un mouvement plus large de retargeting de mouvements humains vers des humanoïdes et d'apprentissage par renforcement guidé par vidéo, où la plupart des méthodes supposent des démonstrations propres. Les grands acteurs de la course humanoïde, de Figure à Tesla avec Optimus, en passant par les modèles fondation comme Pi-0 ou GR00T, misent surtout sur la téléopération et la simulation à grande échelle pour alimenter leurs politiques. TRACC propose une voie complémentaire, moins coûteuse en collecte, qui reste académique et sans produit ni déploiement annoncé. Les prochaines étapes à surveiller sont l'extension à davantage de tâches et de morphologies, la validation sur robot physique et la confrontation avec des méthodes exploitant des démonstrations réussies.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source