VioLA : apprendre des politiques de contrôle humanoïde généralistes à partir de données humaines
VioLA, un travail déposé sur arXiv (2610.12435), propose une politique généraliste pour humanoïdes qui ne prédit plus des commandes articulaires mais des « latents » de mouvement du corps et des mains. Un contrôleur de corps et un contrôleur de mains, pré-entraînés, exécutent ensuite ces latents sur le robot. Des encodeurs de mouvement projettent les mouvements humains et robotiques dans les mêmes espaces latents. Un enregistrement humain se retrouve donc étiqueté directement dans l'espace d'action de la politique. Le pool de démonstrations atteint 140,6 millions de trames, dont 93,2 % sont d'origine humaine. Sur robot réel, VioLA suit des consignes de locomotion en zero-shot, sans réglage fin par tâche, avec 100 % de réussite. GR00T N1.7 plafonne à 16,7 % et Ψ₀ à 0 %. En manipulation, la politique atteint 88,6 % de réussite, toujours sans réglage fin spécifique. La méthode a été testée sur trois architectures : deux VLA (vision-langage-action) et un modèle monde-action. Le code et les checkpoints doivent être publiés, mais ils ne le sont pas encore.
L'enjeu est la rareté des données. Les politiques généralistes actuelles pour humanoïdes exigent un réglage fin sur des démonstrations téléopérées de chaque tâche avant déploiement, ce qui est lent et coûteux. Ici, une politique entraînée uniquement sur des démonstrations humaines réalise des tâches de locomotion en zero-shot sur le robot réel. Cela suggère que l'on peut contourner le goulot d'étranglement de la téléopération en passant par une représentation intermédiaire partagée entre humain et robot. Les cadres d'intégration y gagneraient : des vidéos et des captures de mouvement, bien plus abondantes, pourraient alimenter l'entraînement. Le fait que l'approche fonctionne sur trois backbones différents laisse penser que le gain vient de l'espace d'action, pas d'un modèle particulier. Quelques réserves s'imposent. Le papier est un preprint non évalué par les pairs. Les protocoles de test (nombre d'essais, diversité des consignes, robot utilisé) ne sont pas détaillés dans le résumé. Le score de 100 % en locomotion porte probablement sur un jeu de consignes restreint, et le résultat de 88,6 % en manipulation n'est accompagné d'aucune comparaison de référence.
VioLA s'inscrit dans la course aux modèles fondation pour humanoïdes. GR00T de NVIDIA, Helix de Figure et la famille Pi de Physical Intelligence reposent surtout sur de la téléopération, de la simulation ou des mélanges de données, avec un réglage fin par tâche. L'idée de contrôleurs de bas niveau entraînés en simulation puis pilotés par un espace latent de mouvement prolonge les travaux sur le suivi de mouvement humain en humanoïde, où le contrôle du corps entier et des doigts restait un point dur. Les auteurs ne donnent aucun calendrier de diffusion hors de la promesse de publication du code. La suite à surveiller sera la reproduction indépendante des résultats sur d'autres plateformes, et l'extension à des tâches de manipulation à longue portée, pour savoir si le passage par les latents tient hors du laboratoire.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




