Apprentissage d'actions du monde par guidage latent spectral centré sur l'interaction
Des chercheurs publient sur arXiv WING (World Action Learning via INteraction-Centric Spectral Latent Guidance), un cadre qui transfère des connaissances d'interaction depuis des vidéos égocentriques humaines vers des politiques de manipulation robotique. Il s'attaque à deux obstacles. D'une part, les actions latentes inférées par reconstruction d'images sont polluées par des variations parasites, au premier rang desquelles le mouvement de la caméra portée. WING sépare donc le mouvement induit par l'observateur de l'interaction main-objet, et ne distille que cette seconde composante en actions latentes. D'autre part, humains et robots n'ont pas la même dynamique temporelle. Le système identifie alors, dans le domaine spectral, les composantes basses fréquences communes aux actions latentes égocentriques et aux comportements du robot, puis s'en sert pour guider la génération d'actions. Les auteurs annoncent 99,20 % de réussite moyenne sur LIBERO, 93,80 % sur RoboTwin 2.0 et 57,7 % sur RoboCasa-GR1, ainsi que de bons résultats sur quatre tâches réelles, sans en détailler les chiffres dans le résumé.
L'intérêt tient à l'hypothèse de départ : la sémantique d'une tâche, commune à l'humain et au robot, se loge dans les structures temporelles lentes, alors que la haute fréquence dépend du corps. Si elle se confirme, la vidéo humaine, abondante et peu chère, deviendrait un substitut crédible aux démonstrations téléopérées, dont le coût freine la montée en échelle. Il faut toutefois relativiser. LIBERO approche la saturation, et RoboCasa-GR1, à 57,7 %, rappelle l'écart qui subsiste en simulation sur des tâches plus longues et plus variées. Les résultats réels, sur seulement quatre tâches, ne permettent pas de conclure sur la robustesse en production. Il s'agit d'un article de recherche, sans produit, ni déploiement, ni calendrier.
WING s'inscrit dans la lignée des modèles d'actions latentes, comme LAPA, ou des approches qui exploitent la vidéo humaine pour entraîner des modèles vision-langage-action de type Pi-0 ou GR00T. Tous butent sur le même problème de transfert entre embodiments. La nouveauté ici est le filtrage fréquentiel. La suite logique serait une comparaison directe avec ces références sur des tâches réelles plus nombreuses, avec des chiffres détaillés. Une page projet est disponible pour suivre les démonstrations et, éventuellement, le code.
Dans nos dossiers



