Aller au contenu principal
LD4WAM : apprendre les dynamiques latentes à partir de vidéos humaines pour des modèles d'action du monde
RecherchearXiv cs.RO 

LD4WAM : apprendre les dynamiques latentes à partir de vidéos humaines pour des modèles d'action du monde

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié en août 2026 sur arXiv un article présentant LD4WAM, une méthode pour entraîner des World Action Models à partir de vidéos humaines plutôt que de données de téléopération, coûteuses à collecter. Le système associe un Latent Dynamics Model, entraîné par reconstruction sémantique et alignement sur le mouvement réel, à un World Dynamics Action Model en mixture-of-transformers, qui génère des vidéos futures puis en extrait, via des requêtes apprenables, une dynamique latente conditionnant les actions du robot. Pré-entraîné sur un jeu de données unifié de plus de 5 000 heures de vidéos humaines et robotiques, le modèle affiche de bons résultats dans le simulateur RoboTwin et sur des robots réels équipés de pinces et de mains dexterisées, avec une généralisation à des objets et arrière-plans inédits.

L'enjeu dépasse la prouesse technique. La vidéo humaine est bien plus abondante et moins chère à collecter que les démonstrations téléopérées, mais son exploitation butait sur un dilemme entre prédiction vidéo pixel par pixel, riche mais non actionnable, et retargeting du mouvement vers le squelette du robot, actionnable mais marqué par un fossé visuel entre corps humain et robot. En proposant une dynamique latente alignée sur le mouvement, agnostique à l'embodiment, LD4WAM cherche à combler ce fossé, ce qui pourrait réduire la dépendance des laboratoires aux campagnes de téléopération pour entraîner des politiques de manipulation, un des principaux goulots d'étranglement du passage à l'échelle des modèles vision-langage-action.

Ce travail s'inscrit dans une vague de recherche plus large sur les modèles de monde en robotique, aux côtés d'efforts comme GR00T de NVIDIA, pi-0 de Physical Intelligence ou Helix de Figure, qui explorent aussi l'exploitation de données hétérogènes pour des politiques généralistes. LD4WAM se positionne explicitement contre les deux paradigmes qui l'ont précédé, prédiction vidéo pure et retargeting de mouvement. Il s'agit pour l'instant d'un article déposé sur arXiv, non encore relu par les pairs, sans code publié ni partenariat industriel annoncé, et les démonstrations réelles restent limitées au laboratoire, sans détail sur le taux de réussite.

À lire aussi

Apprentissage natif de prior d'action à partir de vidéos pour les modèles d'action du monde
1arXiv cs.RO 

Apprentissage natif de prior d'action à partir de vidéos pour les modèles d'action du monde

Des chercheurs publient sur arXiv (2610.03391) NAVA-WAM, un « world action model » (WAM) qui apprend une politique d'action directement à partir de vidéos sans annotation d'actions. Un WAM combine la prédiction de la dynamique visuelle future et celle des actions du robot. Jusqu'ici, ces modèles dépendaient de trajectoires robotiques annotées avec les actions, rares et coûteuses à collecter. NAVA-WAM s'entraîne en deux étapes. Le pré-entraînement porte sur des vidéos d'observation seule : une supervision par flow matching sur les transitions visuelles futures est propagée, via une attention jointe structurée par transitions, jusqu'à l'Action-DiT, le module de diffusion qui produit les actions. Celui-ci acquiert ainsi des « priors » d'action. La seconde étape affine l'Action-DiT sur des démonstrations étiquetées par un flow matching conjoint vidéo-action. Une attention asymétrique découple la branche visuelle du débruitage itératif des actions, ce qui permet une inférence rapide, limitée aux actions. Les auteurs affirment de meilleurs résultats que les approches antérieures, en distribution comme hors distribution, une bonne efficacité en nombre d'étiquettes d'action et une généralisation sur robot réel. Le résumé ne fournit ni score chiffré, ni liste de tâches, ni nom de plateforme robotique. L'enjeu est celui du goulot d'étranglement des données. Les modèles vision-langage-action (VLA) et leurs variantes à modèle de monde se heurtent au coût de la téléopération. Les vidéos humaines ou robotiques sans étiquettes, elles, existent en grande quantité. Les méthodes actuelles les exploitent par deux voies indirectes : pré-entraîner des représentations visuelles qu'il faut ensuite adapter au contrôle, ou inférer des « actions latentes » à ancrer ensuite sur des commandes robot. NAVA-WAM supprime ces intermédiaires, ce qui limiterait les pertes de transfert et la complexité d'un modèle d'action latente séparé. Si le résultat tient à grande échelle, le volume de données robotiques annotées nécessaires pour une nouvelle tâche ou un nouvel embodiment pourrait baisser. Un intégrateur pourrait alors réutiliser des vidéos de ses propres lignes. Prudence toutefois : il s'agit d'un preprint non évalué par des pairs. Les gains annoncés restent à confirmer par des benchmarks indépendants, avec des détails sur la quantité de vidéos et la diversité des tâches réelles testées. Ce travail s'inscrit dans la course aux WAM et aux politiques apprises de vidéo, face aux VLA entraînés sur démonstrations (Pi-0, GR00T) et aux approches par actions latentes. Les prochaines étapes à surveiller sont la publication du code et des poids, des évaluations sur des corpus vidéo plus larges, et une comparaison directe avec les modèles de fondation industriels. Les auteurs ne signalent aucun partenaire industriel ni déploiement.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
WALA : apprendre des actions latentes exécutables à partir de démonstrations étiquetées et de vidéos sans action
2arXiv cs.RO 

WALA : apprendre des actions latentes exécutables à partir de démonstrations étiquetées et de vidéos sans action

Des chercheurs présentent WALA (arXiv:2607.11397), un framework qui apprend des actions latentes exécutables à partir de deux types de données distincts : des démonstrations robotiques annotées d'actions et de simples vidéos sans annotation d'action. Le problème visé est bien connu du secteur : les démonstrations robotiques étiquetées coûtent cher à collecter et passent mal à l'échelle, alors que les vidéos humaines et robotiques disponibles en masse restent inexploitables faute d'étiquettes d'action exécutables. WALA fonctionne en deux temps. D'abord, un pré-entraînement d'un modèle d'action latente sémantique-géométrique sur des vidéos, en modélisant l'évolution entre l'observation courante et des observations futures échantillonnées de façon éparse. Plutôt que de reconstruire les pixels bruts, le système prédit les deltas futurs dans l'espace de features DINOv3 et dans l'espace de profondeur dense, ce qui conserve la structure sémantique et géométrique utile à la tâche tout en réduisant la sensibilité aux détails d'apparence. Lors de l'entraînement de la politique, l'encodeur pré-entraîné fournit des cibles d'action latente stables, et le décodeur sert de modèle du monde latent entraînable, avec une supervision conjointe par prédiction d'action robotique, correspondance de cible d'action latente et prédiction de dynamique future. Résultat annoncé : un nouveau record sur RoboCasa avec 75,2% de taux de réussite moyen, ainsi que de bonnes performances sur RoboTwin et en manipulation réelle. L'enjeu pour l'industrie robotique tient moins à la performance brute qu'à la promesse de découplage entre données d'entraînement et coût d'annotation. Si une politique VLA peut effectivement tirer une supervision de dynamique utile de vidéos non annotées, cela ouvre la voie à des jeux de données d'entraînement bien plus vastes sans multiplier les campagnes de téléopération robotique, un goulot d'étranglement connu pour tout intégrateur ou labo qui cherche à généraliser au-delà d'un jeu de tâches restreint. Cela dit, il s'agit d'un résultat de recherche publié sur arXiv, pas d'un produit déployé : les métriques de succès sur RoboCasa et RoboTwin sont des benchmarks de simulation ou semi-contrôlés, et la mention de "manipulation réelle" reste peu détaillée dans l'abstract, sans précision sur le nombre de tâches, le taux de réussite exact en conditions réelles ni le hardware utilisé. Le travail s'inscrit dans la lignée des architectures vision-langage-action (VLA) comme Pi-0 ou GR00T N2, qui cherchent à unifier perception, langage et contrôle moteur dans un même backbone, et dans la tendance plus large des "world models" latents pour la robotique, où l'usage de features pré-entraînées (ici DINOv3) remplace la reconstruction pixel pour la supervision. Aucun acteur français ou européen n'est mentionné dans cet abstract. Les suites logiques incluraient une publication complète avec code et poids, ainsi que des tests de généralisation croisée entre familles de robots, un point sur lequel l'abstract reste volontairement vague.

RechercheActu
1 source
L'apprentissage de la manipulation dextérique à partir de vidéos humaines du quotidien
3arXiv cs.RO 

L'apprentissage de la manipulation dextérique à partir de vidéos humaines du quotidien

Des chercheurs ont mis en ligne sur arXiv en juin 2026 un algorithme nommé DO AS I DO, conçu pour extraire automatiquement des trajectoires de manipulation dextère à partir de vidéos RGB monoculaires filmant des mains humaines en action. Le pipeline reconstruit les interactions main-objet depuis des vidéos égocentriques (caméra portée par l'opérateur) ou exocentriques (caméra tierce), captées en conditions réelles et sans capteurs de profondeur ni marqueurs, puis effectue un retargeting de ces estimations vers des mains robotiques multi-doigts pour produire des séquences d'actions directement exécutables sur robot physique. Selon les évaluations conduites sur plusieurs jeux de données annotés ainsi que sur des clips collectés en ligne, DO AS I DO dépasse l'état de l'art précédent en précision d'estimation des interactions main-objet et en qualité des trajectoires extraites. L'enjeu est structurel : la collecte de données de manipulation reste le principal goulot d'étranglement pour entraîner des robots dextères. La téléopération est lente et coûteuse, la simulation difficile à transférer en conditions réelles sur des mains à 16 DOF ou plus, un phénomène connu sous le nom de sim-to-real gap. DO AS I DO propose une troisième voie en exploitant des vidéos déjà disponibles en ligne comme source de supervision passive, sans infrastructure dédiée. Pour les équipes R&D travaillant sur des manipulateurs multi-doigts, cela pourrait réduire significativement le coût de collecte de démonstrations. Les auteurs publient également un "efficacy playbook", soit un ensemble de recommandations pratiques destinées aux équipes terrain. Le point critique reste la fidélité du retargeting : le fossé cinématique entre les 21 degrés de liberté d'une main humaine et l'anatomie d'un effecteur robotique introduit des approximations que le papier reconnaît sans les quantifier de façon exhaustive. La manipulation dextère demeure l'un des problèmes les moins résolus de la robotique humanoïde commerciale. Physical Intelligence avec Pi-0, Figure AI avec Figure 03 et NVIDIA avec GR00T N2 investissent massivement dans des pipelines de données alternatifs, notamment la génération en simulation via DexMimicGen ou la téléopération structurée à grande échelle comme DROID et ALOHA 2. DO AS I DO se distingue en ciblant directement l'embodiment gap sans recourir à de l'infrastructure de capture spécialisée, en valorisant des vidéos grand public. Ce preprint ne mentionne aucun déploiement industriel ni partenariat commercial ; il s'agit d'une contribution académique, pas d'un produit prêt à l'emploi. L'étape naturelle sera de mesurer si ces trajectoires retargetées alimentent efficacement l'entraînement de modèles VLA à l'échelle, la question ouverte centrale de la robotique de manipulation en 2026.

RecherchePaper
1 source
Zero-WAM : modélisation monde-action en contexte à partir de vidéos humaines pour la généralisation de tâches ouvertes
4arXiv cs.RO 

Zero-WAM : modélisation monde-action en contexte à partir de vidéos humaines pour la généralisation de tâches ouvertes

Des chercheurs présentent Zero-WAM, un modèle causal vidéo-action qui exécute des tâches de manipulation robotique inédites en suivant une simple vidéo humaine donnée en contexte, sans réentraînement, sur le principe de l'apprentissage en contexte des grands modèles de langage. Pour pallier le manque de données appariées humain-robot, ils ont construit un pipeline automatique générant HumanGen, 74 200 paires vidéo sur 8 600 tâches, avec un nouvel objectif d'entraînement dit IFP (prédiction de segments futurs en contexte). Sur sept tâches inédites du simulateur RoboTwin 2.0, le modèle atteint 47,0% de réussite, soit +29,5 points face à la meilleure base vidéo-action comparée, et des essais réels montrent une généralisation à des scènes multi-objets et à des insertions fines. L'article, publié sur arXiv (2608.26103), reste une contribution académique sans produit ni partenaire industriel annoncé. L'enjeu dépasse la performance brute : la plupart des modèles vision-langage-action doivent être réentraînés ou finement ajustés pour chaque nouvelle tâche, ce qui alourdit les coûts d'intégration industrielle. En montrant qu'une vidéo de démonstration peut servir de consigne à la volée, Zero-WAM propose une alternative au conditionnement par le langage utilisé par des approches comme Pi-0 ou GR00T N2, et suggère une piste pour réduire la dépendance aux collectes de démonstrations spécifiques par tâche. Le résultat mérite toutefois d'être nuancé : un taux de réussite de 47% reste modeste en absolu, et l'essentiel de la validation chiffrée se fait en simulation, les essais réels n'étant pas quantifiés dans l'abstract. L'apprentissage en contexte, popularisé par les grands modèles de langage généralistes, se heurtait en robotique à la rareté de vidéos humaines et robotiques appariées, problème que ce travail attaque via son pipeline HumanGen. Il se positionne face à l'écosystème des modèles vision-langage-action généralistes tels Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, qui misent davantage sur le langage que sur la vidéo comme consigne. Aucun acteur français ou européen n'apparaît dans cette publication, et les auteurs ne fournissent ni pilote industriel ni feuille de route de commercialisation.

RecherchePaper
1 source