Aller au contenu principal
RecherchearXiv cs.RO 

Apprentissage natif de prior d'action à partir de vidéos pour les modèles d'action du monde

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.03391) NAVA-WAM, un « world action model » (WAM) qui apprend une politique d'action directement à partir de vidéos sans annotation d'actions. Un WAM combine la prédiction de la dynamique visuelle future et celle des actions du robot. Jusqu'ici, ces modèles dépendaient de trajectoires robotiques annotées avec les actions, rares et coûteuses à collecter. NAVA-WAM s'entraîne en deux étapes. Le pré-entraînement porte sur des vidéos d'observation seule : une supervision par flow matching sur les transitions visuelles futures est propagée, via une attention jointe structurée par transitions, jusqu'à l'Action-DiT, le module de diffusion qui produit les actions. Celui-ci acquiert ainsi des « priors » d'action. La seconde étape affine l'Action-DiT sur des démonstrations étiquetées par un flow matching conjoint vidéo-action. Une attention asymétrique découple la branche visuelle du débruitage itératif des actions, ce qui permet une inférence rapide, limitée aux actions. Les auteurs affirment de meilleurs résultats que les approches antérieures, en distribution comme hors distribution, une bonne efficacité en nombre d'étiquettes d'action et une généralisation sur robot réel. Le résumé ne fournit ni score chiffré, ni liste de tâches, ni nom de plateforme robotique.

L'enjeu est celui du goulot d'étranglement des données. Les modèles vision-langage-action (VLA) et leurs variantes à modèle de monde se heurtent au coût de la téléopération. Les vidéos humaines ou robotiques sans étiquettes, elles, existent en grande quantité. Les méthodes actuelles les exploitent par deux voies indirectes : pré-entraîner des représentations visuelles qu'il faut ensuite adapter au contrôle, ou inférer des « actions latentes » à ancrer ensuite sur des commandes robot. NAVA-WAM supprime ces intermédiaires, ce qui limiterait les pertes de transfert et la complexité d'un modèle d'action latente séparé. Si le résultat tient à grande échelle, le volume de données robotiques annotées nécessaires pour une nouvelle tâche ou un nouvel embodiment pourrait baisser. Un intégrateur pourrait alors réutiliser des vidéos de ses propres lignes. Prudence toutefois : il s'agit d'un preprint non évalué par des pairs. Les gains annoncés restent à confirmer par des benchmarks indépendants, avec des détails sur la quantité de vidéos et la diversité des tâches réelles testées.

Ce travail s'inscrit dans la course aux WAM et aux politiques apprises de vidéo, face aux VLA entraînés sur démonstrations (Pi-0, GR00T) et aux approches par actions latentes. Les prochaines étapes à surveiller sont la publication du code et des poids, des évaluations sur des corpus vidéo plus larges, et une comparaison directe avec les modèles de fondation industriels. Les auteurs ne signalent aucun partenaire industriel ni déploiement.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

LD4WAM : apprendre les dynamiques latentes à partir de vidéos humaines pour des modèles d'action du monde
1arXiv cs.RO 

LD4WAM : apprendre les dynamiques latentes à partir de vidéos humaines pour des modèles d'action du monde

Des chercheurs ont publié en août 2026 sur arXiv un article présentant LD4WAM, une méthode pour entraîner des World Action Models à partir de vidéos humaines plutôt que de données de téléopération, coûteuses à collecter. Le système associe un Latent Dynamics Model, entraîné par reconstruction sémantique et alignement sur le mouvement réel, à un World Dynamics Action Model en mixture-of-transformers, qui génère des vidéos futures puis en extrait, via des requêtes apprenables, une dynamique latente conditionnant les actions du robot. Pré-entraîné sur un jeu de données unifié de plus de 5 000 heures de vidéos humaines et robotiques, le modèle affiche de bons résultats dans le simulateur RoboTwin et sur des robots réels équipés de pinces et de mains dexterisées, avec une généralisation à des objets et arrière-plans inédits. L'enjeu dépasse la prouesse technique. La vidéo humaine est bien plus abondante et moins chère à collecter que les démonstrations téléopérées, mais son exploitation butait sur un dilemme entre prédiction vidéo pixel par pixel, riche mais non actionnable, et retargeting du mouvement vers le squelette du robot, actionnable mais marqué par un fossé visuel entre corps humain et robot. En proposant une dynamique latente alignée sur le mouvement, agnostique à l'embodiment, LD4WAM cherche à combler ce fossé, ce qui pourrait réduire la dépendance des laboratoires aux campagnes de téléopération pour entraîner des politiques de manipulation, un des principaux goulots d'étranglement du passage à l'échelle des modèles vision-langage-action. Ce travail s'inscrit dans une vague de recherche plus large sur les modèles de monde en robotique, aux côtés d'efforts comme GR00T de NVIDIA, pi-0 de Physical Intelligence ou Helix de Figure, qui explorent aussi l'exploitation de données hétérogènes pour des politiques généralistes. LD4WAM se positionne explicitement contre les deux paradigmes qui l'ont précédé, prédiction vidéo pure et retargeting de mouvement. Il s'agit pour l'instant d'un article déposé sur arXiv, non encore relu par les pairs, sans code publié ni partenariat industriel annoncé, et les démonstrations réelles restent limitées au laboratoire, sans détail sur le taux de réussite.

RecherchePaper
1 source
ConfAL-WM : apprentissage actif guidé par la confiance pour les modèles du monde conditionnés par l'action
2arXiv cs.RO 

ConfAL-WM : apprentissage actif guidé par la confiance pour les modèles du monde conditionnés par l'action

Une équipe de recherche publie ConfAL-WM, un framework d'apprentissage actif guidé par la confiance pour le post-entraînement de world models conditionnés par l'action, utilisés en robotique pour la prédiction, la planification et la génération de données synthétiques. Décrit dans un preprint arXiv (2608.25572v1) daté d'août 2026, le système s'appuie sur EVAC, un world model existant, auquel les chercheurs greffent une sonde de confiance légère branchée sur les features du décodeur UNet. Cette sonde produit des cartes de confiance denses dans l'espace latent, ensuite agrégées à trois niveaux : tâche, frame et patch. Le pipeline complet fonctionne en trois étapes : réentraînement de la sonde et préchauffage d'EVAC sur un petit sous-ensemble de données du domaine cible, présélection au niveau tâche pour répartir le budget d'échantillonnage, puis réentraînement ciblé avec pondération optionnelle au niveau frame ou patch. Les expériences ont été menées sur le benchmark RoboTwin2.0, avec une page de démonstration visuelle disponible sur ConfAL-WM.github.io. L'intérêt de ce travail tient au problème qu'il cible : dans les world models embarqués, les erreurs de prédiction ne se répartissent pas uniformément mais se concentrent sur des zones précises, bras robotique, objets manipulés, points de contact, zones occluses. Entraîner ou réadapter ces modèles de façon uniforme gaspille donc du calcul et des données d'annotation. Une sélection guidée par la confiance promet de réduire le coût d'adaptation d'un world model à un nouveau domaine ou une nouvelle tâche, un enjeu direct pour les laboratoires qui développent des modèles de type VLA (vision-langage-action) à grande échelle, où le post-entraînement sur données cibles reste coûteux. Les auteurs affirment que leur pondération dense par frame et patch surpasse des méthodes de scoring plus classiques, basées sur une récompense scalaire, une mesure de progrès ou un jugement automatique. Ce travail s'inscrit dans la dynamique plus large des world models conditionnés par l'action comme brique fondamentale pour la planification robotique et la génération de données synthétiques, aux côtés d'approches comme Pi-0 ou GR00T N2. Il ne s'agit toutefois pas d'un produit commercial ni d'un déploiement industriel : c'est une contribution de recherche publiée sur arXiv, sans partenaire industriel ni acteur français ou européen mentionné, dont l'impact réel dépendra de sa reproduction et de son adoption par d'autres laboratoires.

RecherchePaper
1 source
CLAM : modèles d'action latente continue pour l'apprentissage robotique à partir de démonstrations non étiquetées
3arXiv cs.RO 

CLAM : modèles d'action latente continue pour l'apprentissage robotique à partir de démonstrations non étiquetées

Un nouveau papier arXiv (2505.04999v2, version révisée) présente CLAM, pour Continuous Latent Action Models, une méthode d'apprentissage de politiques de contrôle robotique qui se passe des démonstrations à actions étiquetées, coûteuses à collecter en téléopération. Le principe : à partir de simples séquences d'observations (sans étiquette d'action), un modèle infère des actions latentes continues entre deux images consécutives via une prédiction de dynamique auto-supervisée. Pour transformer ces actions latentes en commandes moteur réellement exécutables, les chercheurs entraînent conjointement un décodeur d'actions sur un petit volume de données dites "de jeu" (play data), c'est-à-dire des interactions non ciblées sur une tâche précise mais qui, elles, comportent des actions étiquetées. Les tests couvrent la locomotion sur DMControl, la manipulation sur MetaWorld, et des tâches réelles sur un bras robotique WidowX. Résultat annoncé : un taux de réussite moyen multiplié par 2 à 3 par rapport aux précédentes méthodes à actions latentes, avec des performances qui se rapprochent du behavior cloning entraîné sur des actions expertes complètes, la référence "privilégiée" du domaine. L'enjeu dépasse la seule performance technique : le goulot d'étranglement de l'apprentissage par imitation reste la collecte de démonstrations étiquetées, un processus lent et onéreux en téléopération. Si des politiques efficaces peuvent être apprises depuis de simples vidéos ou séquences d'observations, cela ouvre la voie à des jeux de données bien plus larges et moins chers à constituer, en combinant une masse de démonstrations non étiquetées avec un minimum de données annotées. Il faut toutefois noter que la validation reste majoritairement en simulation, avec un unique bras WidowX pour la partie matérielle réelle : il s'agit d'une preuve de concept académique, pas d'un déploiement industriel à l'échelle. CLAM s'inscrit dans la lignée des travaux sur les modèles d'action latente et de monde pour la robotique, qu'il cherche explicitement à surpasser en tant que base de comparaison. Il se distingue de l'approche dominante des modèles vision-langage-action comme Pi-0 ou GR00T N2, qui reposent sur de vastes corpus d'actions étiquetées. Code et vidéos sont publiés sur clamrobot.github.io, laissant la porte ouverte à des reproductions et extensions par la communauté.

RecherchePaper
1 source
Apprentissage d'a priori géométriques 4D pour des modèles d'action du monde efficaces en inférence
4arXiv cs.RO 

Apprentissage d'a priori géométriques 4D pour des modèles d'action du monde efficaces en inférence

Des chercheurs publient MECo-WAM (Multi-Expert Co-Training World Action Model), une nouvelle architecture de "World Action Model" (WAM) conçue pour la manipulation robotique, décrite dans un papier référence arXiv:2607.05468v1. L'idée est d'injecter des a priori géométriques 4D dans les représentations vidéo-action pendant l'entrainement, sans alourdir le graphe d'inférence au moment du déploiement. Le système combine trois experts durant l'entrainement : un expert vidéo, un expert action, et un expert 4D léger supervise par des cibles relationnelles issues d'un encodeur VGGT gelé. Une visibilité asymétrique entre experts empêche les raccourcis non causaux entre géométrie auxiliaire et génération d'actions. Deux mécanismes assurent le transfert des connaissances géométriques vers le chemin vidéo-action réellement déployé : une attention a masque de lecture 4D a décroissance progressive, qui fournit un guidage géométrique restreint en début d'entrainement puis le retire par étapes, et une distillation géométrique temporelle orientée action, qui aligne les relations géométriques intra-image et leur évolution en priorisant les zones visuelles pertinentes pour l'action du robot. Au déploiement, tous les composants 4D auxiliaires sont supprimes. Sur les benchmarks LIBERO et RoboTwin 2.0, le modèle atteint respectivement 98,2% et 92,6% de réussite, avec des gains confirmes sur des taches de manipulation réelles. Ce travail cible une limite connue des WAMs actuels : l'entrainement conjoint vidéo-action optimise généralement des latents orientes apparence, qui capturent mal la géométrie évolutive nécessaire a une manipulation précise. En montrant qu'un gain de précision est possible sans surcout d'inférence, MECo-WAM répond a une tension centrale pour les intégrateurs et les équipes de recherche appliquée : les modèles VLA (vision-language-action) les plus performants deviennent souvent trop lourds pour un déploiement temps réel embarque. La méthode illustre une tendance de fond dans la recherche en manipulation robotique, celle de déporter la complexité géométrique et multimodale vers la phase d'entrainement pour ne conserver au runtime qu'un pipeline léger, une piste directement pertinente pour les fabricants de bras robotiques et de systèmes AMR qui cherchent a industrialiser des politiques apprises. MECo-WAM s'inscrit dans la lignée des World Action Models qui cherchent a unifier prédiction vidéo future et génération de séquences d'actions exécutables, une approche déjà explorée par des architectures VLA comme Pi-0 ou GR00T N2. La référence a VGGT, encodeur de géométrie 4D reconnu en vision par ordinateur, situe le papier a l'intersection de la reconstruction 3D/4D et de l'apprentissage de politiques robotiques. Les auteurs évaluent leur approche sur deux benchmarks de simulation standards, LIBERO et RoboTwin 2.0, ainsi que sur des taches réelles, mais ne donnent pour l'instant aucun calendrier de déploiement industriel ni de partenariat avec des intégrateurs : le travail reste, a ce stade, une contribution de recherche publiée sur arXiv.

RecherchePaper
1 source