Aller au contenu principal
Vid2WAM : distiller les a priori de diffusion vidéo en modèles d'action du monde
IA physiquearXiv cs.RO 

Vid2WAM : distiller les a priori de diffusion vidéo en modèles d'action du monde

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Vid2WAM est un nouveau framework de distillation hors ligne pour l'apprentissage de politiques robotiques, décrit dans un preprint publie sur arXiv (arXiv:2608.08558v1). La méthode s'attaque a une limite connue des World Action Models (WAM), ces modèles qui prédisent conjointement la dynamique visuelle future et les actions d'un robot : leur dépendance a des démonstrations expertes couteuses a collecter, qui freine leur passage a l'échelle. Vid2WAM transféré les priors de diffusion vidéo d'un grand modèle fondation vidéo vers un WAM élevé compact, via deux canaux complémentaires. Le premier utilise des projections vidéo futures conditionnées par la tache pour superviser directement la branche de prédiction du modèle élevé. Le second passe par un modèle de dynamique inverse qui reconstruit des pseudo-actions spécifiques a l'embodiment du robot, utilisées pour l'apprentissage de la politique d'action. Une technique nommée "source-aware residual action adaptation" apprend des corrections propres a chaque source de supervision, synthétique ou réelle, autour d'un socle d'action partage, ce qui limite les interférences liées au bruit des pseudo-actions. A l'inférence, le modèle de diffusion vidéo enseignant et le modèle de dynamique inverse sont abandonnes : seul le WAM compact reste déployé, pour un traitement a faible latence. Les auteurs rapportent des expériences en simulation et sur robot réel.

Cette approche cible directement le goulot d'étranglement central des modèles VLA (vision-language-action) et des WAM : la rareté des données de démonstration expertes spécifiques a la tache cible. En s'appuyant sur des priors appris a partir de vidéo générique plutôt que sur des trajectoires robot annotées, Vid2WAM cherche a découpler la généralisation a de nouvelles taches du volume de téléopération collecte, un enjeu central pour tout intégrateur voulant déployer un bras ou un humanoïde sur une nouvelle tache sans campagne de collecte couteuse. Jeter le modèle enseignant et le modèle de dynamique inverse a l'inférence est notable : cela vise une politique légère et rapide, condition nécessaire pour du contrôle temps réel, la ou de nombreuses approches VLA a grande échelle restent limitées par la latence.

Ce travail s'inscrit dans la lignée des World Action Models et politiques VLA qui, comme GR00T N2 de NVIDIA, Pi-0 de Physical Intelligence ou Helix de Figure, exploitent des données vidéo ou multimodales a grande échelle pour réduire la dépendance a la téléopération. Contrairement a ces systèmes déjà testes chez des clients, Vid2WAM reste au stade de preprint de recherche : aucune institution n'est citée dans le résume, aucun partenariat industriel ni déploiement pilote n'est mentionne, et les chiffres de performance restent a vérifier via une publication complète ou une revue par les pairs. La suite logique serait une évaluation sur des benchmarks standardises et un passage a des modèles fondation vidéo plus grands pour tester les limites de la méthode.

À lire aussi

World Pilot : piloter les modèles VLA avec des a priori monde-action
1arXiv cs.RO 

World Pilot : piloter les modèles VLA avec des a priori monde-action

Une équipe de chercheurs a publié World Pilot (arXiv:2606.12403, juin 2026), un framework conçu pour combler une lacune structurelle des modèles Vision-Language-Action (VLA). Ces modèles, comme Pi-0 de Physical Intelligence ou RT-2 de Google Robotics, tirent leur force d'un préentraînement sur de vastes corpus image-texte, mais ce préentraînement s'appuie sur des paires statiques, alors que la manipulation robotique est un processus continu et riche en contacts dont la dynamique leur échappe. World Pilot introduit un World-Action Model (WAM) qui injecte deux types de priors dans la chaîne de décision : le Latent Steering conditionne la couche de perception sur un latent d'évolution de scène, et l'Action Steering fournit une trajectoire anticipée comme prior de mouvement au générateur d'actions. Sur le benchmark LIBERO-Plus en configuration zero-shot out-of-distribution (OOD), le système atteint 84,7 % de taux de succès global et affiche les meilleurs résultats sur quatre tâches de manipulation en environnement réel, avec des marges significatives lors de variations de point de vue, de géométrie d'objets, d'état déformable et de pose. L'intérêt principal de cette approche est de renforcer la robustesse des VLA face aux écarts de distribution sans réentraînement massif. Fait notable : le prior d'évolution de scène reste efficace même lorsqu'il provient d'un world model préentraîné sur vidéo uniquement, sans post-entraînement sur des données d'action, ce qui rend l'augmentation de VLA existants nettement plus accessible. Pour les équipes de déploiement industriel, cela signifie potentiellement moins de données de fine-tuning pour adapter un modèle à un contexte visuel inédit. Le benchmark zero-shot OOD reste l'un des indicateurs les plus exigeants du domaine, là où la majorité des politiques robotiques s'effondrent dès qu'elles sortent de leur distribution d'entraînement. World Pilot s'inscrit dans un courant actif qui vise à doter les politiques robotiques d'un modèle interne du monde, une direction explorée par DeepMind avec DreamerV3 et par Meta via l'architecture JEPA de Yann LeCun. Les VLA ont démontré des capacités de généralisation sémantique prometteuses, mais leur fragilité face aux variations physiques de l'environnement constituait un frein structurel au déploiement industriel. La question ouverte est de savoir si les marges observées sur LIBERO-Plus se maintiendront sur des benchmarks plus larges comme Open-X-Embodiment et sur des plateformes commerciales telles que les bras Franka Robotics ou Universal Robots, étapes nécessaires pour valider la portée industrielle de l'approche.

UESi les résultats se confirment sur Franka Robotics (allemand) et Universal Robots (danois), plateformes dominantes en Europe, cette approche pourrait réduire le coût d'adaptation des VLA aux lignes industrielles européennes sans données d'action supplémentaires.

💬 Le résultat qui compte vraiment, c'est pas les 84% sur le benchmark, c'est que le prior de scène fonctionne avec un world model entraîné sur vidéo uniquement, zéro donnée d'action. Ça veut dire qu'on peut augmenter un Pi-0 ou un RT-2 sans repartir en fine-tuning robotique de zéro, ce qui était le vrai blocage jusqu'ici. Reste à voir si ça tient sur un Franka en prod, mais c'est le genre de papier qu'on garde sous le coude.

IA physiqueOpinion
1 source
Le suivi de points améliore les modèles d'action du monde
2arXiv cs.RO 

Le suivi de points améliore les modèles d'action du monde

Des chercheurs ont publié sur arXiv (référence 2605.23856) JOPAT, un modèle monde-action conjoint qui combine prédiction visuelle au niveau pixel, suivi de points 2D avec gestion de la visibilité, et prédiction d'actions, le tout dans un unique transformeur de diffusion par débruitage. L'idée centrale est de ne pas se contenter de prédire l'apparence pixel à pixel, mais d'intégrer explicitement des trajectoires de points dans la scène, ce qui donne au modèle une représentation directe du mouvement plutôt qu'une reconstruction visuelle brute. Les évaluations portent sur deux environnements : le benchmark de simulation LIBERO, largement utilisé dans la communauté manipulation, et des tâches réelles via la plateforme open-source LeRobot d'Hugging Face. Sur ces deux environnements, JOPAT surpasse les baselines pixel-only, avec les gains les plus marqués sur les tâches à horizon long impliquant occlusions, interactions inter-objets, et mouvements partiellement hors cadre. L'apport technique concret est de résoudre un problème bien connu du robot learning : la prédiction pixel-level mélange dynamique du scène avec des facteurs parasites comme l'éclairage, la texture ou les reflets, ce qui rend les représentations apprises fragiles face à des variations visuelles sans lien avec la tâche. En introduisant des tracks 2D comme signal de supervision supplémentaire, JOPAT force le modèle à construire une représentation de mouvement explicite et stable, notamment en cas d'occultation partielle ou de sortie de champ. C'est un résultat notable pour les intégrateurs qui déploient des bras manipulateurs en environnement non contrôlé : si la robustesse aux variations visuelles se confirme hors labo, cela réduit le besoin de contrôle d'éclairage et de marqueurs artificiels, deux contraintes coûteuses en production. Le suivi de points comme signal de supervision intermédiaire s'inscrit dans une tendance plus large qui cherche à doter les politiques robotiques de représentations structurées plutôt que de tout apprendre depuis les pixels bruts. Des travaux récents comme Track2Act, ATM ou RoboTAP ont exploré des approches voisines ; JOPAT se distingue en intégrant cette supervision directement dans le cadre des world-action models diffusifs, un paradigme popularisé par des modèles comme UniSim ou GROOT de NVIDIA. La plateforme LeRobot, maintenue par Hugging Face, constitue ici le pont vers des expériences matérielles reproductibles avec des robots bas coût, ce qui accélère la validation hors simulation. Les prochaines étapes naturelles seront la généralisation à des manipulateurs à degrés de liberté élevés, la tenue à des changements de fond importants, et l'évaluation sur des séquences multi-étapes représentatives des usages industriels réels.

UELe recours à la plateforme LeRobot de Hugging Face (entreprise française) comme banc de test matériel reproductible consolide la position de l'écosystème français dans l'infrastructure de recherche en robot learning.

💬 Ce que j'aime dans l'approche, c'est que plutôt que d'essayer de mieux prédire les pixels (qui mélangent le mouvement utile avec l'éclairage, les reflets, tout le bruit), ils forcent le modèle à suivre des points dans la scène. C'est bête à dire mais c'est souvent une représentation intermédiaire bien choisie qui fait la différence en robotique. Si les gains se reproduisent hors labo, tu te retrouves avec moins de setup rigide, moins de marqueurs artificiels, et c'est pas rien quand tu déploies un bras en environnement réel.

IA physiqueOpinion
1 source
3arXiv cs.RO 

HarnessWAM : concilier prédiction et délibération dans les modèles vision-action du monde

HarnessWAM, un framework agentique décrit dans un preprint publié sur arXiv (identifiant 2608.09516), vise à combler ce que ses auteurs nomment le « prédiction-délibération gap » des World Action Models (WAM), ces modèles qui apprennent conjointement la dynamique de l'environnement et la génération d'actions robotiques. Le système ajoute un Task Manager basé sur un modèle vision-langage, chargé de maintenir une croyance de scène ancrée dans l'observation et un graphe de tâches, ainsi qu'une projection des plans en séquences de compétences atomiques compatibles avec les capacités du WAM sous-jacent. Une boucle de rétroaction à deux échelles temporelles associe un estimateur de progression haute fréquence à une délibération aux jalons clés, capable de réviser le plan ou de déclencher une récupération locale après l'échec d'une sous-tâche. Sur le benchmark RoboMemArena, HarnessWAM atteint 59,6% de réussite sur les tâches complètes, 69,9% sur les sous-tâches, et 23,7% sur RoboCerebra Ideal, des résultats présentés comme l'état de l'art. Ce travail cible un point de friction connu du secteur : les WAM actuels, entraînés à prédire et agir sur un horizon court, échouent sur des tâches longues exigeant planification globale, maintien d'état entre étapes et récupération après échec, soit le profil typique attendu d'un robot humanoïde en usine ou en entrepôt. En montrant qu'une couche de gestion d'état externe au modèle, couplée à une décision en boucle fermée, prolonge les capacités de contrôle local des WAM vers une exécution vérifiable et récupérable, l'étude suggère que le goulot d'étranglement des architectures VLA/WAM tient autant à l'orchestration cognitive qu'à la génération d'actions elle-même. Les gains restent toutefois mesurés sur des bancs d'essai spécifiques, sans validation annoncée sur robot physique en environnement industriel réel. HarnessWAM s'inscrit dans la lignée des modèles fondation pour la robotique de type VLA ou WAM, à l'image de GR00T N2, Pi-0 ou Helix, qui génèrent des actions à partir d'observations visuelles et de consignes en langage naturel mais restent structurellement limités à des horizons de prédiction courts. Le framework se présente comme une couche agentique complémentaire plutôt qu'un nouveau backbone, en principe transposable à d'autres WAM sous-jacents. La publication ne mentionne ni partenariat industriel, ni pilote de déploiement, ni acteur européen : il s'agit à ce stade d'une contribution académique évaluée en benchmark, dont la suite logique serait une validation sur plateformes robotiques réelles.

IA physiqueActu
1 source
MaskWAM : unification du masquage guidé et de la prédiction pour les modèles monde-action
4arXiv cs.RO 

MaskWAM : unification du masquage guidé et de la prédiction pour les modèles monde-action

Une équipe de chercheurs a soumis sur arXiv (référence 2606.13515) un modèle baptisé MaskWAM, visant à lever deux verrous structurels des World Action Models (WAMs) pour le contrôle robotique par prédiction vidéo. Les WAMs constituent une approche active : au lieu d'apprendre directement une politique motrice, le modèle prédit des frames vidéo futures conditionnées par les actions du robot et extrait la politique de cette représentation. Le problème identifié est double. Les entrées textuelles génèrent une ambiguïté référentielle dans les scènes encombrées : si deux objets similaires cohabitent dans le champ de la caméra, le texte ne suffit pas à désambiguïser la cible. Par ailleurs, les prédictions RGB brutes manquent d'ancrage sémantique et restent perturbées par des arrière-plans sans lien avec la tâche. MaskWAM intègre des masques de segmentation à la fois comme entrées explicites (premier frame annoté avec la cible) et comme sorties prédites, au sein d'une architecture unifiée Mixture of Transformers (MoT). L'apport central est l'introduction d'une supervision sémantique centrée sur l'objet : en forçant le modèle à prédire les masques futurs en parallèle des frames RGB, les auteurs réduisent l'influence du bruit visuel de fond sur la politique apprise. Évalué sur les benchmarks LIBERO et RoboTwin, ainsi que sur des tâches réelles non précisées en détail, MaskWAM surpasse significativement les baselines existantes en conditions de langage clair comme ambigu. Pour les équipes R&D en manipulation robotique, l'enjeu concret est la robustesse des politiques face aux variations de décor et aux instructions imprécises, deux points de friction récurrents dans le transfert du labo vers la ligne de production. Ces résultats restent toutefois ceux d'une prépublication académique sur benchmarks standardisés : aucun déploiement industriel n'est mentionné, et les conditions exactes des expérimentations réelles ne sont pas détaillées dans le résumé disponible. MaskWAM s'inscrit dans la dynamique des Visual Language Action models et des WAMs apparus depuis 2023, notamment Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et OpenVLA. Sa spécificité est l'exploitation systématique des masques de segmentation comme signal de supervision, là où la plupart des approches concurrentes restent ancrées sur du texte libre ou des images de référence non structurées. Les prochaines étapes prévisibles pour ce type de travaux sont l'évaluation sur des manipulations multi-objets en environnement non contrôlé et l'intégration dans des fondations robotiques plus larges. Aucun partenariat industriel ni calendrier de transfert applicatif ne sont mentionnés à ce stade.

IA physiqueOpinion
1 source