Aller au contenu principal
IA physiquearXiv cs.RO 

Video Prediction Policy 2 : mieux prédire pour mieux agir

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Video Prediction Policy 2 (VPP2) est une nouvelle politique robotique de type « world action model » (WAM), décrite dans un preprint arXiv (2610.10270v1). Ces modèles cherchent à transférer les connaissances acquises par les modèles de prédiction vidéo vers l'apprentissage d'actions. Les auteurs constatent que les WAM existants produisent souvent des prédictions de mouvement erronées en environnement ouvert, ce qui entraîne des actions fausses. Ils l'expliquent par deux causes : les modèles vidéo de base ne sont pas optimisés pour la manipulation, et l'ajout naïf de composantes d'action à un modèle vidéo dégrade nettement sa capacité de généralisation. VPP2 procède en trois étapes. D'abord, un grand jeu de données varié de vidéos de manipulation, annotées avec des légendes détaillées, sert à poursuivre le pré-entraînement du modèle vidéo fondation, avec une approche dite « au niveau de l'événement ». Ensuite, ce modèle est post-entraîné puis distillé en un planificateur visuel en une seule étape, à horizon de prédiction fixe. Enfin, un module d'action, bâti sur une architecture mixture-of-transformers (MoT), apprend un modèle de dynamique inverse implicite.

Sur le plan des résultats, la version VPP2-14B (14 milliards de paramètres) dépasse Cosmos3-64B de 11,0 points de pourcentage en taux de réussite du suivi d'instruction en prédiction vidéo, sur des tâches ouvertes. Sur des tâches réelles de manipulation en zero-shot avec un robot ALOHA, VPP2 devance la meilleure référence de 18,5 points. Après un post-entraînement spécifique à chaque benchmark, il obtient les meilleurs taux de succès parmi les méthodes évaluées sur LIBERO-Pro, LIBERO-OOD et RoboDojo. Il s'agit de résultats de laboratoire issus d'un preprint non évalué par les pairs : les auteurs ne précisent pas, dans le résumé, le nombre d'essais, la nature des tâches ALOHA ni la taille des baselines hors Cosmos3. Aucun déploiement industriel n'est annoncé.

L'intérêt tient d'abord au diagnostic : la qualité de la prédiction vidéo conditionne directement celle de l'action. Le résultat suggère qu'un modèle de 14 milliards de paramètres, spécialisé par des données de manipulation, peut battre un modèle généraliste quatre fois plus gros, ce qui compte pour les équipes qui doivent faire tourner ces politiques sur du matériel embarqué. La distillation en une seule étape va dans le même sens, puisqu'elle réduit le coût d'inférence, un frein classique des approches fondées sur la diffusion vidéo. Pour les intégrateurs, le point à surveiller reste l'écart entre benchmarks et usage réel : LIBERO et ses variantes sont des environnements de simulation, et le seul test physique rapporté repose sur ALOHA, plateforme bimanuelle de recherche.

Ce travail prolonge la lignée Video Prediction Policy, qui utilisait déjà des modèles de diffusion vidéo pré-entraînés comme représentation pour piloter des politiques d'action. Il s'inscrit dans la course aux modèles du monde et aux VLA (vision-langage-action), face notamment aux approches de la famille Cosmos de NVIDIA, citée ici comme point de comparaison, et à d'autres politiques généralistes telles que Pi-0 ou GR00T. La suite dépendra de la publication éventuelle du code et des poids, de réplications indépendantes, et de tests sur des robots et des tâches industrielles au-delà des benchmarks académiques.

À lire aussi

Latent Reasoning VLA : pensée latente et prédiction pour les modèles vision-langage-action
1arXiv cs.RO 

Latent Reasoning VLA : pensée latente et prédiction pour les modèles vision-langage-action

Une équipe de chercheurs a publié sur arXiv (arXiv:2602.01166) LaRA-VLA, un nouveau cadre de modèles Vision-Language-Action (VLA) qui internalise le raisonnement multi-modal directement dans un espace latent continu, plutôt que de générer explicitement des chaînes de pensée textuelles (chain-of-thought, CoT) à l'inférence. Concrètement, là où les VLA actuels produisent des tokens de raisonnement discrets avant chaque décision motrice, LaRA-VLA effectue raisonnement et prédiction d'action dans un même espace latent, sans étape de génération textuelle intermédiaire. Les auteurs rapportent une réduction de la latence d'inférence pouvant atteindre 90 % par rapport aux approches CoT explicites, tout en surpassant les méthodes VLA de référence sur des benchmarks en simulation et sur des tâches de manipulation réelle à longue portée. Deux jeux de données CoT structurés ont été construits pour l'entraînement. L'entraînement suit un curriculum progressif : supervision d'abord textuelle et visuelle, puis transition vers un raisonnement purement latent, avant adaptation de ces dynamiques latentes au conditionnement de la génération d'actions. Ce résultat est significatif pour les intégrateurs et décideurs industriels parce qu'il s'attaque directement au principal goulot d'étranglement des VLA raisonnants : le coût computationnel du CoT à l'inférence rendait ces modèles inutilisables en temps réel sur du matériel embarqué. Un gain de 90 % de latence sans dégradation de performance change le rapport entre qualité de raisonnement et contrainte temps-réel, rendant crédible le déploiement de politiques robotiques expressives sur des bras industriels ou des humanoïdes sans serveur dédié au raisonnement. Cela contredit partiellement l'hypothèse que le raisonnement symbolique explicite est nécessaire pour gérer des tâches longues et multi-étapes. Les VLA, popularisés par des travaux comme RT-2 (Google DeepMind, 2023) puis Pi-0 (Physical Intelligence, 2024) et GR00T N2 (NVIDIA, 2025), cherchent à combiner compréhension sémantique et contrôle moteur dans un seul modèle. La tension entre performance de raisonnement et latence d'inférence est un sujet actif : d'autres approches comme les modèles de diffusion d'actions (Pi-0) contournent le problème différemment. LaRA-VLA propose une troisième voie, en fusionnant les deux flux dans l'espace latent. Le code et la page projet sont disponibles publiquement ; les prochaines étapes attendues sont des évaluations sur robots humanoïdes et des tests de robustesse hors distribution, domaines où le gap simulation-réalité reste le critère déterminant pour une adoption industrielle.

UECette réduction de latence d'inférence de 90 % ouvre la voie au déploiement de politiques VLA expressives sur du matériel embarqué, ce qui pourrait bénéficier aux équipes R&D et intégrateurs européens travaillant sur des bras industriels ou des humanoïdes sans infrastructure de calcul dédiée.

💬 90 % de latence en moins sur les VLA, c'est le genre de résultat qu'on attendait pour débloquer l'embarqué. Passer le raisonnement dans l'espace latent plutôt que de cracher des tokens CoT, c'est élégant, et les benchmarks semblent tenir. Reste le gap simulation-réalité, qui est toujours l'épreuve de vérité, et là aucun papier arXiv ne peut te garantir grand chose avant les tests sur du vrai matériel.

IA physiqueOpinion
1 source
Bridge-WA : prédire où et comment le monde change pour l'action robotique
2arXiv cs.RO 

Bridge-WA : prédire où et comment le monde change pour l'action robotique

Une équipe de chercheurs présente Bridge-WA, un nouveau framework "world-action" léger destiné aux modèles de manipulation robotique vision-langage-action (VLA), décrit dans un article publié sur arXiv (2607.02195v1) début juillet. Plutôt que de s'appuyer sur de lourds modèles génératifs du monde ou des séquences denses d'images futures pour anticiper les changements de scène, coûteux en calcul et souvent focalisés sur des détails visuels peu utiles au contrôle, Bridge-WA distille un "teacher" figé de prédiction des changements futurs en trois représentations compactes : des tokens de résultat visé, des cartes de changement pour identifier les zones d'intervention, et des cartes de flux de mouvement pour la direction locale des transitions. Un module appelé WorldBridge conditionne ensuite le transformer d'action sur ces trois priors via des mémoires d'attention multi-sources et des biais spatio-temporels, tandis que le modèle enseignant est retiré au moment de l'inférence. Les auteurs évaluent leur approche sur les benchmarks VLABench, RoboTwin2.0 et LIBERO-Plus, ainsi que sur des tests en robot réel, avec des gains en taux de réussite, en progression de tâche et en robustesse, particulièrement marqués face à des variations visuelles hors distribution. L'intérêt pour l'industrie robotique tient à la promesse d'un compromis efficacité-robustesse : obtenir les bénéfices d'un raisonnement sur l'évolution future de la scène sans payer le coût de génération d'images denses au déploiement, un frein connu pour l'intégration temps réel des modèles VLA. En filtrant les facteurs de nuisance comme le fond, l'éclairage ou les distracteurs pour se concentrer sur où et comment la scène va changer, l'approche s'attaque directement à l'écart généralisation/robustesse qui limite souvent le passage de la démonstration en labo au déploiement industriel. Le travail s'inscrit dans la lignée des modèles VLA à grande échelle qui cherchent à coupler perception, langage et action, un axe de recherche actif depuis l'essor de modèles génériques de manipulation. Comme il s'agit ici de résultats de recherche publiés par les auteurs eux-mêmes sur leurs propres benchmarks, sans déploiement industriel ni validation tierce à ce stade, la prudence reste de mise sur la portée réelle des gains annoncés. Le code et des visualisations sont mis à disposition sur le site du projet, ouvrant la voie à une reproduction indépendante des résultats.

IA physiqueActu
1 source
MaskWAM : unification du masquage guidé et de la prédiction pour les modèles monde-action
3arXiv cs.RO 

MaskWAM : unification du masquage guidé et de la prédiction pour les modèles monde-action

Une équipe de chercheurs a soumis sur arXiv (référence 2606.13515) un modèle baptisé MaskWAM, visant à lever deux verrous structurels des World Action Models (WAMs) pour le contrôle robotique par prédiction vidéo. Les WAMs constituent une approche active : au lieu d'apprendre directement une politique motrice, le modèle prédit des frames vidéo futures conditionnées par les actions du robot et extrait la politique de cette représentation. Le problème identifié est double. Les entrées textuelles génèrent une ambiguïté référentielle dans les scènes encombrées : si deux objets similaires cohabitent dans le champ de la caméra, le texte ne suffit pas à désambiguïser la cible. Par ailleurs, les prédictions RGB brutes manquent d'ancrage sémantique et restent perturbées par des arrière-plans sans lien avec la tâche. MaskWAM intègre des masques de segmentation à la fois comme entrées explicites (premier frame annoté avec la cible) et comme sorties prédites, au sein d'une architecture unifiée Mixture of Transformers (MoT). L'apport central est l'introduction d'une supervision sémantique centrée sur l'objet : en forçant le modèle à prédire les masques futurs en parallèle des frames RGB, les auteurs réduisent l'influence du bruit visuel de fond sur la politique apprise. Évalué sur les benchmarks LIBERO et RoboTwin, ainsi que sur des tâches réelles non précisées en détail, MaskWAM surpasse significativement les baselines existantes en conditions de langage clair comme ambigu. Pour les équipes R&D en manipulation robotique, l'enjeu concret est la robustesse des politiques face aux variations de décor et aux instructions imprécises, deux points de friction récurrents dans le transfert du labo vers la ligne de production. Ces résultats restent toutefois ceux d'une prépublication académique sur benchmarks standardisés : aucun déploiement industriel n'est mentionné, et les conditions exactes des expérimentations réelles ne sont pas détaillées dans le résumé disponible. MaskWAM s'inscrit dans la dynamique des Visual Language Action models et des WAMs apparus depuis 2023, notamment Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et OpenVLA. Sa spécificité est l'exploitation systématique des masques de segmentation comme signal de supervision, là où la plupart des approches concurrentes restent ancrées sur du texte libre ou des images de référence non structurées. Les prochaines étapes prévisibles pour ce type de travaux sont l'évaluation sur des manipulations multi-objets en environnement non contrôlé et l'intégration dans des fondations robotiques plus larges. Aucun partenariat industriel ni calendrier de transfert applicatif ne sont mentionnés à ce stade.

IA physiqueOpinion
1 source
4arXiv cs.RO 

Juno : dompter les latents prédictifs des modèles vision-langage-action (VLA)

Des chercheurs publient sur arXiv (2610.09940) Juno, un cadre unifié qui exploite les « latents prédictifs » d'une architecture JEPA (Joint-Embedding Predictive Architecture) pour améliorer les modèles vision-langage-action (VLA). Une JEPA prédit des observations masquées ou futures dans un espace de représentation plutôt qu'en pixels. Juno s'appuie sur une seule JEPA conditionnée par l'action, qui joue trois rôles : backbone de représentation aligné sur le contrôle, enseignant prédictif et modèle de dynamique adaptable. En pré-entraînement, elle est entraînée sur des trajectoires issues de la même morphologie que le robot cible. Une perte « dynamic CLS » transfère la dynamique des patches, pondérée par le mouvement, vers un état global compact. En apprentissage de politique, les patches JEPA de l'image courante sont fusionnés dans la perception du VLA. Une branche de raisonnement découplée, avec ses propres paramètres de transformation, distille les états latents futurs pour générer les actions. Au déploiement, le modèle du monde est adapté sur toutes les transitions observées, échecs compris. L'enseignant adapté est ensuite gelé, et la politique est réalignée sur les exécutions vérifiées via des adaptateurs LoRA et une tête d'action entraînable, sans corrections d'expert ni récompenses de tâche. Sur le benchmark de simulation SimplerEnv, Juno fait passer le taux de réussite moyen de 60,9 % à 68,5 % face à Qwen3GR00T, la meilleure référence testée. L'adaptation au moment du test porte ce score à 72,7 %. Sur robot réel, la politique conserve 70 à 75 % de réussite quand le fond, la hauteur ou les objets changent, alors que la politique de base tombe à 0 %. Ces chiffres viennent des auteurs, et le papier est une prépublication sans relecture par les pairs. Le nombre d'essais réels, les tâches et la plateforme robotique ne figurent pas dans le résumé, ce qui limite la portée de l'effondrement à 0 % de la référence, un résultat dépendant du protocole. L'enjeu dépasse le gain de 7,6 points en simulation. Le papier s'attaque à un point faible des VLA déployés : la fragilité face aux décalages de distribution (décor, hauteur de table, objets inédits), qui sépare la démo en laboratoire du fonctionnement en production. Deux idées intéressent les intégrateurs. D'abord, apprendre aussi des échecs, sans opérateur humain ni fonction de récompense. Cela réduirait le coût de réglage sur site, aujourd'hui l'un des principaux freins au déploiement. Ensuite, utiliser un enseignant prédictif figé pour éviter la dérive pendant l'adaptation. Cela dit, une adaptation en ligne exige du calcul embarqué ou un cycle de réentraînement, et la robustesse annoncée reste à confirmer hors du dispositif des auteurs. Le travail s'inscrit dans la convergence entre les modèles du monde et les VLA. La lignée JEPA, portée par Yann LeCun et Meta avec V-JEPA, sert ici de source de représentations pour l'action. La comparaison avec Qwen3GR00T, un VLA dérivé de la famille GR00T de NVIDIA et adossé à Qwen3, le situe face aux politiques généralistes actuelles, aux côtés de Pi-0 de Physical Intelligence. Aucun déploiement industriel ni code ou calendrier de diffusion n'est annoncé dans le résumé. La suite dépendra de la publication du code, d'évaluations sur d'autres morphologies et d'une reproduction indépendante.

IA physiqueActu
1 source