Aller au contenu principal
L'action latente comme intention permet une imagination efficace du futur pour les modèles d'action du monde
IA physiquearXiv cs.RO 

L'action latente comme intention permet une imagination efficace du futur pour les modèles d'action du monde

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

La modélisation prédictive de l'action robotique franchit une étape avec LAWA, une architecture présentée dans un article publié sur arXiv fin août 2026 sous la référence 2608.24882. Les modèles dits "world action models" (WAM) améliorent le contrôle des robots en simulant l'évolution future des observations visuelles, mais cette génération d'images futures coûte cher en latence au moment de l'exécution. Une variante rapide, Fast-WAM, supprime cette étape pour gagner en vitesse, au prix d'une généralisation nettement plus faible, en particulier lorsque les démonstrations robotiques sont rares ou dans des scénarios hors distribution. LAWA propose un compromis: au lieu de générer des vidéos futures complètes, il encode l'intention future sous forme d'actions latentes compactes, produites par un tokenizer discret pré-entraîné sans action, qui génère des cibles de codebook centrées sur la manipulation. Le modèle débruite conjointement un état latent continu ancré sur ces cibles avec des blocs d'actions exécutables, tout en omettant la branche vidéo future à l'inférence. Sur le benchmark RoboCasa, LAWA atteint des taux de succès moyens de 65,6% en few-shot et 80,8% en données complètes, dépassant Fast-WAM de 9,6 et 4,5 points respectivement, tout en réduisant la latence d'inférence de 42,9% par rapport à la variante Joint-WAM de référence.

Ces résultats remettent en question l'idée reçue selon laquelle il faudrait sacrifier l'imagination du futur pour gagner en rapidité d'exécution. Pour les équipes qui développent des politiques de contrôle basées sur des modèles VLA (vision-language-action), le message est clair: la vitesse et la généralisation ne sont pas nécessairement antagonistes si l'information future est compressée intelligemment plutôt que supprimée. C'est un enjeu concret pour l'industrialisation des robots manipulateurs, où le temps de cycle et la robustesse hors distribution conditionnent directement la viabilité en usine ou en entrepôt. Un modèle capable de conserver la qualité de généralisation d'un WAM complet tout en réduisant drastiquement la latence rapproche ces architectures d'un déploiement temps réel réaliste, plutôt que d'un simple exercice de recherche en laboratoire.

Le travail s'inscrit dans la lignée des architectures WAM et de leurs déclinaisons rapides, dont Fast-WAM sert ici de point de comparaison direct sur des implémentations appariées. Les auteurs testent aussi LAWA en zero-shot sur LIBERO-Plus, où il affiche une robustesse compétitive, ainsi que sur des tâches réelles où il surpasse les approches concurrentes. Le code et les modèles doivent être publiés, ce qui permettra une vérification indépendante des chiffres annoncés, une précaution utile puisque les métriques de succès en manipulation robotique restent souvent sensibles au choix des tâches et des conditions d'évaluation.

À lire aussi

WISE : ordonnancement de l'imagination guidé par un modèle du monde pour un post-entraînement efficace des modèles vision-langage-action
1arXiv cs.RO 

WISE : ordonnancement de l'imagination guidé par un modèle du monde pour un post-entraînement efficace des modèles vision-langage-action

Un article publié le 3 septembre 2026 sur arXiv (2609.03681) présente WISE, une méthode de post-entraînement pour les modèles VLA (Vision-Language-Action) en robotique manipulatrice. Plutôt que d'affiner ces politiques par démonstrations d'experts coûteuses ou par renforcement en conditions réelles, risqué et onéreux, WISE s'appuie sur un modèle du monde pour imaginer et évaluer des comportements candidats, mais seulement aux états jugés critiques pour l'interaction, sur des horizons courts et multi-vues afin de limiter la dérive de prédiction. Testée sur les modèles Pi-0 et Pi-0.5 de Physical Intelligence, la méthode réduit le temps de calcul GPU d'environ 80% par rapport à une imagination exhaustive, tout en améliorant les performances sur un éventail de tâches de manipulation. Des évaluations en conditions réelles confirment des gains de robustesse et de généralisation face à des changements de distribution. Le résultat s'attaque à un frein connu à l'usage des modèles du monde en robotique: leur coût de calcul et l'accumulation d'erreurs sur de longs horizons de simulation en limitaient jusqu'ici l'intérêt pratique face au renforcement réel. En montrant qu'une imagination sélective et bornée conserve l'essentiel du gain de performance pour un cinquième du coût GPU d'une approche complète, WISE offre aux équipes de recherche appliquée un argument économique pour intégrer ces modèles dans leurs pipelines de fine-tuning sans les risques du reinforcement learning physique. Le travail apporte aussi une preuve empirique que des architectures VLA généralistes comme Pi-0 peuvent gagner en robustesse sans démonstrations supplémentaires, un point clé pour les décideurs qui évaluent le passage du laboratoire au déploiement industriel fiable. Ce travail s'inscrit dans la lignée des recherches récentes sur les modèles du monde en robotique, dans un paysage où NVIDIA (GR00T N2) ou Figure AI (Helix) explorent aussi des architectures VLA généralistes, mais en ciblant ici spécifiquement l'efficacité du post-entraînement plutôt que la génération de comportements bout-en-bout. La méthode a été validée sur Pi-0 et Pi-0.5, les bases VLA développées par Physical Intelligence. Il s'agit à ce stade d'un article de recherche, sans annonce de produit commercial, de partenariat industriel ni de calendrier de déploiement; la suite attendue serait son intégration dans des pipelines de fine-tuning propriétaires ou sa reproduction indépendante sur d'autres architectures pour confirmer les gains annoncés.

IA physiqueOpinion
1 source
Quand faire confiance à l'imagination : exécution adaptative des actions pour les modèles d'action du monde
2arXiv cs.RO 

Quand faire confiance à l'imagination : exécution adaptative des actions pour les modèles d'action du monde

Des chercheurs présentent sur arXiv (2605.06222) une méthode d'exécution adaptative pour les World Action Models (WAMs), une famille d'architectures de manipulation robotique qui prédisent simultanément les observations visuelles futures et les séquences d'actions à exécuter. Le problème structurel de ces systèmes est qu'ils exécutent un nombre fixe d'actions prédites après chaque inférence, sans vérifier si le déroulé physique réel correspond à l'état "imaginé" par le modèle. Pour y remédier, les auteurs proposent FFDC (Future Forward Dynamics Causal Attention), un vérificateur léger qui croise en temps réel les actions prédites, la dynamique visuelle anticipée, les observations caméra actuelles et les instructions en langage naturel, pour décider si le plan reste valide ou s'il faut déclencher une nouvelle inférence plus tôt. Ce module est couplé à une stratégie d'entraînement baptisée Mixture-of-Horizon Training, conçue pour améliorer la couverture des trajectoires longues. Sur le benchmark RoboTwin, FFDC réduit le nombre de passes avant du modèle de 69,10 % et le temps d'exécution de 34,02 %, avec un taux de succès en hausse de 2,54 % par rapport à une baseline à chunk court. En conditions réelles, le gain atteint 35 % de succès supplémentaire, bien que le nombre d'essais et les tâches testées ne soient pas précisés dans ce préprint. L'apport principal est de résoudre un compromis structurel qui freine le déploiement industriel des robots manipulateurs : réinférer fréquemment est réactif mais coûteux en calcul, tandis qu'exécuter de longues séquences prédites est efficace mais aveugle aux imprévus. FFDC introduit une troisième voie, où la taille du chunk d'action devient une variable émergente pilotée par la cohérence entre imagination et réalité. Ce mécanisme est particulièrement critique pour les phases de contact riche, où un décalage millimétrique entre état prédit et état réel suffit à faire échouer une saisie, et représente une avancée concrète vers des WAMs opérationnels hors environnement contrôlé. Les WAMs s'inscrivent dans la dynamique plus large des modèles d'actions visuelles et langagières (VLAs), aux côtés de Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou RT-2 et ses successeurs chez Google DeepMind. Leur spécificité est d'intégrer explicitement une prédiction de l'état visuel futur pour planifier à plus long horizon. Ce préprint, sans affiliation industrielle déclarée, n'est pas encore évalué par les pairs. La prochaine étape naturelle serait une validation sur des benchmarks standardisés plus larges et des pilotes en environnement industriel non structuré.

IA physiqueOpinion
1 source
InternW0 : un modèle fondation du monde physique pour des interactions efficaces avec le monde réel
3arXiv cs.RO 

InternW0 : un modèle fondation du monde physique pour des interactions efficaces avec le monde réel

Shanghai AI Laboratory a publié le 24 septembre 2026 sur arXiv (2609.27656) InternW0, premier modèle de sa série InternW dédiée à la modélisation du monde physique. L'architecture associe un expert vidéo lourd, qui prédit la dynamique visuelle à long horizon, et un expert d'action léger cadencé plus vite, entraînés conjointement par flow matching ; plutôt que de tout recalculer à chaque action, le modèle réutilise ses caches clé/valeur et les met à jour selon les nouvelles observations. Des interfaces par domaine gèrent les morphologies robotiques hétérogènes, complétées par un post-entraînement sensible au contact exploitant force et tactile. L'entraînement mobilise 7 200 heures de données robot et égocentriques, dont EgoLab (275 heures, laboratoire réel), et les tests réels incluent une synthèse de charpentes métallo-organiques en 15 étapes et un pipetage dextre en 5 étapes sensible au contact. L'enjeu pour les intégrateurs tient à l'efficacité : la plupart des modèles vision-langage-action recalculent une passe complète à chaque étape de contrôle, ce qui plafonne la fréquence de commande utilisable, alors que la réutilisation du cache clé/valeur d'InternW0 vise justement ce goulot d'étranglement. Le choix de tâches scientifiques (chimie, pipetage) plutôt que la manipulation domestique privilégiée par la plupart des démonstrations humanoïdes déplace la preuve vers un usage B2B vérifiable en laboratoire et dans l'industrie pharmaceutique ou des matériaux, où comptent la répétabilité et la sensibilité au contact plus que la polyvalence spectaculaire. Le texte reste un preprint, sans taux de réussite chiffré ni preuve de généralisation au delà de ces scénarios. InternW0 prolonge la famille Intern de Shanghai AI Laboratory, déjà connue pour InternLM (langage) et InternVL/InternVideo (multimodal), vers la modélisation du monde physique et le contrôle robotique. Il se positionne face aux modèles vision-langage-action généralistes d'autres laboratoires, comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure, avec une orientation explicitement scientifique plutôt que domestique. Aucun déploiement commercial n'est annoncé : le papier, classé comme nouvelle publication arXiv, décrit une preuve de concept validée en simulation et sur un nombre restreint de scénarios réels, sans calendrier communiqué pour une ouverture du modèle ou du jeu de données EgoLab.

IA physiqueOpinion
1 source
AtlasVLA : une modélisation persistante de l'état monde-ego pour les modèles vision-langage-action
4arXiv cs.RO 

AtlasVLA : une modélisation persistante de l'état monde-ego pour les modèles vision-langage-action

Une équipe de recherche présente AtlasVLA, un nouveau framework pour les modèles vision-langage-action (VLA), décrit dans un article publié sur arXiv le 6 août 2026 (arXiv:2608.06729v1). Le système repose sur une architecture à double mémoire: une "4D Persistent World State Memory", qui transforme les observations 2D transitoires en un état spatial global mis à jour en continu via un hachage voxel, et une "Ego-Working State Memory", qui conserve l'historique de l'état du robot et l'avancement de la tâche en cours. Ces deux mémoires conditionnent un transformeur de diffusion (DiT) chargé de générer les actions. Testé sur les bancs d'essai LIBERO, RLBench et sur des tâches réelles, AtlasVLA atteint des performances de pointe en n'utilisant qu'une seule caméra montée au poignet, avec des gains de taux de réussite de 9,4 points sur LIBERO-Long et de 17,5 points sur des tâches réelles à long horizon, comparé à des méthodes de référence multi-caméras. Ce résultat s'attaque à une limite connue des modèles VLA actuels: leur nature réactive, qui pousse les robots à "oublier" un objet dès qu'il sort du champ de la caméra, et à perdre le fil de la progression dans les tâches à plusieurs étapes. Pour les intégrateurs industriels, l'intérêt est concret: obtenir une robustesse comparable à des rigs multi-caméras avec un seul capteur poignet réduit le coût matériel et la complexité de calibration des cellules robotisées. Le résultat remet en question l'hypothèse selon laquelle une couverture visuelle multi-angles serait indispensable pour la manipulation à long horizon, un argument souvent avancé par les fournisseurs de systèmes de vision embarqués. Ces chiffres proviennent toutefois d'un article encore non revu par les pairs, et les conditions précises des essais réels (nombre d'essais, environnements testés) restent à vérifier avant toute généralisation. Le travail s'inscrit dans la lignée des modèles VLA qui ont émergé ces dernières années, de RT-2 à Pi-0 en passant par GR00T N2 ou Helix, tous construits sur un mappage direct image vers action avec peu ou pas de mémoire persistante. AtlasVLA se positionne explicitement contre les approches multi-vues, qu'il dit surpasser de façon nette sur les tâches longues. L'article ne précise pas d'acteur industriel ni de calendrier de déploiement: il s'agit à ce stade d'une contribution de recherche, sans indication de portage vers un produit commercial ou un partenariat avec un fabricant de robots humanoïdes ou de bras manipulateurs.

IA physiqueActu
1 source