WALL-SS : le passage à l'échelle des modèles du monde à long terme via l'autorégression multi-échelle
Publié fin aout 2026 sur arXiv (2608.26239), WALL-SS est un "world model" conçu pour générer des futurs visuels pilotables par l'action sur de longs horizons, via une autorégression à échelles multiples ("next-scale autoregression"). Les trajectoires du robot y sont représentées comme des séquences causales entrelaçant observations et actions, ce qui rend explicite le lien action-conséquence. Le système génère chaque image future du grossier au fin et combine trois briques : une prédiction "next-scale" conditionnée par l'action, une mémoire longue durée compressée par échelle (interactions récentes en haute résolution, passé compressé) renforcée par un mécanisme de "dream forcing" par échelle pour résister au bruit auto-généré, et un alignement on-policy optimisant des récompenses de suivi d'action et de cohérence long terme sans dériver de la distribution visuelle pré-entraînée. Résultat annoncé : rollouts cohérents sur plusieurs minutes en flux continu, sous mémoire bornée, avec une dérive d'action réduite.
Pour l'industrie robotique, l'enjeu est concret : la plupart des modèles du monde génératifs décrochent au-delà de quelques secondes, produisant des trajectoires visuellement plausibles mais physiquement incohérentes dès que l'horizon s'allonge. Une simulation stable sur plusieurs minutes, à mémoire bornée, intéresse directement les équipes qui entraînent des politiques vision-langage-action (VLA) du type Pi-0, GR00T ou Helix, en offrant une boucle d'évaluation et d'entraînement moins coûteuse que la collecte de données réelles, y compris pour tester des scénarios d'échec sans risquer de matériel. C'est aussi un aveu implicite que le "sim-to-real gap" reste un chantier ouvert : la dérive d'action et l'incohérence long terme sont ici corrigées par un alignement a posteriori, pas éliminées par construction dès le départ.
WALL-SS s'inscrit dans la vague de modèles du monde génératifs nourrie par les progrès de la génération vidéo et leur transposition à la prédiction d'états robotiques, aux côtés d'efforts comme GR00T N2 chez Nvidia ou Pi-0 chez Physical Intelligence sur le versant politiques VLA. Sa contribution est architecturale : remplacer la génération clip par clip par une autorégression à échelles multiples censée mieux gérer les horizons variables et le streaming continu. Publié comme simple preprint arXiv, sans laboratoire ni entreprise identifiés nommément dans le résumé, et sans code ni benchmark public annoncés, le travail reste à ce stade une contribution de recherche destinée à être validée par la communauté, et non un produit ou un déploiement industriel.
Dans nos dossiers




