UniWAM : modèle unifié du monde et de l'action
UniWAM, présenté sur arXiv (2610.02054, première version), est une architecture unifiée qui combine trois blocs : un « raisonneur physique » issu d'un modèle vision-langage préentraîné, un générateur de monde (vidéo) et un prédicteur d'actions. L'ensemble apprend conjointement la compréhension sémantique du monde physique, la génération visuelle et la prédiction d'actions. Les auteurs ont construit un pipeline de nettoyage et d'annotation pour les données égocentriques humaines et les données robot. Les actions bas niveau sont exprimées en langage naturel, afin de préserver les capacités linguistiques du modèle de base. Le préentraînement répartit les supervisions entre composants : VQA (questions-réponses visuelles), vidéos égocentriques humaines et démonstrations robot. Au post-entraînement, une augmentation par bruit visuel sur le futur réduit la dépendance à des prédictions précises, et un flow matching conditionné par l'historique d'actions initialise la génération d'actions. Selon les auteurs, cela réduit nettement le nombre d'étapes de débruitage sans perte de performance. Ils revendiquent l'état de l'art en performance in-distribution, robustesse, généralisation, suivi d'instructions et tâches longues. Le résumé ne donne ni chiffres ni noms de benchmarks.
L'intérêt est de s'attaquer à un compromis connu. Les modèles VLA (vision-langage-action) héritent du raisonnement des VLM, mais une supervision limitée aux actions leur donne peu d'ancrage dans la dynamique physique. À l'inverse, les modèles monde-action, bâtis sur la génération vidéo, captent bien les régularités spatio-temporelles mais comprennent et raisonnent moins bien hors distribution. Unifier les deux dans un seul modèle est une réponse directe à ce problème de robustesse, qui compte pour les intégrateurs confrontés au fossé entre démo et déploiement. La réduction des étapes de débruitage compte aussi pour la latence de contrôle, point faible des approches fondées sur la vidéo. Le résultat le plus transposable est la loi d'échelle log-linéaire du co-entraînement humain-robot. Si elle se confirme, elle soutient l'idée que les vidéos humaines, bien moins chères que la téléopération, peuvent servir de levier de données. Prudence toutefois : il s'agit d'un préprint non évalué par les pairs, sans test annoncé sur robot en production.
Ce travail s'inscrit dans la course entre VLA (Pi-0 de Physical Intelligence, GR00T de NVIDIA, Helix de Figure) et modèles monde-action, qui exploitent la génération vidéo pour la planification. Il prolonge aussi la tendance à exploiter les données égocentriques humaines pour pallier la rareté des démonstrations robot. Le résumé ne cite ni équipe, ni plateforme robotique, ni calendrier de publication du code ou des poids. Il faudra donc attendre le texte complet pour juger du protocole, de la comparaison avec les références et de la validation sur matériel réel.
Dans nos dossiers




