Repenser les représentations pour la modélisation monde-action
Des chercheurs proposent ReWAM, un modèle « monde-action » (world-action model) qui apprend conjointement une politique de contrôle robotique et la prédiction des observations futures, en s'appuyant sur des features DINO pré-entraînées plutôt que sur un pré-entraînement génératif vidéo. Sur le benchmark simulé RoboTwin 2.0, il atteint 93,6 % de réussite. Sur RoboDojo, il obtient un score moyen de 12,29 et un taux de succès de 8,28 %, avec environ 600 heures de données d'embodiment pour le pré-entraînement. Deux mécanismes structurent l'ensemble. Une Feature Calibration et un Temporal Representation Bottleneck compressent les features DINO en états du monde compacts, adaptés à la modélisation de la dynamique. Un Action-Grounded Representation Shaping n'achemine vers ce goulot que les gradients issus de la perte d'action. La politique décide ainsi de ce que la représentation encode, tandis que le modèle du monde apprend comment elle évolue. Il s'agit d'un travail de recherche (preprint arXiv), sans produit ni déploiement associé.
L'intérêt tient à la conclusion des comparaisons contrôlées. Ni la fidélité de reconstruction, ni des features perceptuelles pré-entraînées prises isolément ne garantissent un apprentissage de politique efficace. Cela remet en cause une hypothèse répandue : les world models vidéo, coûteux à pré-entraîner, seraient la voie évidente vers des politiques généralistes. Ici, un espace latent compact, façonné par l'action, suffit à un score élevé sur RoboTwin 2.0 sans génération vidéo. Pour les équipes qui évaluent des architectures VLA (vision-language-action) ou monde-action, cela suggère qu'un budget de calcul peut se déplacer du pré-entraînement génératif vers la conception de la représentation. Deux réserves s'imposent. Les 93,6 % relèvent d'un benchmark simulé, qui ne dit rien du transfert sim-to-real. Et le 8,28 % sur RoboDojo montre qu'une tâche plus exigeante reste très loin d'être résolue, ce que le chiffre de RoboTwin masque.
Ce travail s'inscrit dans la montée des modèles monde-action, qui cherchent à unifier la prédiction de futurs observés et le contrôle, en concurrence avec les VLA purs comme Pi-0 ou GR00T, et avec les approches fondées sur des modèles vidéo génératifs. Le choix de DINO prolonge l'usage des features auto-supervisées comme backbone visuel en robotique. Les prochaines étapes à surveiller sont une validation sur robot réel, des comparaisons à données de pré-entraînement équivalentes, et la publication du code et des poids. Le preprint ne mentionne pas de partenaire industriel ni d'acteur français ou européen.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




