Optimisation directe du modèle du monde par l'expérience : apprendre le monde au-delà de l'imitation des actions
Des chercheurs proposent DEWO (Direct Experience World-Model Optimization), une méthode d'apprentissage post-déploiement pour les World-Action Models (WAM), ces politiques robotiques qui génèrent des actions tout en prédisant l'évolution visuelle des interactions physiques. Le principe consiste à ne plus seulement imiter les actions, mais à raffiner aussi les représentations du monde à partir de l'expérience visuelle du robot. DEWO repère les points de bascule d'une interaction, apprend des futurs réussis comme des futurs échoués pour alimenter un guidage sans classifieur (classifier-free guidance), et ajoute une tête de valeur qui estime l'avancement de la tâche à partir des représentations vidéo. Ce guidage ne s'active en inférence que lorsque la progression stagne. Sur cinq tâches du benchmark DexJoCo, la méthode améliore le taux de succès moyen pour les trois formulations de WAM testées. Sur quatre tâches réelles avec les mains Wuji et Sharpa, une évaluation en grille 3 x 3 montre que deux cycles d'apprentissage en déploiement font passer le succès de 51,0 % à 71,7 % dans les cellules comptant au moins un succès initial, soit un gain de 20,7 points.
L'intérêt tient au diagnostic. Les boucles d'amélioration actuelles, souvent fondées sur l'imitation de démonstrations ou de trajectoires réussies, corrigent le comportement sans rendre les prédictions du modèle plus justes. Or en manipulation dextre, de petites erreurs d'exécution s'accumulent dans un espace d'actions de grande dimension et écartent le robot de la distribution d'entraînement du modèle, ce qui dégrade aussi ses prédictions. Les ablations indiquent que la supervision visuelle des suites réussies et échouées améliore à la fois la prédiction et le contrôle, au-delà de la seule supervision par les actions. Pour les intégrateurs, le message est que les données d'échec, généralement jetées, deviennent utiles. Il faut toutefois nuancer : le gain réel de 20,7 points est mesuré uniquement dans les cellules avec au moins un succès initial, donc sur un sous-ensemble favorable, et les résultats viennent d'un preprint sans validation par les pairs ni détail sur les volumes de données ou le temps de cycle.
Ce travail s'inscrit dans la montée des modèles du monde appliqués à la robotique, où la prédiction vidéo est couplée à la politique d'action, en complément des VLA (vision-langage-action) classiques. Le déploiement continu reste l'un des verrous du secteur : les politiques progressent surtout par rejeu de démonstrations ou par apprentissage par renforcement, coûteux sur du matériel réel. Le choix des mains Wuji et Sharpa, deux plateformes dextres à nombreux degrés de liberté, cible précisément le segment où les écarts entre démonstration et réalité sont les plus marqués. L'article ne cite ni pilote industriel ni calendrier de commercialisation, et il s'agit d'une preuve de concept de recherche. La suite logique serait de tester la méthode sur davantage de tâches et de plateformes, avec des cycles de déploiement plus nombreux et des mesures de robustesse à plus long terme.
Pas d\'impact direct sur la France/UE
Dans nos dossiers



