Aller au contenu principal
RecherchearXiv cs.RO 

Optimisation directe du modèle du monde par l'expérience : apprendre le monde au-delà de l'imitation des actions

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent DEWO (Direct Experience World-Model Optimization), une méthode d'apprentissage post-déploiement pour les World-Action Models (WAM), ces politiques robotiques qui génèrent des actions tout en prédisant l'évolution visuelle des interactions physiques. Le principe consiste à ne plus seulement imiter les actions, mais à raffiner aussi les représentations du monde à partir de l'expérience visuelle du robot. DEWO repère les points de bascule d'une interaction, apprend des futurs réussis comme des futurs échoués pour alimenter un guidage sans classifieur (classifier-free guidance), et ajoute une tête de valeur qui estime l'avancement de la tâche à partir des représentations vidéo. Ce guidage ne s'active en inférence que lorsque la progression stagne. Sur cinq tâches du benchmark DexJoCo, la méthode améliore le taux de succès moyen pour les trois formulations de WAM testées. Sur quatre tâches réelles avec les mains Wuji et Sharpa, une évaluation en grille 3 x 3 montre que deux cycles d'apprentissage en déploiement font passer le succès de 51,0 % à 71,7 % dans les cellules comptant au moins un succès initial, soit un gain de 20,7 points.

L'intérêt tient au diagnostic. Les boucles d'amélioration actuelles, souvent fondées sur l'imitation de démonstrations ou de trajectoires réussies, corrigent le comportement sans rendre les prédictions du modèle plus justes. Or en manipulation dextre, de petites erreurs d'exécution s'accumulent dans un espace d'actions de grande dimension et écartent le robot de la distribution d'entraînement du modèle, ce qui dégrade aussi ses prédictions. Les ablations indiquent que la supervision visuelle des suites réussies et échouées améliore à la fois la prédiction et le contrôle, au-delà de la seule supervision par les actions. Pour les intégrateurs, le message est que les données d'échec, généralement jetées, deviennent utiles. Il faut toutefois nuancer : le gain réel de 20,7 points est mesuré uniquement dans les cellules avec au moins un succès initial, donc sur un sous-ensemble favorable, et les résultats viennent d'un preprint sans validation par les pairs ni détail sur les volumes de données ou le temps de cycle.

Ce travail s'inscrit dans la montée des modèles du monde appliqués à la robotique, où la prédiction vidéo est couplée à la politique d'action, en complément des VLA (vision-langage-action) classiques. Le déploiement continu reste l'un des verrous du secteur : les politiques progressent surtout par rejeu de démonstrations ou par apprentissage par renforcement, coûteux sur du matériel réel. Le choix des mains Wuji et Sharpa, deux plateformes dextres à nombreux degrés de liberté, cible précisément le segment où les écarts entre démonstration et réalité sont les plus marqués. L'article ne cite ni pilote industriel ni calendrier de commercialisation, et il s'agit d'une preuve de concept de recherche. La suite logique serait de tester la méthode sur davantage de tâches et de plateformes, avec des cycles de déploiement plus nombreux et des mesures de robustesse à plus long terme.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

DreamWAM : au-delà de la prédiction RGB pour les modèles d'action du monde
1arXiv cs.RO 

DreamWAM : au-delà de la prédiction RGB pour les modèles d'action du monde

Des chercheurs du laboratoire HUST-VL publient DreamWAM, un modèle monde-action (World Action Model) pour l'apprentissage de politiques robotiques, détaillé dans un article arXiv (2608.04996v1) avec code et modèles publiés sur GitHub. Contrairement à la plupart des WAM, qui prédisent le futur de la scène uniquement en RGB et mélangent ainsi les changements pertinents pour la tâche avec du bruit de texture, d'éclairage ou de point de vue, DreamWAM représente l'état futur sous plusieurs formes complémentaires (apparence, mouvement, géométrie, sémantique). Le modèle combine un débruitage latent conjoint RGB et mouvement avec des branches résiduelles légères pour la géométrie et la sémantique, entraînées via une attention partagée entre les modules VideoDiT et ActionDiT ; ces branches supplémentaires sont désactivées à l'inférence, qui reste purement RGB. Sur le benchmark LIBERO, le taux de réussite passe de 97,30% à 98,40% en inférence sans rollout et de 98,00% à 98,90% en inférence conjointe vidéo-action. Sous les perturbations inédites de LIBERO-Plus, les gains grimpent nettement, de 51,36% à 63,44% et de 69,16% à 75,47%. En manipulation robotique réelle, avec des changements non vus d'éclairage, de fond et de disposition des objets, DreamWAM atteint 74,4% de réussite moyenne, contre 55,6% pour la référence Fast-WAM-Joint. Ce travail pointe un problème bien connu des modèles vision-langage-action: des gains mesurés sur bancs d'essai standards qui s'effondrent dès que l'environnement change légèrement, cet écart entre démonstration et réalité freinant le déploiement industriel des bras manipulateurs et robots humanoïdes. En montrant que des gains modestes en conditions contrôlées, de l'ordre d'un point de pourcentage, se transforment en écarts de dix à vingt points sous perturbation, DreamWAM suggère que la robustesse d'une politique ne dépend pas seulement de la qualité de la prédiction du futur, mais de la forme sous laquelle ce futur est représenté pendant l'entraînement. Pour les équipes de R&D robotique, l'intérêt pratique est que cette supervision multi-vues n'ajoute aucun coût au déploiement puisque les branches concernées sont coupées à l'inférence: la robustesse s'acquiert à l'entraînement, sans alourdir le système embarqué. Ce travail s'inscrit dans une recherche qui cherche à dépasser l'imitation pure en dotant les politiques robotiques d'un modèle du monde capable d'anticiper les conséquences d'une action avant son exécution. DreamWAM se positionne explicitement face à Fast-WAM-Joint, utilisé comme référence RGB pure dans les comparaisons de l'article. Contrairement à une annonce produit ou une démonstration de plateforme humanoïde, il s'agit d'une publication académique évaluée en simulation (LIBERO, LIBERO-Plus) et sur un nombre limité de tâches de manipulation réelle, sans déploiement industriel ni calendrier commercial annoncé. Code et modèles étant publiés en accès libre, la suite logique sera de voir si d'autres équipes reproduisent ces gains de robustesse sur des politiques VLA plus larges ou des tâches de manipulation plus complexes que celles testées ici.

RechercheOpinion
1 source
Les modèles d'action du monde permettent un apprentissage par imitation continu avec rejeu génératif récurrent
2arXiv cs.RO 

Les modèles d'action du monde permettent un apprentissage par imitation continu avec rejeu génératif récurrent

Publiés en juin 2026 sur arXiv (référence 2606.27374), des chercheurs présentent REGEN (Recurrent Generative Replay), un cadre d'apprentissage continu par imitation fondé sur les World Action Models (WAMs). Contrairement aux modèles de politique classiques qui se contentent de prédire les actions du robot, les WAMs génèrent également des observations visuelles futures, combinant ainsi deux capacités distinctes dans un seul modèle. REGEN exploite cette dualité en interrogeant récursivement le WAM pour synthétiser des trajectoires de pseudo-replay, conditionnées uniquement sur les instructions des tâches antérieures et les observations de la tâche courante. Testée en simulation et en manipulation réelle, l'approche réduit l'oubli catastrophique de 50 % en comparaison au fine-tuning séquentiel classique, tout en s'approchant des performances des méthodes dites "privileged" qui, elles, conservent l'accès aux démonstrations humaines originales. L'enjeu industriel est direct : l'oubli catastrophique constitue l'un des verrous majeurs au déploiement continu de robots en environnement réel. Dès qu'un système est refiné sur une nouvelle tâche, il dégrade ses capacités acquises précédemment. Les solutions actuelles imposent de conserver les démonstrations humaines originales, ce qui soulève des contraintes de stockage, de coût de collecte et parfois de confidentialité des données opérationnelles. REGEN casse cette dépendance : le robot répète mentalement ses tâches passées sans jamais avoir besoin des vidéos source. Cela ouvre la voie à des déploiements adaptatifs dans des cellules de production ou d'entrepôt où les tâches évoluent en continu. Le gain de 50 % reste cependant partiel, et les auteurs reconnaissent que leur méthode n'atteint pas encore le niveau des méthodes ayant accès aux données réelles. Le travail s'inscrit dans la dynamique des world models appliqués à la robotique, un axe de recherche en forte accélération depuis 2023 porté par des acteurs comme Physical Intelligence (avec π0), Google DeepMind, ou NVIDIA (GR00T N2). L'originalité de REGEN réside dans l'usage génératif du WAM pour l'apprentissage continu, plutôt que pour la planification ou le sim-to-real. Les auteurs identifient deux goulots d'étranglement principaux : la dégradation visuelle sur les horizons longs et l'incohérence entre actions générées et observations synthétisées, deux limites qui dessinent clairement l'agenda de recherche pour les prochaines itérations. Aucun partenaire industriel ni calendrier de commercialisation n'est mentionné ; il s'agit à ce stade d'une contribution académique, non d'un produit déployé.

RechercheOpinion
1 source
3arXiv cs.RO 

Au-delà de l'état comme action : exploiter l'écart commande-état pour l'apprentissage par imitation en robotique

Une équipe de recherche publie, dans la version 2 de l'article arXiv 2609.33145, une méthode baptisée Command-State Discrepancy Weighting (CSDW) pour l'apprentissage par imitation en robotique. Elle porte sur la construction des cibles d'action. Une pratique établie consiste à les déduire du mouvement mesuré du robot (« state-as-action ») plutôt que de la commande envoyée. Les auteurs montrent que, lorsque l'interaction est contrainte, par exemple en contact avec un objet ou une surface, l'écart entre commande et état mesuré contient une information que le mouvement seul ne restitue pas. Trois tâches sur robot réel ont servi aux tests. Les analyses par tâche et par phase révèlent des écarts de supervision plus grands sous contrainte, et conserver sélectivement la commande s'avère localement utile. CSDW pondère la supervision de la commande de façon continue. Il tient compte des temps de réponse du robot et combine la progression ultérieure, la demande persistante non satisfaite et les variations de cette demande. Le résumé ne donne aucun chiffre de gain. L'intérêt est pratique. La méthode n'exige ni annotation des phases de tâche, ni modification de l'architecture de la politique, ni changement à l'inférence, ce qui la rend greffable sur des pipelines existants, y compris de type VLA (vision-language-action). Elle s'attaque à un angle mort des tâches riches en contact, comme l'insertion, l'essuyage ou le serrage, où l'effort demandé ne se voit pas dans la trajectoire. Les résultats restent nuancés. CSDW fait mieux qu'une supervision uniforme de la commande sur les tâches contraintes, mais les méthodes se valent sur la tâche la moins contrainte. Le gain se limite donc à la manipulation en contact, sans être universel. Le résumé ne précise ni les robots, ni les taux de réussite, ni l'ampleur des améliorations, ce qui empêche d'évaluer la portée réelle avant lecture des expériences. Ce travail relève de la recherche académique. Il n'y a ni produit, ni déploiement, ni calendrier de pilote. Il s'inscrit dans un débat plus large sur la meilleure représentation de l'action pour les politiques apprises, entre commandes de téléopération, positions mesurées et efforts. Ce débat concerne les acteurs qui misent sur des modèles généralistes entraînés sur des démonstrations, ainsi que les équipes européennes actives en manipulation. Aucun acteur français ou européen n'est cité ici. La page projet, seen-e.github.io/CSDW, devrait permettre de vérifier les vidéos et les protocoles. Les prochaines étapes probables sont des validations sur davantage de plateformes et de tâches, et une confrontation avec les grands modèles de fondation.

RecherchePaper
1 source
ACID : cohérence des actions par dynamique inverse pour la planification avec des modèles du monde
4arXiv cs.RO 

ACID : cohérence des actions par dynamique inverse pour la planification avec des modèles du monde

ACID (Action Consistency via Inverse Dynamics), présenté dans un article arXiv publié début juillet 2026 (arXiv:2607.02403v1), s'attaque à un défaut connu de la planification par modèles du monde conditionnés par l'action, une méthode largement utilisée en contrôle robotique. Le problème identifié par les auteurs : le coût de planification standard ne juge une trajectoire candidate qu'à l'aune de la proximité entre l'état terminal prédit et l'objectif, sans vérifier si les transitions intermédiaires sont réalisables. Résultat, une trajectoire peut sembler cohérente sur le papier tout en divergeant fortement une fois exécutée dans l'environnement réel. ACID introduit un principe de "cohérence d'action cyclique" : à chaque étape, un modèle de dynamique inverse tente de retrouver, à partir de la transition prédite, l'action qui l'a produite ; l'écart entre cette action reconstruite et l'action réelle est intégré au coût de planification via une pondération adaptative invariante à l'échelle. Les auteurs valident la méthode sur quatre modèles du monde différents et six tâches couvrant la manipulation d'objets rigides et déformables, le contrôle de systèmes articulés et la navigation visuelle, avec un gain systématique en qualité de planification. L'apport principal n'est pas seulement la précision, mais l'efficacité : ACID atteint une exactitude comparable aux méthodes de référence tout en réduisant substantiellement le budget de calcul nécessaire à la planification. C'est un point sensible pour l'embarqué robotique, où le temps de cycle et la puissance de calcul disponible contraignent directement le déploiement temps réel. Le papier touche aussi à un débat plus large dans le secteur : la fiabilité des modèles du monde utilisés pour anticiper les conséquences d'une action avant de l'exécuter, un maillon critique face aux erreurs qui s'accumulent le long d'une trajectoire prédite. Cette approche s'inscrit dans la lignée des travaux sur la planification par modèle prédictif (MPC) couplée à des dynamiques apprises, une alternative aux architectures vision-langage-action de bout en bout comme Pi-0, GR00T N2 ou Helix, qui n'exposent pas de mécanisme de vérification explicite des trajectoires intermédiaires. Publié en preprint, ACID n'a pas encore fait l'objet d'une revue par les pairs ni d'une validation sur robot physique au-delà des bancs de test utilisés dans l'étude ; la suite logique serait une évaluation en conditions réelles et une comparaison directe avec les méthodes de planification par diffusion, autre piste active du domaine.

RecherchePaper
1 source