Aller au contenu principal
ConfAL-WM : apprentissage actif guidé par la confiance pour les modèles du monde conditionnés par l'action
RecherchearXiv cs.RO 

ConfAL-WM : apprentissage actif guidé par la confiance pour les modèles du monde conditionnés par l'action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie ConfAL-WM, un framework d'apprentissage actif guidé par la confiance pour le post-entraînement de world models conditionnés par l'action, utilisés en robotique pour la prédiction, la planification et la génération de données synthétiques. Décrit dans un preprint arXiv (2608.25572v1) daté d'août 2026, le système s'appuie sur EVAC, un world model existant, auquel les chercheurs greffent une sonde de confiance légère branchée sur les features du décodeur UNet. Cette sonde produit des cartes de confiance denses dans l'espace latent, ensuite agrégées à trois niveaux : tâche, frame et patch. Le pipeline complet fonctionne en trois étapes : réentraînement de la sonde et préchauffage d'EVAC sur un petit sous-ensemble de données du domaine cible, présélection au niveau tâche pour répartir le budget d'échantillonnage, puis réentraînement ciblé avec pondération optionnelle au niveau frame ou patch. Les expériences ont été menées sur le benchmark RoboTwin2.0, avec une page de démonstration visuelle disponible sur ConfAL-WM.github.io.

L'intérêt de ce travail tient au problème qu'il cible : dans les world models embarqués, les erreurs de prédiction ne se répartissent pas uniformément mais se concentrent sur des zones précises, bras robotique, objets manipulés, points de contact, zones occluses. Entraîner ou réadapter ces modèles de façon uniforme gaspille donc du calcul et des données d'annotation. Une sélection guidée par la confiance promet de réduire le coût d'adaptation d'un world model à un nouveau domaine ou une nouvelle tâche, un enjeu direct pour les laboratoires qui développent des modèles de type VLA (vision-langage-action) à grande échelle, où le post-entraînement sur données cibles reste coûteux. Les auteurs affirment que leur pondération dense par frame et patch surpasse des méthodes de scoring plus classiques, basées sur une récompense scalaire, une mesure de progrès ou un jugement automatique.

Ce travail s'inscrit dans la dynamique plus large des world models conditionnés par l'action comme brique fondamentale pour la planification robotique et la génération de données synthétiques, aux côtés d'approches comme Pi-0 ou GR00T N2. Il ne s'agit toutefois pas d'un produit commercial ni d'un déploiement industriel : c'est une contribution de recherche publiée sur arXiv, sans partenaire industriel ni acteur français ou européen mentionné, dont l'impact réel dépendra de sa reproduction et de son adoption par d'autres laboratoires.

À lire aussi

Apprentissage natif de prior d'action à partir de vidéos pour les modèles d'action du monde
1arXiv cs.RO 

Apprentissage natif de prior d'action à partir de vidéos pour les modèles d'action du monde

Des chercheurs publient sur arXiv (2610.03391) NAVA-WAM, un « world action model » (WAM) qui apprend une politique d'action directement à partir de vidéos sans annotation d'actions. Un WAM combine la prédiction de la dynamique visuelle future et celle des actions du robot. Jusqu'ici, ces modèles dépendaient de trajectoires robotiques annotées avec les actions, rares et coûteuses à collecter. NAVA-WAM s'entraîne en deux étapes. Le pré-entraînement porte sur des vidéos d'observation seule : une supervision par flow matching sur les transitions visuelles futures est propagée, via une attention jointe structurée par transitions, jusqu'à l'Action-DiT, le module de diffusion qui produit les actions. Celui-ci acquiert ainsi des « priors » d'action. La seconde étape affine l'Action-DiT sur des démonstrations étiquetées par un flow matching conjoint vidéo-action. Une attention asymétrique découple la branche visuelle du débruitage itératif des actions, ce qui permet une inférence rapide, limitée aux actions. Les auteurs affirment de meilleurs résultats que les approches antérieures, en distribution comme hors distribution, une bonne efficacité en nombre d'étiquettes d'action et une généralisation sur robot réel. Le résumé ne fournit ni score chiffré, ni liste de tâches, ni nom de plateforme robotique. L'enjeu est celui du goulot d'étranglement des données. Les modèles vision-langage-action (VLA) et leurs variantes à modèle de monde se heurtent au coût de la téléopération. Les vidéos humaines ou robotiques sans étiquettes, elles, existent en grande quantité. Les méthodes actuelles les exploitent par deux voies indirectes : pré-entraîner des représentations visuelles qu'il faut ensuite adapter au contrôle, ou inférer des « actions latentes » à ancrer ensuite sur des commandes robot. NAVA-WAM supprime ces intermédiaires, ce qui limiterait les pertes de transfert et la complexité d'un modèle d'action latente séparé. Si le résultat tient à grande échelle, le volume de données robotiques annotées nécessaires pour une nouvelle tâche ou un nouvel embodiment pourrait baisser. Un intégrateur pourrait alors réutiliser des vidéos de ses propres lignes. Prudence toutefois : il s'agit d'un preprint non évalué par des pairs. Les gains annoncés restent à confirmer par des benchmarks indépendants, avec des détails sur la quantité de vidéos et la diversité des tâches réelles testées. Ce travail s'inscrit dans la course aux WAM et aux politiques apprises de vidéo, face aux VLA entraînés sur démonstrations (Pi-0, GR00T) et aux approches par actions latentes. Les prochaines étapes à surveiller sont la publication du code et des poids, des évaluations sur des corpus vidéo plus larges, et une comparaison directe avec les modèles de fondation industriels. Les auteurs ne signalent aucun partenaire industriel ni déploiement.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Apprentissage de modèles du monde par Gaussian Splatting centrés sur les objets et conditionnés par les actions pour objets rigides
2arXiv cs.RO 

Apprentissage de modèles du monde par Gaussian Splatting centrés sur les objets et conditionnés par les actions pour objets rigides

Une équipe de chercheurs publie MRO-GWM (Multi Rigid Object Gaussian World Model), un modèle de monde action-conditionnel capable de prédire en 3D les effets des actions d'un robot sur des objets rigides. Déposé sur arXiv (réf. 2606.01950), le travail combine Gaussian splatting et apprentissage de dynamique : chaque objet de la scène est décrit par un ensemble de gaussiennes dans un référentiel canonique propre, son mouvement étant modélisé comme une transformation de corps rigide (rotation et translation). Un transformateur spatio-temporel prédit la trajectoire future des objets à partir de leur historique gaussien et des actions planifiées par le robot. L'architecture gère les occlusions partielles grâce à un entraînement sur reconstructions multi-vues. Les évaluations portent sur des datasets synthétiques d'objets ménagers en interaction avec un effecteur robot, et sur des tâches de manipulation non préhensile (pousser un objet sans le saisir) dans le cadre d'un contrôle prédictif par modèle (MPC), le tout exclusivement en simulation. L'association de modèles de monde action-conditionnels et de Gaussian splatting est pertinente : les premiers permettent de planifier sans essai-erreur coûteux, le second offre une représentation 3D différentiable adaptée à des géométries complexes sans maillage explicite. La décomposition objet-centrique améliore en théorie la généralisation à de nouvelles configurations de scène, contrairement aux encodages holistes. La validation sur manipulation non préhensile est notable car pousser un objet vers une cible est considéré comme un benchmark difficile : les contacts sont instables et mal modélisés par la plupart des simulateurs physiques. Ces résultats restent toutefois entièrement simulés et limités aux objets strictement rigides, sans aucun transfert sim-to-real documenté. Le Gaussian splatting connaît une adoption rapide en robotique depuis la publication de 3DGS (Kerbl et al., 2023), avec des travaux concurrents comme SplatSim, GaussianWorld ou des approches combinant NeRF et planification. MRO-GWM se distingue par son traitement explicite de la dynamique multi-objets avec interactions physiques, un axe moins couvert que la navigation ou la préhension isolée. Le gap sim-to-real demeure le verrou principal : une validation sur bras réel (type Franka ou UR5) constituerait l'étape naturelle, tout comme une extension aux objets articulés ou semi-rigides, aujourd'hui hors périmètre du modèle.

RecherchePaper
1 source
Modèle du monde critique pour l'apprentissage par renforcement vision-langage-action (WCM)
3arXiv cs.RO 

Modèle du monde critique pour l'apprentissage par renforcement vision-langage-action (WCM)

Des chercheurs ont publié fin juillet 2026 un article arXiv (2607.29613) présentant le World Critic Model (WCM), une nouvelle architecture pour l'apprentissage par renforcement (RL) appliqué aux modèles Vision-Language-Action (VLA) utilisés en manipulation robotique. Le problème ciblé est celui des méthodes RL à base de critique, qui évaluent la valeur d'une action à partir d'une seule image ou d'un seul instant du flux visuel, un choix mal adapté au contrôle robotique où l'observation est par nature partielle et séquentielle. Bâti sur une architecture légère dérivée de LeJEPA, WCM prédit conjointement l'état latent futur de la scène et estime la valeur de l'action, ce qui force le critique à apprendre la dynamique temporelle plutôt qu'à simplement régresser un score. Le système s'intègre aux pipelines on-policy et off-policy et fonctionne avec les backbones VLA de référence Pi0, Pi0.5 et OpenVLA-OFT. Les auteurs rapportent des résultats état de l'art sur 149 tâches réparties sur quatre benchmarks, avec des gains marqués en généralisation hors distribution, ainsi qu'une validation sur sept tâches de manipulation réelles combinant OpenVLA-OFT et Pi0.5 en RL off-policy. L'enjeu dépasse la seule performance chiffrée: le RL post-entraînement des modèles VLA est aujourd'hui l'un des leviers les plus regardés pour fiabiliser les politiques robotiques au-delà de l'imitation pure, mais les critiques scalaires classiques peinent justement là où le contrôle réel exige de la mémoire et de l'anticipation. Si les gains de généralisation se confirment en dehors du cadre des benchmarks académiques, WCM pourrait devenir un composant standard pour les équipes qui affinent des VLA en production plutôt qu'une simple curiosité de laboratoire, en particulier pour les intégrateurs qui cherchent à réduire l'écart entre démonstration en simulation et déploiement réel. L'article s'inscrit dans la lignée des travaux récents sur l'apprentissage par prédiction de représentations latentes (JEPA, popularisé par Meta AI) appliqués à la robotique, et complète les approches critic-based existantes du RL pour VLA. Les auteurs ne précisent pas de plan de mise en open source ni de calendrier d'intégration dans des stacks robotiques commerciales; l'étape suivante logique serait une validation à plus grande échelle sur des plateformes industrielles.

RechercheActu
1 source
HALO-WA : apprentissage par renforcement en ligne guidé par le latent, à attention hybride, pour modèles monde-action
4arXiv cs.RO 

HALO-WA : apprentissage par renforcement en ligne guidé par le latent, à attention hybride, pour modèles monde-action

Des chercheurs viennent de publier sur arXiv (7 juillet 2026, arXiv:2607.04265) HALO-WA, un framework d'apprentissage par renforcement en ligne destine aux modèles "world-action" (WA), ces systèmes capables de générer de longues séquences d'actions pour la manipulation robotique généraliste. Le problème cible: ces modèles échouent fréquemment dans les derniers millimètres d'un alignement ou d'une insertion, a cause d'erreurs de calibration, de perception ou de dynamique de contact. HALO-WA ajoute un adaptateur acteur-critique léger qui exploite les caractéristiques latentes et les a priori d'action déjà produits par le modèle WA, via une structure d'attention hybride qui préservé la cohérence temporelle des séquences tout en intégrant le contexte visuel et les besoins de correction en fin de tache. Teste sur quatre taches de manipulation de précision en conditions réelles, le système fait grimper le taux de succès moyen de 26,4% pour le modèle WA de base a 87,1%, soit 19,2 points devant le meilleur système concurrent, avec seulement 45 a 75 minutes d'entrainement en ligne par tache. Des expériences complémentaires ont été menées en simulation sur RoboTwin, et le code est disponible sur GitHub (YeanRoot/HALO-WA). L'enjeu dépasse la prouesse technique isolée: la manipulation de précision, ce dernier millimètre ou tout se joue lors d'un vissage, d'une insertion de connecteur ou d'un assemblage fin, reste le talon d'Achille des modèles VLA/WA généralistes vantes par des systèmes comme GR00T N2, Pi-0 ou Helix. Ces architectures génèrent des séquences d'actions impressionnantes en démonstration mais s'effondrent souvent des que la tolérance géométrique se resserre, illustrant l'écart persistant entre la démo et le déploiement industriel réel. En montrant qu'un correctif RL léger, applique en quelques dizaines de minutes et sans reentrainer le modèle de base, peut tripler le taux de réussite, HALO-WA offre une piste concrète pour les intégrateurs qui cherchent a fiabiliser des cellules robotiques sans repasser par des mois de collecte de données et de fine-tuning lourd. C'est un argument en faveur de pipelines hybrides ou un gros modèle généraliste fournit la structure d'action pendant qu'un module d'adaptation local, bon marche, absorbe les erreurs spécifiques au site de déploiement. Cette approche s'inscrit dans la vague des modèles world-action apparus avec les VLA de nouvelle génération, censés unifier perception, langage et contrôle moteur pour la manipulation généraliste, une famille qui mélange offres commerciales et travaux de recherche ouverte. Le choix de RoboTwin comme banc d'essai simule et la publication du code renforcent une logique de reproductibilité plutôt que de simple annonce marketing, une distinction que le secteur peine parfois a maintenir face a des communiques mettant en avant des vidéos sélectionnées. Reste a voir si cette méthode d'adaptation en ligne se généralisé au-delà des quatre taches testées et des architectures WA existantes, et si des acteurs industriels, européens ou américains, intègreront ce type de correctif léger dans leurs propres piles logicielles pour accélérer le passage du prototype au déploiement en usine.

RecherchePaper
1 source