Aller au contenu principal
RecherchearXiv cs.RO 

Apprentissage d'actions du monde par guidage latent spectral centré sur l'interaction

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv WING (World Action Learning via INteraction-Centric Spectral Latent Guidance), un cadre qui transfère des connaissances d'interaction depuis des vidéos égocentriques humaines vers des politiques de manipulation robotique. Il s'attaque à deux obstacles. D'une part, les actions latentes inférées par reconstruction d'images sont polluées par des variations parasites, au premier rang desquelles le mouvement de la caméra portée. WING sépare donc le mouvement induit par l'observateur de l'interaction main-objet, et ne distille que cette seconde composante en actions latentes. D'autre part, humains et robots n'ont pas la même dynamique temporelle. Le système identifie alors, dans le domaine spectral, les composantes basses fréquences communes aux actions latentes égocentriques et aux comportements du robot, puis s'en sert pour guider la génération d'actions. Les auteurs annoncent 99,20 % de réussite moyenne sur LIBERO, 93,80 % sur RoboTwin 2.0 et 57,7 % sur RoboCasa-GR1, ainsi que de bons résultats sur quatre tâches réelles, sans en détailler les chiffres dans le résumé.

L'intérêt tient à l'hypothèse de départ : la sémantique d'une tâche, commune à l'humain et au robot, se loge dans les structures temporelles lentes, alors que la haute fréquence dépend du corps. Si elle se confirme, la vidéo humaine, abondante et peu chère, deviendrait un substitut crédible aux démonstrations téléopérées, dont le coût freine la montée en échelle. Il faut toutefois relativiser. LIBERO approche la saturation, et RoboCasa-GR1, à 57,7 %, rappelle l'écart qui subsiste en simulation sur des tâches plus longues et plus variées. Les résultats réels, sur seulement quatre tâches, ne permettent pas de conclure sur la robustesse en production. Il s'agit d'un article de recherche, sans produit, ni déploiement, ni calendrier.

WING s'inscrit dans la lignée des modèles d'actions latentes, comme LAPA, ou des approches qui exploitent la vidéo humaine pour entraîner des modèles vision-langage-action de type Pi-0 ou GR00T. Tous butent sur le même problème de transfert entre embodiments. La nouveauté ici est le filtrage fréquentiel. La suite logique serait une comparaison directe avec ces références sur des tâches réelles plus nombreuses, avec des chiffres détaillés. Une page projet est disponible pour suivre les démonstrations et, éventuellement, le code.

À lire aussi

ConfAL-WM : apprentissage actif guidé par la confiance pour les modèles du monde conditionnés par l'action
1arXiv cs.RO 

ConfAL-WM : apprentissage actif guidé par la confiance pour les modèles du monde conditionnés par l'action

Une équipe de recherche publie ConfAL-WM, un framework d'apprentissage actif guidé par la confiance pour le post-entraînement de world models conditionnés par l'action, utilisés en robotique pour la prédiction, la planification et la génération de données synthétiques. Décrit dans un preprint arXiv (2608.25572v1) daté d'août 2026, le système s'appuie sur EVAC, un world model existant, auquel les chercheurs greffent une sonde de confiance légère branchée sur les features du décodeur UNet. Cette sonde produit des cartes de confiance denses dans l'espace latent, ensuite agrégées à trois niveaux : tâche, frame et patch. Le pipeline complet fonctionne en trois étapes : réentraînement de la sonde et préchauffage d'EVAC sur un petit sous-ensemble de données du domaine cible, présélection au niveau tâche pour répartir le budget d'échantillonnage, puis réentraînement ciblé avec pondération optionnelle au niveau frame ou patch. Les expériences ont été menées sur le benchmark RoboTwin2.0, avec une page de démonstration visuelle disponible sur ConfAL-WM.github.io. L'intérêt de ce travail tient au problème qu'il cible : dans les world models embarqués, les erreurs de prédiction ne se répartissent pas uniformément mais se concentrent sur des zones précises, bras robotique, objets manipulés, points de contact, zones occluses. Entraîner ou réadapter ces modèles de façon uniforme gaspille donc du calcul et des données d'annotation. Une sélection guidée par la confiance promet de réduire le coût d'adaptation d'un world model à un nouveau domaine ou une nouvelle tâche, un enjeu direct pour les laboratoires qui développent des modèles de type VLA (vision-langage-action) à grande échelle, où le post-entraînement sur données cibles reste coûteux. Les auteurs affirment que leur pondération dense par frame et patch surpasse des méthodes de scoring plus classiques, basées sur une récompense scalaire, une mesure de progrès ou un jugement automatique. Ce travail s'inscrit dans la dynamique plus large des world models conditionnés par l'action comme brique fondamentale pour la planification robotique et la génération de données synthétiques, aux côtés d'approches comme Pi-0 ou GR00T N2. Il ne s'agit toutefois pas d'un produit commercial ni d'un déploiement industriel : c'est une contribution de recherche publiée sur arXiv, sans partenaire industriel ni acteur français ou européen mentionné, dont l'impact réel dépendra de sa reproduction et de son adoption par d'autres laboratoires.

RecherchePaper
1 source
2arXiv cs.RO 

DeltaWorld : simulateurs de monde interactifs physiquement cohérents par apprentissage d'incréments latents conditionnés par l'action

Des chercheurs proposent DeltaWorld, un simulateur de monde interactif pour la manipulation robotique, décrit dans un preprint arXiv (2610.02691v1). Les modèles de monde actuels prédisent l'état latent suivant en entier, ce qui leur fait souvent manquer les changements subtils provoqués par les actions du robot. Le résultat peut être physiquement implausible : objets qui s'interpénètrent, déformations excessives. DeltaWorld change de paradigme avec un « Delta Latent Transition Model » (Delta-LTM). Celui-ci prédit uniquement la variation latente induite par l'action, puis l'ajoute à l'état courant pour obtenir l'état suivant. Un second module, l'« Interaction-aware Latent Alignment », construit des régions d'interaction contrefactuelles et supervise les changements latents liés au contact. Le modèle est évalué sur le benchmark de manipulation IWS et sur un jeu de données multi-robots collecté par les auteurs, couvrant plusieurs morphologies et tâches. Sur ce dernier, DeltaWorld réduit la FVD (Fréchet Video Distance) de 46,6 % et la LPIPS de 31,1 % par rapport à la baseline IWS. L'enjeu dépasse la métrique vidéo. Un simulateur interactif fiable permettrait de planifier, d'entraîner des politiques et de les évaluer sans multiplier les essais physiques, ce qui coûte cher en temps, en matériel et en supervision. Or un modèle de monde qui laisse un objet traverser la pince produit des trajectoires inexploitables pour l'entraînement de politiques VLA (vision-langage-action) ou pour l'évaluation hors ligne. Prédire l'incrément plutôt que l'état complet est un choix d'architecture simple, et il cible le défaut principal des modèles actuels : la dérive physique sur les longs horizons. Il faut toutefois rester prudent. FVD et LPIPS mesurent la qualité perceptuelle, pas la justesse physique ; aucune mesure de taux de succès de politique ou de corrélation avec le monde réel n'est mentionnée dans le résumé. Le jeu de données multi-robots n'étant pas public à ce stade, les gains restent à confirmer indépendamment. Ce travail s'inscrit dans la course aux « world models » pour la robotique, où les simulateurs appris sont présentés comme une alternative ou un complément à la simulation physique classique, et comme un moyen de réduire l'écart simulation-réel. Il se positionne contre IWS, la baseline de référence ici, et s'adresse au même terrain que les grands modèles de monde et de vidéo développés par les laboratoires industriels. Aucune implication d'entreprise, européenne ou autre, ni calendrier de déploiement ou de mise en open source n'est précisé dans le résumé. Il s'agit d'un preprint de recherche, non d'un produit livré. Les prochaines étapes à surveiller sont la publication du code et des données, des tests sur des horizons plus longs, et surtout la preuve que ces simulateurs améliorent concrètement l'entraînement et l'évaluation de politiques sur robot réel.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Apprentissage de modèles du monde par Gaussian Splatting centrés sur les objets et conditionnés par les actions pour objets rigides
3arXiv cs.RO 

Apprentissage de modèles du monde par Gaussian Splatting centrés sur les objets et conditionnés par les actions pour objets rigides

Une équipe de chercheurs publie MRO-GWM (Multi Rigid Object Gaussian World Model), un modèle de monde action-conditionnel capable de prédire en 3D les effets des actions d'un robot sur des objets rigides. Déposé sur arXiv (réf. 2606.01950), le travail combine Gaussian splatting et apprentissage de dynamique : chaque objet de la scène est décrit par un ensemble de gaussiennes dans un référentiel canonique propre, son mouvement étant modélisé comme une transformation de corps rigide (rotation et translation). Un transformateur spatio-temporel prédit la trajectoire future des objets à partir de leur historique gaussien et des actions planifiées par le robot. L'architecture gère les occlusions partielles grâce à un entraînement sur reconstructions multi-vues. Les évaluations portent sur des datasets synthétiques d'objets ménagers en interaction avec un effecteur robot, et sur des tâches de manipulation non préhensile (pousser un objet sans le saisir) dans le cadre d'un contrôle prédictif par modèle (MPC), le tout exclusivement en simulation. L'association de modèles de monde action-conditionnels et de Gaussian splatting est pertinente : les premiers permettent de planifier sans essai-erreur coûteux, le second offre une représentation 3D différentiable adaptée à des géométries complexes sans maillage explicite. La décomposition objet-centrique améliore en théorie la généralisation à de nouvelles configurations de scène, contrairement aux encodages holistes. La validation sur manipulation non préhensile est notable car pousser un objet vers une cible est considéré comme un benchmark difficile : les contacts sont instables et mal modélisés par la plupart des simulateurs physiques. Ces résultats restent toutefois entièrement simulés et limités aux objets strictement rigides, sans aucun transfert sim-to-real documenté. Le Gaussian splatting connaît une adoption rapide en robotique depuis la publication de 3DGS (Kerbl et al., 2023), avec des travaux concurrents comme SplatSim, GaussianWorld ou des approches combinant NeRF et planification. MRO-GWM se distingue par son traitement explicite de la dynamique multi-objets avec interactions physiques, un axe moins couvert que la navigation ou la préhension isolée. Le gap sim-to-real demeure le verrou principal : une validation sur bras réel (type Franka ou UR5) constituerait l'étape naturelle, tout comme une extension aux objets articulés ou semi-rigides, aujourd'hui hors périmètre du modèle.

RecherchePaper
1 source
Apprentissage de la manipulation d'objets depuis zéro par interaction contrastive
4arXiv cs.RO 

Apprentissage de la manipulation d'objets depuis zéro par interaction contrastive

Une équipe de chercheurs propose sur arXiv (réf. 2606.11525, juin 2025) une méthode baptisée Interaction-weighted Resampling (IWR) pour améliorer l'apprentissage par renforcement contrastif (CRL) appliqué à la manipulation robotique. Le CRL apprend des représentations structurées des dynamiques pour résoudre des tâches conditionnées par objectif, mais peinait à gérer les contacts et les saisies. L'article formalise ce problème en modélisant la dynamique de manipulation comme un processus de Markov lisse par morceaux : les changements de mode induits par les contacts créent des structures d'accessibilité non linéaires que les fonctions d'énergie CRL standard ne représentent pas correctement. L'IWR rééchantillonne de manière pondérée autour des trois phases clés (avant, pendant et après le contact) pour que la représentation apprise préserve ces frontières de mode. En simulation, la méthode améliore de 19,8 % en moyenne les performances par rapport aux méthodes CRL existantes sur plusieurs environnements (contrôle 2D dynamique, manipulation, hockey sur table). En transfert sim-to-real, un agent de hockey sur table conditionné par objectif voit son taux de réussite passer de 25 % à 60 %. Ce résultat est notable pour les équipes qui misent sur le RL pur pour la manipulation, un domaine dominé depuis 2023 par l'imitation learning et les politiques de diffusion comme ACT, Diffusion Policy ou pi-0. Le principal obstacle, la discontinuité dynamique liée aux contacts, était jusqu'ici contourné par des démonstrations humaines ou des curricula manuels ; IWR propose une approche mathématiquement fondée pour l'attaquer sans supervision. La progression de 25 % à 60 % en conditions réelles reste cependant modeste, et le domaine de test (hockey sur table planaire, tâche répétitive et bien contrainte) est éloigné de la dextérité multidimensionnelle requise en milieu industriel. Aucune comparaison directe avec des architectures VLA ou diffusion policy sur des benchmarks communs n'est fournie dans le preprint. Le CRL pour la manipulation avait été porté par des travaux issus de Berkeley et de Google DeepMind (GCRL, QuaSAR), sans jamais franchir le verrou du contact-rich. Ce preprint arXiv de juin 2025, non encore soumis à peer-review, s'inscrit dans un effort académique plus large face à la montée en puissance des VLA comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné ; le projet reste à un stade de recherche fondamentale. Le code et les démonstrations vidéo sont disponibles sur la page projet IWR-arxiv.github.io.

RecherchePaper
1 source