Aller au contenu principal
KAM-WM : cartes d'affordance cinématique à partir de modèles du monde latents pour la manipulation robotique
RecherchearXiv cs.RO 

KAM-WM : cartes d'affordance cinématique à partir de modèles du monde latents pour la manipulation robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent KAM-WM, une méthode qui extrait des indices visuels d'interaction directement d'un modèle de monde vidéo latent déjà entraîné, sans avoir besoin de le réentraîner ni de simuler de rollouts complets. Le système interroge une seule fois un modèle de génération image-vers-vidéo par flow matching et interprète sa vélocité latente en une étape comme une carte d'affordance cinématique (KAM), qui indique à la fois où le robot doit agir et selon quelle direction de mouvement initier le geste. Un module Perceiver léger compresse cette carte en tokens qui viennent conditionner une politique de diffusion, combinée aux images RGB et aux données de proprioception. Sur les benchmarks LIBERO et RoboTwin2.0, la méthode atteint 90,6% de réussite moyenne sur LIBERO, et respectivement 65,7% et 22,4% sur les configurations Easy et Hard de RoboTwin2.0.

L'intérêt principal tient à la distinction entre position et direction du geste. Les approches classiques d'affordance, basées sur des masques de segmentation statiques, indiquent uniquement où interagir mais pas comment amorcer le mouvement. Les comparaisons contrôlées menées par les auteurs montrent qu'une partie significative des gains provient justement de cette information directionnelle, et non de la seule localisation spatiale. Pour l'apprentissage par imitation à partir de peu de démonstrations, cela ouvre une piste pour réduire le nombre d'exemples nécessaires sans coût de calcul supplémentaire au moment de l'exécution, puisqu'aucun rollout du modèle de monde n'est requis en test.

Ce travail s'inscrit dans la lignée des recherches sur les priors visuels pour la manipulation robotique, où les politiques conditionnées par affordance cherchent à combler l'écart entre perception et action sans dépendre d'architectures VLA massives comme Pi-0 ou GR00T N2. Contrairement à ces modèles génériques entraînés de bout en bout, KAM-WM mise sur la réutilisation d'un modèle de monde figé, une direction distincte des approches propriétaires des grands acteurs humanoïdes. Les auteurs restent prudents: les résultats se limitent pour l'instant aux environnements simulés LIBERO et RoboTwin2.0, une validation en conditions réelles restant l'étape suivante logique.

À lire aussi

Modèles du monde pour la manipulation robotique
1arXiv cs.RO 

Modèles du monde pour la manipulation robotique

Des chercheurs ont publié en juin 2026 sur arXiv (2606.24742) un modèle généraliste de valeur pour la manipulation robotique, le WVM (World Value Model). La proposition centrale consiste à substituer les backbones VLM (Vision-Language Model) habituellement utilisés par un modèle de monde, nativement mieux adapté à la modélisation temporelle nécessaire pour évaluer la progression d'une tâche. Sur les benchmarks standards, WVM atteint les meilleures performances connues en Value-Order Correlation (VOC), la métrique de référence pour les modèles de valeur robotiques. L'équipe introduit également Suboptimal-Value-Bench, un benchmark multi-embodiment composé de 800 trajectoires sous-optimales annotées frame par frame par des humains, comblant un angle mort des évaluations existantes qui ne contenaient que des données expertes. L'enjeu est directement opérationnel pour quiconque entraîne des systèmes de manipulation à grande échelle : les données collectées en conditions réelles sont rarement uniformément expertes. Un modèle de valeur précis permet de pondérer ou filtrer ces trajectoires hétérogènes, améliorant la qualité de l'entraînement sans nettoyage manuel coûteux. WVM démontre des gains de performance sur plusieurs approches d'extraction de politique, en simulation comme en déploiement réel, ce qui renforce la thèse que l'estimation de valeur est un composant orthogonal et complémentaire au choix d'architecture de politique. La robustesse maintenue sur données sous-optimales est l'aspect le plus significatif : c'est précisément dans ce régime que les VLMs classiques décrochent, leurs préentraînements sur observations visuelles statiques ne suffisant pas à capturer les dynamiques temporelles longues. La montée en puissance des VLA comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA a rendu critique la question de la qualité des données d'entraînement à grande échelle. L'approche WVM s'inscrit dans une tendance émergente qui consiste à spécialiser les composants : un backbone temporel dédié pour l'évaluation de la valeur, distinct du modèle d'action. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans cet article purement académique. Les prochaines étapes naturelles incluent l'intégration du WVM dans des pipelines d'imitation à grande échelle ou en combinaison avec du reinforcement learning offline (IQL, CQL), et une extension à des environnements multi-tâches plus complexes.

RechercheOpinion
1 source
HiMem-WAM : modèles d'action-monde à mémoire hiérarchique pour la manipulation robotique
2arXiv cs.RO 

HiMem-WAM : modèles d'action-monde à mémoire hiérarchique pour la manipulation robotique

Une équipe de recherche a déposé sur arXiv (2606.10363v1) HiMem-WAM, un nouveau modèle d'action hiérarchique pour la manipulation robotique. L'architecture s'attaque à une limitation persistante des World Action Models (WAM) existants : leur incapacité à maintenir une mémoire de tâche cohérente sur des séquences longues, typiques des manipulations multi-étapes. HiMem-WAM combine trois mécanismes : des actions latentes centrées sur le mouvement (niveau bas), des latents de compétences de haut niveau, et une porte mémoire déclenchée aux transitions de compétences prédites. Ce verrou mémoire écrit des états compacts à des moments-clés, permettant l'inférence causale sans génération vidéo ni estimation de flux optique au moment du test. Le modèle a été évalué sur les benchmarks LIBERO, LIBERO-PLUS et RMBench, ainsi que sur des tâches en conditions réelles. La contribution principale est d'ordre systémique : la structuration hiérarchique améliore la robustesse sous perturbations lors du déploiement, là où la plupart des architectures VLA actuelles échouent dès qu'un événement imprévu survient en milieu de séquence. Pour un décideur industriel, c'est un signal pertinent : le module mémoire apporte, selon les auteurs, un gain substantiel sur les tâches longues dépendantes de l'historique d'action. Éviter la génération vidéo en temps d'inférence réduit également la latence et la charge computationnelle, deux freins réels au déploiement embarqué. Ces résultats restent toutefois issus d'un preprint non peer-reviewed, et les performances sur benchmarks standardisés ne garantissent pas les mêmes gains en environnement de production non contrôlé. Les World Action Models constituent un paradigme récent qui apprend les dynamiques visuelles pertinentes pour l'action, distinct des architectures VLA classiques comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, lesquelles s'appuient sur des transformers multimodaux de grande taille. La manipulation longue-horizon reste un défi ouvert pour l'ensemble du secteur : ni les diffusion-policies ni les modèles language-conditioned n'ont résolu le maintien du contexte sur des séquences dépassant une dizaine de sous-tâches. HiMem-WAM propose une piste architecturale concrète, mais sans intégration hardware annoncée ni timeline de déploiement, ce qui en fait pour l'instant une contribution de recherche fondamentale.

RechercheOpinion
1 source
HiTac-WAM : un modèle hiérarchique d'action du monde tactile pour la manipulation robotique à contacts riches
3arXiv cs.RO 

HiTac-WAM : un modèle hiérarchique d'action du monde tactile pour la manipulation robotique à contacts riches

Un preprint publié sur arXiv le 21 août 2026 décrit HiTac-WAM, un modèle monde d'action tactile et hiérarchique pour la manipulation robotique en contact riche (arXiv:2608.19574v1). Le système décompose la prévision tactile en trois étages successifs, état de contact, champ de déformation 3D, puis risque de glissement, et classe les segments d'action candidats selon ces prévisions avant de déclencher une replanification si l'écart entre tactile prédit et observé persiste à l'exécution. À budget d'entraînement égal, cette hiérarchie réduit l'erreur de déplacement 3D de 17,6% et améliore la détection de glissement de 60,4% par rapport à des prédicteurs non hiérarchiques. Sur trois tâches robotiques réelles, préhension de puces électroniques, effacement de tableau, insertion de connecteur USB, cette sélection fait passer le taux de réussite moyen de 31,1% à 61,1%, et le système complet atteint 72,2%, avec un F1 de contact moyen de 0,921. Ces résultats indiquent qu'une modélisation structurée du signal tactile, plutôt que la représentation en image ou en flux latent utilisée par les approches existantes, améliore nettement la fiabilité de la manipulation en contact riche, un point de friction connu pour l'assemblage fin, l'insertion de connecteurs ou la manipulation d'objets fragiles. Le taux de réussite plus que doublé par rapport à une sélection sans hiérarchie tactile suggère que séparer contact, déformation et glissement capture mieux la physique du contact que les architectures bout en bout existantes, un argument utile pour les intégrateurs cherchant à dépasser la démonstration contrôlée. Pour les équipes travaillant sur des modèles monde ou des architectures vision-langage-action, ce travail illustre une piste pour fiabiliser l'action à partir du retour tactile sans nécessairement accroître le volume de données. Le travail s'inscrit dans la lignée des modèles monde d'action qui prédisent conjointement observations et actions, en corrigeant une limite des variantes tactiles existantes: l'absence de dépendances physiques structurées entre contact, déformation et glissement. Il s'agit à ce stade d'un preprint arXiv nouvellement soumis, validé sur trois tâches de manipulation en laboratoire et non d'un produit déployé ou d'un pilote industriel, sans calendrier de commercialisation annoncé, les gains restant à confirmer au-delà de ces trois tâches.

RecherchePaper
1 source
Modèles du monde pour la manipulation robotique : une synthèse de la littérature
4arXiv cs.RO 

Modèles du monde pour la manipulation robotique : une synthèse de la littérature

Une revue de littérature publiée sur arXiv (2606.00113) cartographie l'état de l'art des modèles du monde (world models) appliqués à la manipulation robotique. Les auteurs recensent cinq familles de représentations prédictives : modèles de dynamique latente, générateurs vidéo conditionnés par l'action, prédicteurs de scène 3D et 4D, simulateurs à contraintes physiques, et modules prédictifs embarqués dans les systèmes vision-langage-action (VLA). La revue couvre 34 jeux de données de manipulation et propose une taxonomie fonctionnelle distinguant les modèles intégrant prédiction et action de ceux servant de planificateurs explicites. Trois axes structurent l'analyse : quelle représentation future est prédite, comment la prédiction se connecte à l'action, et à quel moment du pipeline d'apprentissage robotique elle intervient. Cette synthèse répond à un besoin concret : le terme "world model" recouvre des réalités très hétérogènes, ce qui brouille les comparaisons et ralentit les transferts technologiques entre laboratoires. En posant une définition opérationnelle stricte (un world model est un système prédictif conditionné par l'action, distinct des modules de perception, des politiques ou des fonctions de valeur), les auteurs établissent un cadre commun dont manquait le secteur. La revue confirme que ces systèmes évoluent d'outils de simulation spécialisés vers une infrastructure générique pour l'apprentissage robotique : génération d'expériences synthétiques, filtrage de candidats, vérification de résultats. Ce glissement architectural touche directement les pipelines de pré-entraînement, de post-entraînement et d'adaptation à l'inférence, trois phases critiques pour quiconque industrialise un robot manipulateur. Le domaine a accéléré avec l'essor des VLA comme Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA), et l'adoption des architectures Transformer en robotique, mais sans convergence méthodologique. La fragmentation reflète une course entre grands labs (Google DeepMind, MIT, Stanford, Berkeley) et startups qui ne partagent ni benchmarks ni protocoles d'évaluation communs. Les défis ouverts identifiés par les auteurs, notamment la modélisation des contacts, le contrôle des hallucinations, l'alignement action-prédiction et le benchmarking en boucle fermée, tracent un agenda de recherche pour les prochaines années. Pour les équipes travaillant sur la manipulation industrielle ou les bras collaboratifs, cette revue constitue une feuille de route pour choisir quelle classe de world model intégrer selon le cas d'usage : data augmentation, planification prédictive ou vérification de trajectoires.

UELes équipes européennes (INRIA, CEA-List, labos collaboratifs) travaillant sur la manipulation robotique peuvent s'appuyer sur cette taxonomie pour structurer leurs choix d'architecture world model, mais aucun acteur ni financement européen n'est impliqué directement.

RecherchePaper
1 source