Aller au contenu principal
GWM-VLA : une modélisation latente du monde tenant compte de la géométrie pour le VLA
RecherchearXiv cs.RO 

GWM-VLA : une modélisation latente du monde tenant compte de la géométrie pour le VLA

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Publié sur arXiv sous la référence 2608.07619 (août 2026), GWM-VLA est un nouveau cadre de modélisation latente du monde pour les modèles vision-langage-action (VLA) utilisés en manipulation robotique. L'architecture combine trois éléments : un module d'encodage multi-vues géométriquement conscient, nommé VGGT-Ω, qui agrège à chaque pas de temps les flux de plusieurs caméras pour construire un état multi-vues cohérent ; un modèle du monde latent qui prédit uniquement les tokens de patch de l'étape suivante pour une vue cible unique, la caméra de poignet du bras robotique dans les expériences, plutôt que de reconstruire l'intégralité de la scène multi-vues ; et une représentation d'action latente partagée qui conditionne à la fois ce modèle du monde et une tête d'action par flow-matching, entraînée simultanément par supervision de prédiction latente et par les actions robotiques réelles. Les auteurs testent le système en simulation et sur robot réel, sans détailler de chiffres de performance dans le résumé public.

L'enjeu vise une faiblesse connue des VLA : leurs performances de manipulation, solides en conditions contrôlées, se dégradent souvent face à des changements visuels ou environnementaux comme l'éclairage, la position de caméra ou l'arrière-plan. La plupart des modèles du monde latents existants encodent chaque vue caméra indépendamment et prédisent la dynamique globale de la scène sans modéliser explicitement les relations géométriques entre vues, ce qui fragilise la robustesse. En imposant une cohérence géométrique multi-vues dès l'encodage, GWM-VLA s'inscrit dans les efforts récents pour combler l'écart entre démonstrations en laboratoire et déploiement réel, un point sensible pour les intégrateurs qui évaluent des politiques VLA de type Pi-0, GR00T N2 ou Helix pour des lignes de production ou de la logistique, où la variabilité des scènes est la norme plutôt que l'exception.

GWM-VLA s'ajoute à une vague de recherches associant modélisation du monde et apprentissage d'actions pour renforcer la généralisation des politiques robotiques, un axe explore en parallèle par plusieurs laboratoires travaillant sur les architectures VLA à grande échelle. L'article ne précise ni l'affiliation institutionnelle des auteurs ni de comparaison chiffrée avec des bases de référence publiées, ce qui en fait pour l'instant une contribution académique en preprint, non revue par les pairs, plutôt qu'un produit ou un déploiement industriel. Aucune date de publication en conférence, aucun partenariat industriel ni feuille de route de déploiement ne sont mentionnés ; la validation indépendante de la robustesse annoncée reste donc à établir par la communauté.

À lire aussi

DEAL-Grasp : représentation d'alignement découplée pour une préhension dextérique tenant compte de la géométrie
1arXiv cs.RO 

DEAL-Grasp : représentation d'alignement découplée pour une préhension dextérique tenant compte de la géométrie

Publié sur arXiv le 24 septembre 2026 sous la référence 2609.28131, l'article présente DEAL-Grasp, une méthode de génération de prises dextres pour mains articulées, robotiques ou virtuelles, destinée à la réalité virtuelle, l'intelligence incarnée et les humains numériques. Plutôt que de mélanger mouvement rigide global et articulation des doigts dans un même espace comme le font les méthodes existantes, ce qui produit des contacts instables et physiquement implausibles, DEAL-Grasp sépare les deux : la pose de la main est recalculée par un alignement de Procrustes en forme close, sans optimisation itérative, tandis que l'articulation des doigts est préservée. La génération repose sur du flow matching avec régularisation physique pendant l'entraînement, sans optimisation ni guidage physique requis à l'inférence. Sur les benchmarks MultiDex et RealDex, ce dernier testé en zero-shot, la méthode affiche un fort taux de réussite sous perturbation de force, une pénétration minimale entre main et objet, une grande diversité de prises générées, et une latence d'inférence nettement inférieure aux méthodes concurrentes fondées sur l'optimisation. Ce résultat s'attaque à un vrai goulot d'étranglement de la manipulation robotique et de l'animation numérique : la plupart des générateurs de prises dextres nécessitent une optimisation physique coûteuse après génération pour corriger des contacts aberrants, ce qui freine leur usage en temps réel. En supprimant cette étape grâce à un calcul en forme close, DEAL-Grasp réduit la latence, un atout pour la téléopération, la simulation et les mains robotiques multi-doigts des humanoïdes. Cela confirme la montée du flow matching comme alternative à la diffusion pour générer des comportements robotiques rapides et physiquement plausibles. Les résultats restent toutefois limités à des benchmarks académiques et à la simulation ; rien n'indique à ce stade un déploiement sur robot physique. Le travail s'inscrit dans la lignée des méthodes de synthèse de prises par régression ou diffusion, qui couplent pose globale et articulation et recourent à une optimisation physique post-hoc ou à un guidage auxiliaire pour stabiliser les contacts, une contrainte que DEAL-Grasp cherche précisément à éliminer. Il rejoint aussi la tendance à l'adoption du flow matching dans les politiques de contrôle robotique, technique également employée par des modèles VLA comme Pi-0. MultiDex et RealDex servent de bancs d'essai standards du domaine. Publié comme preprint non encore évalué par les pairs, avec code et page projet en ligne, le travail n'annonce pour l'instant aucune validation sur mains robotiques physiques ni calendrier de déploiement.

RecherchePaper
1 source
Hydra-0 : flux d'action pour la modélisation généraliste du monde et le contrôle
2arXiv cs.RO 

Hydra-0 : flux d'action pour la modélisation généraliste du monde et le contrôle

Hydra-0, un nouveau modèle du monde généraliste pour la robotique, a été présenté dans un preprint publié sur arXiv le 19 août 2026 (arXiv:2608.18077). Le système repose sur un concept baptisé "action flow" : les actions du robot y sont représentées comme un flux de mouvement de pixels plutôt que comme des commandes articulaires classiques, ce qui crée une interface visuelle commune permettant d'apprendre les conséquences des actions à travers différents robots, tâches, environnements et architectures de génération vidéo. Dans sa meilleure configuration, Hydra-0 réduit l'erreur de mouvement du robot de 90,4% et l'erreur de mouvement des objets de 60,2% par rapport à une base de référence conditionnée par l'action classique. Sur le benchmark RoboLab, le modèle atteint une corrélation de Pearson de r=0,96 entre les taux de réussite rejoués en simulation et les taux de réussite de référence, un signal de fidélité élevé pour l'évaluation de politiques en boucle ouverte. Les auteurs décrivent aussi un mode inverse émergent : le modèle peut prédire un mouvement robotique compatible à partir d'un flux d'objet désiré transféré depuis une démonstration humaine, une "tête d'action" entraînée convertissant ensuite ces représentations latentes en actions exécutables sans démonstration robotique experte spécifique à la tâche. Pour l'industrie robotique, ce travail s'attaque directement à deux goulots d'étranglement connus des approches vision-language-action (VLA) : la dépendance à des démonstrations robotiques coûteuses par tâche, et la difficulté à faire généraliser un modèle entre embodiments et environnements hétérogènes. En transformant l'action en un signal visuel partagé, l'approche promet une adaptation plus économe en données et une composition zero-shot de comportements, deux propriétés recherchées par les intégrateurs qui veulent déployer un même modèle sur plusieurs plateformes matérielles sans réentraînement lourd. Il faut toutefois noter qu'il s'agit d'un résultat de recherche publié en preprint, évalué sur un benchmark interne (RoboLab) et non d'un système déployé en production ou en usine ; les gains annoncés restent à confirmer par une évaluation indépendante et par des essais sur robots physiques réels au-delà du cadre expérimental décrit. Ce travail s'inscrit dans la vague plus large des modèles du monde et des architectures VLA développés ces dernières années pour unifier perception, prédiction et contrôle robotique, un axe de recherche où plusieurs laboratoires cherchent à résoudre le fossé entre démonstrations en simulation et transfert vers le réel. La piste ouverte par le mode inverse d'Hydra-0, apprendre le contrôle à partir de vidéos humaines sans démonstration robotique dédiée, pourrait, si elle se confirme à plus grande échelle, réduire significativement le coût de collecte de données pour l'entraînement de politiques robotiques généralistes. L'article ne précise pas de calendrier de déploiement industriel ni de partenariat commercial associé.

RecherchePaper
1 source
MAVP : politiques visuomotrices tenant compte de la carte pour la manipulation mobile
3arXiv cs.RO 

MAVP : politiques visuomotrices tenant compte de la carte pour la manipulation mobile

Un travail de recherche en robotique publié sur arXiv le 23 septembre 2026 sous la référence 2609.26378v1 présente MAVP (Map-Aware Visuomotor Policies), un framework destiné à fiabiliser l'exécution des robots à manipulation mobile, c'est-à-dire combinant base roulante et bras articulé. Le constat de départ : les politiques entraînées par démonstration peinent souvent à reproduire fidèlement le déplacement de la base, ce qui provoque un désalignement spatial et fait échouer la manipulation qui suit. MAVP reconstruit une carte statique à partir de démonstrations téléopérées, exprime les trajectoires de base démontrées dans ce référentiel cartographique commun, puis, à l'exécution, prédit conjointement des poses cibles de base, des actions du bras et de la pince à partir d'images RGB, de l'état des articulations et de la pose courante du robot sur la carte. Un contrôleur de bas niveau suit ensuite ces cibles par anticipation de mouvement et retour d'erreur de pose, avec un bruit ajouté sur la pose pendant l'entraînement pour renforcer la robustesse. Sur six tâches de manipulation réelles et trois familles de politiques testées, MAVP obtient un taux de succès supérieur au contrôle de vitesse "non ancré" dans l'ensemble des cas, sans que le résumé ne publie de chiffres agrégés précis. Le résultat cible un point de friction bien identifié dans l'apprentissage par imitation appliqué à la manipulation mobile : le contrôle de vitesse pur de la base dérive avec le temps et casse la coordination entre déplacement et geste de préhension, un problème qui freine aujourd'hui le passage des démonstrations de laboratoire à des déploiements fiables en usine ou en entrepôt. En ancrant explicitement chaque politique à une carte et à une pose absolue plutôt qu'à une commande de vitesse relative, MAVP s'attaque directement à l'écart documenté entre démonstrations réussies et exécution robuste en conditions réelles, un enjeu central pour les intégrateurs qui évaluent des politiques génératives type VLA pour des robots mobiles manipulateurs ou des humanoïdes à base roulante. Pour les décideurs B2B, l'apport n'est pas un nouveau modèle de fondation mais une brique de contrôle complémentaire, validée sur trois familles de politiques différentes, ce qui suggère une méthode transposable plutôt qu'une solution propriétaire liée à un seul modèle. Le travail s'inscrit dans la lignée des recherches académiques cherchant à corriger les limites du contrôle de vitesse non ancré, pratique héritée de la robotique mobile classique et transposée telle quelle aux politiques d'apprentissage par imitation. Le site dédié au projet, hébergé sous une adresse GitHub Pages anonymisée, suggère un papier soumis en évaluation en double aveugle à une conférence de robotique ou d'apprentissage automatique, sans que les auteurs ni leur affiliation ne soient révélés à ce stade : il s'agit donc d'une contribution de recherche et non d'un produit commercial. Aucun acteur français ou européen n'apparaît dans ces travaux. Les auteurs annoncent la mise à disposition de vidéos et de résultats complémentaires en ligne, mais ne communiquent ni feuille de route produit ni partenariat industriel ; la suite logique, en cas d'acceptation, sera l'extension de la méthode à davantage de tâches et de plateformes pour confirmer sa généralité au-delà des six cas testés.

RecherchePaper
1 source
Formage de sensibilité pour la modélisation latente
4arXiv cs.RO 

Formage de sensibilité pour la modélisation latente

Des chercheurs ont soumis en juin 2026 (arXiv:2606.14585) une méthode de régularisation pour les modèles de dynamique génératifs utilisés en planification robotique. La contribution centrale, baptisée "régularisation de sensibilité au contrôle conditionnée par le support", s'attaque à un angle mort dans les systèmes de détection hors-distribution (OOD) actuels. Le problème identifié : lorsqu'un modèle de dynamique appris est localement insensible à certains choix d'action critiques, une commande non supportée peut produire des prédictions latentes qui ressemblent à des transitions déjà vues à l'entraînement, masquant les signaux OOD malgré des erreurs de prédiction réelles importantes. Les expériences couvrent trois scénarios : l'évitement d'obstacles par vision, la manipulation d'objets, et la navigation sur robot réel en boucle fermée. Ce résultat touche directement le déploiement sûr de robots pilotés par apprentissage dans des environnements non contrôlés. La détection OOD est le filet de sécurité qui permet à un contrôleur de signaler qu'il opère hors de sa distribution de compétence, plutôt que d'extrapoler dangereusement. Les méthodes existantes greffent a posteriori des estimateurs de support sur un modèle de dynamique figé, et échouent précisément dans les zones critiques où le modèle est le moins discriminant sur les actions. La méthode proposée intervient pendant l'entraînement : elle pousse le modèle à répondre de manière sensible aux variations de commande dans les régions à fort support empirique, tout en limitant l'extrapolation instable là où les données manquent. C'est une correction intrinsèque au processus d'apprentissage, pas un ajout post-hoc. Le travail s'inscrit dans le courant des modèles du monde latents pour la robotique, une famille qui inclut des architectures comme RSSM (utilisé dans Dreamer), TDMPC ou les représentations sous-jacentes à des systèmes comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. La fermeture du "demo-to-reality gap" et la fiabilité en boucle fermée restent des obstacles majeurs pour les intégrateurs cherchant à déployer des robots en milieu industriel non structuré. Les résultats reportés montrent une amélioration de la détection OOD sans dégradation notable de la performance nominale du planificateur, bien que les benchmarks restent limités à des tâches de laboratoire. Une validation sur des plateformes AMR ou humanoïdes en conditions réelles constituerait la prochaine étape naturelle pour crédibiliser l'approche à l'échelle industrielle.

RecherchePaper
1 source