Aller au contenu principal
Vers VLA-Dreamer : affiner le comportement des modèles VLA grâce aux modèles du monde
RecherchearXiv cs.RO 

Vers VLA-Dreamer : affiner le comportement des modèles VLA grâce aux modèles du monde

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié sur arXiv fin septembre 2026 sous la référence 2609.31313, intitulé "Towards VLA-Dreamer: Refining VLA Behavior Using World Models", propose une nouvelle architecture pour les modèles vision-langage-action (VLA) utilisés en contrôle robotique. Les auteurs suggèrent d'entraîner un modèle du monde prédictif directement sur l'espace d'embedding de l'encodeur visuel du VLA, plutôt que sur l'espace des pixels comme le font les modèles du monde classiques. L'hypothèse centrale est que ces embeddings, déjà utilisés pour décider des actions du robot, contiennent aussi l'information nécessaire pour anticiper l'évolution future de la scène. La perte d'apprentissage est calculée dans cet espace de représentation, une approche proche des architectures JEPA (joint embedding prédictive architecture). Le modèle du monde ainsi obtenu pourrait ensuite servir à de la planification à court terme, en générant des actions candidates à partir d'une image représentant l'objectif à atteindre.

L'enjeu dépasse la simple curiosité académique. Les VLA actuels, tels que Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, exigent des volumes massifs de données de démonstration par apprentissage par imitation, ce qui reste le principal frein économique à leur déploiement à grande échelle chez les intégrateurs industriels. L'absence de modèle du monde explicite dans ces architectures alimente aussi un doute persistant sur leur capacité réelle à comprendre la dynamique physique plutôt qu'à reproduire des trajectoires mémorisées. Si les embeddings visuels s'avèrent effectivement prédictifs, cela apporterait un argument empirique en faveur de la piste "réduction des données" tant recherchée par le secteur ; dans le cas contraire, cela confirmerait une limite structurelle largement soupçonnée des VLA.

Il s'agit à ce stade d'un "concept paper", c'est-à-dire d'une proposition architecturale sans résultats expérimentaux chiffrés rapportés dans le résumé, à ne pas confondre avec un système validé ou déployé. Elle s'inscrit dans la lignée des travaux JEPA popularisés par Meta AI et Yann LeCun, et vise, selon les auteurs, à mesurer la richesse prédictive des embeddings VLA et à réduire leurs besoins en données via ce module de planification additionnel.

À lire aussi

Veo-Act : améliorer les politiques VLA grâce aux modèles vidéo de pointe
1arXiv cs.RO 

Veo-Act : améliorer les politiques VLA grâce aux modèles vidéo de pointe

Des chercheurs présentent Veo-Act, un système hiérarchique associant le modèle de génération vidéo Veo-3.1 de Google DeepMind à une politique vision-language-action (VLA) pour la manipulation robotique, décrit dans un article déposé sur arXiv (identifiant 2604.04502, version révisée). Veo-3.1 y joue le rôle de planificateur de haut niveau : il génère des séquences vidéo montrant le mouvement attendu de la main et des objets pour réaliser une instruction. Un modèle de dynamique inverse à têtes multiples convertit ces paires d'images générées en commandes motrices, tandis qu'une «porte d'interaction» décide du moment où basculer vers la politique VLA pour l'exécution réactive et précise au niveau bas. Les auteurs ont testé le système en simulation et sur un robot réel, sans préciser charge utile, degrés de liberté ni temps de cycle, ce qui relève de la recherche méthodologique plutôt que de l'annonce produit. L'enjeu visé est bien connu du secteur : l'adaptation orientée action des politiques VLA à partir de modèles vision-langage pré-entraînés dégrade souvent leur généralisation sémantique, fragilisant leur robustesse face à des scènes ambiguës ou hors distribution. Les modèles vidéo généralisent mieux sur des scènes complexes et encodent des a priori sur les mouvements de la main, mais manquent de précision et de réactivité pour une manipulation dextre bas niveau. Veo-Act cherche à combiner ces deux forces : selon les auteurs, l'approche améliore le suivi d'instructions et le taux de réussite par rapport à une politique VLA seule, notamment dans des situations nouvelles et sémantiquement complexes, un résultat qui alimente le débat sur le rôle des modèles vidéo comme planificateurs visuels pour la robotique généraliste, aux côtés d'approches comme pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure). Ce travail s'inscrit dans la montée en puissance des politiques VLA comme paradigme dominant de l'apprentissage robotique généraliste, et dans celle des modèles de génération vidéo dont les progrès en cohérence temporelle poussent plusieurs équipes à les détourner en planificateurs pour la robotique. Aucune entreprise, aucun laboratoire ni acteur français ou européen n'est cité, et le travail reste une contribution académique publiée en version révisée sur arXiv, sans calendrier de déploiement industriel annoncé.

RechercheActu
1 source
Frottement clé pour améliorer les modèles du monde des robots
2Robotics Business Review 

Frottement clé pour améliorer les modèles du monde des robots

Un nouveau papier technique propose une architecture appelée VμA pour corriger un angle mort des modèles du monde en robotique : l'absence du coefficient de frottement statique (μ) parmi les signaux de conditionnement. Aujourd'hui, la quasi-totalité des systèmes conditionnent leurs prédictions sur deux sources seulement, les images de caméras et la position des effecteurs mesurée par les encodeurs articulaires, ce qui suffit pour des tâches en espace libre mais devient insuffisant dès qu'un robot entre en contact avec un objet. Dans de nombreuses implémentations, le contact n'est même pas mesuré directement : il est déduit du courant moteur, un signal proxy éloigné de la physique réelle qui se joue au bout du doigt du gripper. Certains systèmes ajoutent des capteurs tactiles, comme ceux commercialisés par l'entreprise australienne Contactile pour équiper mains et pinces robotiques, avec des gains mesurables sur la préhension adaptative en temps réel et la correction de glissement. Mais ces capteurs restent limités à des cartes de pression, des images de déformation ou, au mieux, une distribution de force sur trois axes : ils disent qu'un contact a lieu et avec quelle intensité, pas si ce contact va tenir. C'est précisément cette lacune que VμA cherche à combler en injectant μ comme entrée de premier ordre. Le coefficient de frottement statique est la grandeur physique qui détermine si un objet saisi reste saisi, en fonction du couple de matériaux, de l'état de surface, de la température ou de la contamination. Il ne peut être ni vu par une caméra, ni déduit du courant moteur, ni reconstruit à partir d'une carte de pression. Pour l'industrie de la manipulation robotique, l'enjeu dépasse la subtilité académique : sans μ, un modèle du monde n'apprend que des corrélations statistiques entre motifs de contact et résultats observés dans ses données d'entraînement, ce qui explique pourquoi ces systèmes échouent souvent à généraliser sur des surfaces ou des objets inédits. Un modèle conditionné sur la friction change de nature, puisqu'il manipule directement la cause physique du glissement plutôt qu'un proxy appris, ce qui intéresse au premier chef les intégrateurs travaillant sur la manipulation en environnement non structuré, de la logistique à l'assemblage fin. Cette proposition s'inscrit dans la course plus large aux modèles du monde généralistes, présentés par une partie du secteur comme la prochaine étape après les architectures vision-langage-action de type Pi-0 ou GR00T N2, censées permettre à un robot de raisonner sur des situations jamais rencontrées plutôt que de mémoriser des tâches. L'argument du papier est en réalité une critique de cette trajectoire : tant que le conditionnement tactile reste incomplet, la promesse de généralisation reste largement théorique pour toute manipulation en contact riche. Les suites concrètes, à savoir une intégration de VμA sur du matériel comme les capteurs Contactile ou des essais chez des intégrateurs industriels, ne sont pas précisées dans le document source.

RecherchePaper
1 source
TACO : modèle du monde tactile en auto-correcteur pour le post-entraînement à grande échelle des VLA
3arXiv cs.RO 

TACO : modèle du monde tactile en auto-correcteur pour le post-entraînement à grande échelle des VLA

Des chercheurs ont présente TACO (TActile world model as a self-COrrector), un cadre de post-entrainement pour les modèles Vision-Language-Action (VLA) dédié aux taches de manipulation robotique a fort contact physique, décrit dans un article publie sur arXiv (2607.02840v1). Le système repose sur une boucle en trois étapes baptisée Recognize-Imagine-Label : un modèle unifie de progression et d'action détecte les états proches de l'échec a partir d'estimations de progression, un modèle génératif visuo-tactile imagine des segments de correction locale, puis ce même modèle de progression-action étiquette ces segments avec des actions correctives exécutables. Applique a des taches réelles de manipulation a fort contact, TACO améliore le taux de réussite de 44 points de pourcentage par rapport a la politique de base, et de 32 points par rapport a une version dépourvue de son mécanisme d'adaptation tactile a isolation de connaissances, qui protégé les priors visuo-linguistiques pré-entraines pendant l'apprentissage. Ce travail cible un angle mort connu des modèles VLA actuels : la vision seule peine a détecter les micro-perturbations de contact (glissement, mauvais alignement, prise partielle) qui, dans une tache d'assemblage ou de préhension fine, peuvent transformer une erreur locale en échec irrécupérable. Jusqu'ici, corriger ce type de défaillance nécessitait soit une supervision humaine couteuse a grande échelle, soit des modèles du monde uniquement visuels susceptibles de générer des trajectoires imaginées plausibles a l'oeil mais physiquement incohérentes au niveau du contact. En montrant qu'un modèle du monde tactile peut produire des corrections exploitables sans superviseur humain et sans dégrader les capacités de base du modèle, TACO apporte un élément de réponse concret a une limite régulièrement pointée par les intégrateurs industriels : des démonstrations VLA impressionnantes en environnement contrôle qui ne se traduisent pas toujours en fiabilité sur des taches de préhension fine en usine ou en logistique. L'approche s'inscrit dans la lignée des travaux récents sur les modèles du monde pour améliorer les politiques robotiques par simulation de rollouts, dans la même veine que ce qui alimente des familles de modèles VLA comme Pi-0, GR00T N2 ou Helix, mais en ajoutant une modalité tactile la ou ces travaux se limitaient jusque-la a la vision. L'article ne précise ni affiliation institutionnelle ni déploiement industriel : il s'agit a ce stade d'une contribution de recherche publiée en preprint, sans intégration annoncée chez un fabricant de bras robotique ou d'humanoïde. La suite logique, si ces résultats se confirment, serait une adoption par des laboratoires travaillant sur la manipulation fine (objets déformables, assemblage électronique, tri logistique), la ou le cout de supervision humaine pour corriger les échecs de contact reste aujourd'hui le principal frein au déploiement a grande échelle des politiques VLA.

RechercheActu
1 source
La gaussienne suffit : les priors par flow matching n'aident pas lors du fine-tuning de grands modèles de comportement
4arXiv cs.RO 

La gaussienne suffit : les priors par flow matching n'aident pas lors du fine-tuning de grands modèles de comportement

Une étude publiée sur arXiv en septembre 2026 (2609.27070) montre que remplacer le prior gaussien standard des politiques de diffusion ou de flow-matching par un prior non gaussien, plus proche de la distribution cible, n'améliore pas le fine-tuning de grands modèles de comportement (Large Behavior Models) préentraînés. Les auteurs testent trois modèles, LBM 1.0 du Toyota Research Institute, Pi-0.5 de Physical Intelligence et GR00T N1.5 de NVIDIA, sur plus de 100 000 essais en simulation couvrant plus de 40 tâches et deux plateformes, ainsi que 1250 essais sur matériel réel portant sur cinq tâches de manipulation bimanuelle. Dans quasiment tous les cas, le prior non gaussien produit des résultats statistiquement indiscernables, voire pires, que le prior gaussien classique; un éventuel avantage n'apparaît que pour de très faibles fractions de données de fine-tuning. Ce résultat contredit l'hypothèse répandue selon laquelle un prior appris, plus proche de la cible, apporterait un gain supplémentaire lors du fine-tuning de modèles préentraînés, un bénéfice pourtant bien établi à l'entraînement from scratch. Pour les intégrateurs qui bâtissent leurs déploiements sur des modèles vision-language-action génériques, l'étude suggère que l'effort d'ingénierie compte moins sur le design du bruit d'entrée que sur l'entraînement de l'encodeur: les politiques fine-tunées convergent vers des actions similaires quel que soit le prior, alors que leurs embeddings divergent fortement du préentraînement. Une ablation du taux d'apprentissage confirme que l'entraînement de l'encodeur reste le facteur dominant de la performance finale, loin devant le choix du prior. L'étude s'inscrit dans la vague de modèles génériques de manipulation robotique préentraînés sur de larges corpus de démonstrations, à l'image de LBM (Toyota Research Institute), de la famille Pi de Physical Intelligence (Pi-0, Pi-0.5) ou de GR00T (NVIDIA). Les gains procurés par des priors non gaussiens n'avaient jusqu'ici été démontrés qu'à l'entraînement from scratch; ce travail est le premier à tester leur transfert au paradigme dominant de la robotique généraliste en 2026, le fine-tuning de fondations préentraînées. Les auteurs concluent en identifiant des pistes pour déterminer dans quelles conditions, notamment à très faible volume de données cibles, un prior appris pourrait malgré tout apporter un bénéfice.

UELes intégrateurs européens qui fine-tunent des modèles VLA génériques (LBM, Pi-0.5, GR00T) peuvent appliquer ces conclusions pour prioriser l'entrainement de l'encodeur plutôt que le design du prior.

RecherchePaper
1 source