Aller au contenu principal
VLAff : un modèle vision-langage-affordance unifié pour les capacités d'action
RecherchearXiv cs.RO 

VLAff : un modèle vision-langage-affordance unifié pour les capacités d'action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une publication arXiv soumise en août 2026 présente VLAff, un modèle vision-langage-affordance conçu pour apprendre aux robots à manipuler des objets à partir de vidéos humaines filmées à la première personne. Le verrou visé est connu du secteur : la morphologie d'un bras robotique diffère de celle d'une main humaine, ce qui complique le transfert direct des gestes observés. Les auteurs contournent l'obstacle en extrayant des affordances centrées sur l'objet, indépendantes de la morphologie du robot, qui précisent où interagir, comment saisir et comment déplacer. La méthode combine reconstruction 3D par Structure-from-Motion et reconstruction de maillage de la main sur des vidéos égocentriques, appliquée à un nouveau jeu de données, EgoAffordance, comptant 204 000 épisodes, 5,6 millions d'affordances visuelles et 11,6 millions d'affordances de préhension et de trajectoire. Entraîné sur cette base, VLAff génère, à partir d'une observation et d'une instruction, des cartes de chaleur d'affordance, des poses de préhension et des trajectoires, converties en actions exécutables via les informations de scène 3D.

Ce travail s'inscrit dans une tendance de fond de la robotique manipulative : exploiter la masse de vidéos humaines disponibles en ligne pour pallier la rareté et le coût des données de téléopération robotique. Si l'état de l'art revendiqué en prédiction d'affordance visuelle se confirme au-delà des bancs d'essai internes des auteurs, la méthode ouvrirait une source de données bon marché pour les modèles vision-langage-action que développent des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T) ou Figure AI (Helix), tous engagés dans la course aux modèles fondation génériques pour la manipulation. Un bémol s'impose toutefois : les résultats sont pour l'instant mesurés en interne, sans comparaison indépendante publiée, et les démonstrations de manipulation zero-shot sur robot réel restent, d'après le résumé, cantonnées à des scénarios de laboratoire plutôt qu'à un déploiement industriel.

La recherche sur les affordances actionnables, où et comment interagir avec un objet, est un axe actif de la robotique et de la vision par ordinateur depuis plusieurs années, mais les travaux antérieurs se limitaient souvent à une seule modalité ou à des jeux de données restreints tournés en environnement contrôlé. L'apport revendiqué par VLAff est d'unifier trois modalités, visuelle, préhension et trajectoire, dans un seul modèle fondation entraîné sur des vidéos égocentriques du quotidien plutôt que sur des démonstrations robotiques dédiées et coûteuses. Le papier ne précise ni affiliation institutionnelle ni calendrier de publication du code ou du jeu de données : il s'agit à ce stade d'une contribution académique, non d'un produit ou d'un pilote industriel annoncé, dont la suite logique serait la publication du code pour permettre à la communauté de reproduire les résultats.

À lire aussi

VLAFlow : un cadre d'entraînement unifié pour les modèles vision-langage-action via co-entraînement et alignement latent futur
1arXiv cs.RO 

VLAFlow : un cadre d'entraînement unifié pour les modèles vision-langage-action via co-entraînement et alignement latent futur

Des chercheurs présentent VLAFlow (Vision-Language-Action Flow), un framework unifié de flow-matching destiné à comparer objectivement les différents paradigmes d'entraînement des modèles vision-langage-action (VLA) en manipulation robotique. L'étude s'appuie sur OXEMix, un corpus hétérogène d'environ 5 000 heures de données combinant DROID, OpenX-Embodiment, OpenX-Augmented et RoboCOIN. Sous une architecture commune de type pi-0, avec le même backbone VLM, le même action expert et un espace d'action à 14 dimensions, les auteurs évaluent quatre approches strictement comparables : l'entraînement sur les seules actions (MindPI), le co-entraînement supervisé par le langage (MindLPI), l'alignement des représentations latentes futures (MindWPI), et leur combinaison (MindLWPI). Les tests sont menés sur trois bancs d'essai de référence : LIBERO, LIBERO-Plus et SimplerEnv. Pour les équipes qui entraînent des modèles VLA sur des données robotiques hétérogènes, l'apport principal n'est pas un nouveau produit mais une comparaison contrôlée rare dans un champ où architecture, données et protocole d'évaluation varient habituellement d'un papier à l'autre, rendant les résultats difficiles à départager. Les résultats montrent que l'entraînement action seule se dégrade quand les données proviennent de sources trop diverses, un signal utile pour qui envisage de simplement agréger des jeux de données multi-robots sans garde-fou. La supervision par le langage préserve la généralisation vision-langage, et l'alignement latent futur améliore la modélisation des transitions d'état et des relations action-résultat. La combinaison des deux signaux (MindLWPI) offre le transfert le plus stable sur l'ensemble des bancs d'essai, suggérant qu'un espace de méta-action combinant contraintes linguistiques et prédictives rend l'apprentissage par imitation plus robuste au passage à l'échelle. Ce travail s'inscrit dans la lignée des architectures pi-0 popularisées par Physical Intelligence, dans un paysage où Nvidia (GR00T N2), Figure (Helix) ou d'autres laboratoires développent également des modèles généralistes pour la manipulation robotique. Contrairement à des annonces produit, il s'agit ici d'une publication de recherche (preprint arXiv) centrée sur la méthodologie d'entraînement plutôt que sur un déploiement matériel. Les auteurs positionnent VLAFlow comme un socle reproductible pour de futures comparaisons de paradigmes, sans annoncer pour l'instant de calendrier de mise à disposition du code ou des poids du modèle.

RechercheActu
1 source
UniMem : mémoire et contrôle multimodaux unifiés pour les modèles vision-langage-action
2arXiv cs.RO 

UniMem : mémoire et contrôle multimodaux unifiés pour les modèles vision-langage-action

UniMem, un framework qui unifie mémoire multimodale de haut niveau et contrôle bas niveau dans une seule architecture pour les modèles Vision-Language-Action (VLA), est décrit dans une preprint arXiv publiée fin aout 2026 (arXiv:2608.22869v1). Le système combine trois composants: un classificateur d'événements qui déclenche les mises a jour mémoire, un encodeur de keyframes pour construire une mémoire spatiale dense, et une technique de mise en cache des keyframes destinée a limiter la surcharge de calcul pendant l'exécution des politiques. Les auteurs ont teste UniMem sur neuf taches au total, cinq en simulation et quatre sur matériel physique, toutes conçues pour solliciter la mémoire séquentielle et spatiale du robot. Les résultats annonces montrent un taux de réussite de 93,4% contre 68,2% pour une base de référence a échantillonnage d'images a intervalles fixes en simulation, et 80,0% contre 43,5% face a une architecture hiérarchique classique sur matériel réel, avec en prime une inférence plus rapide. Ce travail cible un point de friction reconnu dans le déploiement de VLA sur des taches longues et non markoviennes, celles ou l'action a prendre dépend d'événements passes et pas seulement de l'observation courante. Les approches existantes ajoutent généralement un second modèle vision-langage charge de gérer la mémoire long terme en amont du VLA, ce qui créé un goulot d'étranglement et un pipeline d'entrainement fragmente en deux étapes distinctes. Conditionner le modèle sur plusieurs images historiques choisies a intervalles arbitraires dégradé aussi souvent la performance. En proposant un backbone unique entrainable de bout en bout, UniMem promet une adoption plus simple pour les intégrateurs et laboratoires qui construisent des politiques robotiques a long horizon, sans empiler des modules de mémoire externes couteux en latence. Le problème de la mémoire dans les VLA s'inscrit dans la même trajectoire de recherche que des systèmes généralistes comme Pi-0, GR00T N2 ou Helix, qui ont déjà démontre la capacité des architectures VLA a généraliser sur des taches manipulatoires variées mais restent généralement limites a des comportements réactifs de courte durée. UniMem se positionne explicitement contre les architectures hiérarchiques a deux modèles, qu'il compare directement dans ses benchmarks matériels, avec seulement quatre taches physiques testées et des chiffres qui restent auto-rapportes par les auteurs. Le site du projet (losterberg3.github.io/unimem-vla) met a disposition les démonstrations vidéo associées; aucun calendrier de mise en open source du code ni partenariat industriel n'est communique a ce stade, le travail restant au niveau de la publication de recherche.

RechercheActu
1 source
RotVLA : action latente de rotation pour les modèles vision-langage-action (VLA)
3arXiv cs.RO 

RotVLA : action latente de rotation pour les modèles vision-langage-action (VLA)

Un groupe de chercheurs a publié en mai 2026 RotVLA (arXiv:2605.13403), un framework Vision-Language-Action (VLA) qui substitue la quantification discrète des modèles d'action latente (LAM) existants par une représentation continue dans l'espace de rotation SO(n). Entraîné sur plus de 1 700 heures de données robotiques multi-embodiment et de vidéos humaines, le modèle compte 1,7 milliard de paramètres. Son architecture associe un backbone de modèle vision-langage et une tête d'action par flow-matching, étendue en aval en un "action expert" unifié qui dénoise simultanément actions latentes et actions robot. Sur LIBERO, RotVLA atteint 98,2 % de taux de succès ; sur RoboTwin2.0, il obtient 89,6 % en configuration propre et 88,5 % en configuration randomisée, surpassant les modèles VLA antérieurs dans les deux cas. Des expériences sur des tâches de manipulation réelle confirment ces résultats hors simulation. L'enjeu est architectural : les LAMs actuels, basés sur des pipelines VQ-VAE ou similaires, induisent une reconstruction de frames souvent triviale et n'imposent aucune contrainte géométrique cohérente avec la physique du mouvement. En modélisant les actions latentes comme des éléments de SO(n), RotVLA garantit continuité et compositionnalité absentes des espaces discrets, avec un triplet frame learning qui force une dynamique temporelle non dégénérée. Pour les équipes d'intégration robotique, cela ouvre la voie à un modèle de fondation plus robuste au sim-to-real, l'un des goulots d'étranglement centraux des VLAs en conditions industrielles. L'approche suggère que la structure géométrique de l'espace d'action peut compter autant que l'échelle des données d'entraînement. Le domaine des politiques robotiques généralistes a été structuré par Pi-0 (Physical Intelligence, 2024) et GR00T N2 (NVIDIA, 2025), qui misaient sur des corpus cross-embodiment massifs pour entraîner des politiques généralisables. RotVLA s'inscrit dans cette lignée mais parie sur une représentation latente géométriquement structurée plutôt que sur le volume brut de paramètres, avec 1,7B contre plusieurs dizaines de milliards pour les modèles concurrents les plus ambitieux. Les scores LIBERO et RoboTwin2.0 sont des benchmarks académiques standardisés ; leur transposition sur des cellules industrielles réelles (bras collaboratifs, tri et picking) reste à démontrer. Aucun partenaire de déploiement ni calendrier commercial ne figure dans la publication : RotVLA est, à ce stade, une contribution de recherche.

RechercheOpinion
1 source
RynnVLA-002 : un modèle unifié vision-langage-action (VLA) et du monde
4arXiv cs.RO 

RynnVLA-002 : un modèle unifié vision-langage-action (VLA) et du monde

Une équipe de recherche a publié RynnVLA-002, un modèle unifié combinant Vision-Language-Action (VLA) et world model, présenté en preprint sur arXiv (2511.17502v3). L'architecture couple deux composantes interdépendantes : le world model prédit des états visuels futurs à partir des actions et observations courantes, apprenant ainsi la physique implicite de l'environnement ; le modèle VLA génère en retour les actions suivantes depuis des observations visuelles brutes. Ce couplage bidirectionnel vise un apprentissage conjoint de la dynamique environnementale et de la planification motrice. Sur le benchmark de simulation LIBERO, RynnVLA-002 atteint 97,4 % de taux de succès sans pré-entraînement. En conditions réelles, dans des expériences conduites avec le framework open-source LeRobot de Hugging Face, l'intégration du world model améliore le taux de succès global de 50 % par rapport au modèle VLA seul. L'intérêt de cette architecture tient dans la mutualisation de deux paradigmes historiquement distincts. Les world models ont longtemps servi d'outils de planification offline ou de data augmentation, tandis que les VLA visent la génération d'actions en temps réel depuis des observations brutes. RynnVLA-002 cherche à démontrer leur renforcement mutuel : le world model corrige la génération d'actions en anticipant leurs conséquences visuelles, ce qui réduit la dépendance aux données d'entraînement dans des zones peu couvertes. Le gain de 50 % en real-world est significatif, mais le preprint reste peu disert sur la diversité des tâches testées et les conditions expérimentales précises, ce qui rend une évaluation indépendante prématurée. Pour les équipes confrontées au sim-to-real gap, l'idée d'ancrer une VLA dans une représentation physique anticipatrice constitue néanmoins une direction crédible. Les VLA sont devenus un terrain de compétition dense depuis Pi-0 de Physical Intelligence, OpenVLA, et les approches RoboVLMs, qui exploitent des backbones vision-langage pré-entraînés pour produire des politiques généralisables. Côté world models, des travaux comme Dreamer (DeepMind) et UniSim ont popularisé la prédiction vidéo comme supervision indirecte pour la robotique. RynnVLA-002 cherche à unifier explicitement ces deux lignes, se différenciant ainsi des architectures à modules séparés. À sa troisième version de preprint, le travail est en itération active, mais aucune affiliation institutionnelle claire ni partenariat industriel n'est mentionné dans l'abstract, ce qui limite l'évaluation de sa maturité réelle. Les prochaines étapes logiques incluront une validation sur des benchmarks plus exigeants comme CALVIN ou RLBench, et idéalement une publication des poids du modèle pour permettre une réplication indépendante.

UEL'utilisation de LeRobot (framework open-source de HuggingFace, entreprise française) comme cadre expérimental de référence valide l'écosystème robotique open-source porté par un acteur français, sans impact direct sur le marché ou la R&D en France/UE.

RechercheOpinion
1 source