Aller au contenu principal
RecherchearXiv cs.RO 

NarrativeFlow : un modèle vision-langage-action (VLA) à flux utilisant les champs de vitesse du robot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

NarrativeFlow, publié sur arXiv (2610.00981v1) et accompagné d'une page projet, est un modèle vision-langage-action (VLA) qui génère des « flux robotiques », c'est-à-dire des champs de vitesse continus décrivant le mouvement du robot, à partir d'une instruction en langage naturel. Les auteurs le formulent par flow matching, conditionné sur le texte. L'objectif est d'obtenir des trajectoires physiquement cohérentes avec la manipulation réelle. Le résumé indique que NarrativeFlow surpasse des méthodes de référence sur des jeux de données standards de manipulation conditionnée par le langage, puis qu'il obtient des taux de réussite supérieurs sur plusieurs tâches en conditions réelles. Aucun chiffre n'est fourni dans le résumé : ni taux de succès, ni nombre de tâches, ni plateforme robotique, ni liste des baselines. Il s'agit d'une prépublication, sans produit, sans déploiement ni calendrier annoncé.

L'enjeu porte sur le goulot d'étranglement des modèles de fondation en robotique : la collecte de données propres à chaque morphologie, longue et coûteuse. Un flux de vitesse sert ici de représentation centrée sur le mouvement et indépendante de l'embodiment, ce qui permettrait de mutualiser des données issues de plateformes différentes (bras, mains, voire vidéos). Si l'approche tient ses promesses, un intégrateur pourrait réutiliser des corpus existants au lieu de recollecter des démonstrations pour chaque robot. Les auteurs positionnent leur travail face à deux limites : les méthodes qui approximent grossièrement les flux par des déplacements de points clés épars, et celles qui ne gèrent pas la consigne en langage. Reste à vérifier la généralisation entre morphologies, la robustesse hors laboratoire et le coût de calcul, trois points que le résumé ne documente pas. Les gains « sur les métriques standards » restent à examiner dans l'article complet, notamment la difficulté des tâches réelles et la taille des échantillons d'essais.

Ce travail s'inscrit dans la course aux représentations intermédiaires transférables entre robots, alors que des VLA comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) misent surtout sur la diffusion ou le flow matching directement sur les actions, avec des données massives. Les approches par flux ou par points clés cherchent à tirer parti de vidéos humaines et de données hétérogènes pour contourner cette dépendance. NarrativeFlow prolonge cette lignée en remplaçant les points clés épars par un champ continu. La suite dépendra de la publication du code et des résultats détaillés, ainsi que d'une comparaison directe avec les VLA généralistes sur des benchmarks communs. À ce stade, il s'agit d'une contribution de recherche à confirmer, non d'un système prêt pour l'industrie.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

RotVLA : action latente de rotation pour les modèles vision-langage-action (VLA)
1arXiv cs.RO 

RotVLA : action latente de rotation pour les modèles vision-langage-action (VLA)

Un groupe de chercheurs a publié en mai 2026 RotVLA (arXiv:2605.13403), un framework Vision-Language-Action (VLA) qui substitue la quantification discrète des modèles d'action latente (LAM) existants par une représentation continue dans l'espace de rotation SO(n). Entraîné sur plus de 1 700 heures de données robotiques multi-embodiment et de vidéos humaines, le modèle compte 1,7 milliard de paramètres. Son architecture associe un backbone de modèle vision-langage et une tête d'action par flow-matching, étendue en aval en un "action expert" unifié qui dénoise simultanément actions latentes et actions robot. Sur LIBERO, RotVLA atteint 98,2 % de taux de succès ; sur RoboTwin2.0, il obtient 89,6 % en configuration propre et 88,5 % en configuration randomisée, surpassant les modèles VLA antérieurs dans les deux cas. Des expériences sur des tâches de manipulation réelle confirment ces résultats hors simulation. L'enjeu est architectural : les LAMs actuels, basés sur des pipelines VQ-VAE ou similaires, induisent une reconstruction de frames souvent triviale et n'imposent aucune contrainte géométrique cohérente avec la physique du mouvement. En modélisant les actions latentes comme des éléments de SO(n), RotVLA garantit continuité et compositionnalité absentes des espaces discrets, avec un triplet frame learning qui force une dynamique temporelle non dégénérée. Pour les équipes d'intégration robotique, cela ouvre la voie à un modèle de fondation plus robuste au sim-to-real, l'un des goulots d'étranglement centraux des VLAs en conditions industrielles. L'approche suggère que la structure géométrique de l'espace d'action peut compter autant que l'échelle des données d'entraînement. Le domaine des politiques robotiques généralistes a été structuré par Pi-0 (Physical Intelligence, 2024) et GR00T N2 (NVIDIA, 2025), qui misaient sur des corpus cross-embodiment massifs pour entraîner des politiques généralisables. RotVLA s'inscrit dans cette lignée mais parie sur une représentation latente géométriquement structurée plutôt que sur le volume brut de paramètres, avec 1,7B contre plusieurs dizaines de milliards pour les modèles concurrents les plus ambitieux. Les scores LIBERO et RoboTwin2.0 sont des benchmarks académiques standardisés ; leur transposition sur des cellules industrielles réelles (bras collaboratifs, tri et picking) reste à démontrer. Aucun partenaire de déploiement ni calendrier commercial ne figure dans la publication : RotVLA est, à ce stade, une contribution de recherche.

RechercheOpinion
1 source
RobustVLA : robustesse d'un modèle vision-langage-action face aux perturbations multimodales
2arXiv cs.RO 

RobustVLA : robustesse d'un modèle vision-langage-action face aux perturbations multimodales

RobustVLA s'attaque à un angle mort des modèles Vision-Language-Action (VLA) : leur fragilité face aux perturbations réelles. Une équipe de recherche a d'abord testé les principaux VLA sous 17 types de perturbations réparties sur quatre modalités (actions, instructions, environnement, observations visuelles). Résultat : les actions constituent la modalité la plus fragile, les modèles réputés robustes visuellement (comme BYOVLA) ne conservent aucun gain sur les autres modalités, et pi0 se distingue par une robustesse supérieure aux autres backbones testés. Pour corriger ces faiblesses, les chercheurs proposent RobustVLA, qui combine une optimisation robuste hors ligne contre le pire cas de bruit sur les actions (via l'objectif de flow matching) et un mécanisme forçant des actions cohérentes malgré les variations d'entrée. La sélection automatique des perturbations les plus nuisibles est traitée comme un problème de bandit multi-bras, résolu par un algorithme d'upper confidence bound. Sur le benchmark LIBERO, RobustVLA gagne 12,6% de réussite absolue sur backbone pi0 et 10,4% sur OpenVLA face aux 17 perturbations combinées, avec une inférence 50,6 fois plus rapide que BYOVLA, qui dépend de LLM externes. Cette avancée touche un point sensible pour l'industrie robotique : la plupart des démonstrations de VLA impressionnent en conditions contrôlées mais s'effondrent face au bruit réel (mauvaise calibration caméra, instructions ambiguës, occlusions, dérive capteurs). En identifiant les actions comme le maillon le plus faible, l'étude remet en question l'hypothèse répandue selon laquelle la robustesse visuelle suffirait à garantir un déploiement fiable. Sur robot réel FR5, RobustVLA dépasse pi0 de 65,6% de taux de réussite avec seulement 25 démonstrations, un résultat clé pour les intégrateurs qui manquent de données d'entraînement en environnement industriel. Même avec des données abondantes, le gain reste de 30%, ce qui suggère que la méthode n'est pas qu'un palliatif pour le few-shot mais une amélioration structurelle. Le papier s'inscrit dans la lignée des travaux récents sur pi0 (Physical Intelligence) et OpenVLA, deux architectures de référence dans la course aux modèles génériques de manipulation robotique. Il répond directement aux limites de BYOVLA, une approche antérieure de robustesse visuelle jugée coûteuse en calcul car dépendante de LLM externes. Les auteurs positionnent RobustVLA comme une alternative légère et généralisable, testée à la fois en simulation (LIBERO) et en conditions réelles. Le code et des vidéos de démonstration sont disponibles sur GitHub, ce qui permettra une validation indépendante par la communauté avant une adoption plus large en environnement industriel.

RecherchePaper
1 source
Vision robotique : cartes de points centrées sur le robot pour les modèles vision-langage-action
3arXiv cs.RO 

Vision robotique : cartes de points centrées sur le robot pour les modèles vision-langage-action

Des chercheurs proposent dans un article arXiv (2607.11498v1, soumis en juillet 2026) une méthode baptisée "pointmaps robot-centriques" pour résoudre un problème structurel des modèles vision-langage-action (VLA). Ces modèles prédisent des actions robotiques à partir d'observations visuelles et d'instructions en langage naturel, mais les actions sont définies dans le repère 3D propre au robot, alors que la caméra observe la scène dans son propre repère. Ce décalage reste sans conséquence quand le point de vue de la caméra est fixe, la politique pouvant alors mémoriser une correspondance unique observation-action, mais il devient problématique à mesure que les jeux de données agrègent des démonstrations issues de configurations caméra variées. La solution proposée encode les coordonnées 3D des points de la scène, exprimées dans le repère du robot, directement dans une grille dense H x W, format identique à celui attendu par les VLA 2D pré-entraînés, ce qui permet une intégration avec un minimum de modifications architecturales. Testée sur le benchmark RoboCasa, cette approche améliore les performances de deux modèles existants, pi0.5 et SmolVLA, et surpasse des méthodes de référence basées sur le point de vue caméra ou sur une conscience 3D classique. Cette avancée touche un point sensible pour l'industrialisation des VLA à grande échelle: la généralisation à des configurations caméra non standardisées est un frein connu au déploiement sur des cellules robotiques hétérogènes, où chaque intégrateur positionne ses capteurs différemment. Les expériences sur robot réel confirment que l'avantage par rapport à une politique RGB classique s'accentue justement quand la caméra est déplacée vers un emplacement absent de l'entraînement, ce qui va dans le sens d'une meilleure robustesse au changement de point de vue, condition nécessaire pour des flottes de robots déployées avec des configurations non uniformisées, plutôt qu'un simple gain de performance en conditions contrôlées. Le travail s'inscrit dans la lignée des modèles VLA récents tels que pi-0, GR00T N2 ou Helix, qui cherchent à généraliser l'apprentissage de politiques robotiques à partir de larges corpus de démonstrations multi-plateformes. En comparant explicitement leur méthode à des approches de conditionnement par point de vue caméra et à des baselines 3D-aware, les auteurs positionnent les pointmaps comme une alternative légère à des architectures 3D plus lourdes, ouvrant la voie à des validations plus larges sur des flottes robotiques aux configurations caméra diverses.

RechercheActu
1 source
Faire évoluer un modèle vision-langage-action en agent capable d'utiliser des outils à la volée
4arXiv cs.RO 

Faire évoluer un modèle vision-langage-action en agent capable d'utiliser des outils à la volée

Des chercheurs présentent ART (Agentic Robot with Tool-use), un framework décrit dans un preprint arXiv (2608.14047v1) qui transforme un modèle Vision-Language-Action (VLA) existant en agent capable d'invoquer a la volée des modules outils prêts a l'emploi pour la vision bas niveau, l'estimation d'affordance haut niveau et l'adaptation a l'embodiment du robot. Plutot que de générer directement des actions continues sur tout l'espace de solutions comme le font les VLA classiques, ART réduit cet espace via l'usage d'outils, ce qui améliore la généralisation entre taches et limite la dépendance aux données. L'équipe a constitue un jeu de 30 000 trajectoires d'usage d'outils et de démonstrations, nettement plus réduit que les jeux de données des méthodes de référence, avec un protocole d'entrainement pour le raisonnement sur des trajectoires longues en environnements difficiles. Resultat: un taux de réussite supérieur de 20% aux baselines dominantes, en simulation comme sur des taches réelles de pick-and-place dans l'obscurité a des points de vue inédits. Ce résultat cible deux limites récurrentes des VLA de bout en bout: le besoin de volumes de données toujours plus massifs pour généraliser, et la fragilité des politiques continues face a des scènes inédites (éclairage, angle de vue). En montrant qu'une architecture modulaire, ou le modèle délégué certaines sous-taches a des outils spécialisés plutôt que de tout apprendre dans un seul réseau, réduit la taille du jeu de données nécessaire tout en améliorant la robustesse, ART alimente un débat clé pour les intégrateurs: continuer a scaler des VLA monolithiques comme Pi-0 ou GR00T N2, ou investir dans des couches agentiques orchestrant des outils existants pour un déploiement plus léger. ART s'inscrit dans une tendance qui importe en robotique les techniques de raisonnement agentique déjà éprouvées sur les grands modèles de langage, ou un agent alterne planification et appels d'outils externes plutôt que de tout résoudre en un seul passage. Le travail reste a ce stade un preprint de recherche: aucune date de mise en production, aucun partenaire industriel ni volume de déploiement n'est communique par les auteurs. Il s'ajoute aux efforts de laboratoires développant Pi-0, GR00T ou Helix, qui cherchent tous a rendre les VLA plus généralistes sans multiplier indéfiniment les données d'entrainement, un enjeu suivi de près par les intégrateurs européens du secteur logistique et industriel.

UEAucun acteur ni déploiement européen n'est impliqué, mais la piste intéresse les intégrateurs logistiques et industriels européens qui cherchent des VLA moins gourmands en données.

RechercheActu
1 source