Aller au contenu principal
FibVLA : un modèle vision-langage-action temporel efficace avec échantillonnage de Fibonacci
RecherchearXiv cs.RO 

FibVLA : un modèle vision-langage-action temporel efficace avec échantillonnage de Fibonacci

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

FibVLA, un nouveau modèle vision-langage-action (VLA) présenté dans un article publié sur arXiv (2607.29596v1), s'attaque à un problème central des architectures actuelles: la difficulté à exploiter l'historique temporel sans sacrifier la vitesse d'inférence en temps réel. Les VLA classiques se contentent généralement de la perception du moment présent; ceux qui tentent d'intégrer un contexte long souffrent d'une chute de performance liée à l'encodage de séquences étendues. FibVLA propose deux mécanismes pour résoudre ce compromis: un échantillonnage rétrospectif logarithmique (logarithmic hindsight sampling) appliqué aux états proprioceptifs et aux images, qui capture les dépendances temporelles longue durée avec un minimum de redondance, et un module d'action reposant sur le flow matching couplé à une stratégie d'inférence récurrente dite "Fibonacci", générant des plans d'action sur un horizon étendu à partir d'un retour en boucle fermée en temps réel. Les auteurs rapportent une amélioration nette de la fluidité des mouvements et des taux de réussite, sans avoir besoin de réentraîner les encodeurs visuels de grande taille.

Cette approche répond à une tension concrète pour l'industrie robotique: les intégrateurs veulent des robots capables de raisonner sur une séquence d'actions passées, pas seulement sur l'image instantanée, mais chaque milliseconde d'inférence compte pour un contrôle en boucle fermée. Si les résultats se confirment à plus grande échelle, FibVLA illustrerait qu'il est possible d'obtenir un raisonnement temporel étoffé sans payer le prix habituel en latence, un point sensible dans le débat sur l'écart entre démonstrations impressionnantes et déploiement industriel réel.

FibVLA s'inscrit dans une lignée de modèles VLA qui cherche à généraliser l'IA incarnée, aux côtés d'approches comme RT-2, OpenVLA, Pi-0 ou GR00T N2, où la gestion efficace du contexte temporel reste un défi ouvert. L'article ne précise pas de partenariat industriel ni de calendrier de déploiement; il s'agit à ce stade d'un travail de recherche évalué en conditions réelles limitées, dont la prochaine étape logique serait une validation sur des plateformes robotiques plus variées et des tâches de manipulation plus complexes.

À lire aussi

TS-Mask VLA : masquage spatio-temporel 2D pour un modèle vision-langage-action avec pontage efficace
1arXiv cs.RO 

TS-Mask VLA : masquage spatio-temporel 2D pour un modèle vision-langage-action avec pontage efficace

Une équipe de recherche présente TS-Mask VLA, un nouveau modèle vision-langage-action (VLA) destiné à la manipulation robotique, décrit dans un article publié sur arXiv (2607.09818v1). Le système repose sur deux innovations techniques : un expert d'action à diffusion discrète doté d'un mécanisme appelé Bridge Attention, qui permet un conditionnement multi-couches depuis le modèle vision-langage pour générer des actions plus précises et stables, et une stratégie de masquage temporo-spatial en deux dimensions appliquée aux tokens d'action discrets, censée renforcer la compréhension des dépendances entre instants successifs et du couplage entre dimensions de l'action. Sur le benchmark de simulation LIBERO, TS-Mask VLA atteint un taux de réussite moyen de 95,7 %, avec seulement 0,5 milliard de paramètres, un score supérieur à celui de modèles nettement plus volumineux. Sur CALVIN, autre benchmark de référence pour les tâches robotiques longues et séquentielles, il obtient la meilleure longueur de séquence moyenne réussie observée, 4,19, signe d'une bonne tenue sur les scénarios à horizon long. Ce résultat intéresse directement le secteur de la robotique manipulative parce qu'il s'attaque à une limite connue des VLA autorégressifs actuels, qui traitent la génération d'action comme une simple prédiction du token suivant, sans modéliser explicitement la structure temporelle et spatiale des séquences de mouvement ni séparer clairement représentation perceptuelle et action. Si les gains de performance se confirment en dehors des benchmarks académiques, cela indiquerait qu'un modèle nettement plus compact peut rivaliser, voire dépasser, des architectures VLA plus lourdes sur des tâches de manipulation complexes, un argument important pour les intégrateurs cherchant à déployer ces modèles avec des contraintes de calcul embarqué. Il s'agit toutefois pour l'instant d'un travail de recherche validé uniquement sur des benchmarks de simulation (LIBERO, CALVIN) et quelques tâches réelles limitées, sans déploiement industriel ni intégration dans un produit commercial. L'article s'inscrit dans la lignée des travaux récents sur les VLA à diffusion, dans la continuité d'approches comme les modèles de type Pi-0 ou GR00T, sans toutefois s'y comparer directement dans le résumé fourni. Les auteurs annoncent des analyses d'ablation détaillées pour justifier chacun des deux choix de conception.

RechercheActu
1 source
STeP : logique temporelle de signaux pour des spécifications précises de génération d'actions avec des modèles vision-langage
2arXiv cs.RO 

STeP : logique temporelle de signaux pour des spécifications précises de génération d'actions avec des modèles vision-langage

Des chercheurs proposent STeP, un cadre hiérarchique qui relie les modèles vision-langage-action (VLA) à la logique temporelle de signaux (Signal Temporal Logic, STL), un formalisme mathématique servant à spécifier des contraintes spatiales, temporelles et logiques de façon précise et vérifiable. Concrètement, une politique de haut niveau s'appuie sur un modèle vision-langage pour décomposer une instruction en langage naturel en sous-tâches, générer pour chacune une spécification STL, puis choisir la politique de bas niveau adaptée à son exécution : soit un contrôle prédictif par modèle (MPC) guidé directement par les contraintes STL, soit une politique apprise dont l'exécution est surveillée en continu via ces mêmes contraintes, pour les comportements perceptuellement complexes ou impliquant des contacts physiques. Le système a été évalué sur un banc de manipulation de table en conditions réelles, avec replanification possible si une contrainte est violée en cours d'exécution. Il s'agit d'un article de recherche (arXiv, catégorie "new"), pas d'un produit commercialisé. L'enjeu dépasse la simple démonstration technique. Les modèles VLA génèrent des trajectoires impressionnantes en généralisation mais restent largement des boîtes noires, incapables de garantir qu'une instruction précise, du type "posez l'objet dans les 5 secondes sans dépasser telle zone", sera réellement respectée. Pour des intégrateurs industriels, cette absence de vérifiabilité formelle est un frein direct à l'adoption en environnement contraint, là où une simple démo vidéo ne suffit pas. En réintroduisant des méthodes formelles héritées du contrôle et de la vérification de systèmes cyber-physiques, ce travail illustre une tentative de combler l'écart entre le battage médiatique autour des VLA et des garanties d'exécution exploitables en production. Ce projet s'inscrit dans la lignée des modèles VLA récents (Pi-0, GR00T N2, Helix, RT-2 et dérivés) qui ont démontré la faisabilité de politiques génératives multi-tâches, mais sans mécanisme natif d'interprétabilité ni de contrôle formel. STeP se positionne comme une couche intermédiaire plutôt qu'un modèle concurrent. À ce stade, seule une validation en laboratoire sur tâches de table a été menée, aucun pilote industriel ni déploiement à plus grande échelle n'a été annoncé.

RecherchePaper
1 source
RynnVLA-002 : un modèle unifié vision-langage-action (VLA) et du monde
3arXiv cs.RO 

RynnVLA-002 : un modèle unifié vision-langage-action (VLA) et du monde

Une équipe de recherche a publié RynnVLA-002, un modèle unifié combinant Vision-Language-Action (VLA) et world model, présenté en preprint sur arXiv (2511.17502v3). L'architecture couple deux composantes interdépendantes : le world model prédit des états visuels futurs à partir des actions et observations courantes, apprenant ainsi la physique implicite de l'environnement ; le modèle VLA génère en retour les actions suivantes depuis des observations visuelles brutes. Ce couplage bidirectionnel vise un apprentissage conjoint de la dynamique environnementale et de la planification motrice. Sur le benchmark de simulation LIBERO, RynnVLA-002 atteint 97,4 % de taux de succès sans pré-entraînement. En conditions réelles, dans des expériences conduites avec le framework open-source LeRobot de Hugging Face, l'intégration du world model améliore le taux de succès global de 50 % par rapport au modèle VLA seul. L'intérêt de cette architecture tient dans la mutualisation de deux paradigmes historiquement distincts. Les world models ont longtemps servi d'outils de planification offline ou de data augmentation, tandis que les VLA visent la génération d'actions en temps réel depuis des observations brutes. RynnVLA-002 cherche à démontrer leur renforcement mutuel : le world model corrige la génération d'actions en anticipant leurs conséquences visuelles, ce qui réduit la dépendance aux données d'entraînement dans des zones peu couvertes. Le gain de 50 % en real-world est significatif, mais le preprint reste peu disert sur la diversité des tâches testées et les conditions expérimentales précises, ce qui rend une évaluation indépendante prématurée. Pour les équipes confrontées au sim-to-real gap, l'idée d'ancrer une VLA dans une représentation physique anticipatrice constitue néanmoins une direction crédible. Les VLA sont devenus un terrain de compétition dense depuis Pi-0 de Physical Intelligence, OpenVLA, et les approches RoboVLMs, qui exploitent des backbones vision-langage pré-entraînés pour produire des politiques généralisables. Côté world models, des travaux comme Dreamer (DeepMind) et UniSim ont popularisé la prédiction vidéo comme supervision indirecte pour la robotique. RynnVLA-002 cherche à unifier explicitement ces deux lignes, se différenciant ainsi des architectures à modules séparés. À sa troisième version de preprint, le travail est en itération active, mais aucune affiliation institutionnelle claire ni partenariat industriel n'est mentionné dans l'abstract, ce qui limite l'évaluation de sa maturité réelle. Les prochaines étapes logiques incluront une validation sur des benchmarks plus exigeants comme CALVIN ou RLBench, et idéalement une publication des poids du modèle pour permettre une réplication indépendante.

UEL'utilisation de LeRobot (framework open-source de HuggingFace, entreprise française) comme cadre expérimental de référence valide l'écosystème robotique open-source porté par un acteur français, sans impact direct sur le marché ou la R&D en France/UE.

RechercheOpinion
1 source
Évolution continue des compétences dans un modèle vision-langage-action (VLA)
4arXiv cs.RO 

Évolution continue des compétences dans un modèle vision-langage-action (VLA)

Des chercheurs ont publié Stellar VLA (arXiv:2511.18085v3), un cadre d'apprentissage continu par imitation (continual imitation learning, CIL) pour les modèles Vision-Langage-Action (VLA). La méthode propose deux variantes progressives : T-Stellar, fondée sur une modélisation plate centrée sur les tâches, et TS-Stellar, organisée en structure hiérarchique tâche-compétence. Les expériences menées sur le benchmark LIBERO, référence standard pour les tâches de manipulation robotique, montrent que les deux variantes surpassent les baselines VLA et CIL actuelles, avec seulement 1 % de rejeu de données. Une validation en conditions réelles sur une plateforme bi-bras, avec des configurations de scènes et d'embodiments distincts, confirme que le transfert de connaissances entre tâches reste effectif au-delà du simulateur. Le principal apport de Stellar VLA est d'adresser un frein structurel au déploiement des grands modèles VLA : les méthodes CIL existantes nécessitent des paramètres additionnels ou des modules externes, ce qui les rend difficilement scalables lorsque le modèle de base est déjà massif. En optimisant conjointement des représentations de tâches et un espace de connaissances partagé, Stellar VLA introduit un mécanisme de routage expert guidé par la sémantique, sélectionnant les K embeddings les plus proches pour orienter le modèle vers la compétence pertinente, sans alourdir l'architecture. Pour les équipes qui déploient des robots polyvalents en production, cela ouvre la voie à l'apprentissage incrémental de nouvelles tâches avec un coût de fine-tuning réduit. TS-Stellar se distingue notamment sur les manipulations hiérarchiques complexes, et les visualisations publiées illustrent une rétention robuste des compétences acquises ainsi qu'une capacité de découverte automatique de nouvelles tâches. Les VLA constituent un axe de recherche en accélération depuis 2023, portés par Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA), OpenVLA (UC Berkeley) ou encore RT-2 (Google DeepMind), qui cherchent à généraliser la manipulation robotique via un préentraînement multimodal massif. La question du catastrophic forgetting, c'est-à-dire la perte des compétences antérieures lors de l'apprentissage d'une nouvelle tâche, reste un verrou non résolu à l'échelle industrielle. Stellar VLA se positionne comme une surcouche légère applicable à des VLA existants, sans retraining complet. Le projet est documenté sur stellarvla.github.io ; aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans la publication, qui reste à ce stade un travail de recherche académique.

RechercheOpinion
1 source