Aller au contenu principal
Préserver les capacités fondamentales des modèles VLA à flux de correspondance via un SFT conservateur
IA physiquearXiv cs.RO 

Préserver les capacités fondamentales des modèles VLA à flux de correspondance via un SFT conservateur

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Le fine-tuning non contraint des modèles Vision-Language-Action (VLA) basés sur le flow matching provoque un phénomène bien documenté : l'écrasement massif des paramètres entraînés, qui dégrade les capacités générales acquises en pré-entraînement. Une équipe de recherche publie sur arXiv (2605.08879) une méthode baptisée ConSFT (Conservative Supervised Fine-Tuning), un nouvel objectif d'optimisation qui permet d'adapter un VLA à une distribution cible sans effacer ses compétences préalables. La méthode a été évaluée sur les benchmarks LIBERO et RoboTwin avec trois modèles de référence : pi-0, pi-0.5 et GR00T-N1.6-3B. Résultat : ConSFT dépasse le fine-tuning supervisé classique de plus de 20 points absolus en rétention de capacités, et rivalise avec l'Experience Replay, une méthode connue mais gourmande en données historiques, sans en nécessiter aucune. Des déploiements physiques sur robots confirment que la méthode évite le surapprentissage spatial lors de l'adaptation à des tâches séquentielles nouvelles.

L'enjeu est central pour l'industrialisation des robots manipulateurs polyvalents. Les VLA de type flow matching, comme pi-0 de Physical Intelligence ou GR00T-N1.6-3B de NVIDIA, sont pré-entraînés sur de larges corpus de démonstrations et constituent la base d'agents robotiques généralistes. Mais leur adaptation à un contexte opérationnel précis (cellule de montage, poste de picking spécifique) détruit systématiquement une partie des compétences acquises, forçant les intégrateurs à choisir entre spécialisation et généralité. ConSFT rompt ce compromis : en modulant dynamiquement le signal d'apprentissage selon la confiance du modèle sur chaque échantillon, il bride les gradients excessifs des cas à faible confiance, limitant la perturbation des paramètres. L'inspiration provient du trust-region clipping du reinforcement learning (PPO), transposé ici en apprentissage supervisé.

Les modèles VLA à flow matching représentent la génération actuelle des architectures de contrôle robot les plus performantes. Physical Intelligence a lancé pi-0 fin 2024, suivi de pi-0.5 en 2025 ; NVIDIA a publié GR00T N1 puis N1.6 dans le même intervalle. L'oubli catastrophique lors du fine-tuning est un obstacle pratique que plusieurs équipes tentent de contourner, notamment via l'Experience Replay ou des architectures à réseau de référence parallèle. ConSFT propose une voie plus légère : aucune donnée antérieure requise, aucun réseau auxiliaire, aucune modification architecturale. La méthode reste à valider sur des tâches industrielles longues et des robots avec dextérité fine, mais les résultats sur LIBERO et les expériences physiques publiées suggèrent un transfert sim-to-real fonctionnel.

À lire aussi

AsyncVLA : correspondance de flux asynchrone pour les modèles vision-langage-action (VLA)
1arXiv cs.RO 

AsyncVLA : correspondance de flux asynchrone pour les modèles vision-langage-action (VLA)

Une équipe de chercheurs a publié AsyncVLA (arXiv:2511.14148), un cadre pour modèles Vision-Language-Action (VLA) qui remplace le flow matching synchrone (SFM) conventionnel par un mécanisme asynchrone (AFM) à calendrier temporel non uniforme. Là où le SFM applique un pas de temps identique à tous les tokens d'action, AsyncVLA ajuste ce calendrier en fonction du contexte actionnel en cours, et intègre un module "confidence rater" qui évalue la fiabilité de chaque token généré pour déclencher une auto-correction sélective avant exécution. La procédure d'entraînement est unifiée: un seul modèle peut opérer en mode SFM ou AFM, avec une meilleure utilisation du cache KV. Sur les benchmarks de manipulation robotique en simulation et en conditions réelles, AsyncVLA surpasse les méthodes existantes avec une efficacité accrue en données d'entraînement. Le code est publié en open source sur GitHub. L'instabilité des VLA sur les tâches longue durée (long-horizon) est l'un des principaux freins à leur déploiement industriel: en SFM, une erreur d'action se propage en cascade jusqu'à l'échec complet de la séquence. La capacité d'auto-correction d'AsyncVLA adresse directement ce point, ce qui intéresse les intégrateurs et les équipes robotiques confrontées à des cycles opératoires de plusieurs minutes. L'efficacité en données est un argument complémentaire: entraîner des VLA compétitifs nécessite aujourd'hui des datasets massifs et coûteux, et une méthode qui atteint de meilleures performances avec moins de données réduit la barrière d'entrée. Il faut toutefois nuancer: le papier se limite à des benchmarks de manipulation sans publier de chiffres de déploiement à l'échelle, de temps de cycle réels, ni de résultats sur une flotte opérationnelle. Les VLA à base de flow matching ont été popularisés par Pi-0 de Physical Intelligence et GR00T N2 de NVIDIA en 2024, établissant un standard de génération d'actions continues pour la robotique généraliste. AsyncVLA s'inscrit dans une tendance de raffinement algorithmique de ces architectures, aux côtés d'approches comme OpenVLA, la distillation de politique diffusion, ou les modèles hybrides VLA et planificateur symbolique. Son avantage comparatif est la compatibilité directe avec les pipelines SFM existants, sans rupture architecturale majeure, ce qui facilite l'adoption par les équipes déjà engagées sur ces bases. Les prochaines étapes crédibles seraient une validation sur des robots humanoïdes (Figure, 1X, Unitree) ou des bras industriels en production réelle, là où la robustesse long-horizon reste le goulot d'étranglement dominant.

💬 Le problème de propagation d'erreur en cascade dans les VLA, c'est exactement ce qui bloque le déploiement industriel depuis des mois. AsyncVLA l'attaque frontalement avec un mécanisme de correction sélective avant exécution, et la compatibilité directe avec les pipelines SFM existants (Pi-0, GR00T) rend l'adoption crédible sans tout casser. Reste à voir ce que ça donne sur des cycles de 10 minutes en prod réelle, pas juste en simulation.

IA physiqueOpinion
1 source
SA-VLA : un tokeniseur conscient de l'état pour améliorer les performances des modèles VLA
2arXiv cs.RO 

SA-VLA : un tokeniseur conscient de l'état pour améliorer les performances des modèles VLA

Des chercheurs ont publié le 30 juin 2026 sur arXiv (arXiv:2606.30113) une méthode baptisée SA-VLA, pour State-Aware Vision-Language-Action model, qui s'attaque à un défaut fondamental des politiques de contrôle robotique basées sur les grands modèles de langage. Dans les architectures VLA actuelles, les actions continues du robot sont compressées en codes discrets via une quantification vectorielle (VQ) : chaque token d'action est ensuite décodé vers un prototype continu fixe, indépendamment de la configuration articulaire réelle du robot, de la pose des objets ou des conditions de contact. SA-VLA introduit un tokenizer conditionné sur l'état proprioceptif courant, via deux mécanismes testés en parallèle : une attention croisée entre les features d'état et les features d'action, et un adaptateur léger qui prédit des facteurs de modulation par action pour reconstruire des commandes continues adaptées à l'état. Sur 12 tâches de manipulation du benchmark RoboTwin, le taux de succès moyen passe de 0,29 à 0,56 par rapport au meilleur tokenizer de référence. En transfert sim-to-real zéro-shot sur trois tâches réelles, il grimpe de 0,15 à 0,33, soit un doublement dans les deux cas. Ce résultat est notable parce qu'il cible le "compression gap", c'est-à-dire la perte de précision introduite par la discrétisation des actions continues, un problème longtemps identifié comme le talon d'Achille des VLA autorégessifs. Que le même token discret corresponde à des commandes articulaires radicalement différentes selon la posture du bras est trivial en robotique, mais les architectures de tokenization l'ignoraient jusqu'ici. L'approche par adaptateur est particulièrement intéressante pour les intégrateurs : elle étend la capacité expressive d'un codebook de taille fixe sans en changer la structure, et reste compatible avec le décodage autorégressif comme parallèle, ce qui préserve la compatibilité avec les pipelines LLM existants. Le doublement du taux de succès en transfert zéro-shot sim-to-real est le signal le plus fort : il suggère que le gap de généralisation observé dans de nombreux déploiements VLA n'est pas entièrement dû aux domaines visuels, mais aussi à ce mismatch entre token discret et commande continue. Les VLA sont devenus le paradigme dominant dans la robotique de manipulation depuis les travaux de Physical Intelligence (Pi-0, pi0.5), d'Embodied Intelligence (OpenVLA) et de Google DeepMind (RT-2, puis les variantes Gemini Robotics). Le benchmark RoboTwin, utilisé ici comme référence, est un environnement de simulation standardisé pour la manipulation bi-manuelle apparu fin 2024. SA-VLA s'insère dans l'écosystème des VLA à décodage discret, en compétition directe avec des tokenizers comme FSQ ou les approches diffusion-based qui contournent le problème autrement. L'absence d'affiliation institutionnelle clairement identifiable dans le titre limite la lisibilité du positionnement concurrentiel, mais la méthode est décrite comme intégrable à tout backbone LLM-VLA standard. Les prochaines étapes naturelles seraient une validation sur des benchmarks plus larges (LIBERO, BridgeData v2) et une intégration dans des pipelines de déploiement industriel, où la robustesse aux variations de configuration est précisément le facteur limitant.

IA physiqueOpinion
1 source
DeepThinkVLA : renforcer les capacités de raisonnement des modèles VLA
3arXiv cs.RO 

DeepThinkVLA : renforcer les capacités de raisonnement des modèles VLA

Des chercheurs de l'équipe OpenBMB ont publié en avril 2026 DeepThinkVLA, un nouveau modèle Vision-Language-Action (VLA) qui intègre un raisonnement explicite de type Chain-of-Thought (CoT) pour améliorer les performances de manipulation robotique. Sur le benchmark LIBERO, le modèle atteint 97,0 % de taux de succès, 79,0 % sur LIBERO-Plus (contre 61,6 % pour pi0-FAST de Physical Intelligence), et 59,3 % sur RoboTwin 2.0, soit 21,7 points de plus que le meilleur concurrent testé. L'architecture repose sur un décodeur hybride à double mécanisme d'attention : attention causale pour la génération du langage, attention bidirectionnelle pour le décodage parallèle des actions. L'entraînement suit un pipeline en deux étapes, fine-tuning supervisé puis reinforcement learning avec récompenses éparses liées au succès de la tâche. Des expériences en conditions réelles sur robot physique complètent les résultats en simulation. L'apport principal n'est pas le modèle lui-même, mais le diagnostic rigoureux qu'il repose sur. Les auteurs identifient deux conditions nécessaires et suffisantes pour que le CoT soit utile dans un VLA. Première condition : l'alignement de décodage, c'est-à-dire que le texte de raisonnement et les commandes motrices ne peuvent pas partager le même décodeur autorégressif sans dégradation active des performances, quantifiée à -4,2 points de pourcentage. Deuxième condition : l'alignement causal, le raisonnement doit être optimisé en lien direct avec le succès de la tâche. Sans cela, un VLA entraîné avec CoT supervisé chute de 32,0 points sous distribution shift, quasi identique à la chute de 31,6 points d'un modèle sans raisonnement du tout. Ce résultat contredit l'hypothèse implicite de nombreux travaux récents : ajouter du CoT à un VLA sans ces deux conditions n'apporte rien, voire nuit. Le champ VLA connaît depuis 2024 une accélération intense, portée par des modèles comme pi0 (Physical Intelligence), OpenVLA (Berkeley), et RoboFlamingo. La plupart exploitent des fondations multimodales pré-entraînées mais traitent le raisonnement et l'action dans le même flux autorégressif, une limite que DeepThinkVLA adresse explicitement. OpenBMB est le groupe à l'origine de MiniCPM et CPM-Bee, actif dans les LLM compacts et les agents embarqués. Le code est disponible publiquement sur GitHub. La prochaine étape naturelle sera de valider ces gains sur des tâches de manipulation longue durée et en environnements non structurés, là où l'écart sim-to-real reste le vrai obstacle à la commercialisation.

IA physiqueActu
1 source
Des fondamentaux à l'application : améliorer les modèles VLA en pratique
4arXiv cs.RO 

Des fondamentaux à l'application : améliorer les modèles VLA en pratique

Les chercheurs à l'origine du modèle VLA (vision-language-action) LingBot dévoilent LingBot-VLA 2.0, une version améliorée conçue pour réduire l'écart entre les performances en laboratoire et les conditions réelles de déploiement, un problème récurrent des modèles fondation pour la robotique. Trois axes de travail sont mis en avant. D'abord, la généralisation entre tâches et morphologies de robots a été retravaillée via un nouveau pipeline de traitement de données, avec environ 60 000 heures de données de pré-entraînement, dont 50 000 heures de trajectoires robotiques couvrant 20 configurations de robots différentes et 10 000 heures de vidéos égocentriques humaines. Ensuite, l'espace d'action a été étendu au-delà des plateformes à double bras classiques, pour inclure les degrés de liberté (DOF) de la tête, du buste, de la base mobile et des mains dextres. Enfin, le système intègre une modélisation prédictive de la dynamique, en formulant la prédiction du futur comme tâche annexe, appuyée par un modèle de représentation vidéo pour les indices sémantiques et un modèle d'estimation de profondeur pour les indices géométriques. Les évaluations ont été menées sur le benchmark GM-100 en configuration généraliste. Cette annonce illustre une tendance de fond dans la robotique humanoïde et manipulatrice: le passage de bras robotiques figés à des systèmes corps entier, capables de coordonner tête, buste, base mobile et mains, à l'image des approches poursuivies par Pi-0, GR00T N2 ou Helix. L'accent mis sur la généralisation cross-embodiment et sur le raisonnement temporel prédictif répond directement à une critique fréquente des modèles VLA actuels: leur difficulté à transférer des compétences apprises entre différents robots et à anticiper les conséquences physiques de leurs actions dans des tâches longues et complexes de manipulation mobile. Il s'agit ici d'une publication de recherche (arXiv), pas d'un produit commercialisé ni d'un déploiement industriel annoncé. LingBot-VLA 2.0 s'inscrit dans la succession directe de la première version LingBot-VLA, dans un paysage où les laboratoires chinois et américains multiplient les modèles fondation généralistes pour la robotique, sans que les auteurs ne précisent à ce stade de calendrier de mise en production ou de partenariats industriels.

IA physiqueOpinion
1 source