Aller au contenu principal
RecherchearXiv cs.RO 

Flux proposition-vers-action calibré par le monde pour les modèles vision-langage-action (VLA)

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient ProAct, un cadre pour les politiques Vision-Language-Action (VLA) à flow matching, décrit dans l'article arXiv 2610.02323. Les VLA à flow génèrent des séquences d'actions (« action chunks ») en transportant des échantillons issus d'une source gaussienne isotrope, indépendante de la tâche. ProAct remplace cette source par une source calibrée. Un « Proposal Expert » léger convertit les actions récentes en hypothèse tenant compte de la scène. Il le fait en une seule étape de flow matching ancrée sur le mouvement, ce qui place l'initialisation près de la variété des actions démontrées. Un « World Expert » prédictif traite ensuite cette hypothèse comme un a priori de mouvement souple et prédit le futur latent cohérent avec la tâche. À partir de cette compatibilité, le modèle construit une source anisotrope centrée sur la proposition. Une amplitude bornée par pas limite l'écart autorisé. Une géométrie de bas rang à trace normalisée, sous budget de nombre de conditionnement, répartit le raffinement entre translation, rotation et pince. Face à π0.5 (Physical Intelligence), ProAct améliore les résultats en simulation et en conditions réelles. Il réduit de 50 % le nombre d'étapes de débruitage, de jusqu'à 25,8 % la latence d'inférence, et augmente le débit de jusqu'à 34,8 %. Le résumé ne donne ni taux de succès chiffrés, ni robot, ni liste de tâches.

L'enjeu est double : qualité et coût d'inférence. Dans les VLA actuels, le point de départ du bruit ignore le mouvement qui vient d'être exécuté. La politique doit donc reconstruire la continuité de la trajectoire à chaque chunk, ce qui coûte des étapes de débruitage. En rendant la source prédictible, ProAct vise des trajectoires plus continues avec moins de calcul. Pour un intégrateur, la latence et le débit déterminent la fréquence de contrôle atteignable sur du matériel embarqué, donc la fluidité d'exécution de tâches de manipulation. Le travail suggère aussi que les représentations prédictives du monde servent mieux la génération d'actions si elles en fixent le point de départ, la déviation permise et les directions d'expansion, plutôt que de seulement conditionner la dynamique de transport. Ces gains restent des affirmations de résumé. Ils supposent de vérifier les benchmarks, l'ampleur des gains de réussite et la part de tests réels. Aucun déploiement ni produit n'est annoncé, il s'agit de recherche académique.

Ce travail s'inscrit dans la lignée des VLA à flow matching popularisés par π0, puis par π0.5, devenu une référence de comparaison. Il suit aussi un courant qui ajoute des modèles du monde aux politiques d'action pour anticiper l'évolution de la scène. Le principal angle de recherche concurrent consiste à réduire le nombre d'étapes de débruitage par distillation ou par flows en une étape. D'autres approches rendent les chunks plus continus par chevauchement temporel, mais conservent une source de bruit générique. ProAct attaque le même problème par l'initialisation. La suite dépendra de la publication du code et des poids, d'une reproduction indépendante et d'un test sur d'autres architectures, comme GR00T ou Helix, ou sur des robots humanoïdes où la latence est critique.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

BOKBO : abstention calibrée pour les politiques de modèles vision-langage-action (VLA)
1arXiv cs.RO 

BOKBO : abstention calibrée pour les politiques de modèles vision-langage-action (VLA)

Une équipe de chercheurs publie BOKBO (Best of K Bad Options), décrit comme la première couche d'abstention conforme pour l'inférence VLA à K échantillons. Le problème adressé est précis : les méthodes de scaling à l'inférence telles que RoboMonkey, SEAL, MG-Select et V-GPS génèrent K chunks d'actions candidates et exécutent celle validée comme la meilleure par un vérificateur. Mais lorsque les K candidates sont toutes non sûres, le système en exécute une sans aucun avertissement. BOKBO s'interpose en amont pour garantir, sans hypothèse sur la distribution des données, un taux maximal de violations exécutées. Deux variantes sont proposées : une globale et une par tâche dite Mondrian, cette dernière étant plus robuste sur les tâches les plus difficiles. Évalué sur le benchmark LIBERO avec OpenVLA-OFT à un seuil de risque ε=0,05, le bound conditionnel CRC tient sur 86% des splits bootstrap, avec une couverture de 78% et un taux de réussite nette de 70%. La variante Mondrian-BOKBO relève la fraction minimale de tenue conditionnelle par tâche de 0,71 à 0,93, sur 5 graines d'entraînement. Le résultat le plus saillant n'est pas la méthode elle-même mais l'échec structurel qu'elle expose. Les scores de non-conformité internes aux politiques VLA, utilisés comme proxies de sécurité dans les approches existantes, corrèlent à 0,98 avec l'hyperparamètre de bruit d'action σ, et pratiquement pas avec les violations réelles. Autrement dit, les filtres de sécurité actuels mesurent un réglage de bruit, non un risque réel. Pour les intégrateurs industriels et les équipes d'homologation, c'est un signal d'alarme : les garanties de sécurité des pipelines VLA déployés en production reposent peut-être sur un proxy invalide. Les auteurs montrent que l'échec est partiellement atténué avec un sampling stochastique au niveau des tokens plutôt que perturbation-based, mais le problème reste mécanisme-spécifique. Ils corrigent aussi un biais méthodologique courant : des seuils de force fixés globalement bien en dessous des forces typiques d'un expert humain gonflent artificiellement les taux de violation jusqu'à un facteur 5. Sur le plan du contexte, les VLA comme OpenVLA-OFT et π₀-FAST, testés tous deux dans l'étude, incarnent la convergence entre foundation models et contrôle robotique temps réel. Le benchmark LIBERO, utilisé comme terrain d'évaluation, est devenu une référence dans l'espace manipulation. BOKBO s'inscrit dans la théorie de la prédiction conforme, appliquée ici pour la première fois à l'abstention calibrée dans ce contexte. Les prochaines étapes logiques seraient une validation sur des environnements réels et des tâches hors distribution plus sévères, LIBERO restant un benchmark simulé aux distributions relativement contrôlées. Aucun déploiement industriel ni partenariat n'est annoncé à ce stade.

UELes équipes d'homologation et intégrateurs industriels européens déployant des pipelines VLA en production devraient auditer leurs mécanismes de sécurité : cette étude montre que les scores de non-conformité utilisés comme proxies de sécurité mesurent un réglage de bruit, pas un risque réel.

RechercheActu
1 source
Vers une vérification de propriété par backdoor pour les modèles vision-langage-action (VLA)
2arXiv cs.RO 

Vers une vérification de propriété par backdoor pour les modèles vision-langage-action (VLA)

Des chercheurs ont publié sur arXiv le 12 mai 2026 (référence 2605.09005) GuardVLA, premier cadre de vérification de propriété intellectuelle basé sur les backdoors pour les modèles Vision-Language-Action (VLA). Ces modèles permettent un contrôle robotique généraliste en convertissant des entrées multimodales (vision, langage, données proprioceptives) directement en séquences d'actions motrices. GuardVLA intègre un filigrane cryptographique lors de l'entraînement : un message secret est injecté dans les données visuelles du modèle sans altérer ses performances nominales sur les tâches cibles. La vérification post-déploiement s'effectue via un mécanisme baptisé "swap-and-detect" : un projecteur de déclenchement combiné à une tête de classification externe active et détecte le backdoor intégré à partir des probabilités de prédiction du modèle. Les expériences valident l'approche sur plusieurs architectures, jeux de données et scénarios d'adaptation. L'enjeu est direct pour les intégrateurs et éditeurs de modèles robotiques. Des VLA open-source comme Pi-0 (Physical Intelligence), OpenVLA ou GR00T N2 (NVIDIA) font déjà l'objet de fine-tuning intensif par des tiers. GuardVLA démontre que le filigrane résiste à ces adaptations post-release, ce qui contredit l'hypothèse courante selon laquelle le fine-tuning suffit à effacer toute traçabilité. Pour un éditeur cherchant à protéger un modèle robotique commercial ou à prouver sa propriété en cas de litige, c'est une voie technique crédible sans recours à des mécanismes de DRM contraignants. La capacité à certifier l'origine d'un modèle devient stratégique à l'heure où les VLA s'imposent comme actifs industriels à part entière. Le watermarking de modèles IA existe déjà pour les LLM et les modèles de diffusion d'images, mais les VLA posent une contrainte supplémentaire : leur sortie est une séquence d'actions motrices et non un texte ou une image, ce qui rend la détection de backdoor structurellement différente. Ce travail reste un preprint non évalué par les pairs, sans déploiement industriel annoncé à ce stade. Les approches concurrentes, hachage de poids ou licensing cryptographique, ne ciblent pas spécifiquement la modalité action des VLA. La soumission en conférence, probablement CoRL 2026 ou ICRA 2027, constituera la prochaine validation formelle. L'adoption à grande échelle dépendra aussi de l'intégration aux outils de distribution existants, notamment Hugging Face, où la majorité des VLA généralisés sont aujourd'hui hébergés et redistribués.

UELes éditeurs et chercheurs européens distribuant des modèles VLA via Hugging Face (entreprise française, principal hub de redistribution cité) pourraient adopter GuardVLA pour défendre leur propriété intellectuelle face aux fine-tunings non autorisés.

RechercheOpinion
1 source
RotVLA : action latente de rotation pour les modèles vision-langage-action (VLA)
3arXiv cs.RO 

RotVLA : action latente de rotation pour les modèles vision-langage-action (VLA)

Un groupe de chercheurs a publié en mai 2026 RotVLA (arXiv:2605.13403), un framework Vision-Language-Action (VLA) qui substitue la quantification discrète des modèles d'action latente (LAM) existants par une représentation continue dans l'espace de rotation SO(n). Entraîné sur plus de 1 700 heures de données robotiques multi-embodiment et de vidéos humaines, le modèle compte 1,7 milliard de paramètres. Son architecture associe un backbone de modèle vision-langage et une tête d'action par flow-matching, étendue en aval en un "action expert" unifié qui dénoise simultanément actions latentes et actions robot. Sur LIBERO, RotVLA atteint 98,2 % de taux de succès ; sur RoboTwin2.0, il obtient 89,6 % en configuration propre et 88,5 % en configuration randomisée, surpassant les modèles VLA antérieurs dans les deux cas. Des expériences sur des tâches de manipulation réelle confirment ces résultats hors simulation. L'enjeu est architectural : les LAMs actuels, basés sur des pipelines VQ-VAE ou similaires, induisent une reconstruction de frames souvent triviale et n'imposent aucune contrainte géométrique cohérente avec la physique du mouvement. En modélisant les actions latentes comme des éléments de SO(n), RotVLA garantit continuité et compositionnalité absentes des espaces discrets, avec un triplet frame learning qui force une dynamique temporelle non dégénérée. Pour les équipes d'intégration robotique, cela ouvre la voie à un modèle de fondation plus robuste au sim-to-real, l'un des goulots d'étranglement centraux des VLAs en conditions industrielles. L'approche suggère que la structure géométrique de l'espace d'action peut compter autant que l'échelle des données d'entraînement. Le domaine des politiques robotiques généralistes a été structuré par Pi-0 (Physical Intelligence, 2024) et GR00T N2 (NVIDIA, 2025), qui misaient sur des corpus cross-embodiment massifs pour entraîner des politiques généralisables. RotVLA s'inscrit dans cette lignée mais parie sur une représentation latente géométriquement structurée plutôt que sur le volume brut de paramètres, avec 1,7B contre plusieurs dizaines de milliards pour les modèles concurrents les plus ambitieux. Les scores LIBERO et RoboTwin2.0 sont des benchmarks académiques standardisés ; leur transposition sur des cellules industrielles réelles (bras collaboratifs, tri et picking) reste à démontrer. Aucun partenaire de déploiement ni calendrier commercial ne figure dans la publication : RotVLA est, à ce stade, une contribution de recherche.

RechercheOpinion
1 source
Co-VLA : entraînement fédéré par consensus pour les modèles vision-langage-action
4arXiv cs.RO 

Co-VLA : entraînement fédéré par consensus pour les modèles vision-langage-action

Un article publié sur arXiv (référence 2609.19923v1) présente Co-VLA, une méthode d'entraînement fédéré pour les modèles vision-langage-action (VLA), cette classe de modèles qui traduit perception visuelle et instructions en langage naturel en commandes motrices pour robots. La technique s'appuie sur l'optimisation par consensus via l'algorithme ADMM (Alternating Direction Method of Multipliers) pour coordonner l'entraînement entre plusieurs clients détenant chacun des données robotiques locales différentes, sans jamais faire transiter ces données brutes vers un serveur central. Les auteurs montrent que le même algorithme fonctionne à la fois pour l'entraînement complet d'un modèle et pour le fine-tuning paramétrique-efficient, avec des adaptateurs à rang fixe comme à rang adaptatif. Selon les expériences rapportées, Co-VLA atteint des performances comparables à celles d'un entraînement centralisé classique, aussi bien en entraînement complet qu'en fine-tuning léger. L'abstract ne détaille toutefois ni le nombre de robots ou de sites impliqués dans les tests, ni les tâches précises évaluées, ni de métriques chiffrées de réussite. L'enjeu pratique est celui du goulot d'étranglement identifié par tout le secteur des VLA : les performances de ces modèles s'améliorent avec l'échelle des données, mais ces données de démonstration robotique sont dispersées entre flottes, sites industriels et types de tâches, et leur centralisation pose des problèmes de coût, de bande passante et souvent de confidentialité pour les intégrateurs qui déploient des robots chez des clients tiers. En rendant possible un entraînement collaboratif sans partage de données, Co-VLA ouvre une voie pour mutualiser l'apprentissage entre opérateurs de flottes concurrents ou entre sites d'un même groupe industriel, tout en gérant l'hétérogénéité des distributions de données propre à des robots différents opérant dans des environnements différents, un obstacle documenté du federated learning appliqué à la robotique. Ce travail s'inscrit dans la course actuelle aux modèles VLA généralistes, où des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix) cherchent à industrialiser l'apprentissage à grande échelle sur données robotiques réelles. Co-VLA ne propose pas un nouveau modèle concurrent mais une brique méthodologique complémentaire, exploitable en principe par n'importe quel VLA existant. Il s'agit à ce stade d'une contribution de recherche publiée sur arXiv, sans annonce de déploiement industriel, de partenariat ou de calendrier de suite.

RecherchePaper
1 source