Aller au contenu principal
RecherchearXiv cs.RO 

Une action sûre ne suffit pas : décodage à futurs réalisables pour les politiques vision-langage-action (VLA)

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie sur arXiv (2610.05166, deuxième version) VICS-G, une méthode de décodage pour politiques vision-langage-action (VLA) qui vise à éviter les actions « sûres mais sans issue ». Le point de départ est ce que les auteurs appellent l'écart faisabilité-vraisemblance. Une politique VLA figée classe le prochain mouvement selon sa vraisemblance, alors que la viabilité dépend des futurs que ce mouvement laisse ouverts. Les chercheurs dérivent la marginale exacte du prochain bloc d'actions, restreinte aux trajectoires qui terminent la tâche en sécurité. Comme son calcul exact est impraticable en ligne, ils proposent une approximation sur un nombre fini de candidats, avec des conditions de récupération du meilleur candidat viable. VICS-G est un reclasseur déclenché par alarme, sans entraînement et sans simulation de trajectoires à l'exécution. Sur six configurations de Safety-CHORES, il réduit le coût de sécurité cumulé moyen de 1,9 % à 57,5 %. Le taux de succès reste à moins de 2,5 points de l'échantillonnage standard de la politique, et la longueur moyenne des épisodes à moins de 0,82 pas.

L'idée est utile parce qu'elle s'applique à une politique gelée, sans réentraînement : un intégrateur qui utilise un VLA tiers pourrait ajouter une couche de sécurité au décodage. Elle contredit aussi l'hypothèse qu'un simple filtre d'actions localement admissibles suffit : une action peut passer le filtre et enfermer le robot dans une impasse. Les résultats appellent toutefois à la prudence. La fourchette de 1,9 % à 57,5 % montre des gains très inégaux selon les scénarios, et le résumé ne donne ni valeurs absolues ni coût de calcul de l'approximation. Tout est évalué en simulation, sans robot réel ni déploiement.

Safety-CHORES est un banc d'essai de tâches domestiques en simulation, où l'on mesure à la fois le succès et un coût cumulé de violations de sécurité. Les approches existantes renforcent en général la sécurité en réentraînant ou en ajustant la politique, ou en filtrant les actions pas à pas. VICS-G se place entre les deux : il garde la politique intacte, mais évalue les futurs que chaque candidat laisse possibles. Les prochaines étapes à surveiller sont la validation sur d'autres VLA et d'autres bancs d'essai, la mesure du surcoût de latence, et surtout un test sur robot physique. Sans cela, il reste un résultat de recherche, loin d'un produit livré.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

1arXiv cs.RO 

SWAP : routage pas à pas de politiques d'action pour les modèles vision-langage-action (VLA)

Des chercheurs publient sur arXiv (2610.06926) SWAP, pour StepWise Action Policy Routing, un cadre qui compose dynamiquement plusieurs politiques Vision-Language-Action (VLA) pendant l'exécution d'une tâche de manipulation. Aujourd'hui, la plupart des systèmes reposent sur un seul modèle VLA du début à la fin d'un épisode. SWAP formule le routage comme un problème d'apprentissage par renforcement hors ligne : un « critique de routage » est entraîné à choisir, à chaque pas de décision et selon l'observation courante, la politique la plus adaptée. Le robot peut ainsi changer de politique en cours d'épisode. L'évaluation porte sur des tâches réelles de manipulation sur la plateforme DROID et sur des simulations LIBERO. Face à l'exécution d'une politique fixe et à des méthodes de routage de référence, les auteurs annoncent jusqu'à 33 points de succès supplémentaires en conditions réelles, et une réduction de 28,3 % du nombre de pas d'action des trajectoires réussies. L'enjeu dépasse la performance brute. Le travail s'attaque à une limite que les intégrateurs constatent déjà : aucun VLA n'est le meilleur partout, et les performances varient selon la phase de la tâche et l'environnement. Au lieu d'attendre un modèle généraliste unique, SWAP traite les VLA existants comme une boîte à outils orchestrable, sans réentraîner chacun d'eux. Pour un industriel, cela suggère une voie pragmatique : combiner des politiques spécialisées ou de fournisseurs différents, et ne payer que pour la politique utile à chaque étape. La baisse de la longueur des trajectoires laisse aussi entrevoir un gain de temps de cycle, mais il s'agit d'un nombre de pas d'action, pas d'une durée mesurée en atelier. Il faut aussi rester prudent sur les chiffres : le « jusqu'à 33 % » correspond au meilleur cas, et l'abstract ne précise ni le nombre de tâches ni la taille des échantillons, ni les politiques combinées. Ce résultat s'inscrit dans la course aux modèles fondation pour la manipulation, où des VLA comme Pi-0, GR00T ou Helix sont généralement présentés comme des systèmes autonomes. Le routage entre politiques prolonge les approches de mélange d'experts, mais à l'échelle de politiques complètes et de manière apprise hors ligne. DROID, jeu de données et plateforme de manipulation très utilisé, et LIBERO, banc d'essai en simulation, servent de référence commune, ce qui facilite la comparaison. Il s'agit d'une prépublication v1 non évaluée par les pairs, sans déploiement industriel annoncé. Les prochaines étapes à surveiller : la publication du code, la robustesse du critique face à des environnements inédits, et la latence ajoutée par le routage à chaque pas de décision.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
PAPO-VLA : une optimisation de politique adaptée à la planification pour les modèles vision-langage-action
2arXiv cs.RO 

PAPO-VLA : une optimisation de politique adaptée à la planification pour les modèles vision-langage-action

Des chercheurs ont publié en mai 2026 sur arXiv (2605.19580) PAPO-VLA, une méthode d'optimisation pour les modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique guidée par le langage naturel. L'observation centrale est qu'une politique VLA opère en boucle fermée : chaque action modifie l'état de la scène et conditionne toutes les décisions suivantes, ce qui rend une erreur de planification particulièrement coûteuse. Les auteurs distinguent donc deux rôles dans une politique VLA : le planificateur, qui prend des décisions orientées tâche susceptibles de rediriger l'exécution, et l'exécuteur, qui les traduit en actions continues denses. PAPO-VLA identifie les "actions de planification" en croisant variation d'action et issue de trajectoire, estime leur importance causale via deux critères formels (suffisance et nécessité causales), puis intègre ces poids dans l'estimation d'avantage du GRPO (Group Relative Policy Optimization), de sorte que les moments critiques reçoivent une emphase d'optimisation plus forte sans abandonner le signal de trajectoire globale. Des améliorations sont rapportées sur plusieurs benchmarks de manipulation robotique, sans chiffres précis disponibles dans le résumé public. L'apport clé est de combler un angle mort des approches existantes : l'imitation de trajectoires et l'optimisation par retour de trajectoire entière traitent toutes les actions avec la même importance, alors que certains instants de décision ont un impact causal disproportionné sur le succès de la tâche. Quantifier cet impact via des métriques causales formelles plutôt qu'heuristiques est une avancée méthodologique notable. Pour les équipes déployant des VLA en environnement réel, sur des plateformes comme pi-0 (Physical Intelligence), OpenVLA (Berkeley) ou GR00T N2 (NVIDIA), la méthode promet d'améliorer la fiabilité sans données de démonstration supplémentaires. Depuis RT-2 (Google DeepMind, 2023), le secteur des VLA cherche à combler l'écart entre performance en démonstration contrôlée et robustesse en déploiement réel. Le GRPO, popularisé par DeepSeek-R1 pour le raisonnement en LLM, est ici adapté à la robotique via une pondération causale des actions, dans un axe de recherche croissant autour du renforcement causal appliqué aux robots. PAPO-VLA est un preprint non encore revu par les pairs ; la validation expérimentale complète, avec benchmarks précis et comparaisons contrôlées, reste à confirmer via publication.

RechercheOpinion
1 source
BOKBO : abstention calibrée pour les politiques de modèles vision-langage-action (VLA)
3arXiv cs.RO 

BOKBO : abstention calibrée pour les politiques de modèles vision-langage-action (VLA)

Une équipe de chercheurs publie BOKBO (Best of K Bad Options), décrit comme la première couche d'abstention conforme pour l'inférence VLA à K échantillons. Le problème adressé est précis : les méthodes de scaling à l'inférence telles que RoboMonkey, SEAL, MG-Select et V-GPS génèrent K chunks d'actions candidates et exécutent celle validée comme la meilleure par un vérificateur. Mais lorsque les K candidates sont toutes non sûres, le système en exécute une sans aucun avertissement. BOKBO s'interpose en amont pour garantir, sans hypothèse sur la distribution des données, un taux maximal de violations exécutées. Deux variantes sont proposées : une globale et une par tâche dite Mondrian, cette dernière étant plus robuste sur les tâches les plus difficiles. Évalué sur le benchmark LIBERO avec OpenVLA-OFT à un seuil de risque ε=0,05, le bound conditionnel CRC tient sur 86% des splits bootstrap, avec une couverture de 78% et un taux de réussite nette de 70%. La variante Mondrian-BOKBO relève la fraction minimale de tenue conditionnelle par tâche de 0,71 à 0,93, sur 5 graines d'entraînement. Le résultat le plus saillant n'est pas la méthode elle-même mais l'échec structurel qu'elle expose. Les scores de non-conformité internes aux politiques VLA, utilisés comme proxies de sécurité dans les approches existantes, corrèlent à 0,98 avec l'hyperparamètre de bruit d'action σ, et pratiquement pas avec les violations réelles. Autrement dit, les filtres de sécurité actuels mesurent un réglage de bruit, non un risque réel. Pour les intégrateurs industriels et les équipes d'homologation, c'est un signal d'alarme : les garanties de sécurité des pipelines VLA déployés en production reposent peut-être sur un proxy invalide. Les auteurs montrent que l'échec est partiellement atténué avec un sampling stochastique au niveau des tokens plutôt que perturbation-based, mais le problème reste mécanisme-spécifique. Ils corrigent aussi un biais méthodologique courant : des seuils de force fixés globalement bien en dessous des forces typiques d'un expert humain gonflent artificiellement les taux de violation jusqu'à un facteur 5. Sur le plan du contexte, les VLA comme OpenVLA-OFT et π₀-FAST, testés tous deux dans l'étude, incarnent la convergence entre foundation models et contrôle robotique temps réel. Le benchmark LIBERO, utilisé comme terrain d'évaluation, est devenu une référence dans l'espace manipulation. BOKBO s'inscrit dans la théorie de la prédiction conforme, appliquée ici pour la première fois à l'abstention calibrée dans ce contexte. Les prochaines étapes logiques seraient une validation sur des environnements réels et des tâches hors distribution plus sévères, LIBERO restant un benchmark simulé aux distributions relativement contrôlées. Aucun déploiement industriel ni partenariat n'est annoncé à ce stade.

UELes équipes d'homologation et intégrateurs industriels européens déployant des pipelines VLA en production devraient auditer leurs mécanismes de sécurité : cette étude montre que les scores de non-conformité utilisés comme proxies de sécurité mesurent un réglage de bruit, pas un risque réel.

RechercheActu
1 source
Diviser pour mémoriser : une mémoire récursive centrée sur l'action pour les politiques VLA à long horizon
4arXiv cs.RO 

Diviser pour mémoriser : une mémoire récursive centrée sur l'action pour les politiques VLA à long horizon

Des chercheurs proposent Divide-and-Remember (D&R), une méthode de mémoire récursive pour les politiques VLA (vision-language-action) appliquées à la manipulation de longue durée. Le papier, publié sur arXiv (2610.00982), s'attaque aux tâches dites dépendantes de l'historique, où l'observation courante ne suffit pas à déterminer l'action. D&R apprend une fonction de mémoire mt = M(ht) en s'appuyant sur une sélection récursive : la sélection sur l'historique complet est découpée en sous-problèmes de type top-K sur 2K tokens. Des sélecteurs légers, de taille fixe et entraînés de bout en bout, peuvent ainsi gérer un historique non borné. Tous les blocs de récursion partagent un unique sélecteur, ce qui limite le coût de calcul. Sur RoboMME, un benchmark de 16 tâches de manipulation longue qui exigent de se souvenir du quand, du où, du quoi et du comment agir, D&R atteint le meilleur taux de succès moyen publié, avec des gains constants sur les quatre suites, pour un budget de seulement 64 tokens de mémoire. Les auteurs affirment que des essais sur robot réel confirment le gain, sans en donner les chiffres dans le résumé. Le code et les checkpoints sont publiés. L'enjeu dépasse le seul score de benchmark. Les VLA actuels restent largement réactifs : ils se débrouillent quand la scène contient l'information utile, mais échouent dès qu'il faut se rappeler quel objet a été déplacé, quelle étape est déjà faite ou où un élément a disparu. Ces cas sont fréquents en logistique, en assemblage et en tâches de service. Les méthodes existantes de mémoire reposent sur des heuristiques fixées à la conception, comme conserver les images à forte variation de pixels, et donnent des résultats irréguliers selon les tâches. Le papier les remplace par un critère théorique : la mémoire optimale maximise l'information mutuelle conditionnelle entre l'action et la mémoire, sachant l'observation courante. Autrement dit, elle ne garde que ce qui, dans le passé, est utile à l'action et absent de la vue présente. Pour un intégrateur, le point clé est le budget : 64 tokens, c'est une mémoire compatible avec une inférence embarquée, là où allonger le contexte fait exploser latence et coût. Il faut toutefois rester prudent : RoboMME est un benchmark principalement simulé, et la validation sur robot réel n'est détaillée que dans le papier complet. Il s'agit d'un résultat de recherche, pas d'un produit déployé. Ce travail s'inscrit dans la montée en puissance des VLA généralistes, comme Pi-0 ou GR00T, qui traitent surtout une observation courte ou quelques images récentes. La mémoire à long horizon est identifiée comme un point faible de ces architectures, et plusieurs équipes explorent la compression du contexte, la mémoire par mots-clés ou les représentations récurrentes. D&R se distingue par sa formulation en problème d'optimisation, issue du cadre POMDP de l'apprentissage par imitation. Les prochaines étapes à surveiller sont la reproduction des résultats sur d'autres benchmarks, les chiffres détaillés sur robot réel et l'intégration dans des modèles de fondation de grande taille.

RecherchePaper
1 source