Aller au contenu principal
StageCraft : atténuation, sensible à l'exécution, des échecs de distraction et d'obstruction dans les modèles VLA
RecherchearXiv cs.RO 

StageCraft : atténuation, sensible à l'exécution, des échecs de distraction et d'obstruction dans les modèles VLA

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent StageCraft, une méthode qui améliore les performances des modèles VLA (Vision-Language-Action) sans réentraînement, en s'appuyant sur le raisonnement en contexte de grands modèles vision-langage (VLM) préentraînés sur des données à l'échelle d'internet. Le système prend en entrée des vidéos d'exécution de la politique robotique ainsi que des étiquettes de succès ou d'échec, puis identifie quels objets dans l'état initial de l'environnement doivent être déplacés ou retirés pour éviter les échecs anticipés liés à des distracteurs ou des obstructions physiques. Conçu comme un module plug-and-play, StageCraft ne nécessite que quelques essais de la politique pour fonctionner et n'impose aucune contrainte supplémentaire sur le modèle VLA sous-jacent. Les auteurs rapportent un gain de performance absolu de 40% sur trois domaines de tâches réelles impliquant des distracteurs et obstructions variés, ainsi que des résultats complémentaires en simulation sur RLBench.

Cette approche s'attaque à un point de friction concret pour le déploiement industriel des VLA: ces modèles généralisent bien à de nouvelles tâches, objets et scènes grâce au préentraînement massif, mais restent fragiles dès que l'environnement réel introduit des éléments perturbateurs non anticipés, l'écart classique entre démonstration contrôlée et conditions réelles de production. Les méthodes existantes de finetuning peinent encore face à des distracteurs inédits. En proposant une correction au niveau de l'état initial de la scène plutôt qu'au niveau des poids du modèle, StageCraft ouvre une voie moins coûteuse pour fiabiliser des politiques déjà déployées, un argument qui intéressera directement les intégrateurs cherchant à éviter des cycles de réentraînement à chaque changement d'environnement de production.

Le travail s'inscrit dans la lignée des efforts pour combler l'écart entre capacités démontrées en laboratoire et robustesse en conditions réelles des modèles VLA, une préoccupation centrale du secteur alors que ces architectures se multiplient. Les auteurs montrent aussi que l'intervention de StageCraft s'adapte à la force de la politique sous-jacente et s'améliore avec davantage d'exemples en contexte, suggérant une piste d'amélioration continue sans réentraînement lourd. Des vidéos de démonstration sont disponibles sur le site dédié au projet.

À lire aussi

Quand les instructions récupèrent des trajectoires : diagnostic et atténuation des échecs de généralisation des modèles VLA
1arXiv cs.RO 

Quand les instructions récupèrent des trajectoires : diagnostic et atténuation des échecs de généralisation des modèles VLA

Des chercheurs publient sur arXiv une analyse des échecs de généralisation des modèles vision-langage-action (VLA), accompagnée d'une méthode de correction baptisée Equivariant Counterfactual Training (ECT). Le constat de départ est que des VLA dépassent 90 % de réussite sur les tâches vues à l'entraînement et résistent aux changements parasites qui ne modifient pas l'action requise (éclairage, objets non pertinents). Ils échouent en revanche dès qu'une modification contrefactuelle impose une action différente, par exemple permuter la position de deux objets. Les auteurs nomment ce défaut « instruction-action binding » : la politique réagit au langage comme à la vision, mais ne les combine pas pour choisir l'action adaptée. Les analyses comportementales, menées sur des versions affinées de π0.5 et de GR00T-N1.7, montrent que les rollouts ratés répètent souvent le comportement de la tâche source ou basculent vers une autre tâche démontrée. Le langage n'est donc pas ignoré : il sert d'index vers une famille de trajectoires connues, et le retour visuel n'en ajuste que l'exécution. Sur le simulateur LIBERO-PRO, l'ECT complet fait passer le taux de réussite moyen de π0.5 en permutation de positions de 36 % à 59 %. Sur CALVIN, où les contreparties existent déjà dans les données, la seule fonction de perte ECT améliore l'enchaînement de cinq tâches sans nouvelle démonstration. Sur un bras UR5e réel, à budget de démonstrations constant, le succès sur positions inédites passe de 8 % à 88 %. Ces résultats portent sur un point central pour le déploiement industriel : un score de robustesse agrégé peut masquer une faiblesse structurelle. Un VLA qui encaisse les perturbations visuelles banales peut rester un récupérateur de trajectoires, incapable de reconfigurer son geste quand la même consigne exige un mouvement différent dans une scène modifiée. Pour un intégrateur, c'est le cas typique d'une cellule dont l'agencement change entre deux lots. Le travail suggère aussi qu'une partie du problème tient à la composition des données et à l'objectif d'imitation, et non à la taille du modèle : lorsque l'action reste conditionnellement étroite, une solution ancrée dans la scène et une solution indexée sur l'instruction sont indiscernables sur les démonstrations. Corriger cela par des paires contrefactuelles, plutôt que par plus de volume, est une piste peu coûteuse. Une réserve s'impose : le gain de 8 % à 88 % vient d'un seul robot et d'un protocole à budget fixe, et le gain en simulation (+23 points) est plus modeste. L'étude s'inscrit dans une série de travaux sur les limites de généralisation des VLA, alors que π0.5 de Physical Intelligence et la famille GR00T de NVIDIA servent de références ouvertes pour les politiques généralistes. Les benchmarks comme LIBERO-PRO et CALVIN ont été conçus pour mesurer cette généralisation, et les auteurs montrent que certains scores flatteurs reposent sur la mémorisation. Les suites probables sont des validations sur d'autres plateformes, des tâches plus longues et d'autres architectures de VLA. Il s'agit d'un préprint non évalué par les pairs, sans produit ni déploiement annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
UAOR : réinjection d'observations sensible à l'incertitude pour les modèles vision-langage-action (VLA)
2arXiv cs.RO 

UAOR : réinjection d'observations sensible à l'incertitude pour les modèles vision-langage-action (VLA)

Des chercheurs ont publié sur arXiv (référence 2602.18020v2) une méthode baptisée UAOR (Uncertainty-aware Observation Reinjection), conçue pour améliorer les modèles VLA (Vision-Language-Action) sans nécessiter de réentraînement ni de données supplémentaires. Le principe repose sur la mesure de l'entropie d'action à chaque couche du modèle de langage sous-jacent : lorsqu'une couche présente une incertitude élevée, le module réinjecte les informations d'observation clés dans le réseau Feed-Forward (FFN) de la couche suivante, via un mécanisme d'attention retrieval. Les auteurs exploitent ici une propriété connue des transformeurs où les FFN se comportent comme des mémoires clé-valeur, et l'appliquent de façon adaptative et conditionnelle à l'état d'incertitude du modèle. Les expériences couvrent à la fois des environnements simulés et des tâches de manipulation réelle, sans précisions chiffrées sur les volumes ou les délais de cycle dans l'abstract publié. L'intérêt pratique est réel pour les équipes qui cherchent à améliorer des pipelines VLA existants : la plupart des approches actuelles exigent l'ajout de capteurs (nuages de points, cartes de profondeur) ou de modules auxiliaires (détecteurs d'objets, encodeurs spécialisés), impliquant collecte de données et phases d'entraînement coûteuses. UAOR se branche en plug-and-play sur des modèles déjà entraînés, ce qui réduit significativement le coût d'intégration. Cette approche "training-free" est particulièrement pertinente dans un contexte industriel où le fine-tuning sur données propriétaires reste un frein. Cela dit, l'abstract ne communique pas de métriques précises (taux de succès, amélioration relative), ce qui rend l'évaluation de l'amplitude des gains difficile avant lecture complète du papier. Les VLA sont devenus un axe central de la robotique de manipulation généraliste depuis 2024, portés par des modèles comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI). UAOR s'inscrit dans une dynamique de recherche qui cherche à extraire davantage de performance des architectures existantes plutôt qu'à en construire de nouvelles, une tendance d'optimisation à moindre coût computationnel. La prochaine étape naturelle serait une évaluation comparative sur des benchmarks standardisés comme RLBench ou FurnitureBench, et un test d'intégration sur des modèles open-source populaires tels qu'OpenVLA ou Octo.

RechercheOpinion
1 source
Guidage sensible à l'achèvement pour les modèles du monde et d'action
3arXiv cs.RO 

Guidage sensible à l'achèvement pour les modèles du monde et d'action

Des chercheurs publient sur arXiv (2610.01559) une méthode baptisée Completion Aware Guidance (CAG), destinée aux World Action Models (WAMs). Ces modèles prédisent à la fois les futurs visuels et les actions du robot. Le travail cible un défaut précis, l'« imagination incomplète » : le modèle produit des prédictions plausibles et cohérentes avec les actions, mais qui omettent la transition nécessaire pour terminer la tâche. CAG est une méthode d'échantillonnage sans entraînement supplémentaire, qui oriente la génération vers l'achèvement de la tâche. Sur plusieurs WAMs représentatifs, le taux de succès passe de 64 % à 70 % sur un sous-ensemble de RoboTwin 2.0, et de 69 % à 75 % en simulation zéro-shot. La part d'imagination incomplète tombe de 79 % à 40 %. Les résultats portent sur des benchmarks simulés. L'article ne mentionne ni test sur robot réel, ni déploiement. L'intérêt tient d'abord au diagnostic. Selon les auteurs, l'échec ne vient pas de l'architecture du modèle du monde. Il apparaît quand ce modèle est adapté au contrôle par segments courts (short-chunk control). Dans ce régime, le modèle favorise de façon répétée des prolongements locaux plausibles plutôt que les transitions qui achèvent la tâche. Pour les équipes qui construisent des politiques VLA ou des WAMs, cela signale qu'une partie des échecs en manipulation vient de la procédure d'échantillonnage et d'adaptation, pas d'un manque de capacité du modèle de base. Corriger cela à l'inférence, sans réentraînement, est peu coûteux. Il faut toutefois relativiser : un gain de 6 points de succès reste modeste, et le chiffre le plus net, 79 % à 40 %, mesure un défaut défini par les auteurs eux-mêmes. Il ne se traduit pas directement en fiabilité industrielle. Ce travail s'inscrit dans l'essor des modèles qui apprennent à prédire l'avenir visuel pour guider l'action. L'approche est une alternative aux VLA purement réactifs, comme Pi-0 ou Helix. Elle est aussi un complément aux efforts de modèles du monde généralistes, tels que GR00T. RoboTwin 2.0 sert de banc d'essai standard pour la manipulation bimanuelle en simulation. Il reste donc à voir si le gain tient sur matériel réel, avec ses latences, son bruit de perception et ses contraintes de temps de cycle. Les auteurs n'annoncent pas de calendrier de validation physique. L'article n'évoque aucun acteur français ou européen.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
FASA : adaptation de l'échantillonnage sensible au retour pour des modèles VLA à diffusion efficaces
4arXiv cs.RO 

FASA : adaptation de l'échantillonnage sensible au retour pour des modèles VLA à diffusion efficaces

Un article publié le 18 septembre 2026 sur arXiv (référence 2609.19475v1) présente FASA (Feedback-Aware Sampling Adaptation), une méthode d'accélération pour les modèles Vision-Language-Action (VLA) fondés sur la diffusion. Ces modèles, utilisés pour piloter des robots à partir d'images et de langage naturel, souffrent d'un défaut connu : leur processus de génération d'action repose sur un échantillonnage itératif coûteux en calcul et en accès mémoire, ce qui empêche leur exécution en temps réel sur du matériel embarqué limité. FASA fonctionne sans entraînement supplémentaire et agit directement au moment de l'inférence : un premier module, l'adaptateur de plage piloté par l'interaction, ajuste dynamiquement le nombre global d'étapes de débruitage en fonction du retour visuel et de la force mesurée par la pince du robot ; un second module, l'adaptateur d'étape sensible à la proprioception, choisit précisément l'étape optimale à l'intérieur de cette plage. Les auteurs annoncent des gains de vitesse d'inférence allant jusqu'à 1,45 fois par rapport aux méthodes existantes, avec des taux de réussite jugés comparables sur plusieurs bancs d'essai (benchmarks) non détaillés dans le résumé. Cette approche cible un point de friction central pour l'industrialisation des VLA : les méthodes d'accélération existantes imposent soit un réentraînement coûteux (distillation, flow matching), soit un élagage ou un système de cache programmé de façon statique, qui dégrade la perception en ignorant la variabilité réelle de la charge de travail robotique. En traitant le retour multimodal comme signal de contrôle du pipeline de débruitage, FASA propose une troisième voie, sans coût d'entraînement, potentiellement pertinente pour les intégrateurs cherchant à déployer des modèles génératifs lourds sur des plateformes de calcul contraintes, comme les contrôleurs embarqués de robots manipulateurs. Il s'agit toutefois d'un prépublication arXiv, non encore validée par relecture par les pairs, sans identification des auteurs ni de laboratoire dans le résumé disponible, et sans précision sur le matériel de test ni sur les modèles VLA de référence utilisés pour la comparaison. Le gain de 1,45x reste à situer par rapport aux architectures concurrentes d'accélération de l'inférence robotique, un axe de recherche actif à mesure que les modèles VLA gagnent en taille et en ambition d'usage industriel.

RechercheActu
1 source