Aller au contenu principal
RecherchearXiv cs.RO 

ExecVLA : respecter des contraintes d'exécution fines dans les modèles vision-langage-action (VLA) grâce à une représentation d'action à deux niveaux

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent ExecVLA, un cadre pour les modèles vision-langage-action (VLA) qui vise à faire respecter des contraintes d'exécution fines données dans l'instruction, alors que l'objectif de la tâche reste identique. Ces contraintes portent sur la cible d'interaction, le motif de mouvement, les relations spatiales et la configuration terminale. Le cadre sépare une composante orientée but d'une composante spécifique à l'exécution. Pour cela, il utilise une représentation d'action à deux niveaux et des jetons de raisonnement à deux niveaux, supervisés. Deux objectifs d'entraînement s'y ajoutent. L'invariance du but maintient stable la représentation de haut niveau entre les exécutions d'un même but. La prédictibilité de l'exécution garantit que la représentation de bas niveau conserve les contraintes qui distinguent ces exécutions. Les auteurs ont construit des jeux de données dédiés, avec annotations de but et de raisonnement fin, en simulation (sur la base de LIBERO) et sur un bras Realman-75. Ils rapportent une meilleure complétion des tâches et, surtout, un respect nettement plus fiable des contraintes. L'extrait ne fournit aucun chiffre précis, ni taux de réussite ni écart avec les modèles de référence, ni nombre d'épisodes ou de tâches.

L'enjeu est de distinguer deux critères que les benchmarks VLA actuels confondent souvent. Une politique orientée but est jugée sur l'accomplissement de la tâche, sans regarder la manière. Or, en contexte industriel, la manière compte. Contourner un obstacle par la gauche, saisir un objet par une zone précise, déposer une pièce selon une orientation donnée ou s'arrêter dans une pose finale imposée sont des exigences courantes en assemblage, en logistique ou en manipulation en environnement partagé. Les trajectoires qui réussissent la même tâche ne sont donc pas interchangeables. Ce travail met en évidence une limite des VLA généralistes : ils ignorent facilement les consignes de style d'exécution tant que le but est atteint. Pour un intégrateur, la contrôlabilité fine par le langage peut devenir un critère de sélection aussi important que le taux de réussite brut. Il faut toutefois rester prudent. Il s'agit d'un article académique sur un seul bras, avec des jeux de données maison, et les contraintes évaluées restent probablement proches de celles de l'entraînement. Aucun résultat ne porte encore sur la généralisation à des contraintes inédites ou sur des cadences industrielles.

Le contexte est celui d'une génération de VLA (Pi-0, Helix, GR00T et leurs dérivés) qui a surtout progressé sur la généralisation de la tâche et la robustesse perceptive. La question du pilotage fin de l'exécution reste moins traitée. Des approches voisines utilisent le raisonnement en chaîne de pensée ou des représentations intermédiaires de trajectoire pour guider l'action. ExecVLA y ajoute une séparation explicite entre le but et la manière, avec une supervision dédiée. Il s'agit d'une version révisée (v2) d'un préprint arXiv, sans partenaire industriel ni calendrier de déploiement annoncé. Les prochaines étapes à surveiller sont une évaluation sur d'autres embodiments, des comparaisons directes avec les VLA ouverts du moment, et la publication du code et des jeux de données, qui permettrait à la communauté de reproduire les résultats.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

1arXiv cs.RO 

WARP-VLA : adaptation de la caméra de poignet pour une exécution robuste aux changements de point de vue dans les modèles vision-langage-action

WARP-VLA, un modèle décrit dans un preprint arXiv (2610.11508v1), s'attaque à une faiblesse connue des modèles Vision-Language-Action (VLA) pour la manipulation robotique : leur sensibilité à la configuration des caméras. Les auteurs ciblent en particulier la caméra montée au poignet, dont le point de vue se déplace avec le robot. Un léger écart de fixation suffit alors à modifier les indices géométriques fins dont dépend la politique. Leur solution repose sur une architecture Mixture-of-Experts (MoE) : chaque expert apprend une transformation de features propre à un type de vue, et un routeur les combine à partir d'informations de vue implicites. La politique peut ainsi être déployée sans fournir les paramètres extrinsèques de la caméra en entrée. Sur le benchmark LIBERO, le taux de succès moyen de pi-0.5 passe de 39,2 % à 78,3 % sous perturbations de la vue poignet, soit un doublement. Des essais sur robot réel indiquent que l'adaptation au niveau des features, apprise en simulation, se transfère à plusieurs configurations de déploiement. Le benchmark de robustesse aux points de vue poignet et une implémentation « plug-and-play » sont publiés. Ce résultat touche un point bloquant du passage des VLA du laboratoire à l'atelier. Reproduire exactement la pose de caméra utilisée à l'entraînement est quasi impossible d'un site à l'autre. Les supports se desserrent, les intégrateurs choisissent des fixations différentes et les générations de robots varient. Une politique qui perd la moitié de ses performances pour un déplacement modéré du capteur oblige à recalibrer ou à réentraîner à chaque déploiement, ce qui pèse directement sur les coûts d'intégration. Le gain mesuré sur pi-0.5 montre que cette fragilité vient en bonne part de la représentation visuelle, et qu'on peut la corriger sans exiger les extrinsèques en entrée. Il faut toutefois rester prudent : les chiffres viennent surtout de LIBERO, un benchmark simulé aux tâches relativement standardisées. Le résumé ne chiffre pas la performance sur robot réel, ni le nombre de plateformes, de tâches ou d'essais. Le taux de 78,3 % reste aussi nettement inférieur à ce qu'exigerait une exploitation industrielle, et le texte fourni ne dit pas quel est le niveau de référence sans perturbation. Le travail s'inscrit dans une série de recherches sur la robustesse des VLA aux changements de point de vue, après l'essor de modèles généralistes comme pi-0 et pi-0.5 de Physical Intelligence. Ces modèles sont entraînés sur des données massives, mais avec des configurations de caméras peu variées. Les approches concurrentes passent par l'augmentation de données multi-vues, la randomisation de domaine ou l'injection explicite de la géométrie de caméra. WARP-VLA évite l'entrée extrinsèque et mise sur un routage implicite, ce qui simplifie le déploiement. Le code et le benchmark publics permettront à d'autres équipes de comparer leurs méthodes, une étape utile avant toute validation en conditions de production. Aucune annonce de pilote industriel n'accompagne ce preprint, qui n'a pas encore été évalué par des pairs.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
LARA : alignement des représentations d'actions latentes pour les modèles vision-langage-action
2arXiv cs.RO 

LARA : alignement des représentations d'actions latentes pour les modèles vision-langage-action

Une équipe de recherche propose LARA (Latent Action Representation Alignment), un framework qui entraîne conjointement deux composants jusqu'ici séparés dans les modèles vision-langage-action (VLA) : le modèle d'action latente (LAM), qui apprend des représentations d'actions à partir de vidéos non annotées, et le modèle VLA lui-même. Jusqu'à présent, ces deux briques étaient optimisées indépendamment, ce qui limitait leurs bénéfices mutuels : le LAM restait déconnecté du contexte robotique réel, et le VLA était contraint par des représentations figées, sans possibilité d'ajustement. LARA aligne les deux via un mécanisme de représentation partagée, permettant au LAM d'apprendre à partir de trajectoires d'actions réelles pour éviter de capter de simples changements visuels sans pertinence (comme un déplacement de caméra), tandis que le VLA est régularisé par la dynamique prédictive du LAM pour réduire les hallucinations de trajectoires inefficaces. Les auteurs rapportent des gains moyens d'environ 10% en pré-entraînement, 5% en amélioration post-entraînement de modèles VLA déjà entraînés, et 15% en affinage du LAM seul, mesurés sur trois benchmarks de manipulation en simulation et un benchmark réel conçu spécifiquement pour l'évaluation. L'enjeu pour le secteur est la dépendance chronique des VLA à des jeux de données robotiques réels, coûteux et rares à grande échelle. Exploiter des vidéos humaines non étiquetées comme source de supervision, sans perdre en fiabilité, est une piste suivie par plusieurs laboratoires travaillant sur des modèles comme GR00T N2 ou Pi-0. Ce que suggère LARA, c'est que le goulot d'étranglement n'est pas seulement la quantité de données vidéo disponibles, mais la façon dont les représentations d'action apprises restent ou non ancrées dans la réalité physique du robot pendant l'entraînement conjoint. L'approche s'inscrit dans la lignée des travaux sur les Latent Action Models, qui cherchent depuis plusieurs années à combler l'écart entre l'abondance de vidéos web et la rareté des démonstrations robotiques annotées. Contrairement à une annonce produit, il s'agit ici d'un travail académique (version 2 d'un article déposé sur arXiv), sans déploiement industriel annoncé ni calendrier de commercialisation ; sa portée dépendra de sa reproductibilité et de son adoption par les équipes développant des VLA en conditions réelles.

RecherchePaper
1 source
Lost dans la reconstruction : aligner les représentations d'action et le langage dans les modèles vision-langage-action
3arXiv cs.RO 

Lost dans la reconstruction : aligner les représentations d'action et le langage dans les modèles vision-langage-action

Un article publié le 12 août 2026 sur arXiv (2608.10484) s'attaque à la tokenisation des trajectoires de mouvement dans les modèles vision-langage-action, ou VLA. Sur le jeu de données BridgeV2, les auteurs montrent que ces trajectoires portent des informations liées au sens des verbes d'instruction, au-delà des simples changements d'état visuel, et que les tokenizers classiques, entraînés à reconstruire le geste via des pertes L1/L2, effacent systématiquement cette information linguistique. Leur méthode, baptisée SALT pour Semantically ALigned action Tokenizer, ajoute à un tokenizer de type VQ-VAE un objectif auxiliaire: un modèle vision-langage figé doit retrouver l'instruction textuelle de l'épisode à partir des seuls latents d'action quantifiés. Sur le benchmark de simulation SimplerEnv, les politiques entraînées avec SALT atteignent 71,9% de réussite moyenne, contre 42,7% pour un VQ-VAE classique et 31,2% pour FAST. Ce résultat touche un choix de conception central pour toute la famille des VLA, celle qui sous-tend des systèmes comme Pi-0, GR00T ou Helix: comment découper des actions continues en tokens discrets avant l'entraînement. Jusqu'ici, la priorité allait à la fidélité de reconstruction du geste, sous l'hypothèse que minimiser l'erreur numérique suffisait à préserver le sens de l'instruction en langage naturel. L'écart de près de 30 points entre SALT et un VQ-VAE standard suggère qu'une part importante du sens se perd dès la tokenisation, indépendamment de la taille du modèle ou du volume de données. Pour les équipes qui construisent des politiques de contrôle conditionnées par le langage, obtenir un tel gain par un simple changement d'objectif d'entraînement du tokenizer, sans toucher à l'architecture principale, constitue un signal fort. Le travail s'inscrit dans le débat sur la tokenisation des actions robotiques, partagé entre les tokenizers de reconstruction type VQ-VAE et des approches comme FAST, développée par Physical Intelligence et utilisée dans la lignée Pi-0. SALT s'en distingue en conservant la fidélité de reconstruction tout en développant des codes discrets spécialisés par verbe d'action. Publié comme nouvelle soumission arXiv, le travail est validé uniquement en simulation via SimplerEnv, sans démonstration sur robot physique, laissant ouverte la question du transfert sim-to-real.

UEAucun acteur ni deploiement francais/europeen n'est implique; il s'agit d'un resultat de recherche generique pouvant interesser les equipes europeennes travaillant sur des modeles VLA.

RechercheOpinion
1 source
SAM3D pour aligner les représentations centrées sur l'objet dans les modèles vision-langage-action
4arXiv cs.RO 

SAM3D pour aligner les représentations centrées sur l'objet dans les modèles vision-langage-action

Cette recherche présente un cadre d'alignement de représentations 3D centré sur l'objet, appliqué au modèle vision-langage-action (VLA) $\pi0$. Les auteurs utilisent SAM3D, un modèle 3D figé servant de "professeur", pour injecter des connaissances géométriques sur les objets cibles pendant l'entraînement : les objets pertinents pour la tâche sont localisés via des modèles de reconnaissance, des masques sont générés, puis SAM3D en extrait des représentations 3D denses alignées avec les caractéristiques visuelles intermédiaires de $\pi0$. Fait notable, ce module 3D n'intervient qu'à l'entraînement : au moment de l'inférence, le pipeline reste purement RGB-langage-vers-action, sans besoin de profondeur, nuage de points, masques ou calculs SAM3D supplémentaires. Les résultats en simulation atteignent 99,1% de réussite sur le benchmark LIBERO et une longueur moyenne de tâches de 4,11 sur CALVIN, avec des gains confirmés en conditions réelles, notamment sur des scénarios de manipulation longue durée impliquant plusieurs sous-tâches et objets cibles différents. L'enjeu pour l'industrie robotique est la résolution d'un point faible connu des modèles VLA actuels : leur dépendance à des backbones vision-langage 2D qui peinent face à l'occlusion, aux variations de pose ou d'échelle, et aux interactions spatiales précises. En démontrant qu'on peut internaliser une compréhension 3D fine sans alourdir le pipeline de déploiement, ce travail répond à une critique récurrente du secteur : les architectures VLA génériques marchent bien en démo contrôlée mais échouent sur des tâches de manipulation fine en conditions réelles. Pour les intégrateurs et décideurs B2B, cela suggère une voie pour améliorer la robustesse des politiques de manipulation sans complexifier ni ralentir le matériel embarqué, un compromis critique pour le déploiement industriel à grande échelle de bras robotiques et de robots humanoïdes. Ce travail s'inscrit dans la lignée des modèles VLA construits sur $\pi_0$ (Physical Intelligence), déjà positionné comme concurrent direct des approches comme GR00T N2 de NVIDIA ou Helix de Figure AI dans la course à des politiques de manipulation généralistes. L'apport spécifique ici est méthodologique plutôt qu'un nouveau produit ou déploiement terrain : il s'agit d'une technique d'entraînement, testée pour l'instant en simulation (LIBERO, CALVIN) et en expérimentations réelles limitées, sans annonce de déploiement commercial ni de partenariat industriel. Les prochaines étapes attendues porteraient sur l'extension à d'autres backbones VLA et sur la validation à plus grande échelle en environnement réel, au-delà des bancs d'essai académiques actuels.

RecherchePaper
1 source