Aller au contenu principal
RecherchearXiv cs.RO 

WARP-VLA : adaptation de la caméra de poignet pour une exécution robuste aux changements de point de vue dans les modèles vision-langage-action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

WARP-VLA, un modèle décrit dans un preprint arXiv (2610.11508v1), s'attaque à une faiblesse connue des modèles Vision-Language-Action (VLA) pour la manipulation robotique : leur sensibilité à la configuration des caméras. Les auteurs ciblent en particulier la caméra montée au poignet, dont le point de vue se déplace avec le robot. Un léger écart de fixation suffit alors à modifier les indices géométriques fins dont dépend la politique. Leur solution repose sur une architecture Mixture-of-Experts (MoE) : chaque expert apprend une transformation de features propre à un type de vue, et un routeur les combine à partir d'informations de vue implicites. La politique peut ainsi être déployée sans fournir les paramètres extrinsèques de la caméra en entrée. Sur le benchmark LIBERO, le taux de succès moyen de pi-0.5 passe de 39,2 % à 78,3 % sous perturbations de la vue poignet, soit un doublement. Des essais sur robot réel indiquent que l'adaptation au niveau des features, apprise en simulation, se transfère à plusieurs configurations de déploiement. Le benchmark de robustesse aux points de vue poignet et une implémentation « plug-and-play » sont publiés.

Ce résultat touche un point bloquant du passage des VLA du laboratoire à l'atelier. Reproduire exactement la pose de caméra utilisée à l'entraînement est quasi impossible d'un site à l'autre. Les supports se desserrent, les intégrateurs choisissent des fixations différentes et les générations de robots varient. Une politique qui perd la moitié de ses performances pour un déplacement modéré du capteur oblige à recalibrer ou à réentraîner à chaque déploiement, ce qui pèse directement sur les coûts d'intégration. Le gain mesuré sur pi-0.5 montre que cette fragilité vient en bonne part de la représentation visuelle, et qu'on peut la corriger sans exiger les extrinsèques en entrée. Il faut toutefois rester prudent : les chiffres viennent surtout de LIBERO, un benchmark simulé aux tâches relativement standardisées. Le résumé ne chiffre pas la performance sur robot réel, ni le nombre de plateformes, de tâches ou d'essais. Le taux de 78,3 % reste aussi nettement inférieur à ce qu'exigerait une exploitation industrielle, et le texte fourni ne dit pas quel est le niveau de référence sans perturbation.

Le travail s'inscrit dans une série de recherches sur la robustesse des VLA aux changements de point de vue, après l'essor de modèles généralistes comme pi-0 et pi-0.5 de Physical Intelligence. Ces modèles sont entraînés sur des données massives, mais avec des configurations de caméras peu variées. Les approches concurrentes passent par l'augmentation de données multi-vues, la randomisation de domaine ou l'injection explicite de la géométrie de caméra. WARP-VLA évite l'entrée extrinsèque et mise sur un routage implicite, ce qui simplifie le déploiement. Le code et le benchmark publics permettront à d'autres équipes de comparer leurs méthodes, une étape utile avant toute validation en conditions de production. Aucune annonce de pilote industriel n'accompagne ce preprint, qui n'a pas encore été évalué par des pairs.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

ROAD-VLA : adaptation en ligne robuste par auto-distillation pour les modèles vision-langage-action
1arXiv cs.RO 

ROAD-VLA : adaptation en ligne robuste par auto-distillation pour les modèles vision-langage-action

Une équipe de chercheurs publie fin juin 2026 ROAD-VLA (arXiv:2606.25800), un cadre d'adaptation en ligne des modèles VLA (Vision-Language-Action) par auto-distillation guidée par avantage. Les VLA, à l'image de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou RT-2 (Google DeepMind), traduisent directement une entrée visuelle et une instruction en langage naturel en séquences d'actions robotiques. Le problème : affiner un tel modèle pré-entraîné sur de nouvelles tâches via apprentissage par renforcement (RL) génère des récompenses trop éparses pour superviser des politiques autoregressives de haute dimension. ROAD-VLA y répond en construisant un "enseignant proximal" dans l'espace des actions, perturbant les logits des tokens d'action avec des estimations d'avantage calibrées pour convertir des récompenses rares en supervision dense token par token. Évalué sur sept environnements de manipulation robotique, en distribution et hors distribution, le framework surpasse PPO (Proximal Policy Optimization, référence RL standard) dans la quasi-totalité des configurations. La découverte la plus saillante est l'existence d'un "modality gap" : les enseignants textuels conditionnés sur des démonstrations, des expériences récupérées ou des plans de haut niveau s'avèrent systématiquement inefficaces pour adapter les politiques d'action VLA. C'est une contradiction directe avec une hypothèse répandue selon laquelle le guidage symbolique ou langagier peut servir de supervision fiable lors du fine-tuning RL. ROAD-VLA démontre que la supervision doit opérer dans l'espace des actions, pas dans l'espace du langage. Pour un intégrateur déployant des bras manipulateurs basés sur VLA, cela ouvre une voie d'adaptation au domaine sans collecter de nouvelles démonstrations massives : le modèle se corrige via son propre comportement et les signaux de récompense de l'environnement réel. Le paradigme VLA a pris son essor avec RT-2 (Google DeepMind, 2023), puis s'est accéléré via Pi-0 (Physical Intelligence, 2024), GR00T N2 (NVIDIA, 2025) et Helix (Figure AI), accompagnés d'une vague de publications académiques. L'adaptation post-déploiement, soit ajuster un modèle généraliste à une géométrie de préhension spécifique ou à un flux industriel précis sans tout ré-entraîner, est désormais identifiée comme le verrou opérationnel suivant par les équipes terrain. Ce travail reste une annonce académique (arXiv, juin 2026), pas un produit livré ni un déploiement industriel réel, et la validation sur robots physiques en conditions industrielles reste à conduire. Aucun acteur français ou européen n'est impliqué dans cette recherche.

RechercheOpinion
1 source
RotVLA : action latente de rotation pour les modèles vision-langage-action (VLA)
2arXiv cs.RO 

RotVLA : action latente de rotation pour les modèles vision-langage-action (VLA)

Un groupe de chercheurs a publié en mai 2026 RotVLA (arXiv:2605.13403), un framework Vision-Language-Action (VLA) qui substitue la quantification discrète des modèles d'action latente (LAM) existants par une représentation continue dans l'espace de rotation SO(n). Entraîné sur plus de 1 700 heures de données robotiques multi-embodiment et de vidéos humaines, le modèle compte 1,7 milliard de paramètres. Son architecture associe un backbone de modèle vision-langage et une tête d'action par flow-matching, étendue en aval en un "action expert" unifié qui dénoise simultanément actions latentes et actions robot. Sur LIBERO, RotVLA atteint 98,2 % de taux de succès ; sur RoboTwin2.0, il obtient 89,6 % en configuration propre et 88,5 % en configuration randomisée, surpassant les modèles VLA antérieurs dans les deux cas. Des expériences sur des tâches de manipulation réelle confirment ces résultats hors simulation. L'enjeu est architectural : les LAMs actuels, basés sur des pipelines VQ-VAE ou similaires, induisent une reconstruction de frames souvent triviale et n'imposent aucune contrainte géométrique cohérente avec la physique du mouvement. En modélisant les actions latentes comme des éléments de SO(n), RotVLA garantit continuité et compositionnalité absentes des espaces discrets, avec un triplet frame learning qui force une dynamique temporelle non dégénérée. Pour les équipes d'intégration robotique, cela ouvre la voie à un modèle de fondation plus robuste au sim-to-real, l'un des goulots d'étranglement centraux des VLAs en conditions industrielles. L'approche suggère que la structure géométrique de l'espace d'action peut compter autant que l'échelle des données d'entraînement. Le domaine des politiques robotiques généralistes a été structuré par Pi-0 (Physical Intelligence, 2024) et GR00T N2 (NVIDIA, 2025), qui misaient sur des corpus cross-embodiment massifs pour entraîner des politiques généralisables. RotVLA s'inscrit dans cette lignée mais parie sur une représentation latente géométriquement structurée plutôt que sur le volume brut de paramètres, avec 1,7B contre plusieurs dizaines de milliards pour les modèles concurrents les plus ambitieux. Les scores LIBERO et RoboTwin2.0 sont des benchmarks académiques standardisés ; leur transposition sur des cellules industrielles réelles (bras collaboratifs, tri et picking) reste à démontrer. Aucun partenaire de déploiement ni calendrier commercial ne figure dans la publication : RotVLA est, à ce stade, une contribution de recherche.

RechercheOpinion
1 source
Vision robotique : cartes de points centrées sur le robot pour les modèles vision-langage-action
3arXiv cs.RO 

Vision robotique : cartes de points centrées sur le robot pour les modèles vision-langage-action

Des chercheurs proposent dans un article arXiv (2607.11498v1, soumis en juillet 2026) une méthode baptisée "pointmaps robot-centriques" pour résoudre un problème structurel des modèles vision-langage-action (VLA). Ces modèles prédisent des actions robotiques à partir d'observations visuelles et d'instructions en langage naturel, mais les actions sont définies dans le repère 3D propre au robot, alors que la caméra observe la scène dans son propre repère. Ce décalage reste sans conséquence quand le point de vue de la caméra est fixe, la politique pouvant alors mémoriser une correspondance unique observation-action, mais il devient problématique à mesure que les jeux de données agrègent des démonstrations issues de configurations caméra variées. La solution proposée encode les coordonnées 3D des points de la scène, exprimées dans le repère du robot, directement dans une grille dense H x W, format identique à celui attendu par les VLA 2D pré-entraînés, ce qui permet une intégration avec un minimum de modifications architecturales. Testée sur le benchmark RoboCasa, cette approche améliore les performances de deux modèles existants, pi0.5 et SmolVLA, et surpasse des méthodes de référence basées sur le point de vue caméra ou sur une conscience 3D classique. Cette avancée touche un point sensible pour l'industrialisation des VLA à grande échelle: la généralisation à des configurations caméra non standardisées est un frein connu au déploiement sur des cellules robotiques hétérogènes, où chaque intégrateur positionne ses capteurs différemment. Les expériences sur robot réel confirment que l'avantage par rapport à une politique RGB classique s'accentue justement quand la caméra est déplacée vers un emplacement absent de l'entraînement, ce qui va dans le sens d'une meilleure robustesse au changement de point de vue, condition nécessaire pour des flottes de robots déployées avec des configurations non uniformisées, plutôt qu'un simple gain de performance en conditions contrôlées. Le travail s'inscrit dans la lignée des modèles VLA récents tels que pi-0, GR00T N2 ou Helix, qui cherchent à généraliser l'apprentissage de politiques robotiques à partir de larges corpus de démonstrations multi-plateformes. En comparant explicitement leur méthode à des approches de conditionnement par point de vue caméra et à des baselines 3D-aware, les auteurs positionnent les pointmaps comme une alternative légère à des architectures 3D plus lourdes, ouvrant la voie à des validations plus larges sur des flottes robotiques aux configurations caméra diverses.

RechercheActu
1 source
Adaptation des modèles vision-langage-action (VLA) à des perturbations visuelles inconnues pendant l'exécution
4arXiv cs.RO 

Adaptation des modèles vision-langage-action (VLA) à des perturbations visuelles inconnues pendant l'exécution

Des chercheurs proposent SALT (Self-supervised Adaptation from Leftover Trajectories), une méthode d'adaptation au moment du test pour les modèles vision-langage-action (VLA), publiée sur arXiv (2610.07946). Elle cible un problème précis : une perturbation visuelle (corruption d'image, obstruction physique de la caméra) survient en cours d'exécution, sans que la politique connaisse son type ni son moment d'apparition. SALT exploite la « trajectoire résiduelle », c'est-à-dire la partie non exécutée du chunk d'actions précédent. Les chunks consécutifs se recouvrant dans le temps, ce résidu fournit une cible alignée sur le même intervalle de contrôle que la prédiction courante. Aucune annotation de perturbation, aucune action d'expert et aucune démonstration du domaine cible ne sont requises. Une porte d'adaptation légère, calibrée uniquement sur des trajectoires nominales, déclenche les mises à jour. Sur LIBERO-10, le taux de succès moyen sur cinq corruptions visuelles persistantes passe de 43,9 % à 53,2 % avec SmolVLA, et de 58,7 % à 66,0 % avec GR00T N1.7, avec une performance nominale largement préservée. Sur robot réel, la progression de tâche moyenne, perturbations numériques et physiques confondues, passe de 0,49 à 0,61. L'intérêt tient à la nature du problème traité. La plupart des travaux de robustesse des VLA supposent un entraînement avec augmentation de données ou une connaissance du décalage de domaine. Or en production, caméras salies, éclairage changeant ou occultations partielles arrivent sans préavis. SALT suggère qu'on peut gagner entre 7 et 9 points de succès sans données supplémentaires, en recyclant les prédictions déjà produites par le modèle. Deux mécanismes expliquent l'effet : à l'apparition du décalage, le résidu garde un plan formé avant la corruption et sert d'ancre (Transition Anchoring), puis la correction se propage d'un replanning à l'autre (Sequential Correction Propagation). Les limites sont nettes : le gain reste modeste en valeur absolue, les taux de succès restent sous les 70 %, et le test sur robot réel, mesuré par un score de progression et non un taux de réussite, offre peu de détails sur le nombre d'essais ou les tâches. Le benchmark LIBERO reste de plus de la simulation. Ce travail s'inscrit dans l'effort de fiabilisation des VLA après la vague de modèles généralistes comme Pi-0, GR00T ou SmolVLA, dont l'écart entre démonstration et déploiement tient souvent à la sensibilité aux conditions visuelles. L'approche rejoint l'adaptation au moment du test, déjà explorée en vision par ordinateur, mais l'applique ici à la structure par chunks d'actions propre aux politiques modernes. Elle reste un résultat de recherche, sans produit ni déploiement annoncé. Les prochaines étapes probables sont des validations sur d'autres architectures, des perturbations plus variées et des tâches longues, ainsi qu'une évaluation du coût de calcul des mises à jour en ligne sur du matériel embarqué, point que le résumé ne chiffre pas.

RecherchePaper
1 source