Aller au contenu principal
Event-VLA : fusion d'événements conditionnée par l'action pour un modèle VLA robuste
IA physiquearXiv cs.RO 

Event-VLA : fusion d'événements conditionnée par l'action pour un modèle VLA robuste

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (référence 2606.29384) Event-VLA, un framework combinant des caméras événementielles avec des modèles Vision-Language-Action (VLA) pour rendre la manipulation robotique robuste dans des conditions d'éclairage dégradées. L'approche repose sur l'intégration de flux d'événements, une modalité de capteur neuromorphique qui encode les variations de luminosité pixel par pixel avec une résolution temporelle de l'ordre de la microseconde, contrairement aux caméras RGB classiques qui acquièrent des images complètes à fréquence fixe. L'architecture introduit un mécanisme de routage par requêtes d'action : des requêtes apprenantes extraient la sémantique pertinente à la tâche depuis le raisonnement VLA, puis agrègent sélectivement les tokens événementiels via une cross-attention à portes (gated cross-attention), produisant des représentations d'action sensibles aux conditions lumineuses. Les expériences couvrent des scénarios de simulation et de déploiement réel en faible luminosité, voire en quasi-obscurité.

Ce travail s'attaque à une faille structurelle des VLA actuels, Pi-0, OpenVLA, GR00T N2 ou Helix inclus, qui sont entraînés et évalués quasi-exclusivement dans des environnements d'intérieur bien éclairés et stables. Le sim-to-real gap se double ici d'un lighting-to-real gap rarement quantifié dans les benchmarks publiés. Event-VLA démontre qu'on peut greffer une modalité événementielle sans détruire les priors sémantiques RGB-langage préentraînés, ce qui est non trivial : la plupart des fusions multimodales naïves dégradent la performance en conditions normales pour gagner en robustesse marginale. Le fait que le gain soit mesuré sans régression sur éclairage standard constitue le résultat le plus solide à retenir pour les intégrateurs industriels envisageant des déploiements en entrepôt, en extérieur ou en environnement à éclairage variable.

Les caméras événementielles (Prophesee, inivation, Sony IMX636) restent onéreuses et peu présentes dans les pipelines robotiques commerciaux, ce qui limite la portée immédiate du framework. Le travail s'inscrit dans un mouvement plus large d'hybridation sensorielle pour les VLA, en parallèle d'approches tactiles (GelSight) ou proprioceptives. Côté concurrent, Boston Dynamics, Figure et Agility travaillent sur la robustesse des politiques en conditions réelles mais publient peu sur la gestion de l'éclairage. Aucun acteur européen n'est mentionné dans ce papier. Les auteurs ne précisent pas de pipeline de déploiement à l'échelle ni de timeline industrielle : il s'agit d'un résultat de recherche, pas d'un produit shipé.

Impact France/UE

Prophesee, fabricant français de caméras événementielles, est explicitement cité comme fournisseur matériel clé, ce qui positionne l'écosystème européen du capteur neuromorphique comme brique potentielle des futurs pipelines VLA industriels robustes.

À lire aussi

CAC-VLA : un conditionnement d'action contrôlé par le contexte pour les modèles vision-langage-action
1arXiv cs.RO 

CAC-VLA : un conditionnement d'action contrôlé par le contexte pour les modèles vision-langage-action

Des chercheurs proposent CAC-VLA (Context-Gated Action Conditioning), une nouvelle architecture pour les modèles vision-langage-action (VLA), la famille de systèmes qui pilote de plus en plus de bras et robots humanoïdes generalistes. Le problème identifié: dans les VLA classiques, les représentations visuelles et langagières ne sont pas pensées pour guider directement le contrôle moteur, ce qui laisse à «l'expert action» (le module qui génère la trajectoire) la charge de combler cet écart. Des méthodes récentes tentent de corriger cela avec des modules de raisonnement d'action séparés, mais elles nécessitent des architectures dédiées supplémentaires. CAC-VLA prend une autre voie: il entraîne le modèle vision-langage lui-même à prédire des actions latentes, des représentations compactes encodées à partir de segments d'action futurs, du grossier au fin, puis utilise une «porte de contexte» pour doser en temps réel l'influence de ce signal sur l'expert d'action. Sur les bancs d'essai LIBERO et LIBERO-Plus, la méthode atteint respectivement 98,3% et 89,5% de taux de réussite moyen. Pour l'industrie robotique, l'enjeu dépasse le simple gain de quelques points de benchmark. Le goulot d'étranglement entre compréhension multimodale et motricité précise est l'un des obstacles centraux à la généralisation des VLA au-delà de tâches scriptées, un sujet suivi de près par les équipes qui travaillent sur des systèmes comme π0, GR00T N2 ou Helix. Une interface qui intègre le raisonnement d'action directement dans le VLM, sans framework de génération séparé, simplifierait l'entraînement et le déploiement de ces piles logicielles chez les intégrateurs, réduisant la complexité d'ingénierie souvent invoquée comme frein à la mise en production. Ces résultats restent toutefois obtenus en simulation, sur des suites de tâches standardisées et non sur du matériel réel en usine ou en entrepôt, une nuance importante alors que le secteur multiplie les annonces de percées en manipulation générale. LIBERO et sa variante LIBERO-Plus servent de référence commune pour comparer les approches d'action-conditioning, et la prochaine étape logique pour valider l'intérêt de CAC-VLA sera sa transposition sur des robots physiques et des tâches de manipulation en conditions réelles.

IA physiqueActu
1 source
AR-WAM : un modèle monde-action prêt pour les agents, conditionné par la vision, pour la manipulation robotique
2arXiv cs.RO 

AR-WAM : un modèle monde-action prêt pour les agents, conditionné par la vision, pour la manipulation robotique

Un article déposé le 22 septembre 2026 sur arXiv (2609.23578) présente AR-WAM, un modèle de manipulation robotique qui remplace les instructions en langage naturel par deux signaux visuels : une boîte englobante désignant l'objet cible et un jeton d'opération appris précisant la compétence à exécuter. Compact avec 0,5 milliard de paramètres et un encodeur visuel figé, sans encodeur de langage, il prédit l'évolution de la scène en espace latent tout en décodant les actions. Une couche de compatibilité à trois primitives, détecter, exécuter, interroger, permet à un VLM local ou une API d'agent de piloter la politique. Testé sur RoboTwin 2.0, RMBench et un robot réel bi-bras Astribot S1, il atteint 87,2% de succès en manipulation standard, gagne 5,9 points sur les tâches à mémoire et 36,7 points sur les tâches longues réelles, avec la latence la plus basse du comparatif, 14,1 millisecondes. Le choix cible un problème identifié par les auteurs : les VLA et les world action models dominants spécifient encore les tâches en langage naturel, une interface jugée ambiguë sur les références, imprécise spatialement et redondante avec la compréhension déjà portée par l'agent. En séparant le « quoi », décidé par l'agent, du « comment », exécuté par le robot via un grounding visuel explicite, AR-WAM offre une interface standardisée qui intéresse les intégrateurs cherchant à connecter des piles agentiques à des flottes de robots hétérogènes plutôt qu'à des prompts textuels ad hoc. Le bond de 36,7 points sur les tâches longues en conditions réelles suggère surtout que la faiblesse chronique des VLA sur l'horizon long peut être atténuée en délégant mémoire et récupération d'erreur à la couche agent, plutôt qu'en la faisant porter entièrement par un modèle d'action monolithique. Ces résultats restent ceux d'un article de recherche récent, validé en simulation et sur une seule plateforme robotique réelle, sans annonce de déploiement commercial ni de partenariat industriel. Astribot, dont le bras bi-bras S1 sert de banc d'essai réel, est une entreprise chinoise de manipulation robotique ; RoboTwin 2.0 et RMBench comptent parmi les bancs d'essai standards du secteur pour comparer des politiques de manipulation en simulation. L'article ne fournit ni échéancier de déploiement ni partenaire industriel identifié ; il se positionne comme une contribution méthodologique destinée à la prochaine génération de systèmes agent-robot, dans un secteur où l'exécution fiable de tâches longues sans supervision humaine reste l'un des principaux verrous avant une adoption industrielle à grande échelle.

IA physiqueOpinion
1 source
TacVLA : fusion tactile consciente du contact pour une manipulation VLA robuste
3arXiv cs.RO 

TacVLA : fusion tactile consciente du contact pour une manipulation VLA robuste

Une équipe de recherche présente TacVLA, un modèle Vision-Language-Action (VLA) affiné en ajoutant une modalité tactile aux flux visuels et linguistiques habituels de ce type de politique robotique. Décrit dans la troisième version d'un article publié sur arXiv (2603.12665), le système repose sur un mécanisme de gating conditionné au contact : les tokens tactiles ne s'activent que lorsqu'un contact physique est détecté, évitant de polluer la fusion multimodale le reste du temps. Les tokens visuels, linguistiques et tactiles sont ensuite traités conjointement par le transformer pour renforcer l'ancrage cross-modal durant la manipulation en contact. Sur des tâches de démontage de pièces verrouillées mécaniquement et de picking en boîte, TacVLA améliore le taux de réussite moyen de 20% en démontage et de 60% en picking face aux méthodes de référence, avec un gain de 2,1 fois sous occlusion visuelle et une capacité de récupération face aux perturbations manuelles. Ces résultats ciblent une limite connue des VLA purement visio-linguistiques, dont les performances chutent dès que la caméra est partiellement masquée ou que la tâche exige une manipulation fine avec contact prolongé, deux situations courantes en assemblage et démontage industriels. Pour les intégrateurs et équipes robotique en usine, un canal tactile activé seulement au contact ouvre une piste pour fiabiliser le bin picking et le désassemblage sans capteur tactile actif en permanence. Ces chiffres restent toutefois issus d'un article de recherche non encore publié en conférence, avec des vidéos choisies par les auteurs et sans précision sur le robot ni l'échelle de déploiement : une preuve de concept en laboratoire, pas un produit industriel déployé. TacVLA s'inscrit dans la vague des modèles VLA (Pi-0, GR00T N2, Helix, entre autres) qui transforment perception et langage en actions robotiques continues, un domaine où l'intégration du toucher reste largement un chantier ouvert malgré son rôle central dans la manipulation fine humaine. L'article ne mentionne aucune affiliation industrielle ni partenariat avec un fabricant de bras ou d'humanoïdes : il s'agit d'une contribution académique testée en conditions contrôlées. Aucun pilote industriel, calendrier de transfert vers un robot commercial ou suite opérationnelle n'est annoncé ; les auteurs renvoient aux vidéos publiées pour illustrer le comportement du système.

IA physiqueOpinion
1 source
VLA Foundry : un cadre unifié pour l'entraînement des modèles vision-langage-action
4arXiv cs.RO 

VLA Foundry : un cadre unifié pour l'entraînement des modèles vision-langage-action

Le laboratoire TRI-ML (Toyota Research Institute Machine Learning) publie VLA Foundry, un framework open-source qui unifie dans une seule base de code l'entraînement des modèles LLM, VLM et VLA (Vision-Language-Action). Jusqu'ici, la majorité des pipelines open-source de robotique apprenante se concentraient exclusivement sur l'étape d'entraînement à l'action, assemblant à la hâte des briques de préentraînement incompatibles entre elles. VLA Foundry propose à la place un continuum de bout en bout: du préentraînement linguistique jusqu'au fine-tuning spécialisé pour le contrôle moteur. Deux familles de modèles sont publiées simultanément: la première entraînée intégralement depuis zéro via le pipeline LLM→VLM→VLA, la seconde construite sur le backbone Qwen3-VL d'Alibaba. Les deux sont évalués en boucle fermée sur LBM Eval, un simulateur open-source et open-data de manipulation sur table. Sur les tâches multi-objets, le modèle fondé sur Qwen3-VL dépasse la baseline de façon significative, sans que TRI-ML ne quantifie précisément l'écart dans le résumé publié. Le code est disponible sur GitHub (TRI-ML/vla_foundry) et les poids sont libérés sur HuggingFace. Ce que VLA Foundry prouve concrètement, c'est que le choix du backbone VLM est un levier critique: partir d'un modèle vision-langage préentraîné et performant comme Qwen3-VL, plutôt que de construire une architecture robotique ad hoc, améliore substantiellement la politique de contrôle multi-tâches. Pour les équipes d'intégration et les chercheurs, cela valide une stratégie de transfert: exploiter les représentations génériques des grands VLMs commerciaux ou open-weights plutôt que de repartir de zéro. Par ailleurs, le fait que le modèle from-scratch atteigne les performances des travaux closed-source antérieurs de TRI-ML constitue un signal positif pour la reproductibilité de cette classe de modèles, souvent opaque dans la littérature. TRI-ML est l'un des laboratoires de robotique académique les plus actifs, avec une longue historique en apprentissage par renforcement et en manipulation. Dans la course aux VLA, il affronte désormais Physical Intelligence et son modèle pi0, Figure AI avec Helix, Google DeepMind (RT-2, et ses successeurs), ainsi que plusieurs startups émergentes. L'appui sur Qwen3-VL, un modèle produit par l'équipe Qwen d'Alibaba, illustre la tendance croissante à hybrider les avancées du monde NLP avec les contraintes du monde physique. Les prochaines étapes mentionnées incluent des améliorations d'outillage pour le simulateur LBM Eval et l'outil d'analyse STEP, deux contributions qui pourraient aider la communauté à standardiser l'évaluation des politiques robotiques en boucle fermée.

IA physiqueOpinion
1 source