Aller au contenu principal
UrbanVLA : un modèle vision-langage-action (VLA) pour la micromobilité urbaine
IA physiquearXiv cs.RO 

UrbanVLA : un modèle vision-langage-action (VLA) pour la micromobilité urbaine

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2510.23576, version 2) UrbanVLA, un cadre Vision-Language-Action (VLA) conditionné par une route, conçu pour la navigation de micromobilité urbaine, c'est-à-dire des robots de livraison qui doivent suivre des itinéraires longs dans des villes réelles. Le système aligne explicitement des waypoints de route bruités avec les observations visuelles pendant l'exécution, puis planifie des trajectoires pour piloter le robot. L'entraînement se fait en deux étapes. Une phase de Supervised Fine-Tuning (SFT) utilise des environnements simulés et des trajectoires extraites de vidéos web. Une phase de Reinforcement Fine-Tuning (RFT) s'appuie ensuite sur un mélange de données simulées et réelles, afin d'améliorer la sécurité et l'adaptabilité en conditions réelles. Les auteurs affirment un gain de plus de 55 % face à des références solides sur la tâche SocialNav du benchmark MetaUrban, ainsi qu'une navigation réelle fiable. Le résumé ne donne ni payload, ni plateforme robotique, ni vitesse, ni distances parcourues.

L'intérêt tient à la structuration du problème. Les méthodes de navigation actuelles ciblent surtout des scénarios courts et contrôlables, alors qu'une livraison urbaine exige deux niveaux de compétence : bas niveau (atteindre un point, éviter les obstacles) et haut niveau (faire correspondre la route prévue à ce que le robot voit). Pour les intégrateurs de robots de trottoir, l'enjeu est de savoir si un VLA peut absorber des itinéraires GPS ou cartographiques imparfaits, sans recalibrage manuel par site. L'usage de vidéos web pour amorcer l'apprentissage vise à réduire le coût de collecte de données, un des principaux freins du secteur. Il faut toutefois rester prudent : le chiffre de 55 % provient d'un benchmark simulé, dont le choix des baselines n'est pas détaillé dans le résumé. La robustesse « réelle » annoncée n'est étayée ici par aucune métrique publique. Reste à voir si le transfert sim-to-real tient hors des scénarios sélectionnés pour la démonstration.

Ce travail s'inscrit dans la vague des modèles VLA, d'abord développés pour la manipulation (Pi-0, GR00T, Helix) et désormais étendus à la navigation. Il vise un marché déjà occupé par des robots de livraison à roues, comme ceux de Starship Technologies, dont la navigation repose en grande partie sur des cartes préconstruites et des piles modulaires. Un VLA de bout en bout leur oppose une approche plus généraliste, mais moins éprouvée en sécurité. La mention d'une version 2 indique un article révisé, probablement après relecture. Les prochaines étapes à surveiller sont la publication du code, des modèles et des données, ainsi que des essais sur de longs parcours en environnement dense, seuls capables de confirmer ou non l'échelle revendiquée.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Fusion des modalités tactiles pour les modèles vision-langage-action (VLA)
1arXiv cs.RO 

Fusion des modalités tactiles pour les modèles vision-langage-action (VLA)

Il s'agit d'un article de recherche académique (préprint arXiv, version révisée), donc sans annonce commerciale ni chiffres de performance détaillés dans le résumé fourni, je reste factuel sur ce point plutôt que d'inventer des métriques. TacFiLM est une méthode de fusion de modalités proposée dans un préprint arXiv (2603.14604v2, version révisée) qui intègre des signaux tactiles aux modèles vision-langage-action (VLA) utilisés en robotique manipulatrice. Le constat de départ est simple: les VLA actuels, bien qu'efficaces pour généraliser des politiques de contrôle a partir d'instructions sémantiques, reposent presque exclusivement sur la perception visuelle, incapable de capturer les dynamiques d'interaction propres aux taches de manipulation en contact étroit, comme les forces de contact, le frottement de surface, la compliance ou le cisaillement. Plutot que de concaténer des tokens tactiles ou de reentrainer massivement le modèle, ce qui alourdit considérablement le cout de calcul, les auteurs proposent un finetuning post-entrainement léger: les caractéristiques visuelles intermédiaires sont conditionnées par des représentations tactiles pré-entraînées via une modulation linéaire par caractéristique (FiLM). La méthode a été testée sur des taches d'insertion et d'ouverture de tiroir, en distribution et hors distribution, avec des améliorations rapportées sur le taux de réussite, la performance directe, le temps d'exécution et la stabilité des forces appliquées. L'intérêt pour le secteur tient moins a la performance brute qu'a la stratégie d'intégration: la plupart des architectures VLA déployées (dans la lignée de Pi-0, GR00T N2 ou Helix) tournent déjà a la limite du budget de calcul embarque, ce qui rend les approches de fusion tactile lourdes difficilement viables en production. Une méthode de finetoning légère, greffée après coup sur un modèle déjà entraine, ouvre la voie a l'ajout de retour tactile sur des politiques existantes sans reentrainement complet ni explosion du cout d'inférence, un point clé pour les intégrateurs qui visent des taches d'assemblage ou de manipulation fine ou le seul retour visuel échoue régulièrement. Cette publication s'inscrit dans une tendance de fond de la recherche VLA: après avoir démontre la généralisation sémantique et le contrôle multitâche, le champ se heurte désormais au problème spécifique de la manipulation en contact, un angle mort connu depuis les débuts de l'apprentissage par imitation en robotique. Le fait qu'il s'agisse d'une version "replace" du preprint suggère une itération après retours de relecture. Les auteurs renvoient vers une page de projet dédiée pour le code et les démonstrations, sans toutefois annoncer de déploiement industriel ou de partenariat avec un fabricant de robots a ce stade.

IA physiqueOpinion
1 source
TAP-VLA : annotation tactile pour les modèles vision-langage-action (VLA)
2arXiv cs.RO 

TAP-VLA : annotation tactile pour les modèles vision-langage-action (VLA)

Des chercheurs ont publié sur arXiv (réf. 2606.29089) une méthode appelée TAP-VLA (Tactile Annotation Prompting for Vision-Language-Action models) visant à doter les modèles vision-langage-action du sens du toucher sans modifier leur architecture. Sur quatre tâches de manipulation à contacts complexes (vissage, insertion, assemblage de précision), TAP-VLA atteint un taux de succès de 78 %, contre moins de 50 % pour un fine-tuning purement visuel et pour les approches alternatives de fusion tactile, certaines de ces baselines ne faisant pas mieux qu'un résultat aléatoire. Le principe repose sur des capteurs visuo-tactiles capables de mesurer les champs de cisaillement (shear fields) à la surface de contact ; ces champs sont ensuite superposés sous forme de vecteurs spatialement alignés directement sur les images RGB multi-vues que le modèle consomme déjà, sans ajouter de modalité d'entrée distincte. L'enjeu est réel : les VLAs de génération actuelle, comme π0 de Physical Intelligence, OpenVLA ou RT-2 de Google DeepMind, offrent un raisonnement robuste sur les variations visuelles, sémantiques et spatiales grâce à leur pré-entraînement à grande échelle, mais restent aveugles aux forces de contact, pourtant centrales dans toute manipulation industrielle sérieuse (emboîtement de précision, vissage, gestion d'objets déformables). Intégrer le toucher comme nouvelle modalité d'entrée détériore précisément ce pré-entraînement, car les données tactiles sont absentes des corpus à grande échelle sur lesquels ces modèles sont construits, un problème de distribution shift bien documenté dans la littérature. TAP-VLA contourne l'obstacle en restant dans l'espace d'observation natif du modèle : pas de modification architecturale, pas de pré-entraînement tactile spécifique, surcoût computationnel négligeable. Ce travail s'inscrit dans une course active autour de l'embodied AI pour la manipulation de précision, où Physical Intelligence (π0, π0-FAST), Figure AI ou Apptronik cherchent à étendre les capacités de leurs humanoïdes et bras industriels au-delà du pick-and-place visuel. La question du sim-to-real pour les contacts reste l'un des derniers verrous majeurs avant un déploiement industriel à l'échelle. En évitant la refonte architecturale, TAP-VLA propose une voie d'intégration compatible avec les VLAs existants, ce qui simplifie son adoption par des équipes qui travaillent à partir de modèles déjà entraînés. La publication sur arXiv sans conférence associée indique que ce travail est encore en cours d'évaluation par les pairs ; aucun déploiement réel ou pilote industriel n'est annoncé à ce stade.

IA physiqueOpinion
1 source
Guidance stable par le langage pour les modèles vision-langage-action (VLA)
3arXiv cs.RO 

Guidance stable par le langage pour les modèles vision-langage-action (VLA)

Des chercheurs ont publié sur arXiv (réf. 2601.04052v2) une méthode baptisée Residual Semantic Steering (RSS), conçue pour corriger un défaut structurel des modèles Vision-Language-Action (VLA) utilisés en robotique manipulation : leur fragilité face aux variations de formulation des instructions textuelles. Le problème identifié, nommé "effondrement de modalité" (modality collapse), survient lorsque les signaux visuels, très denses, écrasent les signaux linguistiques, plus rares, forçant le modèle à mémoriser des tournures de phrases spécifiques plutôt qu'à comprendre l'intention sous-jacente. RSS propose deux mécanismes complémentaires : la Monte Carlo Syntactic Integration, qui génère un ensemble distribué de reformulations d'une même instruction via un LLM afin d'approximer le vrai postérieur sémantique, et le Residual Affordance Steering, un décodage à double flux qui isole explicitement la contribution causale du langage en soustrayant l'a priori visuel des affordances physiques. Les résultats publiés indiquent des performances state-of-the-art en robustesse sur plusieurs benchmarks de manipulation, y compris sous perturbations linguistiques adversariales. Le code est disponible en open source. Ce travail pointe un angle mort concret du pipeline VLA : un robot entraîné avec π0 (Physical Intelligence), OpenVLA ou GR00T N2 (NVIDIA) peut échouer à exécuter une tâche simplement parce que l'opérateur reformule l'ordre différemment, ce qui est rédhibitoire pour tout déploiement industriel réel. RSS apporte une réponse architecturale sans nécessiter de réentraînement complet du modèle de base, ce qui le rend potentiellement compatible avec les VLA existants. La démonstration sur benchmarks adversariaux est un signal positif, même si les benchmarks de manipulation académiques restent éloignés des conditions d'atelier réelles : cycles courts, éclairage variable, instructions opérateur non normalisées. Les VLA ont émergé comme paradigme dominant depuis les travaux de RT-2 (Google DeepMind, 2023), suivis par OpenVLA, π0 de Physical Intelligence et GR00T N2 de NVIDIA, tous confrontés au même sim-to-real gap linguistique. RSS s'inscrit dans une vague de travaux tentant de rendre ces modèles plus robustes sans sacrifier leur généralité. L'approche concurrente la plus proche est le data augmentation sémantique (paraphrase augmentation), moins élégante théoriquement mais déjà intégrée dans certains pipelines de fine-tuning. Les prochaines étapes logiques seraient une validation sur robot physique en environnement non contrôlé et une intégration dans un framework VLA open source comme OpenVLA, ce que les auteurs n'ont pas encore annoncé.

IA physiqueOpinion
1 source
MotionVLA : un modèle vision-langage-action pour les robots humanoïdes
4arXiv cs.RO 

MotionVLA : un modèle vision-langage-action pour les robots humanoïdes

Une équipe de l'AIGeeksGroup a publié le 18 juin 2026 sur arXiv (2606.15142) MotionVLA, un modèle de type Vision-Language-Action conçu pour générer du mouvement humanoïde réaliste à partir d'images de scène et d'instructions textuelles. Le coeur de la contribution repose sur DSFT (Dual-Stream Frequency Tokenizer), un tokeniseur qui décompose le signal de mouvement en deux flux distincts : un flux Base capturant la sémantique de pose basse fréquence, et un flux Phys encodant la dynamique physique haute fréquence. Cette séparation s'appuie sur une analyse en transformée en cosinus discrète (DCT) du corpus HumanML3D, qui révèle un déséquilibre concret : cinq coefficients DCT suffisent à couvrir 93 % de l'énergie des positions articulaires, mais seulement 37 % de l'énergie des vélocités. Les deux flux sont compressés indépendamment par troncature DCT et encodage BPE, puis réinjectés dans un transformeur autorégressif basé sur Qwen3.5 2B. Sur les benchmarks HumanML3D et MBench, MotionVLA réduit l'écart de diversité avec les données réelles de plus de 50 % et améliore la cohérence mouvement-condition de 3,8 %. Ce résultat pointe une limite structurelle des approches à codebook unique, qui dominent actuellement la génération de mouvement humanoïde : en forçant des signaux hétérogènes dans un espace de quantification commun, ces méthodes sous-représentent systématiquement les composantes dynamiques hautes fréquences au profit de la géométrie de pose. Pour les équipes travaillant sur le contrôle de robots humanoïdes ou la synthèse d'animation procédurale, cela signifie que la qualité du mouvement généré peut sembler plausible en posture statique mais manquer de naturel en transition. L'architecture duale de MotionVLA, malgré un backbone léger de 2 milliards de paramètres, obtient des gains mesurables sans augmenter significativement le coût de calcul. MotionVLA s'inscrit dans un mouvement de recherche plus large qui adapte les VLA, initialement développés pour le contrôle robotique visuomoteur, à la génération de comportement humanoïde. Le modèle s'appuie sur Qwen3.5, la famille de modèles open-weight d'Alibaba, et le code source est disponible sur GitHub (AIGeeksGroup/MotionVLA). À ce stade, il s'agit exclusivement d'un résultat de recherche académique évalué sur des benchmarks synthétiques standard, sans déploiement industriel ni partenariat hardware annoncé. Les acteurs comme Figure AI, 1X, Agility Robotics ou Fourier Intelligence, qui investissent dans la génération de mouvement pour leurs humanoïdes, suivent de près ce type de travaux, même si le chemin du benchmark de laboratoire vers un déploiement sim-to-real reste non démontré ici.

IA physiqueOpinion
1 source