Aller au contenu principal
Any3D-VLA : améliorer la robustesse des modèles VLA grâce à des nuages de points diversifiés
RecherchearXiv cs.RO 

Any3D-VLA : améliorer la robustesse des modèles VLA grâce à des nuages de points diversifiés

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Les modèles VLA (Vision-Language-Action) qui pilotent aujourd'hui les robots manipulateurs reposent quasi-exclusivement sur des images 2D comme entrée visuelle. Une équipe de chercheurs publie sur arXiv (arXiv:2506.00807v2) Any3D-VLA, une architecture d'entraînement qui intègre explicitement des nuages de points 3D pour améliorer la robustesse spatiale de ces modèles. L'approche fusionne trois sources de nuages de points hétérogènes, données de simulation, capteurs de profondeur réels (LiDAR, RGB-D), et estimation par modèle monoculaire, avec les représentations 2D existantes, dans un pipeline d'entraînement unifié. Les expériences couvrent à la fois des environnements simulés et des déploiements réels, et montrent des gains de performance mesurables sur des tâches de manipulation.

L'intérêt technique est double. D'abord, le papier démontre empiriquement que "lever" l'entrée visuelle en nuage de points produit des représentations complémentaires aux features 2D, plutôt que redondantes, ce qui valide une hypothèse souvent discutée dans la communauté VLA. Ensuite, Any3D-VLA s'attaque directement aux deux verrous pratiques qui ont jusqu'ici freiné l'adoption du 3D dans ce domaine : la rareté des données 3D annotées et le domain gap lié aux différences de calibration entre environnements et aux biais d'échelle de profondeur. En traitant ces deux obstacles dans un seul framework, le travail suggère une voie vers des VLA plus robustes au sim-to-real transfer, un problème central pour le déploiement en conditions industrielles réelles.

Les VLA sont au cœur d'une course intense depuis la publication de RT-2 (Google DeepMind, 2023) et l'essor de modèles comme Pi-0 (Physical Intelligence), OpenVLA, ou RoboVLMs. La plupart restent limités par leur dépendance aux caméras RGB standard, ce qui crée des angles morts en cas d'occlusion ou de scènes encombrées. Any3D-VLA ne propose pas encore un produit déployé : il s'agit d'une contribution de recherche avec code et page projet publics. La prochaine étape logique serait une intégration dans des pipelines de fine-tuning utilisés par des acteurs comme Physical Intelligence ou les équipes robotique de Figure AI, qui cherchent précisément à réduire le nombre de démonstrations réelles nécessaires grâce à un meilleur transfert depuis la simulation.

À lire aussi

Veo-Act : améliorer les politiques VLA grâce aux modèles vidéo de pointe
1arXiv cs.RO 

Veo-Act : améliorer les politiques VLA grâce aux modèles vidéo de pointe

Des chercheurs présentent Veo-Act, un système hiérarchique associant le modèle de génération vidéo Veo-3.1 de Google DeepMind à une politique vision-language-action (VLA) pour la manipulation robotique, décrit dans un article déposé sur arXiv (identifiant 2604.04502, version révisée). Veo-3.1 y joue le rôle de planificateur de haut niveau : il génère des séquences vidéo montrant le mouvement attendu de la main et des objets pour réaliser une instruction. Un modèle de dynamique inverse à têtes multiples convertit ces paires d'images générées en commandes motrices, tandis qu'une «porte d'interaction» décide du moment où basculer vers la politique VLA pour l'exécution réactive et précise au niveau bas. Les auteurs ont testé le système en simulation et sur un robot réel, sans préciser charge utile, degrés de liberté ni temps de cycle, ce qui relève de la recherche méthodologique plutôt que de l'annonce produit. L'enjeu visé est bien connu du secteur : l'adaptation orientée action des politiques VLA à partir de modèles vision-langage pré-entraînés dégrade souvent leur généralisation sémantique, fragilisant leur robustesse face à des scènes ambiguës ou hors distribution. Les modèles vidéo généralisent mieux sur des scènes complexes et encodent des a priori sur les mouvements de la main, mais manquent de précision et de réactivité pour une manipulation dextre bas niveau. Veo-Act cherche à combiner ces deux forces : selon les auteurs, l'approche améliore le suivi d'instructions et le taux de réussite par rapport à une politique VLA seule, notamment dans des situations nouvelles et sémantiquement complexes, un résultat qui alimente le débat sur le rôle des modèles vidéo comme planificateurs visuels pour la robotique généraliste, aux côtés d'approches comme pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure). Ce travail s'inscrit dans la montée en puissance des politiques VLA comme paradigme dominant de l'apprentissage robotique généraliste, et dans celle des modèles de génération vidéo dont les progrès en cohérence temporelle poussent plusieurs équipes à les détourner en planificateurs pour la robotique. Aucune entreprise, aucun laboratoire ni acteur français ou européen n'est cité, et le travail reste une contribution académique publiée en version révisée sur arXiv, sans calendrier de déploiement industriel annoncé.

RechercheActu
1 source
StressDream : piloter des modèles du monde vidéo pour évaluer et améliorer la robustesse des politiques
2arXiv cs.RO 

StressDream : piloter des modèles du monde vidéo pour évaluer et améliorer la robustesse des politiques

StressDream est une méthode proposée par des chercheurs dans un preprint arXiv (2606.00267, juin 2026) pour orienter les modèles du monde vidéo (video world models, WMs) vers des scénarios rares mais plausibles lors de l'évaluation et de l'amélioration de politiques robotiques. Le principe : au lieu de tirer des millions d'échantillons depuis un WM diffusion pour espérer tomber sur un cas d'échec critique, StressDream optimise directement le bruit initial du processus de diffusion à l'inférence, guidé par une consigne textuelle (par exemple "l'agent rate la tâche"). Deux objectifs complémentaires structurent l'optimisation : un objectif sémantique, où un modèle vision-langage (VLM) fournit des gradients en raisonnant sur la vidéo générée, et un objectif de plausibilité qui empêche le bruit optimisé de dériver hors distribution (OOD), évitant ainsi des imaginations irréalistes. La méthode est validée sur des benchmarks en conduite autonome et en manipulation robotique. L'enjeu est de taille pour les équipes de validation pré-déploiement. L'évaluation nominale des politiques, c'est-à-dire simuler ce qui se passe en moyenne, rate systématiquement les événements à fort impact mais faible probabilité : collision, lâcher d'objet, blocage de bras. Or ces cas sont précisément ceux qui bloquent la mise en production. StressDream propose de les cibler chirurgicalement sans explosion combinatoire du budget de simulation. C'est une forme de stress-test automatisé, piloté par langage naturel, applicable à n'importe quel WM diffusion existant, ce qui en fait un outil d'intégration potentiellement direct dans les pipelines d'évaluation de politique comme ceux utilisés par des laboratoires développant des VLAs (Vision-Language-Action models). Les video world models ont connu une montée en puissance rapide depuis 2023, notamment avec des travaux comme DIAMOND (Micheli et al.), UniSim ou DreamerV3, portés en partie par leur utilisation dans la robotique humanoïde et la conduite autonome. La difficulté de trouver des échecs plausibles sans déploiement réel est un frein reconnu à la certification de politiques autonomes. StressDream s'inscrit dans une dynamique plus large visant à combler le gap entre simulation et réel en enrichissant la diversité des scénarios simulés, sans pour autant halluciner des situations impossibles. Les auteurs publient des résultats vidéo sur junwon.me/StressDream, mais aucune intégration industrielle ni partenariat de déploiement n'est annoncé à ce stade.

RechercheOpinion
1 source
Frottement clé pour améliorer les modèles du monde des robots
3Robotics Business Review 

Frottement clé pour améliorer les modèles du monde des robots

Un nouveau papier technique propose une architecture appelée VμA pour corriger un angle mort des modèles du monde en robotique : l'absence du coefficient de frottement statique (μ) parmi les signaux de conditionnement. Aujourd'hui, la quasi-totalité des systèmes conditionnent leurs prédictions sur deux sources seulement, les images de caméras et la position des effecteurs mesurée par les encodeurs articulaires, ce qui suffit pour des tâches en espace libre mais devient insuffisant dès qu'un robot entre en contact avec un objet. Dans de nombreuses implémentations, le contact n'est même pas mesuré directement : il est déduit du courant moteur, un signal proxy éloigné de la physique réelle qui se joue au bout du doigt du gripper. Certains systèmes ajoutent des capteurs tactiles, comme ceux commercialisés par l'entreprise australienne Contactile pour équiper mains et pinces robotiques, avec des gains mesurables sur la préhension adaptative en temps réel et la correction de glissement. Mais ces capteurs restent limités à des cartes de pression, des images de déformation ou, au mieux, une distribution de force sur trois axes : ils disent qu'un contact a lieu et avec quelle intensité, pas si ce contact va tenir. C'est précisément cette lacune que VμA cherche à combler en injectant μ comme entrée de premier ordre. Le coefficient de frottement statique est la grandeur physique qui détermine si un objet saisi reste saisi, en fonction du couple de matériaux, de l'état de surface, de la température ou de la contamination. Il ne peut être ni vu par une caméra, ni déduit du courant moteur, ni reconstruit à partir d'une carte de pression. Pour l'industrie de la manipulation robotique, l'enjeu dépasse la subtilité académique : sans μ, un modèle du monde n'apprend que des corrélations statistiques entre motifs de contact et résultats observés dans ses données d'entraînement, ce qui explique pourquoi ces systèmes échouent souvent à généraliser sur des surfaces ou des objets inédits. Un modèle conditionné sur la friction change de nature, puisqu'il manipule directement la cause physique du glissement plutôt qu'un proxy appris, ce qui intéresse au premier chef les intégrateurs travaillant sur la manipulation en environnement non structuré, de la logistique à l'assemblage fin. Cette proposition s'inscrit dans la course plus large aux modèles du monde généralistes, présentés par une partie du secteur comme la prochaine étape après les architectures vision-langage-action de type Pi-0 ou GR00T N2, censées permettre à un robot de raisonner sur des situations jamais rencontrées plutôt que de mémoriser des tâches. L'argument du papier est en réalité une critique de cette trajectoire : tant que le conditionnement tactile reste incomplet, la promesse de généralisation reste largement théorique pour toute manipulation en contact riche. Les suites concrètes, à savoir une intégration de VμA sur du matériel comme les capteurs Contactile ou des essais chez des intégrateurs industriels, ne sont pas précisées dans le document source.

RecherchePaper
1 source
StereoPolicy : améliorer les politiques de manipulation robotique grâce à la perception stéréoscopique
4arXiv cs.RO 

StereoPolicy : améliorer les politiques de manipulation robotique grâce à la perception stéréoscopique

Une équipe de chercheurs a présenté StereoPolicy, un cadre d'apprentissage de politiques visuomotrices déposé sur arXiv (2605.09989) qui exploite des paires d'images stéréoscopiques synchronisées pour améliorer la précision des robots manipulateurs. Contrairement aux approches dominantes basées sur la vision monoculaire, StereoPolicy traite chaque image indépendamment via des encodeurs visuels 2D pré-entraînés, puis fusionne les représentations au sein d'un module baptisé Stereo Transformer. Cette architecture extrait implicitement des indices de disparité et de correspondance spatiale, sans nécessiter de reconstruction 3D explicite ni de calibration de caméra. Évalué sur trois benchmarks de simulation, RoboMimic, RoboCasa et OmniGibson, le système surpasse systématiquement les baselines RGB, RGB-D, nuage de points et multi-vues. Les auteurs ont également validé l'approche sur des robots réels, dans des configurations de manipulation tabulaire et de manipulation bimane mobile. L'intérêt principal de StereoPolicy réside dans sa modularité: le framework s'intègre directement avec des politiques à base de diffusion et des politiques VLA (vision-language-action) pré-entraînées, ce qui en fait un composant additionnel plutôt qu'une refonte architecturale. Pour les intégrateurs et les équipes robotique, cela signifie que des systèmes existants basés sur des modèles comme Pi-0 ou GR00T pourraient bénéficier de la perception stéréo sans repartir de zéro. La vision monoculaire, omniprésente dans les déploiements actuels, souffre d'une absence d'indices de profondeur fiables dans les scènes encombrées ou géométriquement complexes, un problème que la stéréo adresse naturellement à faible surcoût matériel. Ce résultat renforce l'hypothèse que les représentations 2D pré-entraînées, aussi puissantes soient-elles, restent limitées sans ancrage géométrique explicite. StereoPolicy s'inscrit dans la dynamique actuelle de l'imitation learning robotique, portée par des travaux comme ACT, Diffusion Policy et les VLA multimodaux. La plupart des systèmes en production s'appuient encore sur des caméras monoculaires ou des capteurs RGB-D de type RealSense ou ZED, qui ajoutent complexité et coût. Les caméras stéréo passives, technologie mature présente depuis des décennies en vision par ordinateur, avaient été quelque peu éclipsées par la montée en puissance des encodeurs 2D profonds. Ce papier, une préprint arXiv, pas encore un produit déployé, rouvre la question de leur rôle dans les pipelines modernes d'apprentissage par imitation. Les prochaines étapes naturelles seront d'évaluer StereoPolicy dans des environnements industriels réels et de tester sa robustesse aux variations d'éclairage et de texture, deux limites classiques de la vision stéréo passive.

RechercheOpinion
1 source