Aller au contenu principal
IA physiquearXiv cs.RO 

Opt2VLA : modèle vision-langage-action sensible à la force pour la manipulation humanoïde à corps entier avec contacts

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un preprint arXiv publié le 22 septembre 2026 (2609.23968v1) présente Opt2VLA, un framework vision-language-action (VLA) pour la manipulation corps-entier de robots humanoïdes dans des tâches à contact riche. Le système introduit des commandes de force explicites à l'interface entre la politique VLA et les contrôleurs bas niveau : une seule politique multi-tâches prédit à la fois des objectifs de mouvement géométriques et des références de force de contact continues, suivies par des contrôleurs entraînés par apprentissage par renforcement. Les données d'entraînement sont générées par optimisation de trajectoire avec références de force explicites, garantissant des trajectoires dynamiquement réalisables. Le système a été testé sur trois tâches humanoïdes à contact riche, en simulation et sur matériel robotique réel.

L'enjeu dépasse la démonstration académique. La plupart des modèles VLA actuels pour humanoïdes, à l'image de Pi-0, GR00T N2 ou Helix, représentent les actions uniquement par des objectifs de mouvement géométriques, sans raisonnement explicite sur les forces d'interaction, une limite critique dans les tâches où des mouvements similaires exigent des régimes de force différents, ou où la vision devient peu fiable après contact. Les auteurs montrent que le conditionnement explicite par la force améliore la précision et la stabilité de la régulation, et que la supervision physique issue de l'optimisation de trajectoire renforce encore ce suivi. Pour les intégrateurs industriels, cela suggère qu'une politique VLA unique peut arbitrer entre précision géométrique et contrôle de force sans multiplier les contrôleurs ad hoc, un prérequis pour des tâches fines comme le vissage ou l'insertion de connecteurs.

Opt2VLA s'inscrit dans la vague de modèles VLA pour humanoïdes portée par des acteurs comme Physical Intelligence, NVIDIA ou Figure AI, jusqu'ici centrés sur la sémantique visuelle et le suivi de mouvement plutôt que sur la dynamique de contact. L'abstract ne précise ni l'affiliation des auteurs ni le modèle de robot utilisé pour les essais matériels, et les résultats restent ceux d'un preprint non encore relu par les pairs, validé sur trois tâches expérimentales. Les prochaines étapes attendues portent sur l'extension à davantage de tâches à contact riche et la validation de la génération de données par optimisation de trajectoire sur d'autres plateformes matérielles.

À lire aussi

CompVLA : un modèle vision-langage-action à conformité variable pour la manipulation en contact riche
1arXiv cs.RO 

CompVLA : un modèle vision-langage-action à conformité variable pour la manipulation en contact riche

CompVLA est un modèle Vision-Language-Action présente dans un preprint arXiv (2609.23614v1), consacre a la manipulation dite contact-rich, ces taches ou un robot doit réguler la force qu'il exerce et céder de manière contrôlée aux forces externes, pas seulement se déplacer. La ou les VLA classiques ne produisent que des commandes de position, CompVLA prédit conjointement, a partir d'une image RGB et d'une instruction en langage naturel, un mouvement et une matrice de raideur, via un module dédié, le Compliance Expert, qui génère des profils de raideur variables dans le temps et de déplacement virtuel, exécutés par contrôle d'impédance géométrique. Les auteurs revendiquent le meilleur taux de réussite moyen sur des taches variées avec contact, devant les VLA classiques et compliance-aware existants, sans toutefois publier de chiffres précis ni détailler les taches testées ou la plateforme robotique utilisée. Cette approche vise un angle mort connu des VLA généralistes, tels Pi-0, GR00T N2 ou Helix, qui réussissent bien en espace libre mais peinent des qu'il faut insérer un connecteur ou assembler des pièces avec du jeu mécanique. En intégrant la prédiction de raideur dans le modèle langage-vision plutôt qu'un contrôleur sépare code a la main, CompVLA esquisse une piste pour rapprocher les VLA des usages industriels réels, la ou le fosse entre démonstration et déploiement reste le plus large. Pour les intégrateurs qui évaluent ces modèles, le travail reste un résultat de recherche en preprint, sans benchmark standardise ni validation industrielle, ce qui appelle a la prudence avant d'y voir une preuve d'adoption a l'échelle. Le contrôle en impédance et les approches hybrides force-position existent depuis longtemps en robotique industrielle, mais leur intégration dans des politiques VLA apprises reste récente, aux cotes des travaux de Physical Intelligence, Nvidia ou Figure sur leurs propres modèles. Publie en preprint arXiv sans mention d'un laboratoire ou d'une entreprise précise, le document ne fixe aucun calendrier de suite ni de partenariat industriel. Les prochaines étapes attendues restent classiques pour ce type de travail : validation sur une flotte de robots plus large, comparaison a des benchmarks reconnus du secteur, puis éventuelle reprise par un acteur commercial du marche des VLA.

IA physiqueOpinion
1 source
SAVLA : des modèles vision-langage-action sensibles à la symétrie pour la manipulation robotique
2arXiv cs.RO 

SAVLA : des modèles vision-langage-action sensibles à la symétrie pour la manipulation robotique

Un article publié le 16 septembre 2026 sur arXiv (2609.16641) présente SAVLA (Symmetry-Aware Vision-Language-Action), un modèle de manipulation robotique conditionnée par le langage. Contrairement aux modèles vision-langage-action classiques, qui n'apprennent leur compétence spatiale qu'à partir des démonstrations et échouent hors de la plage de poses couverte par celles-ci, SAVLA gèle un backbone vision-langage pré-entraîné et y ajoute une tête d'action équivariante par flow-matching ainsi qu'un module de canonicalisation qui ramène les vues obliques dans un repère de référence tout en faisant tourner les conditions géométriques en conséquence. Testé sur le benchmark simulé LIBERO face au modèle GR00T N1.5 de NVIDIA, SAVLA améliore de 5,1 points le taux de réussite moyen sur les quatre suites du benchmark, et fait passer le taux de réussite sous rotation sur LIBERO-Goal de 41,5% à 90,4%. Le résultat s'attaque à une faiblesse connue des VLA : leur généralisation géométrique limitée, qui oblige aujourd'hui les intégrateurs à multiplier les démonstrations pour couvrir chaque orientation possible d'objet ou de caméra sur une ligne de production. En codant la symétrie directement dans l'architecture plutôt qu'en la laissant émerger des données, SAVLA vise une robustesse aux changements de pose avec moins d'exemples, un argument pertinent pour réduire le coût de collecte de données avant tout déploiement industriel de bras ou d'humanoïdes pilotés par VLA. Le gain reste toutefois mesuré en simulation sur un benchmark académique, pas sur un robot physique en usine, ce qui en fait une preuve de concept méthodologique plutôt qu'une solution prête à l'emploi. SAVLA s'inscrit dans la vague des modèles VLA devenus le paradigme dominant du contrôle robotique par langage naturel, aux côtés de familles comme GR00T de NVIDIA, Pi-0 de Physical Intelligence ou Helix de Figure. Le choix de GR00T N1.5 comme référence positionne directement SAVLA face à l'un des modèles de fondation les plus utilisés du secteur. La méthode puise dans des travaux antérieurs sur l'apprentissage équivariant, une approche distincte du tout-données qui domine l'entraînement actuel des VLA. L'article ne mentionne ni partenariat industriel ni test sur robot physique, la validation en conditions réelles restant l'étape suivante logique pour ce type de travail académique.

IA physiqueActu
1 source
FAWAM : modèles d'action du monde sensibles aux forces pour la manipulation en boucle fermée à contacts multiples
3arXiv cs.RO 

FAWAM : modèles d'action du monde sensibles aux forces pour la manipulation en boucle fermée à contacts multiples

Une équipe de chercheurs a publié sur arXiv (référence 2606.08555) FAWAM, un modèle d'action robotique intégrant les signaux de force à trois niveaux distincts du pipeline de manipulation : la perception, la prédiction et l'exécution en boucle fermée. Concrètement, le système encode des signaux force/couple sur six axes (6-DoF wrench) pour moduler la génération d'actions, prédit conjointement les actions futures et les efforts en bout d'effecteur afin de modéliser explicitement l'évolution du contact, puis utilise cette trajectoire de wrench prédite comme référence d'exécution pour corriger les actions en temps réel via un module de correction résiduelle. Sur plusieurs tâches de manipulation nécessitant des contacts riches -- vissage, insertion, assemblage par contrainte -- FAWAM affiche un taux de succès moyen supérieur de 36,25 % aux baselines purement visuelles et de 21,25 % aux baselines force-aware existantes. Il s'agit d'un preprint, sans déploiement industriel annoncé à ce stade. L'apport technique est notable pour les intégrateurs et les équipes R&D en manipulation apprise : la plupart des politiques modernes type Diffusion Policy, ACT ou des VLA (Vision-Language-Action models) traitent la force comme une modalité d'observation annexe, sans lui donner de rôle prédictif dans la dynamique future du contact. FAWAM repositionne le signal force comme variable de première classe dans l'architecture du modèle, ce qui permet une correction online des actions sans nécessiter de replanification complète. C'est précisément ce découplage entre prédiction de wrench et correction résiduelle qui explique le gain de performance : le robot anticipe l'effort attendu avant de l'observer, et ajuste en conséquence dès qu'un écart apparaît. Pour un COO ou un directeur technique envisageant des cellules d'assemblage automatisées, cela représente une réduction significative du gap simulation-réalité sur les tâches à contact fort. La manipulation en contact riche reste l'un des derniers verrous majeurs de la robotique industrielle polyvalente, là où les approches vision-seule échouent dès que les tolérances sont serrées ou les surfaces glissantes. Des travaux récents comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou les politiques de manipulation de Google DeepMind intègrent parfois la proprioception mais rarement le couple d'axe complet en boucle de prédiction. FAWAM s'inscrit dans un courant émergent de world action models orientés contact, aux côtés de travaux comme RoboDex ou des approches de manipulation tactile de Berkeley et Carnegie Mellon. La prochaine étape logique serait une validation sur robot humanoïde ou sur bras industriel en environnement semi-structuré, ce que le preprint ne couvre pas encore.

IA physiqueOpinion
1 source
ForeTac-VLA : un modèle vision-langage-action tactile basé sur la prévision pour la manipulation robotique en contact riche
4arXiv cs.RO 

ForeTac-VLA : un modèle vision-langage-action tactile basé sur la prévision pour la manipulation robotique en contact riche

Publié en septembre 2026 sur arXiv sous la référence 2609.20980, ForeTac-VLA est un modèle vision-langage-action (VLA) qui ajoute une couche tactile prédictive pour la manipulation robotique en environnement riche en contacts physiques. Le système encode les observations tactiles récentes en représentations temporelles, les fusionne avec les caractéristiques vision-langage par attention croisée bidirectionnelle, puis un module de prévision fondé sur un transformeur anticipe l'état tactile sur plusieurs pas de temps futurs avant d'injecter ces prédictions dans le backbone VLA qui génère l'action. Un curriculum passant progressivement des données tactiles réelles aux données prédites stabilise l'entraînement lorsque les premières prévisions sont peu fiables. Sur quatre tâches de manipulation réelles à fort contact physique, ForeTac-VLA atteint un taux de réussite moyen de 95%, avec un gain de 36,25 points de pourcentage sur un VLA simplement affiné et de plus de 22 points sur les meilleures méthodes tactiles-VLA existantes, tout en maintenant ses performances en faible luminosité et en environnement visuellement encombré. Ce travail cible une faiblesse connue des modèles VLA, très dépendants de la vision, alors que des états physiques critiques comme le glissement d'un objet ou l'alignement lors d'une insertion ne sont pas observables visuellement. Les approches tactiles existantes se contentaient de réagir au contact déjà survenu; ForeTac-VLA propose de l'anticiper, ce qui change la nature du signal exploité par le modèle d'action. Pour les intégrateurs industriels, l'intérêt pratique tient à la robustesse démontrée en conditions dégradées, faible éclairage ou encombrement visuel, des situations fréquentes en usine ou en entrepôt où la vision seule échoue souvent. Si ces écarts se confirment au-delà des quatre tâches testées, cela conforterait l'idée qu'une fusion tactile prédictive, plutôt que purement réactive, est une piste sérieuse pour fiabiliser la manipulation en contact riche, un point faible récurrent des démonstrations VLA actuelles. ForeTac-VLA s'inscrit dans la lignée des modèles VLA génériques qui unifient perception, langage et contrôle moteur, et dans la sous-famille plus récente des VLA tactiles qui ajoutent un capteur de contact au pipeline vision-langage. Il se positionne explicitement contre ces baselines tactiles-VLA de l'état de l'art, qu'il dépasse de plus de 22 points, ainsi que contre un VLA classique simplement affiné sur les mêmes tâches. La publication reste un preprint arXiv, sans nom d'entreprise ni calendrier de déploiement industriel associé: il s'agit d'un résultat de recherche évalué sur quatre tâches choisies par les auteurs et illustré par des vidéos sélectionnées sur le site du projet, pas d'un produit commercialisé. Les suites attendues sont l'élargissement à davantage de tâches et de plateformes robotiques, ainsi qu'une évaluation indépendante confirmant que l'écart de performance tient face à des scénarios plus variés que le banc d'essai initial.

IA physiqueOpinion
1 source