Aller au contenu principal
CompVLA : un modèle vision-langage-action à conformité variable pour la manipulation en contact riche
IA physiquearXiv cs.RO 

CompVLA : un modèle vision-langage-action à conformité variable pour la manipulation en contact riche

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

CompVLA est un modèle Vision-Language-Action présente dans un preprint arXiv (2609.23614v1), consacre a la manipulation dite contact-rich, ces taches ou un robot doit réguler la force qu'il exerce et céder de manière contrôlée aux forces externes, pas seulement se déplacer. La ou les VLA classiques ne produisent que des commandes de position, CompVLA prédit conjointement, a partir d'une image RGB et d'une instruction en langage naturel, un mouvement et une matrice de raideur, via un module dédié, le Compliance Expert, qui génère des profils de raideur variables dans le temps et de déplacement virtuel, exécutés par contrôle d'impédance géométrique. Les auteurs revendiquent le meilleur taux de réussite moyen sur des taches variées avec contact, devant les VLA classiques et compliance-aware existants, sans toutefois publier de chiffres précis ni détailler les taches testées ou la plateforme robotique utilisée.

Cette approche vise un angle mort connu des VLA généralistes, tels Pi-0, GR00T N2 ou Helix, qui réussissent bien en espace libre mais peinent des qu'il faut insérer un connecteur ou assembler des pièces avec du jeu mécanique. En intégrant la prédiction de raideur dans le modèle langage-vision plutôt qu'un contrôleur sépare code a la main, CompVLA esquisse une piste pour rapprocher les VLA des usages industriels réels, la ou le fosse entre démonstration et déploiement reste le plus large. Pour les intégrateurs qui évaluent ces modèles, le travail reste un résultat de recherche en preprint, sans benchmark standardise ni validation industrielle, ce qui appelle a la prudence avant d'y voir une preuve d'adoption a l'échelle.

Le contrôle en impédance et les approches hybrides force-position existent depuis longtemps en robotique industrielle, mais leur intégration dans des politiques VLA apprises reste récente, aux cotes des travaux de Physical Intelligence, Nvidia ou Figure sur leurs propres modèles. Publie en preprint arXiv sans mention d'un laboratoire ou d'une entreprise précise, le document ne fixe aucun calendrier de suite ni de partenariat industriel. Les prochaines étapes attendues restent classiques pour ce type de travail : validation sur une flotte de robots plus large, comparaison a des benchmarks reconnus du secteur, puis éventuelle reprise par un acteur commercial du marche des VLA.

À lire aussi

ForeTac-VLA : un modèle vision-langage-action tactile basé sur la prévision pour la manipulation robotique en contact riche
1arXiv cs.RO 

ForeTac-VLA : un modèle vision-langage-action tactile basé sur la prévision pour la manipulation robotique en contact riche

Publié en septembre 2026 sur arXiv sous la référence 2609.20980, ForeTac-VLA est un modèle vision-langage-action (VLA) qui ajoute une couche tactile prédictive pour la manipulation robotique en environnement riche en contacts physiques. Le système encode les observations tactiles récentes en représentations temporelles, les fusionne avec les caractéristiques vision-langage par attention croisée bidirectionnelle, puis un module de prévision fondé sur un transformeur anticipe l'état tactile sur plusieurs pas de temps futurs avant d'injecter ces prédictions dans le backbone VLA qui génère l'action. Un curriculum passant progressivement des données tactiles réelles aux données prédites stabilise l'entraînement lorsque les premières prévisions sont peu fiables. Sur quatre tâches de manipulation réelles à fort contact physique, ForeTac-VLA atteint un taux de réussite moyen de 95%, avec un gain de 36,25 points de pourcentage sur un VLA simplement affiné et de plus de 22 points sur les meilleures méthodes tactiles-VLA existantes, tout en maintenant ses performances en faible luminosité et en environnement visuellement encombré. Ce travail cible une faiblesse connue des modèles VLA, très dépendants de la vision, alors que des états physiques critiques comme le glissement d'un objet ou l'alignement lors d'une insertion ne sont pas observables visuellement. Les approches tactiles existantes se contentaient de réagir au contact déjà survenu; ForeTac-VLA propose de l'anticiper, ce qui change la nature du signal exploité par le modèle d'action. Pour les intégrateurs industriels, l'intérêt pratique tient à la robustesse démontrée en conditions dégradées, faible éclairage ou encombrement visuel, des situations fréquentes en usine ou en entrepôt où la vision seule échoue souvent. Si ces écarts se confirment au-delà des quatre tâches testées, cela conforterait l'idée qu'une fusion tactile prédictive, plutôt que purement réactive, est une piste sérieuse pour fiabiliser la manipulation en contact riche, un point faible récurrent des démonstrations VLA actuelles. ForeTac-VLA s'inscrit dans la lignée des modèles VLA génériques qui unifient perception, langage et contrôle moteur, et dans la sous-famille plus récente des VLA tactiles qui ajoutent un capteur de contact au pipeline vision-langage. Il se positionne explicitement contre ces baselines tactiles-VLA de l'état de l'art, qu'il dépasse de plus de 22 points, ainsi que contre un VLA classique simplement affiné sur les mêmes tâches. La publication reste un preprint arXiv, sans nom d'entreprise ni calendrier de déploiement industriel associé: il s'agit d'un résultat de recherche évalué sur quatre tâches choisies par les auteurs et illustré par des vidéos sélectionnées sur le site du projet, pas d'un produit commercialisé. Les suites attendues sont l'élargissement à davantage de tâches et de plateformes robotiques, ainsi qu'une évaluation indépendante confirmant que l'écart de performance tient face à des scénarios plus variés que le banc d'essai initial.

IA physiqueOpinion
1 source
HapticVLA : manipulation riche en contacts via un modèle vision-langage-action sans détection tactile à l'inférence
2arXiv cs.RO 

HapticVLA : manipulation riche en contacts via un modèle vision-langage-action sans détection tactile à l'inférence

HapticVLA, décrit dans un article arXiv (2603.15257v2, republié) sans affiliation académique précisée, propose une architecture vision-langage-action capable de manipulation en contact riche sans capteur tactile embarqué au moment de l'inférence. La méthode se déroule en deux étapes couplées. D'abord, un module baptisé SA-RWFM (Safety-Aware Reward-Weighted Flow Matching) entraîne un expert d'action par flow matching à partir de récompenses tactiles précalculées, qui pénalisent une force de préhension excessive et des trajectoires de saisie sous-optimales. Ensuite, la Distillation Tactile (TD) transfère cette capacité vers un VLA classique : un token tactile compact, issu du modèle SA-RWFM, sert de cible d'apprentissage à un VLA étudiant qui doit le prédire uniquement à partir de la vision et de l'état du robot. Résultat annoncé sur des expériences réelles : un taux de réussite moyen de 86,7 %, supérieur à celui de VLA de référence, y compris des versions disposant d'un vrai retour tactile pendant l'inférence. L'intérêt pratique tient au coût et à la reproductibilité. Les capteurs tactiles dédiés renchérissent le matériel et compliquent le transfert d'un comportement appris d'une plateforme robotique à une autre. Si l'approche tient sur d'autres tâches et d'autres bras, elle affaiblirait une hypothèse répandue dans le secteur, celle qu'un retour haptique direct est indispensable pour un contrôle fin de la force de préhension sur des objets fragiles ou déformables. Pour les intégrateurs industriels, cela ouvrirait la voie à des lignes de préhension contact-riche moins instrumentées, donc moins chères à déployer et à maintenir. Il s'agit toutefois d'un résultat de recherche publié sur arXiv, pas d'un produit commercialisé ni d'un déploiement industriel annoncé. Le papier s'inscrit dans la vague actuelle des modèles VLA généralistes pour la manipulation, aux côtés de GR00T N2 de NVIDIA, Pi-0 de Physical Intelligence ou Helix de Figure, qui cherchent tous à réduire la dépendance à des capteurs spécialisés tout en préservant une manipulation fine. Aucune date de disponibilité ni partenariat industriel n'est mentionné dans l'abstract, la validation reste donc circonscrite au cadre expérimental décrit.

IA physiqueActu
1 source
DeMaVLA : un modèle fondation vision-langage-action (VLA) pour la manipulation de matériaux déformables
3arXiv cs.RO 

DeMaVLA : un modèle fondation vision-langage-action (VLA) pour la manipulation de matériaux déformables

Des chercheurs ont publié DeMaVLA, un modèle fondation de type Vision-Langage-Action (VLA) conçu pour la manipulation d'objets déformables, en particulier le pliage de vêtements. Annoncé en preprint arXiv (2605.31286, mai 2026), DeMaVLA couple un backbone VLM à un module appelé "action expert" qui génère des trajectoires continues par flow matching. Pour réduire les coûts d'entraînement et d'inférence, cet action expert est construit en élaguant une couche transformer sur deux du backbone, tout en préservant l'alignement entre les deux modules. Le modèle est d'abord pré-entraîné sur environ 5 000 heures de démonstrations bimanuals en conditions réelles, puis affiné via un pipeline DAgger (Data Aggregation) avec supervision humaine : des trajectoires correctives sont collectées à partir des échecs du robot sur plusieurs tâches de pliage, puis réinjectées en entraînement. Les résultats sont compétitifs sur le benchmark RoboTwin et solides sur un benchmark maison de pliage domestique. La plupart des systèmes VLA actuels entraînent des politiques séparées par catégorie d'objet (un réseau pour les t-shirts, un autre pour les pantalons), ce qui limite la généralisation et alourdit la maintenance. DeMaVLA propose une politique unifiée capable de traiter des vêtements de géométries, matières et états initiaux variés sans réentraînement par catégorie, ce qui est directement pertinent pour les intégrateurs en robotique domestique et logistique. Le recours au DAgger avec boucle humaine est aussi un signal industriel : les corrections issues des échecs du robot, structurées et réinjectées, améliorent concrètement la robustesse au-delà des seules démonstrations expertes. Cela valide l'hypothèse que les données correctives à grande échelle sont un levier clé pour réduire le sim-to-real gap sur des tâches à haute variabilité. La manipulation d'objets déformables reste l'un des problèmes ouverts les plus difficiles en robotique physique : contrairement aux objets rigides, un vêtement n'a pas d'état canonique stable, ce qui complique radicalement la planification et la perception. Plusieurs équipes travaillent sur ce terrain : Physical Intelligence avec Pi-0 (manipulation généraliste bimanuels), NVIDIA avec GR00T N2, et divers laboratoires académiques (Columbia, CMU) sur la manipulation textile. DeMaVLA se positionne sur le créneau des fondations multi-tâches déformables, en combinant pré-entraînement à grande échelle et fine-tuning correctif. Ce travail reste un preprint non encore évalué par les pairs, et les benchmarks maisons appellent à une validation indépendante. Les suites naturelles sont l'extension à d'autres objets déformables (câbles, sacs souples) et l'évaluation sur des plateformes robotiques commerciales en environnement non contrôlé.

IA physiqueOpinion
1 source
Facet-0 : un modèle fondation robotique pour la manipulation précise en contact riche
4arXiv cs.RO 

Facet-0 : un modèle fondation robotique pour la manipulation précise en contact riche

Un preprint publié sur arXiv (2609.01596) présente Facet-0, un modèle de fondation robotique pour l'assemblage de précision à tolérance sous-millimétrique, capable de prédire et d'évaluer les conséquences de contact de ses actions. Par flow matching, il génère chaque segment de mouvement avec le profil de force au poignet attendu, aligné sur l'historique des forces, la sémantique vision-langage et l'état cinématique, puis affine sa politique grâce à un critique distributionnel entraîné sur les déploiements réels et des récompenses ciblant les interactions de contact décisives. Entraîné sur ManuFacet-1K, un corpus de 1 000 heures synchronisées avec des données de force sur trois embodiments et plusieurs cellules de fabrication, le système atteint 82% de réussite moyenne sur cinq tâches d'assemblage informatique sous-millimétrique, contre 15% pour la meilleure référence, avec 0,5 mm de précision de placement et 50 ms de latence de commande. Ce résultat cible un angle mort des modèles vision-langage-action actuels, à l'aise pour saisir et déplacer des objets mais peu fiables dès qu'une tâche exige un contact fin, comme l'insertion de connecteurs ou le vissage. En traitant le retour de force comme signal d'apprentissage plutôt que garde-fou de sécurité, Facet-0 s'attaque à l'écart entre démonstrations impressionnantes et fiabilité réelle en ligne d'assemblage électronique, un enjeu concret pour les intégrateurs qui évaluent des bras génériques au-delà du tri ou de la manutention. Si l'écart revendiqué entre 82% et 15% se confirme dans des évaluations indépendantes, la modélisation explicite du contact pourrait devenir un prérequis pour les modèles de fondation visant l'industrie manufacturière exigeante. Facet-0 s'inscrit dans la vague des modèles de fondation robotique généralistes lancée par des systèmes comme Pi-0, GR00T N2 ou Helix, qui unifient perception, langage et contrôle moteur mais brillent surtout sur des tâches de manipulation grossière. En couplant une tête de prédiction de force à un critique dédié aux conséquences du contact, ses auteurs cherchent à combler ce manque sans abandonner l'architecture VLA générale. Le travail reste à ce stade une publication de recherche, sans annonce de déploiement industriel ni de mise à disposition du code ou du jeu de données ManuFacet-1K, les prochaines étapes attendues étant la revue par les pairs et des comparaisons indépendantes.

IA physiqueActu
1 source