Aller au contenu principal
RecherchearXiv cs.RO 

TacZero : insertion de cheville sans entraînement grâce à un modèle vision-langage généraliste et un retour tactile

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent TacZero, un cadre qui confie à un modèle vision-langage (VLM) généraliste pré-entraîné, sans aucun entraînement tactile ni manipulation supplémentaire, le pilotage d'une tâche d'insertion de cheville cylindrique (peg-in-hole). Le VLM reçoit les images de caméra, l'état du robot et les réponses tactiles à trois axes, présentées soit sous forme de valeurs numériques, soit sous forme de vecteurs superposés aux images. À partir de ces observations et de l'historique des interactions, il génère des commandes précisant les positions cibles de l'effecteur et l'ouverture ou la fermeture de la pince, qu'un contrôleur bas niveau exécute. Aucune règle spécifique à la tâche n'est codée pour interpréter le contact ou choisir les actions. Lors d'essais réels, TacZero a réussi 15 insertions sur 20 avec un retour tactile numérique, contre 10 sur 20 sans toucher. Le travail a été publié sur arXiv (2610.07621, première version).

L'intérêt tient à l'approche plus qu'au score. Les méthodes antérieures reposent soit sur des modèles d'estimation de contact et des lois de commande tactile conçus à la main, soit sur des modèles appris à partir de données tactiles pour estimer le mouvement des objets, prédire l'effet des actions et sélectionner ces dernières. TacZero suggère qu'un VLM généraliste peut raisonner sur le contact sans cette infrastructure, ce qui, si cela se confirme, réduirait fortement le coût de mise en place de nouvelles tâches riches en contact. Il faut toutefois relativiser. L'échantillon est minuscule (20 essais par condition), la tâche est simple et la différence de cinq succès n'a pas de robustesse statistique démontrée. Les auteurs ne donnent ni temps de cycle ni comparaison avec des politiques apprises, et eux-mêmes parlent d'un « point de départ » qui met en évidence des difficultés. Le résultat n'indique donc pas que la manipulation tactile est résolue par les VLM, seulement que le toucher apporte un gain mesurable dans ce cadre.

Ce travail s'inscrit dans la montée des modèles vision-langage-action (VLA) comme Pi-0, Helix ou GR00T, qui apprennent la manipulation à partir de grandes quantités de démonstrations, mais intègrent encore peu et mal le tactile. TacZero prend le chemin inverse : un modèle généraliste utilisé tel quel, sans réentraînement. L'insertion de cheville reste un banc d'essai classique de l'assemblage industriel, où les approches actuelles dépendent de contrôle en force réglé à la main ou d'apprentissage par renforcement. Les prochaines étapes naturelles seraient des géométries plus variées, des tolérances plus serrées, davantage d'essais et une mesure de la latence d'un VLM dans la boucle de commande, point critique pour tout usage en atelier.

À lire aussi

Entraînement au moment de l'inférence pour les modèles vision-langage-action à prévision visuelle (VLA)
1arXiv cs.RO 

Entraînement au moment de l'inférence pour les modèles vision-langage-action à prévision visuelle (VLA)

Des chercheurs proposent T³VF (Test-Time Training Visual Foresight VLA), une méthode d'adaptation à l'inférence publiée sur arXiv en mai 2025 (réf. 2605.08215). Les architectures Visual Foresight VLA, qui figurent parmi les plus performantes pour le contrôle de robots manipulateurs, fonctionnent en deux temps : elles prédisent d'abord une image future représentant l'état visuel attendu après l'action, puis génèrent la commande motrice à partir de cette prédiction. Cette dépendance en cascade crée une vulnérabilité double aux situations hors-distribution (OOD) : une prédiction visuelle dégradée corrompt directement la décision motrice en aval. T³VF exploite l'écart entre l'image future prédite et l'observation réellement reçue comme signal de supervision naturel, permettant au modèle de s'ajuster en continu pendant l'exécution, sans modification architecturale ni modules auxiliaires. Un mécanisme de filtrage adaptatif sélectionne les mises à jour pertinentes pour éviter la dérive par accumulation d'erreurs indiscriminée. Pour les équipes de déploiement, l'enjeu est direct : les VLA sont benchmarkés en laboratoire mais confrontés en production à des variations de scène (éclairage, textures, disposition des objets) rarement couvertes par les données d'entraînement. T³VF propose une adaptation sans annotation humaine ni nouvelle session d'entraînement, le robot se corrigeant à partir de ses propres observations, avec un surcoût d'inférence qualifié de modeste par les auteurs, une affirmation à vérifier selon les environnements cibles. Si les résultats se confirment à plus grande échelle, la méthode pourrait réduire les cycles de re-fine-tuning lors du passage en production, un poste de coût opérationnel significatif pour les intégrateurs industriels. Les VLA s'imposent depuis 2023 comme architecture dominante en manipulation robotique, portés par des modèles comme RT-2 (Google DeepMind), OpenVLA ou Pi-0 de Physical Intelligence. Les variantes Visual Foresight, qui ajoutent une prédiction d'état futur avant l'action, ont montré des gains sur les tâches de précision, mais leur fragilité face aux shifts de distribution restait peu adressée dans la littérature. Ce travail s'inscrit dans un courant croissant de Test-Time Training (TTT) appliqué à la robotique, distinct du fine-tuning classique en ce qu'il n'exige aucune supervision externe. Aucun partenariat industriel ni timeline de transfert technologique n'est mentionné : ce pré-print académique ne décrit pas de produit ou de déploiement commercialisé associé.

RechercheOpinion
1 source
SimpleTouch : les modèles vision-langage-action (VLA) maîtrisent-ils la manipulation riche en contacts sans préentraînement tactile de la politique ?
2arXiv cs.RO 

SimpleTouch : les modèles vision-langage-action (VLA) maîtrisent-ils la manipulation riche en contacts sans préentraînement tactile de la politique ?

Des chercheurs publient SimpleTouch, une extension du modèle vision-langage-action (VLA) π0.5 qui lui ajoute un « expert tactile ». Cet expert exploite tous les tokens d'un encodeur tactile préentraîné et gelé. Il apprend à partir de la supervision des actions et de la prédiction à plusieurs horizons de représentations latentes tactiles futures. L'entraînement tient en une seule étape et n'utilise que les démonstrations de la tâche, sans préentraînement tactile de la politique ni alignement visuotactile séparé. Avec 50 démonstrations par tâche, SimpleTouch obtient le meilleur taux de succès parmi les méthodes évaluées sur les six tâches du benchmark UniVTAC, avec une moyenne de 77,5 %. FTP-π0.5 atteint 45,2 % et FTP-1 66,7 %, soit des écarts de 32,3 et 10,8 points de pourcentage. Sur quatre tâches réelles, la moyenne est de 71,3 %, soit 8,8 points au-dessus de FTP-1. Le papier, disponible sur arXiv avec une page projet, ne précise pas dans cet extrait le capteur tactile utilisé, le robot ni le nombre d'essais par tâche. L'enjeu est la chaîne d'entraînement de la manipulation riche en contacts. Beaucoup d'équipes partent du principe que greffer le toucher sur un VLA préentraîné uniquement sur la vision et le langage, au moment du réglage fin, creuse un écart intermodal et donne peu de gains, voire dégrade les résultats. Elles ajoutent donc des corpus tactiles à grande échelle ou une étape d'alignement dédiée, ce qui alourdit la collecte de données et le pipeline. SimpleTouch suggère que, si l'on dispose déjà d'un VLA et d'un encodeur tactile solides, ces étapes ne sont pas indispensables pour ces tâches. Pour un intégrateur, cela abaisse le coût d'entrée : une cinquantaine de démonstrations par tâche suffiraient pour doter une politique existante de sensibilité tactile. Il faut toutefois rester prudent. Il s'agit d'un préprint non évalué par les pairs, d'un nombre limité de tâches (six en simulation, quatre en réel), et la comparaison porte sur des références choisies par les auteurs. Rien n'indique une généralisation à d'autres capteurs, morphologies ou tâches. Ce travail s'inscrit dans la montée des VLA fondés sur la famille π de Physical Intelligence, qui servent de base à de nombreuses extensions de recherche. La question de la modalité tactile y reste ouverte : les approches concurrentes, comme FTP-1, misent sur un préentraînement tactile de la politique, tandis que SimpleTouch teste l'hypothèse inverse, celle de la simplicité. Le benchmark UniVTAC fournit un terrain commun de comparaison, mais les résultats en conditions industrielles, avec cadences, variabilité des pièces et usure des capteurs, restent à démontrer. Les prochaines étapes probables sont des réplications par d'autres laboratoires, des tests sur davantage de tâches et de capteurs, et une confrontation directe avec des modèles préentraînés sur de grands volumes de données tactiles.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Correction d'actions sans réentraînement pour les échecs des modèles VLA, via retour en langage naturel
3arXiv cs.RO 

Correction d'actions sans réentraînement pour les échecs des modèles VLA, via retour en langage naturel

Des chercheurs ont publié fin août 2026 sur arXiv (2608.29967) CorrectVLA, une méthode qui corrige les échecs des modèles Vision-Language-Action (VLA) sans réentraînement. Le principe : un humain formule une seule consigne de correction en langage naturel, traduite en ajustements additifs de l'amplitude des actions et appliquée uniformément à tous les essais suivants, sans toucher aux poids de la politique. En simulation sur le benchmark LIBERO-90, CorrectVLA récupère des échecs de désalignement d'exécution aussi bien sur des tâches connues que sur des tâches inédites (out-of-distribution). Sur un bras robotique réel UFactory xArm7 soumis à un changement d'environnement, la méthode restaure un taux de réussite quasi parfait là où la politique de base échoue presque totalement, et généralise à de nouvelles positions et identités d'objets. Ce travail s'attaque à l'un des points faibles connus des VLA en déploiement : l'écart entre démonstrations impressionnantes et robustesse réelle sur le terrain. Pour les intégrateurs et décideurs industriels, l'intérêt est opérationnel : plutôt que de réentraîner un modèle coûteux à chaque échec observé, une simple instruction textuelle suffirait à corriger certains comportements erronés sur une flotte déjà déployée. Mais l'apport le plus utile est la taxonomie des échecs établie sur LIBERO-90 : seuls les échecs de désalignement d'exécution, où le robot vise la bonne cible mais mal calibre l'amplitude de son geste, sont corrigibles par ce biais. Quand la compréhension sémantique de la tâche elle-même fait défaut, la méthode échoue, ce qui fixe une limite opérationnelle claire et tempère l'idée que le feedback en langage suffirait à résoudre tous les problèmes de généralisation des VLA. Ce résultat s'inscrit dans la course aux modèles VLA généralistes (Pi-0, GR00T N2, Helix) de plus en plus déployés sur bras industriels et humanoïdes, où la question du contrôle post-déploiement face aux échecs en conditions réelles reste ouverte. Contrairement à un réentraînement complet ou à du fine-tuning, CorrectVLA se positionne comme une méthode d'intervention à l'inférence, complémentaire aux approches existantes de correction de politique. Les auteurs présentent ce travail comme une première délimitation empirique des cas où la correction sans réentraînement fonctionne, la piste des échecs de compréhension sémantique restant un chantier ouvert.

RecherchePaper
1 source
Grands modèles de récompense : génération de récompenses robotiques en ligne et généralisable grâce aux modèles vision-langage
4arXiv cs.RO 

Grands modèles de récompense : génération de récompenses robotiques en ligne et généralisable grâce aux modèles vision-langage

Des chercheurs proposent les Large Reward Models (LRM), un cadre qui transforme des modèles vision-langage (VLM) de base en générateurs de récompense image par image, destinés à affiner des politiques de manipulation robotique. Le VLM de pointe retenu est spécialisé sur un jeu de données multi-sources : trajectoires de robots réels, interactions humain-objet et environnements de manipulation simulés. Contrairement aux approches qui évaluent les trajectoires a posteriori, les LRM exposent trois interfaces de récompense à partir des seules observations visuelles : estimation de progression, détection d'achèvement de la tâche et comparaison contrastive temporelle. Partant d'une politique apprise par imitation (IL), les auteurs utilisent ces signaux pour guider un affinage par PPO sur des tâches de manipulation à long horizon non vues pendant l'entraînement. La récompense de progression s'impose comme le meilleur signal en ligne sans information privilégiée : elle améliore la politique IL de référence et réduit l'écart avec les récompenses « privilégiées » issues de l'état interne de l'environnement. Côté matériel réel, elle sert à pondérer un clonage comportemental (behavioral cloning) selon la progression, sur quatre tâches de manipulation et deux plateformes robotiques, avec un gain sur le fine-tuning supervisé (SFT) classique dans les quatre cas. Le résumé ne donne ni modèle de VLM, ni taux de réussite chiffrés, ni noms de robots. L'enjeu est celui d'un goulot d'étranglement bien connu : l'apprentissage par renforcement (RL) peut améliorer les politiques de manipulation, mais écrire une fonction de récompense à la fois sémantiquement pertinente et réutilisable d'une tâche à l'autre reste coûteux, et se fait aujourd'hui surtout à la main, tâche par tâche. Si ces résultats se confirment, un VLM spécialisé pourrait servir de récompense générique, ce qui réduirait l'ingénierie de récompense pour les intégrateurs et ouvrirait la voie à une auto-amélioration des robots en déploiement, sans instrumentation de la scène. Des réserves s'imposent : l'écart avec les récompenses privilégiées est réduit, pas comblé ; la validation réelle ne porte que sur quatre tâches, et sur du clonage comportemental pondéré plutôt que sur du RL en ligne sur robot physique. Le travail relève de la recherche (preprint arXiv, version 3), sans produit ni déploiement industriel. Ces travaux s'inscrivent dans la montée des modèles de fondation pour la robotique, des VLA (vision-langage-action) comme Pi-0 ou GR00T aux VLM utilisés comme juges ou générateurs de récompense. Les approches précédentes de récompense par modèle de langage ou de vision restaient souvent limitées à une évaluation après coup, ce que les LRM cherchent à dépasser avec un signal exploitable en ligne. La suite logique serait de tester ces récompenses en RL directement sur robot réel, sur un plus grand nombre de tâches, et de mesurer leur robustesse face aux erreurs d'estimation de progression, qui peuvent être exploitées par la politique. Le résumé ne cite aucun acteur européen ni partenaire industriel.

RecherchePaper
1 source