Aller au contenu principal
La désapprentissage de politiques par traits parcimonieux atténue les hallucinations d'état dans les modèles vision-langage-action (VLA)
RecherchearXiv cs.RO 

La désapprentissage de politiques par traits parcimonieux atténue les hallucinations d'état dans les modèles vision-langage-action (VLA)

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.09496v1) SOUL (Sparse feature pOlicy UnLearning), une méthode censée réduire l'« hallucination d'état » des modèles Vision-Language-Action (VLA). Ce terme désigne un mode de défaillance récurrent: le modèle continue d'agir comme si un état robot-objet n'avait pas été atteint alors qu'il ne l'a pas été. Un robot peut par exemple poursuivre sa séquence comme s'il tenait déjà l'objet, alors que la saisie a échoué. Les auteurs relient ces épisodes à un affaiblissement de l'attention portée aux régions visuelles pertinentes pour la tâche. Une analyse par autoencodeurs parcimonieux (sparse autoencoders) leur permet d'identifier des features précises, activées spécifiquement lors de ces échecs. SOUL utilise ces features comme cibles d'oubli, et celles issues des comportements réussis comme cibles de rétention. Le résumé annonce des tests sur plusieurs architectures de VLA, en simulation et en environnement réel. Il parle d'une réduction substantielle des échecs hallucinés et d'une amélioration du taux de succès, sans dégrader sensiblement les capacités existantes. Il ne donne aucun chiffre: ni taux de succès, ni nombre de tâches, ni modèles testés, ni robots utilisés.

L'enjeu est la fiabilité, principal frein au déploiement des VLA hors laboratoire. Les intégrateurs et les responsables d'exploitation constatent que ces modèles généralisent bien sur des démonstrations, mais qu'ils échouent de façon répétitive et parfois silencieuse en production. Un robot qui ignore l'échec de sa propre action est difficile à superviser et à certifier. L'approche proposée vise à corriger un comportement indésirable précis sans réentraîner toute la politique, ce qui serait bien moins coûteux qu'un nouveau cycle de collecte de données et de fine-tuning. Elle suggère aussi que l'interprétabilité, souvent cantonnée à l'analyse des LLM, peut servir d'outil d'ingénierie pour les politiques robotiques. Il faut toutefois rester prudent. Il s'agit d'un preprint sans revue par les pairs, et l'absence de métriques dans le résumé empêche d'évaluer l'ampleur du gain. Les résultats en conditions réelles, souvent limités à quelques tâches et à une seule plateforme, ne garantissent pas la robustesse en usine ou en entrepôt.

Ces travaux s'inscrivent dans la montée des VLA, de Pi-0 à GR00T ou Helix, bâtis sur des modèles vision-langage pré-entraînés dont ils héritent à la fois la puissance de généralisation et certains défauts. La littérature explore déjà plusieurs pistes pour fiabiliser ces politiques: détection d'échecs, vérification en boucle fermée, apprentissage par renforcement après entraînement. Le « machine unlearning », c'est-à-dire la suppression ciblée de connaissances, venait jusqu'ici surtout des modèles de langage. SOUL l'applique à la manipulation robotique. La suite logique serait une validation sur des modèles de grande taille et des tâches longues, puis une comparaison avec les méthodes concurrentes de détection d'échecs. Aucun calendrier ni partenaire industriel n'est mentionné.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

SWAP : routage pas à pas de politiques d'action pour les modèles vision-langage-action (VLA)
1arXiv cs.RO 

SWAP : routage pas à pas de politiques d'action pour les modèles vision-langage-action (VLA)

Des chercheurs publient sur arXiv (2610.06926) SWAP, pour StepWise Action Policy Routing, un cadre qui compose dynamiquement plusieurs politiques Vision-Language-Action (VLA) pendant l'exécution d'une tâche de manipulation. Aujourd'hui, la plupart des systèmes reposent sur un seul modèle VLA du début à la fin d'un épisode. SWAP formule le routage comme un problème d'apprentissage par renforcement hors ligne : un « critique de routage » est entraîné à choisir, à chaque pas de décision et selon l'observation courante, la politique la plus adaptée. Le robot peut ainsi changer de politique en cours d'épisode. L'évaluation porte sur des tâches réelles de manipulation sur la plateforme DROID et sur des simulations LIBERO. Face à l'exécution d'une politique fixe et à des méthodes de routage de référence, les auteurs annoncent jusqu'à 33 points de succès supplémentaires en conditions réelles, et une réduction de 28,3 % du nombre de pas d'action des trajectoires réussies. L'enjeu dépasse la performance brute. Le travail s'attaque à une limite que les intégrateurs constatent déjà : aucun VLA n'est le meilleur partout, et les performances varient selon la phase de la tâche et l'environnement. Au lieu d'attendre un modèle généraliste unique, SWAP traite les VLA existants comme une boîte à outils orchestrable, sans réentraîner chacun d'eux. Pour un industriel, cela suggère une voie pragmatique : combiner des politiques spécialisées ou de fournisseurs différents, et ne payer que pour la politique utile à chaque étape. La baisse de la longueur des trajectoires laisse aussi entrevoir un gain de temps de cycle, mais il s'agit d'un nombre de pas d'action, pas d'une durée mesurée en atelier. Il faut aussi rester prudent sur les chiffres : le « jusqu'à 33 % » correspond au meilleur cas, et l'abstract ne précise ni le nombre de tâches ni la taille des échantillons, ni les politiques combinées. Ce résultat s'inscrit dans la course aux modèles fondation pour la manipulation, où des VLA comme Pi-0, GR00T ou Helix sont généralement présentés comme des systèmes autonomes. Le routage entre politiques prolonge les approches de mélange d'experts, mais à l'échelle de politiques complètes et de manière apprise hors ligne. DROID, jeu de données et plateforme de manipulation très utilisé, et LIBERO, banc d'essai en simulation, servent de référence commune, ce qui facilite la comparaison. Il s'agit d'une prépublication v1 non évaluée par les pairs, sans déploiement industriel annoncé. Les prochaines étapes à surveiller : la publication du code, la robustesse du critique face à des environnements inédits, et la latence ajoutée par le routage à chaque pas de décision.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
STAR : apprentissage de représentations tactiles éparses pour la manipulation dextérique via modèles vision-tactile-langage-action
2arXiv cs.RO 

STAR : apprentissage de représentations tactiles éparses pour la manipulation dextérique via modèles vision-tactile-langage-action

Des chercheurs ont publié le 12 septembre 2026 sur arXiv (2609.12549) STAR, un système d'apprentissage pour modèles vision-tactile-langage-action destinés à la manipulation dextre bimanuelle. L'équipe a construit une plateforme robotique et un dispositif de téléopération pour collecter 200 heures de données, soit 10 576 trajectoires réparties sur 65 tâches, dont 69,5 % impliquent une manipulation multi-doigts fine, chaque séquence étant annotée simultanément en vision, tactile et langage. STAR combine trois mécanismes pour compenser la rareté spatiale, temporelle et informationnelle des signaux tactiles : un pré-entraînement conjoint visuel-tactile, une représentation par jetons tactiles globaux épars, et une prédiction tactile future éparse. Après entraînement sur ce corpus, puis un post-entraînement léger de seulement 100 trajectoires par tâche, le modèle atteint un taux de réussite moyen de 61 % sur quatre tâches réelles. Ce résultat s'attaque à un goulot d'étranglement connu des modèles vision-langage-action (VLA) : le signal tactile, clairsemé par nature, est souvent négligé au profit de la seule combinaison vision-langage, ce qui limite la finesse de manipulation. Démontrer qu'un post-entraînement de 100 démonstrations par tâche suffit à dépasser 60 % de réussite renforce l'idée qu'une intégration tactile native, plutôt qu'ajoutée après coup, améliore la généralisation des politiques robotiques. Pour les intégrateurs en robotique humanoïde et en préhension industrielle, cela ouvre une piste concrète pour réduire le coût de collecte de données réelles, souvent le vrai frein au passage du laboratoire au terrain. Le chiffre de 61 % reste toutefois à confirmer sur des objets et environnements non vus, les quatre tâches testées ayant été sélectionnées par les auteurs eux-mêmes. STAR s'inscrit dans une recherche croissante visant à doter les modèles VLA d'un véritable retour tactile, alors que des systèmes de référence du secteur, comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure AI, reposent surtout sur la coordination vision-langage sans exploiter systématiquement le toucher. La rareté des jeux de données vision-tactile-langage synchronisés à grande échelle explique en partie pourquoi peu d'acteurs disposent d'un corpus comparable aux 10 576 trajectoires réunies ici. Publié comme préprint sans affiliation industrielle revendiquée ni calendrier de déploiement, STAR reste à ce stade une contribution de recherche. La communauté attendra probablement la publication du code et du jeu de données, ainsi que des comparaisons directes avec d'autres architectures tactiles en cours de développement.

RechercheActu
1 source
HARP-VLA : apprentissage de représentations alignées humain-robot pour modèle vision-langage-action
3arXiv cs.RO 

HARP-VLA : apprentissage de représentations alignées humain-robot pour modèle vision-langage-action

Des chercheurs ont publié le 31 mai 2026 HARP-VLA (Human-Robot Aligned Representation Learning for Vision-Language-Action), un framework de pré-entraînement conçu pour exploiter les vastes corpus de vidéos humaines dans l'apprentissage de politiques de manipulation robotique. Le coeur de l'approche repose sur deux composants entraînés conjointement : un encodeur visuel adapté aux robots et un modèle d'action latente. L'entraînement combine un petit nombre de démonstrations appariées humain-robot utilisées comme ponts inter-embodiment, et une quantité bien plus importante de vidéos non appariées des deux types comme supervision de dynamique. Sur le benchmark CALVIN ABC-D, HARP-VLA atteint un score moyen de 4,481 tâches consécutives réussies, et enregistre un gain de 7,1 points de pourcentage de taux de succès en conditions réelles par rapport à la meilleure baseline testée. Le problème que résout HARP est structurel pour tout le champ des VLA (Vision-Language-Action models) : les vidéos humaines sont abondantes et bon marché, mais les représentations visuelles qu'on en extrait sont mal alignées avec celles d'un robot, ce qui rend le co-entraînement inefficace voire contre-productif. Les modèles d'action latente existants, comme ceux utilisés dans les travaux sur UniPi ou Genie, réduisaient déjà le gap d'exécution en apprenant des abstractions d'action, mais restaient dépendants de features visuelles non alignées induisant des actions latentes domain-dépendantes. HARP introduit une perte d'alignement par discrimination relative de paires (source-relative pair-discriminative alignment loss) qui adapte les représentations robot vers la sémantique humaine sans effacer la discrimination inter-paires. Pour les intégrateurs et les équipes de recherche en manipulation, c'est un signal concret que le sim-to-real gap peut être partiellement adressé au niveau de la représentation, pas seulement du domaine de simulation. Ce travail s'inscrit dans une lignée de recherches sur l'apprentissage inter-embodiment qui a pris de l'ampleur depuis RT-2 (Google DeepMind, 2023) et OpenVLA (2024), lesquels montraient qu'un pré-entraînement sur données humaines ou web pouvait transférer vers des politiques robotiques. Les approches concurrentes directes incluent Octo, pi-0 de Physical Intelligence, et GR00T N2 de NVIDIA, tous confrontés à la même tension entre généralisation cross-embodiment et performance sur tâches précises. HARP se distingue en n'exigeant que peu de démonstrations appariées, ce qui réduit le coût de collecte de données. L'article reste pour l'instant une publication arXiv sans déploiement industriel annoncé, et les résultats en conditions réelles, bien que positifs, portent sur un nombre limité de configurations de manipulation.

RechercheOpinion
1 source
Là où le succès échoue : apprentissage aux frontières d'échec pour des modèles vision-langage-action (VLA) robustes
4arXiv cs.RO 

Là où le succès échoue : apprentissage aux frontières d'échec pour des modèles vision-langage-action (VLA) robustes

Des chercheurs proposent DLS (Discovering, Localizing, Shaping), une méthode d'adaptation de modèles vision-langage-action (VLA) qui vise à rendre ces politiques plus robustes après un fine-tuning supervisé (SFT). Le point de départ est une asymétrie structurelle: les démonstrations d'experts indiquent où se situe le comportement réussi, mais ne disent rien de la zone où il cesse d'être fiable. DLS s'appuie sur un a priori comportemental ancré dans le réel, obtenu à partir de quelques démonstrations réelles et d'un co-entraînement en simulation. La méthode explore ensuite à grande échelle les frontières d'échec grâce à des déploiements « on-policy » dans un jumeau numérique de l'environnement. Les auteurs annoncent une amélioration de la robustesse par rapport au SFT et à des baselines d'apprentissage par renforcement en ligne, sur des tâches de manipulation avec robot réel. Le gain est surtout marqué avec des états initiaux aléatoires et des conditions visuelles inédites. L'article, en version 2 sur arXiv, ne fournit dans ce résumé ni taux de réussite chiffrés, ni nombre de démonstrations, ni modèle de base nommé. Le principal apport est conceptuel: au lieu de traiter chaque rollout comme un simple succès ou échec, DLS exploite les états privilégiés du simulateur, inaccessibles en conditions réelles, pour mesurer où la trajectoire franchit la frontière de l'échec. Cette « localisation sémantique de la progression » produit un signal plus riche qu'un label binaire. Ce signal sert à façonner la dynamique de flux de la politique, c'est-à-dire le débruitage des actions: les directions qui mènent au succès sont renforcées, celles qui mènent à l'échec sont supprimées. Cela se fait sans calcul de vraisemblance des actions et sans critique auxiliaire, deux composants qui compliquent souvent le RL appliqué aux politiques à diffusion ou à flow matching. Pour les intégrateurs, l'enjeu est la fragilité bien connue des VLA hors de la distribution des démonstrations (positions initiales variées, éclairage, textures). Si les résultats se confirment, le jumeau numérique servirait moins à générer des démonstrations qu'à cartographier les zones de rupture, ce qui réduirait le besoin de collecte réelle coûteuse. Les résultats restent toutefois ceux d'un préprint, sans comparaison indépendante, et leur portée dépend du nombre de tâches, de la fidélité du jumeau numérique et de l'écart sim-to-real réellement couvert. Ce travail s'inscrit dans la montée du post-entraînement des VLA après le SFT, où le RL en ligne et le co-entraînement simulation-réel sont devenus les pistes dominantes pour dépasser le plafond de l'imitation. Les modèles à flux ou à diffusion, comme la famille Pi-0 ou GR00T, rendent cette adaptation plus délicate, car leurs vraisemblances d'action sont difficiles à calculer, d'où l'intérêt d'une approche qui les évite. DLS se positionne face aux méthodes de RL en ligne qui récompensent uniquement le succès final, avec un signal de progression plus dense. Les prochaines étapes à surveiller sont la publication du code et des chiffres détaillés, le test sur des modèles de base variés et la validation sur des tâches plus longues ou plus contraintes en précision, qui diront si la cartographie des frontières d'échec passe à l'échelle industrielle.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source