Aller au contenu principal
Regarder avant d'agir : distiller la recherche arborescente en évaluation d'actions pour modèles VLA figés
RecherchearXiv cs.RO 

Regarder avant d'agir : distiller la recherche arborescente en évaluation d'actions pour modèles VLA figés

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie sur arXiv (2607.03751v1) une étude qui identifie un goulot d'étranglement méconnu dans les modèles Vision-Language-Action (VLA) : leurs échecs ne viennent pas seulement d'une mauvaise génération d'actions, mais surtout d'une mauvaise évaluation de ces actions. Un test diagnostique dit "pass@k" le prouve de façon frappante : un même modèle VLA figé, sans aucun réentraînement, voit son taux de réussite grimper de 33% en pass@1 à 92% en pass@32. Autrement dit, la bonne action existe déjà dans la distribution de sortie du modèle, mais celui-ci ne sait pas la reconnaître parmi ses propres propositions. Les chercheurs en tirent SVA (Search, Value, and Act), un framework qui ajoute une couche d'évaluation à un modèle VLA gelé : une recherche arborescente Monte-Carlo (MCTS) explore en simulation les trajectoires possibles et les annote de leurs résultats réels, ces données entraînent ensuite un modèle de valeur Q léger qui prédit la conséquence attendue de chaque action candidate, et au déploiement le VLA propose plusieurs actions parmi lesquelles l'évaluateur choisit la meilleure, sans besoin d'accès à un simulateur.

Cette approche renverse une hypothèse répandue du secteur : que la seule voie d'amélioration des VLA est le post-entraînement par fine-tuning supervisé ou apprentissage par renforcement, au prix d'une perte de capacité généraliste. En découplant proposition d'action et évaluation de conséquence, SVA préserve les capacités de généralisation acquises au pré-entraînement tout en améliorant nettement le taux de succès sur des tâches inédites. Résultat le plus marquant : un modèle VLA de 9 milliards de paramètres équipé de SVA dépasse de 7 points un modèle de 27 milliards, avec une latence d'inférence inférieure de 27%. Le message pour l'industrie est clair : investir dans le calcul au moment de l'inférence peut être plus rentable que de faire grossir les modèles.

Ces travaux s'inscrivent dans la lignée des modèles VLA généralistes type Pi-0, OpenVLA ou GR00T N2, dont la fragilité de généralisation face aux méthodes de post-entraînement classique est un problème documenté depuis plusieurs mois dans la recherche en robotique. SVA propose une alternative architecturale plutôt qu'un simple ajustement d'entraînement, ouvrant la voie à des déploiements où l'évaluation test-time devient un axe de scaling à part entière, distinct de la taille du modèle.

À lire aussi

Penser comme un modèle du monde, agir comme un VLA : distiller les représentations en politiques compactes
1arXiv cs.RO 

Penser comme un modèle du monde, agir comme un VLA : distiller les représentations en politiques compactes

Une équipe de recherche publie sur arXiv (référence 2609.24682) une méthode qui ajoute un terme d'alignement de représentations à l'entraînement classique des modèles Vision-Language-Action (VLA), ces réseaux qui associent perception et langage à des actions robotiques. Un world model figé est passé une seule fois sur les images d'entraînement, ses caractéristiques internes sont mises en cache, puis le modèle VLA « étudiant » apprend à s'aligner sur ce cache pendant l'entraînement. Le world model n'est jamais chargé lors du déploiement et le module de projection est jeté après l'entraînement, si bien que la politique finale reste identique au modèle VLA non distillé, tant en taille qu'en calcul. Résultat mesuré : un étudiant de 0,8 milliard de paramètres tourne en 32 millisecondes et consomme 1,86 Go de mémoire sur une carte grand public RTX 5090, atteint 97,9 % de réussite sur le benchmark de manipulation LIBERO, et progresse de 48,2 % à 50,5 % sur RoboCasa-GR1, un banc d'essai de manipulation humanoïde en simulation. Le gain se vérifie aussi sur du matériel réel, sur une plateforme à bras unique et sur une plateforme bimanuelle. L'intérêt pour l'industrie robotique tient à la séparation qu'établit ce travail entre deux familles de modèles jusque-là difficiles à concilier : les VLA, rapides mais dépourvus d'objectif qui tienne compte de la réaction du monde à une action, et les world models, physiquement mieux fondés mais trop lents pour piloter un robot en temps réel puisqu'ils doivent projeter le futur seconde par seconde. En montrant que la connaissance physique d'un world model peut être injectée dans une politique légère sans alourdir le calcul au moment de l'exécution, l'étude suggère qu'on peut améliorer la robustesse des VLA sans ajouter de données, de paramètres ni de calcul supplémentaire au déploiement, un point qui intéresse directement les intégrateurs contraints par la latence et la puissance embarquée. Ce résultat s'inscrit dans un débat actuel de la recherche en robotique entre approches VLA et approches par world models, sans qu'aucun partenaire industriel ni déploiement commercial ne soit mentionné à ce stade. La méthode a été testée en faisant varier la taille de l'étudiant, l'architecture de base, la couche d'alignement et le world model utilisé comme enseignant, un signal que l'effet observé relève d'un principe général plutôt que d'un couplage fragile entre deux réseaux précis. Les auteurs publient les détails sur une page projet dédiée, mais le travail reste à ce jour un résultat de recherche évalué en simulation et en laboratoire, sans calendrier annoncé vers une industrialisation.

RecherchePaper
1 source
Agir avec intention : distiller l'intention comportementale pour les modèles vision-langage-action
2arXiv cs.RO 

Agir avec intention : distiller l'intention comportementale pour les modèles vision-langage-action

Publié le 25 août 2026 sur arXiv (référence 2608.23478), un article de recherche présente INDI (Intention Distillation), une méthode d'entraînement pour les décodeurs d'action des modèles Vision-Language-Action (VLA) en robotique, dominés aujourd'hui par le clonage de comportement, qui indique la commande démontrée sans expliciter l'objectif poursuivi. Pendant l'entraînement, un VLM enseignant figé interprète chaque segment démontré à partir de l'observation, de l'instruction, d'un résumé d'action et de la vidéo d'exécution ; le VLA déployé récupère cette représentation d'intention à une couche intermédiaire du décodeur. Sur le benchmark SimplerEnv-Bridge, le modèle GR00T-N1.7 passe de 64,3 % à 84,7 % de réussite ; sur RoboCasa Kitchen, sa baseline progresse de 64,1 % à 70,3 %, avec des gains similaires relevés sur Pi-0.5. En conditions réelles, le taux de réussite moyen grimpe de 62,0 % à 68,7 %, avec un bond de jusqu'à 12 points de pourcentage sur les tâches à horizon long. Ces résultats visent une limite structurelle connue du clonage de comportement, qui capture le geste démontré mais pas la raison d'être du comportement, ce qui dégrade la généralisation sur les tâches longues ou multi-étapes. Le fait que les gains les plus marqués apparaissent justement sur ces tâches à horizon long est significatif pour les intégrateurs, car c'est là que les pipelines VLA actuels échouent le plus souvent hors démonstration scénarisée. La méthode ne requiert ni capteur ni collecte de données additionnelle : elle exploite des signaux déjà disponibles via un VLM enseignant utilisé seulement à l'entraînement, sans surcoût d'inférence au déploiement, et reste transposable à d'autres architectures VLA. Le travail prolonge des approches qui enrichissaient le clonage de comportement avec des frames futures, des observations latentes ou des trajectoires, jugées insuffisantes car elles captent une réalisation du futur, non l'objectif sémantique partagé du comportement. INDI est testé sur des modèles VLA de référence déjà largement utilisés, GR00T-N1.7 et Pi-0.5, ce qui en fait une couche d'entraînement complémentaire plutôt qu'un modèle concurrent. La publication reste à ce stade un article arXiv sans revue par les pairs formelle ni annonce de déploiement industriel ; la communauté robotique attend désormais une reproduction indépendante des résultats et une extension à d'autres familles de VLA.

RechercheActu
1 source
Recherche arborescente Monte Carlo avec factorisation tensorielle pour les problèmes d'optimisation en robotique
3arXiv cs.RO 

Recherche arborescente Monte Carlo avec factorisation tensorielle pour les problèmes d'optimisation en robotique

Une équipe de chercheurs a publié sur arXiv (référence 2507.04949, troisième version) un algorithme baptisé Tensor Train Tree Search (TTTS), qui combine la recherche arborescente Monte Carlo (MCTS) avec la factorisation tensorielle dite "tensor train" pour résoudre des problèmes d'optimisation en robotique. La méthode a été validée expérimentalement sur cinq familles de tâches : cinématique inverse, planification de trajectoire avec évitement d'obstacles, manipulation par robot à pattes, planification multi-étapes, et manipulation bimane corps entier. Il s'agit d'un préprint de recherche, sans déploiement industriel annoncé à ce stade. L'enjeu central est la généralisation cross-tâche : les solveurs actuels (optimiseurs de trajectoire, planificateurs par échantillonnage comme RRT*, méthodes RL) sont fortement spécialisés par domaine, ce qui impose un effort de reformulation important pour chaque nouveau problème et limite l'autonomie multi-tâche des robots. MCTS offre naturellement ce caractère généraliste via l'exploration structurée de l'espace de solutions, mais souffre d'une complexité combinatoire explosive en haute dimension, rendant son application naïve impraticable pour les espaces articulaires de bras ou de robots marcheurs. TTTS contourne ce verrou en exploitant les corrélations implicites entre branches de l'arbre de décision via une représentation compacte à complexité linéaire, ce qui réduit simultanément l'empreinte mémoire et le coût de calcul. Pour un intégrateur ou un architecte de systèmes robotiques, l'intérêt est de disposer d'un cadre de planification unifié plutôt que d'une pile d'optimiseurs hétérogènes à maintenir. MCTS est historiquement issu du jeu (AlphaGo/AlphaZero de DeepMind), et sa transposition à la robotique se heurte depuis longtemps à la malédiction de la dimensionnalité. La factorisation tensor train, technique établie en algèbre linéaire numérique, a déjà démontré son efficacité pour compresser des représentations haute dimension dans d'autres domaines, mais son intégration à MCTS pour la planification robotique reste peu explorée. Du côté concurrentiel, TTTS se positionne face aux approches de type diffusion (Diffusion Policy) et aux VLA (Vision-Language-Action models) qui traitent la planification de façon implicite via des réseaux appris, ainsi qu'aux solveurs classiques comme IPOPT ou SNOPT. La prochaine étape naturelle serait une validation sur matériel réel et une comparaison de temps de cycle en conditions industrielles, absentes du preprint actuel.

RecherchePaper
1 source
ForceDelta-VLA : distiller les corrections d'action conditionnées par la force pour la manipulation à contact riche
4arXiv cs.RO 

ForceDelta-VLA : distiller les corrections d'action conditionnées par la force pour la manipulation à contact riche

Des chercheurs publient sur arXiv (2609.18242v1) ForceDelta-VLA, une méthode destinée à améliorer les politiques Vision-Language-Action (VLA) sensibles à la force pour la manipulation robotique en contact riche, comme l'insertion ou l'assemblage de pièces. Le problème de départ: les VLA actuels fusionnent mouvement de tâche et ajustement de contact en une seule prédiction, sans distinguer une action de référence réutilisable d'une correction. ForceDelta-VLA construit cette correction à partir des prédictions d'un modèle enseignant gelé, comparées en mode conditionné par la force et en mode agnostique, complétées par une correction de délai gérant le décalage de l'action de référence. La politique légère qui en résulte ajuste les actions via l'historique de force récent, sans régénérer de séquences complètes à chaque contact. Sur neuf tâches en bras unique et bimanuelles, le taux de réussite moyen atteint 82,2%, contre 54,4% pour la référence ForceVLA; le "Stage-1 Temporal Teacher" seul atteint 70,6%, et le système complet réduit la force de contact de crête d'environ 26% sur les deux plateformes testées. Ce résultat vise d'abord les chercheurs et intégrateurs travaillant sur la manipulation fine (insertion de connecteurs, assemblage, montage électronique), un point faible connu des VLA généralistes, plus à l'aise sur la préhension grossière que sur les tâches exigeant un retour de force précis. En découplant mouvement macro et correction de contact, ForceDelta-VLA évite de régénérer un chunk d'action complet à chaque micro-ajustement, ce qui allège le calcul et améliore la réactivité pour un déploiement industriel manipulant des pièces fragiles ou mal positionnées. La baisse de 26% du pic de force est aussi pertinente pour la sécurité du matériel et la durée de vie des effecteurs. Ces gains restent toutefois mesurés sur seulement neuf tâches en environnement de recherche, sans indication de déploiement industriel ni de plateforme commerciale nommée. ForceDelta-VLA se positionne comme une amélioration du système ForceVLA, pris comme référence de comparaison tout au long de l'article, et s'inscrit dans la lignée des modèles Vision-Language-Action, à l'image de Pi-0, GR00T N2 ou Helix, qui cherchent à généraliser la manipulation robotique à partir de démonstrations, la manipulation à contact riche restant un angle mort persistant de ces architectures. Publié sans affiliation industrielle citée, le travail ne mentionne ni entreprise ni date de déploiement: c'est une contribution méthodologique pour la communauté robotique, dont l'extension à davantage de tâches et de plateformes physiques serait la suite logique.

RechercheActu
1 source