Aller au contenu principal
Récupération hiérarchique de compétences pour l'adaptation efficiente des modèles vision-langage-action
RecherchearXiv cs.RO 

Récupération hiérarchique de compétences pour l'adaptation efficiente des modèles vision-langage-action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent Hierarchical Skill Retrieval (HSR), un framework de récupération de démonstrations pour adapter plus efficacement les modèles Vision-Language-Action (VLA) à de nouvelles tâches de manipulation robotique avec peu de données spécifiques. Plutôt que de chercher des correspondances de tâches complètes, rares dans les jeux de données existants, HSR décompose une tâche cible en séquences de compétences candidates, évalue chaque plan selon sa plausibilité sémantique et la fiabilité des compétences estimée à partir du jeu de données préalable, puis combine récupération de langage au niveau sous-tâche et reclassement par caractéristiques comportementales pour sélectionner des démonstrations pertinentes et compatibles. La politique est ensuite adaptée via un pipeline en deux étapes séparant acquisition générale de compétences et finetuning spécifique à la tâche. Sur le benchmark LIBERO et sur plusieurs tâches de manipulation en conditions réelles, HSR améliore le taux de succès moyen de 10,3% et 21,3% respectivement par rapport à la meilleure méthode de référence. Vidéos et code sont disponibles sur le site du projet.

Ce travail s'attaque à un problème très concret pour l'industrie robotique : les modèles VLA préentraînés sur de vastes jeux de données de démonstrations perdent en performance dès qu'on les confronte à des tâches nouvelles avec peu d'exemples, un frein majeur au déploiement rapide chez les intégrateurs. En structurant la récupération autour de compétences réutilisables plutôt que de tâches entières, HSR propose une piste pour réduire le coût de collecte de données lors du transfert vers de nouveaux environnements ou de nouvelles chaînes de production, un enjeu central pour quiconque cherche à industrialiser des bras robotiques ou des humanoïdes au-delà des démonstrations en laboratoire. Le gain plus marqué en conditions réelles (21,3%) qu'en simulation (10,3%) suggère que l'approche hiérarchique compense particulièrement bien le bruit et la variabilité du monde physique, un point souvent négligé par les méthodes de récupération fondées sur la seule similarité visuelle ou l'appariement de langage au niveau tâche.

HSR s'inscrit dans la lignée des travaux récents sur l'adaptation efficace des modèles VLA de type Pi-0 ou GR00T, où la question centrale reste de savoir comment tirer parti de grands jeux de données hétérogènes sans réentraînement coûteux pour chaque nouvelle tâche. Les auteurs positionnent leur méthode par rapport aux approches de récupération existantes basées sur la similarité visuelle, les représentations état-action ou l'appariement de langage au niveau tâche, qu'ils jugent insuffisantes face à la structure hiérarchique des tâches de manipulation à long horizon. Le code et les vidéos de démonstration étant publiés en accès libre, la validation par la communauté sur d'autres benchmarks et plateformes robotiques déterminera si ces gains se généralisent au-delà de LIBERO et des tâches réelles testées par les auteurs.

À lire aussi

StrataVLA : ancrage géométrique 3D hiérarchique et efficace pour les modèles vision-langage-action
1arXiv cs.RO 

StrataVLA : ancrage géométrique 3D hiérarchique et efficace pour les modèles vision-langage-action

Une équipe de recherche présente StrataVLA, un framework pour les modèles Vision-Language-Action (VLA) utilisés en manipulation robotique, dans un preprint mis en ligne sur arXiv en septembre 2026 (référence 2609.26071v1). Le système cible le manque de conscience spatiale en 3D des VLA, qui héritent de solides priors sémantiques du préentraînement vision-langage mais restent limités en manipulation faute d'accès continu à l'information géométrique. Il associe un modèle de géométrie figé, qui extrait des caractéristiques à partir d'images RGB, à des Geometry Adapters épars insérés à des profondeurs choisies du réseau et récupérant cette information par attention croisée, complété par un routage sensible à la tâche et un cache LRU exploitant la redondance temporelle pour limiter le coût de calcul. Testé sur LIBERO, SimplerEnv et en manipulation réelle, StrataVLA atteint 98,53 % de réussite moyenne sur les suites LIBERO tout en réduisant jusqu'à 88 % les appels au modèle de géométrie. Pour les intégrateurs robotiques, cette approche plug-and-play promet d'ajouter une compréhension 3D fiable à un VLA existant sans multiplier les capteurs de profondeur ni réentraîner tout le réseau, le tronc vision-langage préentraîné restant gelé. La réduction de 88 % des appels au modèle de géométrie vise directement le coût de calcul qui freine le déploiement temps réel de politiques conscientes de la géométrie. Le chiffre de 98,53 % reste toutefois un résultat de simulation sur LIBERO ; les gains rapportés sur SimplerEnv et en conditions réelles ne sont pas quantifiés de la même manière, ce qui invite à la prudence avant d'extrapoler cette performance à des environnements industriels variés. Ce travail s'inscrit dans une recherche sur les VLA qui, depuis des modèles comme Pi-0 ou GR00T N2, cherchent à unifier perception, langage et action dans un seul réseau de bout en bout, tout en se heurtant à la même limite : un raisonnement spatial 3D précis, nécessaire pour saisir et positionner des objets, que les représentations purement 2D ne capturent pas nativement. Plutôt que de créer un nouveau modèle de fondation, StrataVLA propose d'injecter la géométrie de manière hiérarchique et distribuée dans le tronc existant. L'article ne mentionne ni entreprise ni site de déploiement industriel : il s'agit d'un preprint de recherche, non encore évalué par les pairs, sans code ni robot commercial associé à ce stade.

RechercheOpinion
1 source
RA-VLA : adaptation d'un modèle vision-langage-action par récupération augmentée au moment de l'inférence
2arXiv cs.RO 

RA-VLA : adaptation d'un modèle vision-langage-action par récupération augmentée au moment de l'inférence

RA-VLA (arXiv 2608.25585v1) est un nouveau framework de type Vision-Language-Action (VLA) augmenté par récupération, conçu pour l'adaptation à l'exécution sans réentraînement. Les auteurs partent du constat que les modèles VLA, bien qu'utilisés comme socle généraliste pour la manipulation robotique, restent fragiles face à des distributions de tâches inédites. L'apprentissage par imitation en contexte (ICIL), approche existante ne nécessitant pas d'entraînement supplémentaire, souffre selon eux d'un goulot d'étranglement : des mécanismes de récupération superficiels et une forme d'inertie comportementale qui maintient la politique ancrée sur ses biais pré-entraînés. RA-VLA propose de corriger cela en combinant une récupération de contexte alignée sur le comportement recherché avec un pipeline d'exécution ancré dans des indices fonctionnels concrets. Le système a été évalué sur le benchmark LIBERO, référence standard pour la manipulation robotique en simulation, ainsi que sur un environnement réel utilisant un bras UR5e. Le résumé revendique des taux de réussite supérieurs et une meilleure efficacité de calcul par rapport aux méthodes existantes, sans toutefois fournir de chiffre précis (pourcentage de réussite, temps de cycle, latence) permettant de quantifier l'écart. Cette publication touche un point sensible du secteur : la capacité réelle des modèles VLA à généraliser au-delà de leurs données d'entraînement, alors que des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix) présentent leurs modèles comme des socles universels prêts à s'adapter à de nouvelles tâches. En proposant une adaptation purement par récupération de contexte au moment de l'inférence, sans réentraînement, RA-VLA illustre une voie alternative au fine-tuning lourd, potentiellement utile pour des intégrateurs devant déployer des bras robotiques sur des tâches changeantes sans budget de réentraînement récurrent. Pour les décideurs B2B, ce travail rappelle surtout que le fossé entre démonstration et robustesse en conditions réelles reste un sujet de recherche actif, même pour les architectures VLA les plus médiatisées. Le papier s'inscrit dans la lignée des travaux sur l'apprentissage en contexte appliqué à la robotique, alternative au fine-tuning classique de modèles VLA de type RT-2 ou OpenVLA. Il ne mentionne aucun partenaire industriel ni aucun site de déploiement : il s'agit d'une contribution académique évaluée en simulation et sur un unique bras UR5e en laboratoire, sans code source public ni calendrier de suite indiqués. La compétition dans ce domaine reste dominée par les laboratoires et start-up développant des modèles fondation généralistes, tels que Physical Intelligence, NVIDIA, Google DeepMind ou Figure, pour lesquels la robustesse à l'adaptation en test reste un argument de différenciation central. RA-VLA se positionne comme une brique méthodologique susceptible d'être intégrée à ces architectures existantes plutôt que comme un produit ou un modèle concurrent autonome.

RechercheOpinion
1 source
RotVLA : action latente de rotation pour les modèles vision-langage-action (VLA)
3arXiv cs.RO 

RotVLA : action latente de rotation pour les modèles vision-langage-action (VLA)

Un groupe de chercheurs a publié en mai 2026 RotVLA (arXiv:2605.13403), un framework Vision-Language-Action (VLA) qui substitue la quantification discrète des modèles d'action latente (LAM) existants par une représentation continue dans l'espace de rotation SO(n). Entraîné sur plus de 1 700 heures de données robotiques multi-embodiment et de vidéos humaines, le modèle compte 1,7 milliard de paramètres. Son architecture associe un backbone de modèle vision-langage et une tête d'action par flow-matching, étendue en aval en un "action expert" unifié qui dénoise simultanément actions latentes et actions robot. Sur LIBERO, RotVLA atteint 98,2 % de taux de succès ; sur RoboTwin2.0, il obtient 89,6 % en configuration propre et 88,5 % en configuration randomisée, surpassant les modèles VLA antérieurs dans les deux cas. Des expériences sur des tâches de manipulation réelle confirment ces résultats hors simulation. L'enjeu est architectural : les LAMs actuels, basés sur des pipelines VQ-VAE ou similaires, induisent une reconstruction de frames souvent triviale et n'imposent aucune contrainte géométrique cohérente avec la physique du mouvement. En modélisant les actions latentes comme des éléments de SO(n), RotVLA garantit continuité et compositionnalité absentes des espaces discrets, avec un triplet frame learning qui force une dynamique temporelle non dégénérée. Pour les équipes d'intégration robotique, cela ouvre la voie à un modèle de fondation plus robuste au sim-to-real, l'un des goulots d'étranglement centraux des VLAs en conditions industrielles. L'approche suggère que la structure géométrique de l'espace d'action peut compter autant que l'échelle des données d'entraînement. Le domaine des politiques robotiques généralistes a été structuré par Pi-0 (Physical Intelligence, 2024) et GR00T N2 (NVIDIA, 2025), qui misaient sur des corpus cross-embodiment massifs pour entraîner des politiques généralisables. RotVLA s'inscrit dans cette lignée mais parie sur une représentation latente géométriquement structurée plutôt que sur le volume brut de paramètres, avec 1,7B contre plusieurs dizaines de milliards pour les modèles concurrents les plus ambitieux. Les scores LIBERO et RoboTwin2.0 sont des benchmarks académiques standardisés ; leur transposition sur des cellules industrielles réelles (bras collaboratifs, tri et picking) reste à démontrer. Aucun partenaire de déploiement ni calendrier commercial ne figure dans la publication : RotVLA est, à ce stade, une contribution de recherche.

RechercheOpinion
1 source
FAN : normalisation d'action anticipative pour l'adaptation continue des modèles vision-langage-action
4arXiv cs.RO 

FAN : normalisation d'action anticipative pour l'adaptation continue des modèles vision-langage-action

Un article de recherche publié sur arXiv en septembre 2026 (arXiv:2609.21358, un preprint non encore relu par les pairs) s'attaque à un aspect négligé de l'adaptation continue des modèles Vision-Language-Action (VLA) : la normalisation des actions, c'est à dire le système de coordonnées dans lequel une politique perçoit et exécute ses mouvements. Les auteurs testent cinq stratégies de normalisation sur quatre flux de tâches robotiques réelles, en manipulation à bras unique et bimanuelle, et montrent que les protocoles existants provoquent des échecs récurrents : dérive des coordonnées d'une tâche à l'autre, couverture de mouvement insuffisante, ou décalage entre coordonnées d'entraînement et de test. Ils en tirent trois principes de conception, cohérence, couverture et causalité (3C), qui donnent naissance à FAN (Foresight Action Normalization), une méthode qui calcule une seule fois des statistiques de normalisation sur un petit jeu de calibration indépendant des tâches, puis les fige pour toute la durée de l'apprentissage continu qui suit. FAN obtient les meilleurs résultats sur l'ensemble des flux testés. Cette découverte concerne directement les acteurs qui déploient des politiques VLA généralistes, du type Pi-0, GR00T N2 ou Helix, sur des flottes de robots censées apprendre de nouvelles compétences sans oublier les précédentes. La plupart des travaux sur l'apprentissage continu en robotique misent sur le rejeu d'expérience ou le fine-tuning par renforcement, en traitant la normalisation des actions comme un simple détail d'ingénierie ; cet article montre qu'un choix mal calibré à ce niveau suffit à faire échouer l'adaptation continue, quel que soit l'algorithme d'apprentissage retenu. Pour les intégrateurs, le message est clair : avant d'empiler des techniques d'apprentissage sophistiquées, la représentation d'action sous-jacente doit rester stable d'une tâche à l'autre. Ce travail s'inscrit dans la vague des modèles VLA pré-entraînés sur de vastes jeux de données fermés puis adaptés à des robots et tâches spécifiques, une tendance portée par des laboratoires comme Physical Intelligence, NVIDIA ou Figure AI avec leurs politiques généralistes respectives. Contrairement à une annonce produit, il s'agit ici d'une contribution académique testée en laboratoire sur quatre flux de tâches, sans précision sur la plateforme robotique utilisée, la disponibilité du code ou un calendrier de reprise industrielle. FAN se présente comme une brique de base destinée à de futurs pipelines d'apprentissage continu, plutôt que comme un système prêt à déployer sur le terrain.

RecherchePaper
1 source