Aller au contenu principal
LIRA : routage local d'informations inter-couches pour le décodage des modèles vision-langage-action
RecherchearXiv cs.RO 

LIRA : routage local d'informations inter-couches pour le décodage des modèles vision-langage-action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent LIRA (Local cross-layer Information Routing for Action decoding), un nouveau mécanisme de connexion entre les modèles vision-langage (VLM) preentraines et les décodeurs d'action robotique au sein des architectures Vision-Language-Action (VLA), décrit dans un article publie sur arXiv en aout 2026 (arXiv:2608.07596v1). Le problème cible: les interfaces existantes n'exploitent qu'une partie restreinte de la hiérarchie de représentations du VLM, ou associent rigidement chaque bloc du décodeur a une seule couche du VLM, limitant l'accès a des indices de tache complémentaires selon la profondeur du réseau. LIRA travaille sur des features de task-tokens et des "LIRA Query features" extraites d'états intermédiaires du VLM, puis attribue a chaque Parallel Fusion Block une fenêtre locale centrée sur la couche VLM correspondante, sans modifier le backbone, le décodeur ni la recette d'entrainement. Teste sur les benchmarks LIBERO, LIBERO-Plus, CALVIN ABC vers D et sur des taches de manipulation réelle, LIRA surpasse la baseline VLA-Adapter a configuration identique de 0,5 milliard de paramètres, avec un gain de 18,9 points en transfert zero-shot sur LIBERO-Plus, ou le taux de succès moyen passe de 59,1% a 78,0%.

Ce résultat cible un maillon jusque-la peu étudie des architectures VLA, l'interface de routage entre VLM et décodeur d'action, souvent traitée comme un détail d'implémentation face aux choix de backbone ou de données d'entrainement. En montrant qu'un routage plus fin de l'information, sans toucher au reste du pipeline, améliore nettement la robustesse aux changements de distribution, l'étude suggère que la généralisation des modèles VLA ne dépend pas seulement de leur taille ou du volume de données, mais aussi de la circulation de l'information entre couches. Pour les équipes qui construisent des politiques robotiques sur des VLM preentraines, ce travail pointe une optimisation peu couteuse, sans collecte de données supplémentaire ni refonte d'architecture, un argument utile pour fiabiliser des politiques VLA sur du matériel a calcul embarque limite.

L'article s'inscrit dans la lignée des travaux récents sur les modèles VLA, popularises par des systèmes comme Pi-0 ou OpenVLA, qui transforment des représentations de VLM preentraines en commandes motrices pour bras manipulateurs ou robots mobiles. LIRA est positionne comme une amélioration directe de VLA-Adapter, pris comme référence de comparaison plutôt que concurrent indépendant. L'évaluation combine bancs d'essai en simulation, LIBERO, LIBERO-Plus et CALVIN en transfert ABC vers D, et manipulation réelle, une combinaison classique pour distinguer performance en distribution et robustesse hors distribution. L'article ne mentionne ni calendrier de publication de code ni partenariat industriel: il s'agit pour l'instant d'une contribution académique.

À lire aussi

RotVLA : action latente de rotation pour les modèles vision-langage-action (VLA)
1arXiv cs.RO 

RotVLA : action latente de rotation pour les modèles vision-langage-action (VLA)

Un groupe de chercheurs a publié en mai 2026 RotVLA (arXiv:2605.13403), un framework Vision-Language-Action (VLA) qui substitue la quantification discrète des modèles d'action latente (LAM) existants par une représentation continue dans l'espace de rotation SO(n). Entraîné sur plus de 1 700 heures de données robotiques multi-embodiment et de vidéos humaines, le modèle compte 1,7 milliard de paramètres. Son architecture associe un backbone de modèle vision-langage et une tête d'action par flow-matching, étendue en aval en un "action expert" unifié qui dénoise simultanément actions latentes et actions robot. Sur LIBERO, RotVLA atteint 98,2 % de taux de succès ; sur RoboTwin2.0, il obtient 89,6 % en configuration propre et 88,5 % en configuration randomisée, surpassant les modèles VLA antérieurs dans les deux cas. Des expériences sur des tâches de manipulation réelle confirment ces résultats hors simulation. L'enjeu est architectural : les LAMs actuels, basés sur des pipelines VQ-VAE ou similaires, induisent une reconstruction de frames souvent triviale et n'imposent aucune contrainte géométrique cohérente avec la physique du mouvement. En modélisant les actions latentes comme des éléments de SO(n), RotVLA garantit continuité et compositionnalité absentes des espaces discrets, avec un triplet frame learning qui force une dynamique temporelle non dégénérée. Pour les équipes d'intégration robotique, cela ouvre la voie à un modèle de fondation plus robuste au sim-to-real, l'un des goulots d'étranglement centraux des VLAs en conditions industrielles. L'approche suggère que la structure géométrique de l'espace d'action peut compter autant que l'échelle des données d'entraînement. Le domaine des politiques robotiques généralistes a été structuré par Pi-0 (Physical Intelligence, 2024) et GR00T N2 (NVIDIA, 2025), qui misaient sur des corpus cross-embodiment massifs pour entraîner des politiques généralisables. RotVLA s'inscrit dans cette lignée mais parie sur une représentation latente géométriquement structurée plutôt que sur le volume brut de paramètres, avec 1,7B contre plusieurs dizaines de milliards pour les modèles concurrents les plus ambitieux. Les scores LIBERO et RoboTwin2.0 sont des benchmarks académiques standardisés ; leur transposition sur des cellules industrielles réelles (bras collaboratifs, tri et picking) reste à démontrer. Aucun partenaire de déploiement ni calendrier commercial ne figure dans la publication : RotVLA est, à ce stade, une contribution de recherche.

RechercheOpinion
1 source
LARA : alignement des représentations d'actions latentes pour les modèles vision-langage-action
2arXiv cs.RO 

LARA : alignement des représentations d'actions latentes pour les modèles vision-langage-action

Une équipe de recherche propose LARA (Latent Action Representation Alignment), un framework qui entraîne conjointement deux composants jusqu'ici séparés dans les modèles vision-langage-action (VLA) : le modèle d'action latente (LAM), qui apprend des représentations d'actions à partir de vidéos non annotées, et le modèle VLA lui-même. Jusqu'à présent, ces deux briques étaient optimisées indépendamment, ce qui limitait leurs bénéfices mutuels : le LAM restait déconnecté du contexte robotique réel, et le VLA était contraint par des représentations figées, sans possibilité d'ajustement. LARA aligne les deux via un mécanisme de représentation partagée, permettant au LAM d'apprendre à partir de trajectoires d'actions réelles pour éviter de capter de simples changements visuels sans pertinence (comme un déplacement de caméra), tandis que le VLA est régularisé par la dynamique prédictive du LAM pour réduire les hallucinations de trajectoires inefficaces. Les auteurs rapportent des gains moyens d'environ 10% en pré-entraînement, 5% en amélioration post-entraînement de modèles VLA déjà entraînés, et 15% en affinage du LAM seul, mesurés sur trois benchmarks de manipulation en simulation et un benchmark réel conçu spécifiquement pour l'évaluation. L'enjeu pour le secteur est la dépendance chronique des VLA à des jeux de données robotiques réels, coûteux et rares à grande échelle. Exploiter des vidéos humaines non étiquetées comme source de supervision, sans perdre en fiabilité, est une piste suivie par plusieurs laboratoires travaillant sur des modèles comme GR00T N2 ou Pi-0. Ce que suggère LARA, c'est que le goulot d'étranglement n'est pas seulement la quantité de données vidéo disponibles, mais la façon dont les représentations d'action apprises restent ou non ancrées dans la réalité physique du robot pendant l'entraînement conjoint. L'approche s'inscrit dans la lignée des travaux sur les Latent Action Models, qui cherchent depuis plusieurs années à combler l'écart entre l'abondance de vidéos web et la rareté des démonstrations robotiques annotées. Contrairement à une annonce produit, il s'agit ici d'un travail académique (version 2 d'un article déposé sur arXiv), sans déploiement industriel annoncé ni calendrier de commercialisation ; sa portée dépendra de sa reproductibilité et de son adoption par les équipes développant des VLA en conditions réelles.

RecherchePaper
1 source
Agir avec intention : distiller l'intention comportementale pour les modèles vision-langage-action
3arXiv cs.RO 

Agir avec intention : distiller l'intention comportementale pour les modèles vision-langage-action

Publié le 25 août 2026 sur arXiv (référence 2608.23478), un article de recherche présente INDI (Intention Distillation), une méthode d'entraînement pour les décodeurs d'action des modèles Vision-Language-Action (VLA) en robotique, dominés aujourd'hui par le clonage de comportement, qui indique la commande démontrée sans expliciter l'objectif poursuivi. Pendant l'entraînement, un VLM enseignant figé interprète chaque segment démontré à partir de l'observation, de l'instruction, d'un résumé d'action et de la vidéo d'exécution ; le VLA déployé récupère cette représentation d'intention à une couche intermédiaire du décodeur. Sur le benchmark SimplerEnv-Bridge, le modèle GR00T-N1.7 passe de 64,3 % à 84,7 % de réussite ; sur RoboCasa Kitchen, sa baseline progresse de 64,1 % à 70,3 %, avec des gains similaires relevés sur Pi-0.5. En conditions réelles, le taux de réussite moyen grimpe de 62,0 % à 68,7 %, avec un bond de jusqu'à 12 points de pourcentage sur les tâches à horizon long. Ces résultats visent une limite structurelle connue du clonage de comportement, qui capture le geste démontré mais pas la raison d'être du comportement, ce qui dégrade la généralisation sur les tâches longues ou multi-étapes. Le fait que les gains les plus marqués apparaissent justement sur ces tâches à horizon long est significatif pour les intégrateurs, car c'est là que les pipelines VLA actuels échouent le plus souvent hors démonstration scénarisée. La méthode ne requiert ni capteur ni collecte de données additionnelle : elle exploite des signaux déjà disponibles via un VLM enseignant utilisé seulement à l'entraînement, sans surcoût d'inférence au déploiement, et reste transposable à d'autres architectures VLA. Le travail prolonge des approches qui enrichissaient le clonage de comportement avec des frames futures, des observations latentes ou des trajectoires, jugées insuffisantes car elles captent une réalisation du futur, non l'objectif sémantique partagé du comportement. INDI est testé sur des modèles VLA de référence déjà largement utilisés, GR00T-N1.7 et Pi-0.5, ce qui en fait une couche d'entraînement complémentaire plutôt qu'un modèle concurrent. La publication reste à ce stade un article arXiv sans revue par les pairs formelle ni annonce de déploiement industriel ; la communauté robotique attend désormais une reproduction indépendante des résultats et une extension à d'autres familles de VLA.

RechercheActu
1 source
CounterAlign : supervision contrefactuelle pour les modèles vision-langage-action
4arXiv cs.RO 

CounterAlign : supervision contrefactuelle pour les modèles vision-langage-action

Publié le 25 août 2026 sur arXiv sous la référence 2608.21740, l'article intitulé "CounterAlign: Counterfactual Supervision for Vision-Language-Action Models" propose une nouvelle méthode d'entraînement pour les modèles vision-langage-action (VLA), la brique logicielle qui traduit instructions textuelles et images en commandes motrices pour les robots. Le constat de départ est que l'apprentissage par clonage comportemental (behavior cloning), standard du secteur, n'expose le modèle qu'à des démonstrations d'expert réussies, sans jamais lui montrer quelles actions seraient incorrectes ou hors instruction. Les auteurs contournent le coût de collecte de trajectoires négatives ou de récompenses annotées en générant des tuples contrefactuels: chaque action d'expert est associée à une instruction différente et volontairement incompatible, puis un discriminateur adversarial apprend à partir de ces paires un modèle de récompense ancré dans l'instruction, utilisable pour du RL hors ligne, sans rollouts ni annotations supplémentaires. Testée sur le benchmark LIBERO-PRO, conçu pour mesurer la robustesse face aux changements de position d'objets et de tâches, la méthode améliore les performances par rapport à une référence récente jugée état de l'art. Des essais sur robot réel, menés sur la plateforme TX-G2 compatible AGIBot G2, confirment l'avantage face à d'autres approches concurrentes, sans que l'article ne publie de chiffres précis de taux de réussite. L'enjeu dépasse le simple gain de benchmark: il touche au goulot d'étranglement central de l'apprentissage VLA, la rareté des données négatives ou des récompenses annotées, coûteuses à produire en robotique réelle. En montrant qu'une supervision plus dense peut être extraite des démonstrations déjà collectées plutôt que d'exiger une collecte additionnelle, les auteurs offrent une piste concrète aux équipes qui entraînent des modèles VLA à grande échelle, dans la lignée de Pi-0 chez Physical Intelligence, GR00T N2 chez Nvidia ou Helix chez Figure. La méthode s'attaque à un défaut connu des politiques entraînées par simple clonage: leur fragilité face à de petites perturbations, comme un objet déplacé, un écart fréquemment cité entre démonstrations filmées et comportement réel sur le terrain. Il s'agit néanmoins d'un résultat de recherche en préprint, validé sur un benchmark et un nombre limité d'essais réels, et non d'un produit déployé en production. Le clonage comportemental s'est imposé comme paradigme dominant à mesure que les VLA passaient à l'échelle, mais ses limites en matière de supervision négative sont documentées depuis plusieurs années, tandis que le renforcement classique bute sur le coût de l'ingénierie de récompense ou de la collecte de données non expertes. CounterAlign s'inscrit dans une famille de techniques d'alignement par modélisation de récompense et discrimination adversariale, proches par l'esprit des méthodes de RLHF développées pour les grands modèles de langage, mais adaptées ici aux contraintes de la robotique physique. Le résumé ne détaille ni les baselines concurrentes précises ni de calendrier de déploiement industriel, et aucun acteur français ou européen n'apparaît dans les expériences décrites. La suite logique, non confirmée par les auteurs, serait une extension à davantage de plateformes robotiques et une comparaison plus large face aux modèles VLA commercialisés.

RechercheActu
1 source