Aller au contenu principal
RecherchearXiv cs.RO 

FastOPD : distillation sur politique pour un déploiement léger des modèles VLA

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent FastOPD, un cadre de distillation « on-policy » qui transforme un grand modèle VLA (Vision-Language-Action) en élève compact, déployable sur un robot réel. La méthode adapte une flow map pour fournir au modèle élève une supervision à partir d'un seul état du modèle enseignant, puis la combine avec un objectif d'auto-cohérence afin que l'élève apprenne la dynamique de l'enseignant. Les auteurs affirment aussi démontrer théoriquement que l'élève distillé peut retrouver une distribution équivalente à celle d'un enseignant idéal à peu d'étapes. Sur le benchmark de simulation LIBERO, FastOPD conserve 84 % des performances de π0.5 avec seulement deux étapes d'inférence, ce qui réduit la latence de 78,1 % et dépasse les méthodes de distillation à peu d'étapes existantes sur le taux de succès moyen. Avec LingBot-VLA comme enseignant, l'approche gagne 15,9 points de pourcentage en succès à une seule étape par rapport à l'élève de base sur RoboTwin 2.0. Elle est aussi appliquée à un World Action Model (WAM), et un élève compact distillé de MolmoAct2 a été déployé sur un robot réel.

L'enjeu est le coût de calcul des VLA, qui croît avec la taille des modèles de fondation et complique leur exécution embarquée à fréquence de contrôle suffisante. Les solutions courantes consistent à concevoir des architectures plus petites ou à réduire les étapes de débruitage des politiques à flux. FastOPD vise une troisième voie : garder le modèle massif comme enseignant et distiller un élève léger. Le résultat est utile pour les intégrateurs, car il suggère qu'une partie de la capacité de généralisation peut être conservée sur du matériel moins coûteux. Il faut toutefois lire les chiffres avec prudence. Conserver 84 % des performances signifie perdre 16 % de succès, un écart qui peut compter en production, et LIBERO comme RoboTwin 2.0 sont des benchmarks simulés. La seule validation physique mentionnée est le déploiement sur un robot réel avec l'élève issu de MolmoAct2. Le résumé ne donne ni tâches, ni taux de succès, ni matériel, donc le fossé entre démonstration et réalité reste à mesurer.

Ce travail s'inscrit dans la course à l'efficacité des VLA, après la montée en échelle de modèles comme π0.5. Il compare ses résultats à des références de distillation à peu d'étapes, sans les nommer dans le résumé. Il teste aussi plusieurs enseignants (π0.5, LingBot-VLA, MolmoAct2 et un WAM), ce qui suggère une méthode relativement indépendante de l'architecture. Il s'agit d'une prépublication arXiv (v1), non évaluée par des pairs, et aucun produit ni calendrier de déploiement commercial n'est annoncé. Les prochaines étapes à surveiller sont la publication du code et des poids, des mesures de latence sur calculateurs embarqués, et des évaluations sur des tâches longues en conditions réelles, qui diront si la distillation tient hors des benchmarks.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Déploiement de modèles fondation pour la navigation robotique incarnée
1arXiv cs.RO 

Déploiement de modèles fondation pour la navigation robotique incarnée

Un article publié sur arXiv (2609.25666v1) détaille deux limites concrètes du déploiement de modèles de fondation (FM) sur des agents incarnés chargés de navigation : un biais d'entraînement qui dégrade la personnalisation dans des environnements inédits, et une longueur de contexte insuffisante qui pénalise les tâches à long horizon. Face au premier problème, les auteurs proposent TAP (Transit-Aware Planning), qui amorce le FM avec des données d'habitudes humaines extraites directement de la scène. Pour le second, ils introduisent MemCtrl, doté d'une "tête de mémoire" (memory head) qui gère activement le contexte plutôt que de le laisser s'accumuler passivement. Testé en conditions réelles dans un environnement de laboratoire avec un robot Turtlebot sur une tâche de recherche de cible personnalisée, TAP affiche une amélioration moyenne de 18% par rapport à une base sans cette méthode. MemCtrl, évalué sur plusieurs tâches incarnées, obtient un gain moyen de 6%, qui monte à 20% sur les sous-ensembles d'instructions longues, tout en consommant près de moitié moins de contexte que le modèle de référence. Ces résultats visent deux angles morts souvent minimisés dans les annonces de robots généralistes pilotés par des modèles vision-langage-action (VLA) : la personnalisation réelle une fois le robot sorti de son jeu de données d'entraînement, et le coût en contexte des tâches longues, qui limite la scalabilité en usage réel. Le fait que le gain de TAP soit mesuré sur un robot physique, et non sur des vidéos sélectionnées en simulation, constitue un signal utile pour les intégrateurs, même si l'échelle reste celle d'un laboratoire contrôlé et non d'un déploiement commercial. Diviser par deux le budget de contexte tout en améliorant la précision représente aussi un argument économique concret pour qui doit faire tourner ces modèles en inférence à grande échelle sur du matériel embarqué. Pour les décideurs B2B qui évaluent des piles VLA pour la logistique ou le service, le papier rappelle que le sim-to-real et le passage à l'échelle du contexte restent des problèmes ouverts, non résolus par la seule taille des modèles. Le travail s'inscrit dans un corpus déjà dense de recherches sur la navigation incarnée pilotée par des FM, que les auteurs organisent en une taxonomie pour situer leurs deux contributions par rapport à l'état de l'art. Il s'agit d'une publication de recherche académique, pas d'une annonce produit : elle défend une position argumentée sur la déployabilité réelle des agents incarnés fondés sur des FM et liste des pistes de recherche ouvertes plutôt qu'une feuille de route commerciale. Aucun partenariat industriel, aucun site de déploiement commercial ni aucun calendrier de mise sur le marché n'est mentionné ; les suites annoncées portent sur l'extension des tests à d'autres environnements et tâches à long horizon, pas sur un lancement produit.

RechercheActu
1 source
WAM-OPD : distillation on-policy pour les modèles d'action du monde
2arXiv cs.RO 

WAM-OPD : distillation on-policy pour les modèles d'action du monde

Des chercheurs publient WAM-OPD (arXiv:2608.22364v1), une méthode de post-entraînement pour les world action models (WAM), qui couplent prédiction vidéo du futur et génération d'actions robotiques. Une fois distillés pour accélérer l'inférence, ces modèles étudiants perdent des capacités et rencontrent des états mal couverts par les données hors ligne d'origine. WAM-OPD y répond par une distillation "on-policy" sans renforcement à récompense éparse : l'agent étudiant agit dans l'environnement, un enseignant figé annote ses historiques avec des cibles vidéo et action cohérentes, et la branche action s'entraîne sous son propre plan vidéo, comme au déploiement, via des adaptateurs légers et un régularisateur flow-matching. Sur le simulateur RoboTwin 2.0, le modèle Flash-WAM voit son taux de réussite passer de 0% à 58,3% sur HANDOVER MIC, et de 16,7% à 33,3% sur PUT OBJECT CABINET. Le résultat vise un compromis bien connu du secteur robotique : les modèles d'action pilotés par vidéo sont souvent trop lourds pour du contrôle temps réel, et leur compression classique dégrade la fiabilité. WAM-OPD montre qu'une supervision dense sur les trajectoires produites par l'étudiant en conditions réelles de déploiement peut restaurer une partie des compétences perdues, sans recourir à un apprentissage par renforcement coûteux. Pour les intégrateurs, c'est un signal à nuancer : les auteurs qualifient eux-mêmes leurs résultats de "preuve de capacité initiale", obtenue sur seulement deux tâches en simulation, loin d'une généralisation démontrée. Cette approche prolonge la lignée des modèles de monde vidéo appliqués à la robotique, où action et prédiction visuelle sont générées conjointement, une piste également suivie par des familles comme GR00T N2, Pi-0 ou Helix. Le défi reste constant : un enseignant volumineux doit être compressé pour tourner en boucle de contrôle rapide, au prix de compétences que la distillation classique ne restitue pas toujours. Seul le modèle ouvert Flash-WAM a été testé ici, sur le banc bimanuel RoboTwin 2.0, sans validation sur robot réel ni comparaison aux modèles commerciaux du marché. Les auteurs présentent ces résultats comme préliminaires et annoncent vouloir étendre l'évaluation avant toute conclusion sur la généralisation de la méthode.

RecherchePaper
1 source
Penser comme un modèle du monde, agir comme un VLA : distiller les représentations en politiques compactes
3arXiv cs.RO 

Penser comme un modèle du monde, agir comme un VLA : distiller les représentations en politiques compactes

Une équipe de recherche publie sur arXiv (référence 2609.24682) une méthode qui ajoute un terme d'alignement de représentations à l'entraînement classique des modèles Vision-Language-Action (VLA), ces réseaux qui associent perception et langage à des actions robotiques. Un world model figé est passé une seule fois sur les images d'entraînement, ses caractéristiques internes sont mises en cache, puis le modèle VLA « étudiant » apprend à s'aligner sur ce cache pendant l'entraînement. Le world model n'est jamais chargé lors du déploiement et le module de projection est jeté après l'entraînement, si bien que la politique finale reste identique au modèle VLA non distillé, tant en taille qu'en calcul. Résultat mesuré : un étudiant de 0,8 milliard de paramètres tourne en 32 millisecondes et consomme 1,86 Go de mémoire sur une carte grand public RTX 5090, atteint 97,9 % de réussite sur le benchmark de manipulation LIBERO, et progresse de 48,2 % à 50,5 % sur RoboCasa-GR1, un banc d'essai de manipulation humanoïde en simulation. Le gain se vérifie aussi sur du matériel réel, sur une plateforme à bras unique et sur une plateforme bimanuelle. L'intérêt pour l'industrie robotique tient à la séparation qu'établit ce travail entre deux familles de modèles jusque-là difficiles à concilier : les VLA, rapides mais dépourvus d'objectif qui tienne compte de la réaction du monde à une action, et les world models, physiquement mieux fondés mais trop lents pour piloter un robot en temps réel puisqu'ils doivent projeter le futur seconde par seconde. En montrant que la connaissance physique d'un world model peut être injectée dans une politique légère sans alourdir le calcul au moment de l'exécution, l'étude suggère qu'on peut améliorer la robustesse des VLA sans ajouter de données, de paramètres ni de calcul supplémentaire au déploiement, un point qui intéresse directement les intégrateurs contraints par la latence et la puissance embarquée. Ce résultat s'inscrit dans un débat actuel de la recherche en robotique entre approches VLA et approches par world models, sans qu'aucun partenaire industriel ni déploiement commercial ne soit mentionné à ce stade. La méthode a été testée en faisant varier la taille de l'étudiant, l'architecture de base, la couche d'alignement et le world model utilisé comme enseignant, un signal que l'effet observé relève d'un principe général plutôt que d'un couplage fragile entre deux réseaux précis. Les auteurs publient les détails sur une page projet dédiée, mais le travail reste à ce jour un résultat de recherche évalué en simulation et en laboratoire, sans calendrier annoncé vers une industrialisation.

RecherchePaper
1 source
WoVR : des modèles du monde comme simulateurs fiables pour l'entraînement post-déploiement des politiques VLA par renforcement
4arXiv cs.RO 

WoVR : des modèles du monde comme simulateurs fiables pour l'entraînement post-déploiement des politiques VLA par renforcement

Des chercheurs ont publié sur arXiv (référence 2602.13977v2) un framework nommé WoVR, conçu pour entraîner via du reinforcement learning (RL) des politiques de type Vision-Language-Action (VLA) sans recourir à des milliers d'heures d'interaction physique réelle. Le principe : substituer le robot réel par un modèle du monde appris, c'est-à-dire un modèle vidéo conditionné par les actions qui prédit le comportement de l'environnement. WoVR articule trois mécanismes distincts : un modèle vidéo action-conditionné à stabilité contrôlée, une stratégie baptisée Keyframe-Initialized Rollouts qui réinitialise les trajectoires imaginées à partir d'images-clés pour limiter l'accumulation d'erreurs sur l'horizon, et une co-évolution conjointe du modèle du monde et de la politique pour maintenir leur cohérence dans le temps. Les expériences rapportées montrent des gains sur le benchmark LIBERO et des améliorations mesurées sur plusieurs plateformes robotiques physiques. Ce travail s'attaque à un verrou central du post-entraînement des VLA : le RL promet d'aller au-delà de l'imitation learning, mais ses besoins en données d'interaction rendent son application directe sur robot physique quasi prohibitive. La contribution de WoVR est de montrer qu'un modèle du monde imparfait peut néanmoins servir de simulateur RL fiable, à condition de contrôler explicitement ses hallucinations plutôt que de les ignorer. C'est un signal positif pour la thèse que le sim-to-real, appliqué non au niveau du rendu physique mais au niveau de la prédiction vidéo apprise, peut débloquer l'optimisation de politiques à grande échelle. La nuance importante : les résultats sont publiés sous forme de papier de recherche, les démonstrations sont disponibles sur wovr-corl.github.io, mais aucun déploiement industriel n'est revendiqué. WoVR s'inscrit dans une vague de recherche qui cherche à reproduire pour la robotique ce que le RL a accompli pour les grands modèles de langage. Les VLA comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou OpenVLA ont montré des capacités impressionnantes en imitation, mais leur amélioration par RL reste un problème ouvert. D'autres approches concurrentes misent sur des simulateurs physiques classiques (Isaac Lab, MuJoCo) ou sur du RL directement en conditions réelles, avec des cycles de collecte longs et coûteux. WoVR propose une troisième voie via les world models vidéo, dans la lignée des travaux de type DIAMOND ou DreamerV3 appliqués à la robotique. La soumission cible CORL, conférence de référence du domaine, ce qui suggère une prochaine validation par les pairs et potentiellement une intégration dans les pipelines d'entraînement open-source des équipes académiques et industrielles dès 2026.

RechercheOpinion
1 source