Aller au contenu principal
RecherchearXiv cs.RO 

DriftOPD : distillation à divergence KL inverse au niveau séquence pour politiques VLA en une seule étape

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.00317) DriftOPD, un cadre de distillation « on-policy » au niveau séquence, destiné aux experts d'action continus des modèles Vision-Language-Action (VLA). Ces experts d'action produisent de courts segments d'actions (« action chunks ») exécutés en commande à horizon glissant. L'entraînement par segment, pratique d'une morphologie de robot à l'autre, optimise la vraisemblance locale des actions sans tenir compte du succès de la tâche sur la durée. DriftOPD ne nécessite ni modèle enseignant séparé, ni déploiement de la politique (« rollout ») en boucle fermée. Les auteurs montrent que la divergence de Kullback-Leibler inverse au niveau séquence se décompose en deux termes : une KL inverse par segment et un terme de « potentiel futur » qui mesure l'effet à long terme de l'action courante. Le premier est optimisé par un objectif de « drifting » à une étape. Le second l'est par un critique Q appris à partir de démonstrations hors ligne. Le résultat est un expert d'action qui génère ses actions en une seule étape. Testé sur plusieurs architectures VLA, en simulation et en manipulation réelle, DriftOPD surpasse généralement les méthodes de distillation à une étape existantes. Il atteint un taux de succès comparable à celui des politiques enseignantes multi-étapes. Le résumé ne donne ni chiffres de succès, ni robots, ni architectures précis.

L'enjeu est de lever un compromis qui pèse sur les politiques VLA. Les experts d'action de type diffusion ou flow-matching donnent de bons résultats mais demandent plusieurs étapes d'inférence, d'où une latence gênante pour le contrôle réactif. Les distiller en une étape accélère l'exécution, mais au prix d'une perte de qualité. Le gain annoncé tient à ce que le comportement à long terme est transféré sans interaction en ligne. Or l'apprentissage par renforcement sur robot réel coûte cher en temps machine, en supervision humaine et en risque de casse. Si les résultats se confirment, un intégrateur pourrait affiner une politique à partir de ses seules démonstrations existantes, sans campagne de collecte supplémentaire. Il faut rester prudent : il s'agit d'un préprint non évalué par des pairs, et seules les tables complètes (tâches, nombre d'essais, variance, latences mesurées) permettront de juger si « comparable à l'enseignant » vaut aussi pour des tâches longues et peu tolérantes aux erreurs.

Ce travail s'inscrit dans la course à l'efficacité d'inférence des VLA. Pi-0 de Physical Intelligence, GR00T de NVIDIA et les systèmes à double architecture comme Helix de Figure reposent sur des têtes d'action génératives. La distillation en une étape, les modèles de cohérence et les approches inspirées du « drifting » visent à réduire leur coût de calcul. En parallèle, des méthodes d'apprentissage par renforcement post-entraînement cherchent à optimiser le succès de tâche, mais exigent des déploiements réels. DriftOPD se place entre ces deux familles : il reprend l'objectif de séquence de la seconde avec le coût hors ligne de la première. Les prochaines étapes à surveiller sont la publication du code et des résultats détaillés, ainsi que la reproduction par d'autres laboratoires sur des plateformes et tâches variées. La mesure de la latence de bout en bout sur matériel embarqué sera aussi déterminante.

À lire aussi

1arXiv cs.RO 

Kinematic MeanFlow : une politique de génération d'actions en une seule étape pour les modèles fondation en robotique

Des chercheurs affiliés à Intel Chine proposent Kinematic MeanFlow (K-MF), une politique de génération d'actions en une seule étape pour les modèles de fondation robotiques (RFM), publiée sur arXiv (2610.00864v1). L'objectif est de supprimer la latence d'inférence du flow matching multi-étapes, qui impose plusieurs passes de débruitage dans la tête d'action. Les auteurs constatent d'abord qu'une application directe de MeanFlow, cadre censé permettre la génération en un pas, fait s'effondrer les performances. Ils l'attribuent à deux dynamiques propres au champ de vitesse des RFM : l'« accélération locale » reste stable au début du débruitage puis grimpe brutalement vers la fin, et la dispersion des amplitudes entre échantillons s'élargit à mesure que le débruitage avance. K-MF repose sur une identité cinématique. Il scinde le terme de dérivée temporelle de MeanFlow en deux termes sur des sous-intervalles, séparés par un point intermédiaire. Chaque terme capte la dynamique du début ou de la fin du débruitage, ce qui limite l'amplification des erreurs. Sur GR00T-N1.6, la latence de la tête d'action baisse de 67,5 % à 74,4 % selon les configurations (GPU L40 et Jetson Orin, modes eager et compilé). La latence de bout en bout baisse de 30,3 % à 54,9 %. Le code sera publié sur GitHub (IntelChina-AI/K-MF). L'enjeu est très concret pour les intégrateurs et les équipes embarquées. Les politiques VLA basées sur la diffusion ou le flow matching, comme GR00T ou Pi-0, paient un coût d'inférence multiplié par le nombre d'étapes, ce qui limite la fréquence de contrôle, surtout sur du matériel embarqué de classe Jetson Orin. Le gain de bout en bout reste nettement inférieur au gain sur la tête d'action : le reste du modèle (encodeur visuel, backbone langage) devient alors le goulot d'étranglement. Les auteurs affirment aussi que K-MF fonctionne en entraînement from scratch comme en fine-tuning, et dépasse le flow matching multi-étapes « dans la plupart des cas ». Cette formulation appelle à la prudence. Il s'agit d'une préimpression non relue par des pairs, et le résumé ne donne ni taux de réussite précis, ni liste de tâches, ni validation sur robot physique. Aucun déploiement industriel n'est annoncé. Le travail s'inscrit dans une course à la réduction de la latence des politiques génératives. MeanFlow a émergé comme alternative aux approches par distillation ou par consistance, et la distillation en une étape ou les têtes d'action plus légères restent les principales pistes concurrentes. Le choix de GR00T-N1.6 de NVIDIA comme banc d'essai et des plateformes L40 et Jetson Orin reflète la réalité du déploiement actuel des humanoïdes, où la puissance de calcul embarquée est contrainte. L'implication d'Intel Chine laisse penser que l'optimisation de l'inférence en périphérie est un axe stratégique pour le fabricant. La suite dépendra de la publication du code, qui permettra à la communauté de reproduire les résultats, de les tester sur d'autres architectures VLA et de vérifier si l'accélération se maintient sur des tâches réelles de manipulation fine.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
IMLE-VLA : génération d'actions en une seule étape pour les modèles vision-langage-action
2arXiv cs.RO 

IMLE-VLA : génération d'actions en une seule étape pour les modèles vision-langage-action

Publié sur arXiv (2609.10915), IMLE-VLA remplace la tête d'action itérative des politiques vision-langage-action (VLA) par un générateur en une seule étape, entraîné via l'estimation conditionnelle du maximum de vraisemblance implicite (cIMLE). Appliqué au modèle π0.5, il fait passer la fréquence d'inférence de 15 Hz à 55 Hz, soit un facteur 3,67, et jusqu'à 11 fois le débit d'action. Sur le benchmark LIBERO, qui couvre 40 tâches, IMLE-VLA atteint 98,0% de réussite moyenne, le meilleur score et la plus haute fréquence d'inférence parmi les méthodes comparées. Sous les perturbations du test LIBERO-plus, il conserve la robustesse de π0.5 alors que les autres approches se dégradent nettement. Sur un bras Franka Emika Panda, quatre tâches en conditions réelles montrent un jerk réduit de 2,2 à 3,0 fois et un temps d'inférence par épisode divisé par 3,9 à 6,6 par rapport à π0.5 seul. Le problème visé est bien identifié dans le secteur: les têtes d'action entraînées par diffusion ou flow matching, comme celle de π0.5, exigent un échantillonnage multi-étapes (jusqu'à 10 pas d'Euler), ce qui produit un mouvement saccadé du robot et ralentit l'exécution des tâches. Pour les intégrateurs et équipes robotique qui déploient des bras ou des humanoïdes pilotés par des modèles de fondation, la latence d'inférence conditionne directement la fluidité et la sécurité du contrôle en temps réel. En montrant qu'un générateur à étape unique peut couvrir la multimodalité de l'action sans tomber dans l'effondrement de mode des têtes de régression classiques, IMLE-VLA remet en cause l'idée reçue selon laquelle l'échantillonnage itératif serait indispensable pour préserver la généralisation des politiques VLA à grande échelle. Ce travail s'inscrit dans la lignée des VLA construits sur des backbones vision-langage préentraînés, avec π0.5 comme base de comparaison. Il s'agit d'une contribution académique et non d'un produit commercial: code et vidéos de démonstration sont publiés sur le site du projet à des fins de reproductibilité, sans annonce de déploiement industriel ni de pilote client. Présentée comme générique, la méthode cIMLE pourrait en principe s'appliquer à d'autres têtes d'action par diffusion ou flow matching utilisées ailleurs dans le secteur, ce qui ouvre la voie à des tests sur d'autres politiques VLA et d'autres plateformes robotiques, au-delà du seul bras Franka Emika Panda utilisé pour cette validation.

RechercheActu
1 source
Adaptateur de réseau de neurones inversible pour la correspondance de flux en une étape dans la manipulation robotique
3arXiv cs.RO 

Adaptateur de réseau de neurones inversible pour la correspondance de flux en une étape dans la manipulation robotique

Des chercheurs ont soumis fin juin 2026 sur arXiv (2606.19194) un adaptateur neuronal invertible pour la manipulation robotique dextère. La méthode repose sur un flow matching contraint dans un espace latent invertible, ce qui ramène la génération d'actions à une seule passe d'inférence, contre de multiples étapes pour les politiques de flow matching itératif classiques. Conditionné sur des entrées visuelles, linguistiques et proprioceptives, l'adaptateur réduit la latence moyenne des modèles VLA de 110 ms à 61 ms, soit un gain de 44 %, sans dégradation mesurée de la précision sur les benchmarks de manipulation testés. Cette réduction n'est pas marginale : à 110 ms par cycle, un VLA plafonne à moins de 10 Hz, fréquence insuffisante pour les tâches de manipulation en boucle fermée nécessitant une haute réactivité. Descendre à 61 ms rapproche ces modèles de conditions d'utilisation industrielle réelle, notamment pour des effecteurs devant s'adapter à une variabilité de pièces ou de positions. Point distinctif de l'approche : elle préserve la stabilité de la prédiction d'actions là où les méthodes de distillation one-step existantes, comme les consistency models ou certaines variantes DDIM, introduisent généralement une dégradation de précision. Les résultats sur benchmarks de simulation se situent à parité ou au-dessus de l'état de l'art sur un large éventail de tâches. Le flow matching s'est imposé en robotique embarquée via des modèles comme Pi-0 de Physical Intelligence et GR00T N2 de NVIDIA, qui ont démontré que la latence itérative restait un goulot d'étranglement à l'inférence. Le problème du passage à une seule étape est documenté depuis les travaux sur Consistency Policy ; l'approche proposée ici le contourne par l'invertibilité de l'espace latent plutôt que par distillation directe. Il convient de noter que l'article est un preprint non relu par les pairs et que les conditions des expériences réelles (type de robot, nature des tâches, variabilité de scènes) ne figurent pas dans l'abstract disponible, ce qui limite la portée des conclusions. Une validation sur des architectures VLA open-source telles qu'OpenVLA ou Octo constituerait la suite logique pour la communauté.

RechercheOpinion
1 source
4arXiv cs.RO 

Diviser pour mémoriser : une mémoire récursive centrée sur l'action pour les politiques VLA à long horizon

Des chercheurs proposent Divide-and-Remember (D&R), une méthode de mémoire récursive pour les politiques VLA (vision-language-action) appliquées à la manipulation de longue durée. Le papier, publié sur arXiv (2610.00982), s'attaque aux tâches dites dépendantes de l'historique, où l'observation courante ne suffit pas à déterminer l'action. D&R apprend une fonction de mémoire mt = M(ht) en s'appuyant sur une sélection récursive : la sélection sur l'historique complet est découpée en sous-problèmes de type top-K sur 2K tokens. Des sélecteurs légers, de taille fixe et entraînés de bout en bout, peuvent ainsi gérer un historique non borné. Tous les blocs de récursion partagent un unique sélecteur, ce qui limite le coût de calcul. Sur RoboMME, un benchmark de 16 tâches de manipulation longue qui exigent de se souvenir du quand, du où, du quoi et du comment agir, D&R atteint le meilleur taux de succès moyen publié, avec des gains constants sur les quatre suites, pour un budget de seulement 64 tokens de mémoire. Les auteurs affirment que des essais sur robot réel confirment le gain, sans en donner les chiffres dans le résumé. Le code et les checkpoints sont publiés. L'enjeu dépasse le seul score de benchmark. Les VLA actuels restent largement réactifs : ils se débrouillent quand la scène contient l'information utile, mais échouent dès qu'il faut se rappeler quel objet a été déplacé, quelle étape est déjà faite ou où un élément a disparu. Ces cas sont fréquents en logistique, en assemblage et en tâches de service. Les méthodes existantes de mémoire reposent sur des heuristiques fixées à la conception, comme conserver les images à forte variation de pixels, et donnent des résultats irréguliers selon les tâches. Le papier les remplace par un critère théorique : la mémoire optimale maximise l'information mutuelle conditionnelle entre l'action et la mémoire, sachant l'observation courante. Autrement dit, elle ne garde que ce qui, dans le passé, est utile à l'action et absent de la vue présente. Pour un intégrateur, le point clé est le budget : 64 tokens, c'est une mémoire compatible avec une inférence embarquée, là où allonger le contexte fait exploser latence et coût. Il faut toutefois rester prudent : RoboMME est un benchmark principalement simulé, et la validation sur robot réel n'est détaillée que dans le papier complet. Il s'agit d'un résultat de recherche, pas d'un produit déployé. Ce travail s'inscrit dans la montée en puissance des VLA généralistes, comme Pi-0 ou GR00T, qui traitent surtout une observation courte ou quelques images récentes. La mémoire à long horizon est identifiée comme un point faible de ces architectures, et plusieurs équipes explorent la compression du contexte, la mémoire par mots-clés ou les représentations récurrentes. D&R se distingue par sa formulation en problème d'optimisation, issue du cadre POMDP de l'apprentissage par imitation. Les prochaines étapes à surveiller sont la reproduction des résultats sur d'autres benchmarks, les chiffres détaillés sur robot réel et l'intégration dans des modèles de fondation de grande taille.

RecherchePaper
1 source