Aller au contenu principal
RecherchearXiv cs.RO 

Kinematic MeanFlow : une politique de génération d'actions en une seule étape pour les modèles fondation en robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs affiliés à Intel Chine proposent Kinematic MeanFlow (K-MF), une politique de génération d'actions en une seule étape pour les modèles de fondation robotiques (RFM), publiée sur arXiv (2610.00864v1). L'objectif est de supprimer la latence d'inférence du flow matching multi-étapes, qui impose plusieurs passes de débruitage dans la tête d'action. Les auteurs constatent d'abord qu'une application directe de MeanFlow, cadre censé permettre la génération en un pas, fait s'effondrer les performances. Ils l'attribuent à deux dynamiques propres au champ de vitesse des RFM : l'« accélération locale » reste stable au début du débruitage puis grimpe brutalement vers la fin, et la dispersion des amplitudes entre échantillons s'élargit à mesure que le débruitage avance. K-MF repose sur une identité cinématique. Il scinde le terme de dérivée temporelle de MeanFlow en deux termes sur des sous-intervalles, séparés par un point intermédiaire. Chaque terme capte la dynamique du début ou de la fin du débruitage, ce qui limite l'amplification des erreurs. Sur GR00T-N1.6, la latence de la tête d'action baisse de 67,5 % à 74,4 % selon les configurations (GPU L40 et Jetson Orin, modes eager et compilé). La latence de bout en bout baisse de 30,3 % à 54,9 %. Le code sera publié sur GitHub (IntelChina-AI/K-MF).

L'enjeu est très concret pour les intégrateurs et les équipes embarquées. Les politiques VLA basées sur la diffusion ou le flow matching, comme GR00T ou Pi-0, paient un coût d'inférence multiplié par le nombre d'étapes, ce qui limite la fréquence de contrôle, surtout sur du matériel embarqué de classe Jetson Orin. Le gain de bout en bout reste nettement inférieur au gain sur la tête d'action : le reste du modèle (encodeur visuel, backbone langage) devient alors le goulot d'étranglement. Les auteurs affirment aussi que K-MF fonctionne en entraînement from scratch comme en fine-tuning, et dépasse le flow matching multi-étapes « dans la plupart des cas ». Cette formulation appelle à la prudence. Il s'agit d'une préimpression non relue par des pairs, et le résumé ne donne ni taux de réussite précis, ni liste de tâches, ni validation sur robot physique. Aucun déploiement industriel n'est annoncé.

Le travail s'inscrit dans une course à la réduction de la latence des politiques génératives. MeanFlow a émergé comme alternative aux approches par distillation ou par consistance, et la distillation en une étape ou les têtes d'action plus légères restent les principales pistes concurrentes. Le choix de GR00T-N1.6 de NVIDIA comme banc d'essai et des plateformes L40 et Jetson Orin reflète la réalité du déploiement actuel des humanoïdes, où la puissance de calcul embarquée est contrainte. L'implication d'Intel Chine laisse penser que l'optimisation de l'inférence en périphérie est un axe stratégique pour le fabricant. La suite dépendra de la publication du code, qui permettra à la communauté de reproduire les résultats, de les tester sur d'autres architectures VLA et de vérifier si l'accélération se maintient sur des tâches réelles de manipulation fine.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

IMLE-VLA : génération d'actions en une seule étape pour les modèles vision-langage-action
1arXiv cs.RO 

IMLE-VLA : génération d'actions en une seule étape pour les modèles vision-langage-action

Publié sur arXiv (2609.10915), IMLE-VLA remplace la tête d'action itérative des politiques vision-langage-action (VLA) par un générateur en une seule étape, entraîné via l'estimation conditionnelle du maximum de vraisemblance implicite (cIMLE). Appliqué au modèle π0.5, il fait passer la fréquence d'inférence de 15 Hz à 55 Hz, soit un facteur 3,67, et jusqu'à 11 fois le débit d'action. Sur le benchmark LIBERO, qui couvre 40 tâches, IMLE-VLA atteint 98,0% de réussite moyenne, le meilleur score et la plus haute fréquence d'inférence parmi les méthodes comparées. Sous les perturbations du test LIBERO-plus, il conserve la robustesse de π0.5 alors que les autres approches se dégradent nettement. Sur un bras Franka Emika Panda, quatre tâches en conditions réelles montrent un jerk réduit de 2,2 à 3,0 fois et un temps d'inférence par épisode divisé par 3,9 à 6,6 par rapport à π0.5 seul. Le problème visé est bien identifié dans le secteur: les têtes d'action entraînées par diffusion ou flow matching, comme celle de π0.5, exigent un échantillonnage multi-étapes (jusqu'à 10 pas d'Euler), ce qui produit un mouvement saccadé du robot et ralentit l'exécution des tâches. Pour les intégrateurs et équipes robotique qui déploient des bras ou des humanoïdes pilotés par des modèles de fondation, la latence d'inférence conditionne directement la fluidité et la sécurité du contrôle en temps réel. En montrant qu'un générateur à étape unique peut couvrir la multimodalité de l'action sans tomber dans l'effondrement de mode des têtes de régression classiques, IMLE-VLA remet en cause l'idée reçue selon laquelle l'échantillonnage itératif serait indispensable pour préserver la généralisation des politiques VLA à grande échelle. Ce travail s'inscrit dans la lignée des VLA construits sur des backbones vision-langage préentraînés, avec π0.5 comme base de comparaison. Il s'agit d'une contribution académique et non d'un produit commercial: code et vidéos de démonstration sont publiés sur le site du projet à des fins de reproductibilité, sans annonce de déploiement industriel ni de pilote client. Présentée comme générique, la méthode cIMLE pourrait en principe s'appliquer à d'autres têtes d'action par diffusion ou flow matching utilisées ailleurs dans le secteur, ce qui ouvre la voie à des tests sur d'autres politiques VLA et d'autres plateformes robotiques, au-delà du seul bras Franka Emika Panda utilisé pour cette validation.

RechercheActu
1 source
OGPO : optimisation de politique générative en une étape pour le contrôle de robots en temps réel
2arXiv cs.RO 

OGPO : optimisation de politique générative en une étape pour le contrôle de robots en temps réel

Des chercheurs publient OGPO (One-Step Generative Policy Optimization), un cadre d'apprentissage pour le contrôle robotique en temps réel, dont la version 2 vient d'être diffusée sur arXiv (2601.20701). Il vise un problème précis : les politiques de contrôle fondées sur la diffusion ou le flow matching génèrent les actions en plusieurs étapes d'échantillonnage, ce qui limite leur usage dès que la latence compte. Réduire ce nombre d'étapes à un seul dégrade d'ordinaire la qualité de représentation et la performance sur la tâche. Les auteurs décrivent un compromis à trois pôles entre vitesse, fidélité et performance. OGPO associe une architecture légère au principe d'« interval velocity » pour une inférence en une étape sans distillation, tandis qu'une technique de « représentation spreading » évite la dégradation des représentations. Une phase d'apprentissage par renforcement (RL) on-policy affine ensuite cette politique rapide et stable. Sur les benchmarks RoboMimic et OpenAI Gym, la méthode égale ou dépasse des références multi-étapes, avec une inférence 5 à 20 fois plus rapide et une fréquence de contrôle supérieure à 120 Hz. Un déploiement physique sur un bras Franka Emika Panda est présenté comme validation. L'intérêt tient à la place des politiques génératives dans la robotique actuelle. Diffusion et flow matching sont devenus des choix courants pour représenter des comportements multimodaux, y compris dans plusieurs architectures VLA (vision-langage-action). Leur coût d'inférence impose pourtant des compromis : fréquences de contrôle basses, découpage des actions en blocs (chunking), ou matériel de calcul embarqué plus lourd. Une politique à plus de 120 Hz sans distillation, si les résultats tiennent, rapprocherait ces méthodes des boucles de contrôle réactives, utiles pour la manipulation fine ou le contact. L'ajout du RL on-policy répond à une limite connue de l'apprentissage par imitation, dont la performance reste bornée par la qualité des démonstrations. Les réserves sont claires : RoboMimic et Gym sont des benchmarks académiques, la validation réelle se limite à un seul bras et le résumé ne détaille ni les tâches physiques, ni le taux de réussite, ni le matériel de calcul. Le gain de 5 à 20 fois dépend des références choisies. Ce travail s'inscrit dans une course à l'accélération des politiques génératives. Diffusion Policy a imposé le paradigme, les approches de flow matching comme Pi-0 l'ont repris à plus grande échelle, et plusieurs équipes explorent la distillation en peu d'étapes ou le fine-tuning par RL de ces politiques. OGPO prend une voie sans distillation, en combinant vitesse et amélioration par renforcement. Il s'agit ici d'une publication de recherche, sans produit ni déploiement industriel annoncé. La suite dépendra des preuves sur des tâches plus variées, sur des robots différents et, surtout, de son intégration dans de grands modèles VLA. Une page de projet accompagne l'article.

RecherchePaper
1 source
SC3-Eval : évaluer les modèles fondation pour la robotique via la génération vidéo auto-cohérente
3arXiv cs.RO 

SC3-Eval : évaluer les modèles fondation pour la robotique via la génération vidéo auto-cohérente

Une équipe de chercheurs a publié fin juin 2026 SC3-Eval (arXiv:2606.18610), un cadre d'évaluation des politiques de manipulation robotique basé sur la génération vidéo cohérente. Le principe : plutôt que de rouler une politique en conditions réelles, un modèle fondamental vidéo pré-entraîné simule les trajectoires du robot et prédit si la tâche aboutit. SC3-Eval repose sur trois mécanismes de cohérence complémentaires. La cohérence dynamique avant-inverse entraîne simultanément le modèle à prédire les images à partir des actions et à récupérer les actions à partir des images, ancrant les rollouts à un espace d'action physiquement plausible. La cohérence multi-vue oblige le modèle à reconstruire chaque caméra depuis les autres, maintenant la cohérence spatiale sur de longs épisodes. Enfin, à l'inférence, un signal d'incertitude par chunk d'actions interrompt les rollouts dont les images générées divergent des actions demandées. Évalué sur sept politiques vision-langage-action (VLA) réelles, SC3-Eval atteint une corrélation de Pearson de 0,929 avec les résultats terrain et un MMRV de 0,119, surpassant trois baselines vidéo existantes. Ce résultat a une portée pratique immédiate : évaluer une politique de manipulation en conditions réelles est coûteux, lent et difficile à paralléliser. Un corrélat simulé à 0,929 constitue un substitut crédible pour filtrer les candidats politiques avant déploiement physique, réduisant potentiellement les cycles d'itération de plusieurs semaines à quelques heures. Fait notable, SC3-Eval reproduit fidèlement les modes d'échec observés en réel, permettant un diagnostic fin au niveau tâche plutôt qu'un classement agrégé, ce qui est plus actionnable pour un intégrateur. Le cadre se généralise par ailleurs à des tâches hors distribution d'entraînement, un point critique pour les équipes qui développent des politiques généralistes. Ce travail s'inscrit dans la vague d'adoption des modèles VLA commerciaux et de recherche, Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, Helix, OpenVLA, dont l'évaluation standardisée reste un goulot d'étranglement reconnu. Les approches alternatives passent par des simulateurs physiques classiques (MuJoCo, Isaac Sim) ou des rollouts réels coûteux ; les world models vidéo comme UniSim ou IRASim avaient amorcé cette direction mais se heurtaient à la dérive autorégressiveet à l'incohérence multi-caméras que SC3-Eval adresse directement. Le code et les données ne sont pas encore publiés au moment de la préprint, ce qui limite l'adoption immédiate. La prochaine étape logique sera de valider la méthode sur des plateformes humanoïdes à plus haute dimensionnalité, où le coût d'évaluation réelle est encore plus prohibitif.

RechercheOpinion
1 source
Modélisation unifiée condition-action pour une génération d'action précise en une étape
4arXiv cs.RO 

Modélisation unifiée condition-action pour une génération d'action précise en une étape

Des chercheurs publient sur arXiv (identifiant 2608.16153v1) un nouveau papier intitule "Unified Condition-Action Modeling for Accurate One-Step Action Generation", qui présente UCA-Flow, un framework de modélisation conjointe condition-action pour générer des trajectoires robotiques en une seule étape. Contrairement aux politiques de diffusion et de flow habituelles, qui traitent les conditions (observations visuelles, timestep, intervalle temporel) comme des signaux auxiliaires séparés des tokens d'action, UCA-Flow fusionne l'ensemble dans une séquence unique traitée par un Unified Condition-Action Transformer, ce qui permet de reconstruire dynamiquement les représentations de condition selon l'étape de génération en cours. Les auteurs ajoutent un schéma de supervision en double passe sur les variables u et v pour renforcer l'optimisation conjointe. Resultat annonce: un gain de 9,3 points de pourcentage de taux de réussite moyen par rapport a la meilleure base de comparaison, avec une inférence 45,6 fois plus rapide que DP3 et 33,4 fois plus rapide que Simple DP3, tout en restant 4,3 fois plus rapide que FlowPolicy en une étape et 2,3 fois plus rapide que MP1. Pour l'industrie de la manipulation robotique, ce travail s'attaque a un compromis central: les politiques de diffusion et de flow, au coeur de nombreux modèles VLA vision-language-action, doivent générer des actions précises tout en respectant des latences très serrées en boucle fermée, et accélérer l'inférence se faisait jusqu'ici généralement au prix de la précision. En montrant qu'un traitement conjoint des conditions et des actions améliore simultanément vitesse et taux de réussite, UCA-Flow bouscule l'hypothèse selon laquelle rapidité et fiabilité s'excluent dans ce type de politique. Pour les intégrateurs qui évaluent des architectures de contrôle temps réel pour bras manipulateurs ou plateformes mobiles, ce résultat suggère une piste d'optimisation potentiellement transférable au-delà du cas teste, sous réserve de validation indépendante. UCA-Flow s'inscrit dans la lignée des politiques de diffusion pour la manipulation, dont DP3 et sa variante allégée Simple DP3 servent de référence historique, suivies par des approches en une seule étape comme FlowPolicy et MP1, toutes citées comme bases de comparaison. Le papier ne précise ni affiliation institutionnelle ni plan de commercialisation: c'est une publication de recherche évaluée sur des benchmarks de manipulation, sans démonstration annoncée sur robot physique en conditions réelles ni intégration a un produit existant, et les chiffres proviennent des propres expériences des auteurs, non encore confirmes de manière indépendante. Les suites naturelles seraient une reproduction par des tiers, une extension a des taches multi-bras plus complexes, et une possible intégration dans des architectures VLA généralistes comme Pi-0 ou GR00T N2, qui reposent elles aussi sur des têtes d'action par diffusion ou par flow.

RechercheOpinion
1 source