Aller au contenu principal
RecherchearXiv cs.RO 

Forçage discret : injecter un guidage discret dans le débruitage continu pour des experts d'action en peu d'étapes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (identifiant 2609.39526, version 1) Discrete Forcing, un cadre de génération d'actions pour modèles vision-langage-action (VLA) fondé sur le flow matching. L'approche procède du grossier au fin : un premier module prédit des tokens d'action discrets qui fixent la structure globale du mouvement, puis un second module les utilise pour guider le raffinement d'actions continues. Les deux branches partagent un même backbone de type diffusion transformer, avec des têtes spécialisées. Le nombre de paramètres reste comparable à celui d'un expert d'action continu classique à une seule branche, et chaque branche ne demande qu'une seule passe avant. Les auteurs annoncent de meilleures performances et une inférence plus rapide que celles d'un expert continu à paramètres équivalents, sur plusieurs benchmarks. Le gain progresse de façon régulière avec la capacité du modèle. Des essais sur robot réel sont mentionnés pour des tâches de manipulation de haute précision et dynamiques. Le résumé ne donne ni chiffres, ni noms de benchmarks, ni plateforme robotique.

L'enjeu est le coût de l'action experte dans les VLA. Les tokens discrets sont compacts et se prêtent bien à la prédiction par un modèle de langage, mais la quantification limite la précision. Les actions continues, générées par diffusion ou flow matching, sont précises mais demandent souvent plusieurs étapes de débruitage, ce qui pèse sur la latence, critique pour les tâches dynamiques. Si les résultats tiennent, Discrete Forcing montrerait qu'on peut réduire le nombre d'étapes sans alourdir le modèle, en confiant la structure au discret et le détail au continu. Le comparatif à paramètres égaux est une bonne pratique méthodologique. Il faudra cependant voir les chiffres réels, les écarts de latence mesurés, la variété des tâches physiques et la robustesse hors démonstration. Pour un intégrateur, il s'agit d'une brique de recherche, pas d'un produit disponible ni d'un déploiement industriel.

Ce travail s'inscrit dans une tension ancienne entre deux familles de politiques. D'un côté, les approches par tokens d'action de type FAST ou les modèles autorégressifs. De l'autre, les experts continus à flow matching popularisés par des modèles comme Pi-0 ou l'architecture de GR00T, qui sont devenus la référence pour la précision. Plusieurs équipes cherchent à accélérer ces experts en réduisant le nombre d'étapes d'inférence, par distillation ou par modèles à peu d'étapes. Discrete Forcing propose une voie hybride plutôt qu'une simple compression. Il s'agit d'une prépublication, sans relecture par les pairs à ce stade. Les prochaines étapes à surveiller sont la publication du code et des poids, des évaluations indépendantes sur des benchmarks établis, et l'intégration éventuelle de l'idée dans des VLA de grande taille.

À lire aussi

DIDO : distiller la dynamique centrée sur l'interaction en débruitage à une étape pour les modèles d'action du monde
1arXiv cs.RO 

DIDO : distiller la dynamique centrée sur l'interaction en débruitage à une étape pour les modèles d'action du monde

Une équipe de recherche publie DIDO (arXiv 2609.15570, septembre 2026), une méthode de distillation pour les World Action Models (WAM), ces systèmes qui utilisent des modèles de génération vidéo pour prédire la dynamique visuelle future et piloter la manipulation robotique. Le problème de départ est la latence : le débruitage itératif de ces modèles vidéo est incompatible avec un contrôle en boucle fermée. Les auteurs montrent empiriquement que le contenu visuel converge à des vitesses différentes durant le débruitage : le fond statique de la scène se forme dès les premières étapes, tandis que la pince du robot et l'objet manipulé restent flous, leur dynamique d'interaction n'émergeant que lors des étapes suivantes. Tronquer naïvement un modèle multi-étapes à une seule étape préserve donc la structure de la scène mais perd l'information d'interaction, la plus critique pour la manipulation. DIDO combine une distillation par appariement de distribution avec un guidage centré sur l'interaction : des tokens de raisonnement visuel supervisés par boîtes englobantes modélisent la pince, l'objet et leur interaction, et les représentations de l'objet cible sont alignées, sur plusieurs couches, avec les caractéristiques d'un encodeur DINOv3 préentraîné. Résultat : 99,0% de réussite sur LIBERO, 76,6% sur LIBERO-Plus et 92,0% sur RoboTwin, en une seule étape de débruitage. Pour les intégrateurs et chercheurs en robotique, l'enjeu est concret : les modèles vidéo-génératifs produisent des prédictions visuelles de qualité, mais leur coût de calcul itératif les rend souvent inadaptés au temps réel. En ramenant le débruitage à une seule étape sans sacrifier la dynamique gripper-objet, DIDO s'attaque à un des obstacles qui séparent les démonstrations de manipulation en simulation d'un déploiement réactif. Le travail met aussi en garde contre la distillation naïve des WAM : réduire le nombre d'étapes sans traitement spécifique dégrade précisément l'information la plus utile à la tâche. DIDO s'inscrit dans la lignée des World Action Models, qui détournent des générateurs vidéo pour servir de moteur de prédiction à des politiques de manipulation, en s'appuyant sur des encodeurs visuels auto-supervisés comme DINOv3 de Meta, utilisé ici comme signal d'enseignement. Les résultats restent validés sur des benchmarks de simulation standards du secteur (LIBERO, LIBERO-Plus, RoboTwin), complétés par des essais réels sur des tâches longues et des scénarios de généralisation. Aucun partenariat industriel ni date de disponibilité n'est mentionné : il s'agit à ce stade d'une publication de recherche, pas d'un produit livré.

RecherchePaper
1 source
Les actions urgentes d'abord : un débruitage sensible à l'urgence pour le contrôle VLA en temps réel
2arXiv cs.RO 

Les actions urgentes d'abord : un débruitage sensible à l'urgence pour le contrôle VLA en temps réel

Des chercheurs proposent Urgency-Aware Denoising (UAD), un cadre appliqué à l'inférence qui vise la latence des politiques Vision-Language-Action (VLA) à diffusion ou à flow matching. Ces modèles produisent des « chunks » d'actions par débruitage itératif, et chaque étape de débruitage ajoute du délai avant que le robot puisse bouger. UAD part d'un constat simple. Les actions d'un chunk sont générées ensemble mais exécutées l'une après l'autre, donc les premières sont plus urgentes que les dernières. Le système libère ces actions urgentes après moins d'étapes de débruitage. Il poursuit en arrière-plan le raffinement des actions de fin de chunk, pendant que le robot exécute les premières. Deux mécanismes corrigent les effets secondaires. Trajectory Reconciliation reconstruit un état interne cohérent, sans évaluation supplémentaire du modèle. Ghost Action Correction utilise des « actions fantômes », des prolongements non exécutés, pour compenser les erreurs des actions libérées trop tôt. Selon les auteurs, testés sur plusieurs architectures VLA, des benchmarks de simulation et des tâches de manipulation réelles, UAD atteint jusqu'à 1,89x d'accélération sur la latence moyenne de disponibilité des actions. Le taux de succès reste comparable à l'inférence classique avec un budget de débruitage optimal. L'intérêt tient au point de blocage de ces politiques : la latence d'inférence limite le contrôle temps réel. Beaucoup de méthodes d'accélération traitent le chunk comme un bloc indivisible. Ici, on exploite la structure temporelle du contrôle à horizon glissant. Cela peut réduire le délai de réaction sans changer les poids du modèle. Les résultats appellent toutefois de la prudence. Le chiffre de 1,89x est un maximum. Il porte sur la disponibilité moyenne des actions, pas sur le temps de cycle d'une tâche complète. Le résumé ne précise ni les modèles, ni le matériel, ni les tâches réelles, ni la variance entre essais. « Comparable » reste à quantifier. Ce travail s'inscrit dans la course aux VLA à diffusion et à flow matching, de la famille Pi-0 aux politiques de diffusion, qui pousse à réduire le coût du débruitage. Les alternatives connues passent par moins d'étapes, la distillation, la mise en cache ou l'inférence asynchrone. Les auteurs affirment un meilleur compromis succès-latence que les références de pointe, sans que le résumé les nomme. C'est un preprint arXiv, non évalué par les pairs, sans acteur industriel identifié. Les prochaines étapes à surveiller sont la publication du code, la réplication indépendante et des essais sur robot embarqué.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
IMLE-VLA : génération d'actions en une seule étape pour les modèles vision-langage-action
3arXiv cs.RO 

IMLE-VLA : génération d'actions en une seule étape pour les modèles vision-langage-action

Publié sur arXiv (2609.10915), IMLE-VLA remplace la tête d'action itérative des politiques vision-langage-action (VLA) par un générateur en une seule étape, entraîné via l'estimation conditionnelle du maximum de vraisemblance implicite (cIMLE). Appliqué au modèle π0.5, il fait passer la fréquence d'inférence de 15 Hz à 55 Hz, soit un facteur 3,67, et jusqu'à 11 fois le débit d'action. Sur le benchmark LIBERO, qui couvre 40 tâches, IMLE-VLA atteint 98,0% de réussite moyenne, le meilleur score et la plus haute fréquence d'inférence parmi les méthodes comparées. Sous les perturbations du test LIBERO-plus, il conserve la robustesse de π0.5 alors que les autres approches se dégradent nettement. Sur un bras Franka Emika Panda, quatre tâches en conditions réelles montrent un jerk réduit de 2,2 à 3,0 fois et un temps d'inférence par épisode divisé par 3,9 à 6,6 par rapport à π0.5 seul. Le problème visé est bien identifié dans le secteur: les têtes d'action entraînées par diffusion ou flow matching, comme celle de π0.5, exigent un échantillonnage multi-étapes (jusqu'à 10 pas d'Euler), ce qui produit un mouvement saccadé du robot et ralentit l'exécution des tâches. Pour les intégrateurs et équipes robotique qui déploient des bras ou des humanoïdes pilotés par des modèles de fondation, la latence d'inférence conditionne directement la fluidité et la sécurité du contrôle en temps réel. En montrant qu'un générateur à étape unique peut couvrir la multimodalité de l'action sans tomber dans l'effondrement de mode des têtes de régression classiques, IMLE-VLA remet en cause l'idée reçue selon laquelle l'échantillonnage itératif serait indispensable pour préserver la généralisation des politiques VLA à grande échelle. Ce travail s'inscrit dans la lignée des VLA construits sur des backbones vision-langage préentraînés, avec π0.5 comme base de comparaison. Il s'agit d'une contribution académique et non d'un produit commercial: code et vidéos de démonstration sont publiés sur le site du projet à des fins de reproductibilité, sans annonce de déploiement industriel ni de pilote client. Présentée comme générique, la méthode cIMLE pourrait en principe s'appliquer à d'autres têtes d'action par diffusion ou flow matching utilisées ailleurs dans le secteur, ce qui ouvre la voie à des tests sur d'autres politiques VLA et d'autres plateformes robotiques, au-delà du seul bras Franka Emika Panda utilisé pour cette validation.

RechercheActu
1 source
Au-delà de la prédiction du futur : le débruitage comme adaptation générative pour le contrôle des robots
4arXiv cs.RO 

Au-delà de la prédiction du futur : le débruitage comme adaptation générative pour le contrôle des robots

Des chercheurs publient sur arXiv (arXiv:2609.28339v1) une méthode baptisée NowWAM pour entraîner des politiques de contrôle robotique à partir de Diffusion Transformers (DiT) pré-entraînés sur de la génération d'images et de vidéos. Plutôt que de prédire des images futures pour transférer ce prior génératif vers le contrôle, comme le font la plupart des approches existantes, NowWAM débruite l'observation courante et prédit les actions du robot à partir du même flux visuel, sans cible visuelle future séparée. Sur le benchmark de simulation LIBERO-Plus, avec un backbone FLUX2-Klein, la méthode atteint 87,7 % de réussite, soit 6,1 points de plus qu'une base entraînée avec prédiction du futur, tout en divisant par deux le nombre de tokens visuels d'entraînement (784 à 392) et en réduisant le temps par étape de 2,85 à 1,63 seconde, un gain de vitesse de 1,8x. Avec un backbone texte-vers-image pur, Z-Image, sans capacité de génération vidéo ni d'édition d'image, NowWAM atteint 87,8 %. Le résultat central du papier est que restreindre l'entraînement au seul point d'arrivée débruité dégrade nettement la robustesse, alors que remplacer la cible future par la cible présente ne change quasiment rien aux performances. Cela suggère que ce n'est pas la prédiction du futur en tant que telle qui rend utile le prior génératif des DiT pour le contrôle, mais la trajectoire de débruitage elle-même, utilisée comme interface d'apprentissage. Pour le secteur des politiques robotiques de type VLA (vision-language-action), bâties sur des bases génératives comparables à celles derrière Pi-0 ou GR00T N2, ce travail remet en cause l'hypothèse répandue selon laquelle un module de prédiction vidéo du futur serait nécessaire pour exploiter un prior génératif. Il ouvre aussi une piste d'efficacité concrète: moitié moins de tokens visuels et un temps de calcul par étape quasi divisé par deux, un enjeu direct pour le contrôle temps réel embarqué. Ce travail s'inscrit dans la tendance à construire des politiques de contrôle sur des DiT pré-entraînés à grande échelle, une lignée qui inclut des modèles comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, généralement adaptés via prédiction visuelle du futur. NowWAM se positionne comme une alternative de co-entraînement plus économe, comparée sous conditions contrôlées à une base "future prédiction" sur LIBERO-Plus, un environnement de simulation standard pour la manipulation, et non un déploiement sur robot réel. Les auteurs montrent que l'adaptation au contrôle ne dépend pas d'un backbone spécialisé en vidéo ou en édition d'image, élargissant les bases génératives exploitables en robotique. Publié en preprint, l'article ne mentionne aucun déploiement industriel ni partenariat commercial; ses conclusions restent à confirmer au-delà du benchmark simulé.

RechercheActu
1 source