Aller au contenu principal
OGPO : optimisation de politique générative en une étape pour le contrôle de robots en temps réel
RecherchearXiv cs.RO 

OGPO : optimisation de politique générative en une étape pour le contrôle de robots en temps réel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient OGPO (One-Step Generative Policy Optimization), un cadre d'apprentissage pour le contrôle robotique en temps réel, dont la version 2 vient d'être diffusée sur arXiv (2601.20701). Il vise un problème précis : les politiques de contrôle fondées sur la diffusion ou le flow matching génèrent les actions en plusieurs étapes d'échantillonnage, ce qui limite leur usage dès que la latence compte. Réduire ce nombre d'étapes à un seul dégrade d'ordinaire la qualité de représentation et la performance sur la tâche. Les auteurs décrivent un compromis à trois pôles entre vitesse, fidélité et performance. OGPO associe une architecture légère au principe d'« interval velocity » pour une inférence en une étape sans distillation, tandis qu'une technique de « représentation spreading » évite la dégradation des représentations. Une phase d'apprentissage par renforcement (RL) on-policy affine ensuite cette politique rapide et stable. Sur les benchmarks RoboMimic et OpenAI Gym, la méthode égale ou dépasse des références multi-étapes, avec une inférence 5 à 20 fois plus rapide et une fréquence de contrôle supérieure à 120 Hz. Un déploiement physique sur un bras Franka Emika Panda est présenté comme validation.

L'intérêt tient à la place des politiques génératives dans la robotique actuelle. Diffusion et flow matching sont devenus des choix courants pour représenter des comportements multimodaux, y compris dans plusieurs architectures VLA (vision-langage-action). Leur coût d'inférence impose pourtant des compromis : fréquences de contrôle basses, découpage des actions en blocs (chunking), ou matériel de calcul embarqué plus lourd. Une politique à plus de 120 Hz sans distillation, si les résultats tiennent, rapprocherait ces méthodes des boucles de contrôle réactives, utiles pour la manipulation fine ou le contact. L'ajout du RL on-policy répond à une limite connue de l'apprentissage par imitation, dont la performance reste bornée par la qualité des démonstrations. Les réserves sont claires : RoboMimic et Gym sont des benchmarks académiques, la validation réelle se limite à un seul bras et le résumé ne détaille ni les tâches physiques, ni le taux de réussite, ni le matériel de calcul. Le gain de 5 à 20 fois dépend des références choisies.

Ce travail s'inscrit dans une course à l'accélération des politiques génératives. Diffusion Policy a imposé le paradigme, les approches de flow matching comme Pi-0 l'ont repris à plus grande échelle, et plusieurs équipes explorent la distillation en peu d'étapes ou le fine-tuning par RL de ces politiques. OGPO prend une voie sans distillation, en combinant vitesse et amélioration par renforcement. Il s'agit ici d'une publication de recherche, sans produit ni déploiement industriel annoncé. La suite dépendra des preuves sur des tâches plus variées, sur des robots différents et, surtout, de son intégration dans de grands modèles VLA. Une page de projet accompagne l'article.

À lire aussi

Pilotage sûr et en temps réel des politiques par optimisation de trajectoire dans l'espace du bruit pour des politiques génératives en une étape
1arXiv cs.RO 

Pilotage sûr et en temps réel des politiques par optimisation de trajectoire dans l'espace du bruit pour des politiques génératives en une étape

Une publication déposée sur arXiv (référence 2609.21220, catégorie "new") présente INSPO, une méthode pour piloter en temps réel des politiques robotiques génératives sans les réentraîner. Le problème visé est le suivant : les politiques préentraînées de type diffusion ou flow matching génèrent des comportements variés et multimodaux, mais restent difficiles à adapter aux contraintes imposées au moment du déploiement, comme l'évitement de collision ou le maintien d'une orientation donnée, sans repasser par un guidage par gradient coûteux appliqué tout au long d'un processus itératif, trop lent pour du contrôle temps réel. INSPO reformule le problème comme une optimisation de trajectoire dans l'espace du bruit d'entrée de la politique : au lieu de modifier directement les actions générées, l'algorithme optimise le bruit injecté en évaluant les contraintes sur la trajectoire d'état qui en résulte, avec un terme de régularisation qui garde la solution proche de la distribution d'entrée native du modèle, le tout résolu en ligne par optimisation par essaim de particules. Les auteurs testent la méthode sur des politiques spécifiques à une tâche, à base d'état ou d'image, et sur des politiques généralistes vision-langage-action, avec trois bancs d'essai simulés : Push-T, la préhension-dépose de boîtes de conserve (Can pick-and-place) et LIBERO-Spatial. Pour l'industrie robotique, ce travail cible un verrou concret : les politiques génératives promettent plus de diversité comportementale que les politiques déterministes classiques, mais leur nature stochastique complique la garantie de contraintes de sécurité strictes une fois déployées sur un bras ou un robot mobile réel. Jusqu'ici, imposer ces contraintes passait soit par un rejet coûteux d'échantillons (best-of-N sampling), soit par une projection a posteriori des actions générées, soit par un guidage par gradient trop lent pour le temps réel. INSPO affiche de meilleurs taux de réussite et de respect des contraintes que les deux premières approches, tout en égalant le guidage par gradient avec un temps d'exécution plus faible, ce qui, si cela se confirme sur du matériel physique, réduirait un frein réel à l'usage industriel des politiques VLA génériques du type Pi-0 ou GR00T, où la sécurité à l'inférence limite encore la commercialisation au-delà des démonstrations. Ce travail s'inscrit dans la vague des politiques robotiques fondées sur la diffusion ou le flow matching, et plus particulièrement dans le virage récent vers des politiques génératives "en une étape", plus rapides à échantillonner que les processus itératifs classiques mais qui rendent obsolètes certaines méthodes de guidage par gradient conçues pour ces derniers. À ce stade, INSPO n'a été validé que sur des bancs d'essai simulés standards de la littérature, sans démonstration sur robot physique ni comparaison avec un système commercial : il s'agit d'une contribution méthodologique amont plutôt que d'un produit ou d'un déploiement annoncé. Aucun acteur français ou européen n'apparaît dans cette publication.

RecherchePaper
1 source
HybridFlow : une politique générative à 2 NFE pour la manipulation robotique en temps réel
2arXiv cs.RO 

HybridFlow : une politique générative à 2 NFE pour la manipulation robotique en temps réel

Des chercheurs restés anonymes, dont l'identité est masquée le temps d'une évaluation en double aveugle, publient sur arXiv (2602.13718v2, version révisée) HybridFlow, une politique générative pour le contrôle robotique en temps réel. Le système ne nécessite que deux évaluations du réseau de neurones, contre les 16 étapes habituelles d'une politique par diffusion, grâce à un pipeline en trois temps : un "Global Jump" qui utilise la vitesse moyenne du cadre MeanFlow pour générer une trajectoire d'action grossière, une interpolation "ReNoise" sans paramètre qui construit un état intermédiaire à un instant de raffinement non nul, puis un "Local Refine" qui interroge la limite de vitesse instantanée du même réseau à cet instant, sans distillation ni modèle séparé. Sur des ablations contrôlées avec le benchmark RoboMimic, la méthode atteint 95% de réussite moyenne avec bruit réutilisé et 95,5% avec bruit frais, contre 78% pour une version MeanFlow à une seule étape. Sur cinq configurations de robots réels, toutes les politiques comparées tournant sur le même module embarqué Jetson AGX Thor de Nvidia, HybridFlow améliore la performance normalisée des tâches de 13 à 68 points par rapport à une Diffusion Policy à 16 étapes, avec une latence de génération d'action environ huit fois plus faible. Ce résultat s'attaque directement au compromis central des politiques génératives en robotique : la précision des gestes exige généralement de nombreuses étapes de débruitage, incompatibles avec les boucles de contrôle temps réel exigées par la manipulation fine. En conservant un modèle unique et en évitant la distillation, qui dégrade souvent la précision ou la généralisation, HybridFlow promet une exécution quasi aussi fiable qu'une diffusion complète mais à une fraction du coût de calcul, sur du matériel embarqué contraint. Les auteurs démontrent aussi sa compatibilité comme module d'action au sein d'une architecture vision-langage-action, ce qui en fait un candidat pour accélérer l'inférence dans les grands modèles généralistes de contrôle robotique déployés sur des plateformes comme le Jetson. Le travail s'inscrit dans la lignée des politiques par diffusion et par flow-matching devenues dominantes pour l'apprentissage de la manipulation robotique, où le nombre d'étapes de sampling reste le principal frein au déploiement temps réel. Aucun acteur industriel ni produit commercial n'est associé à cette publication, qui reste une contribution de recherche académique publiée en préprint, sans date de déploiement ni partenaire annoncé.

RecherchePaper
1 source
Ancrage physique des politiques génératives : diffusion guidée par l'optimisation pour le contrôle robotique
3arXiv cs.RO 

Ancrage physique des politiques génératives : diffusion guidée par l'optimisation pour le contrôle robotique

Des chercheurs ont publié le 24 juin 2026 sur arXiv (référence 2606.24208) une méthode visant à corriger un angle mort des politiques robotiques génératives : les sorties produites par les modèles de diffusion peuvent être statistiquement valides mais physiquement infaisables. En pratique, un modèle génératif de haute qualité peut planifier une saisie (grasp), un waypoint ou une trajectoire qui viole des contraintes d'atteignabilité (reachability), d'évitement de collision ou d'exécutabilité en boucle fermée, rendant le déploiement direct sur robot impossible. Les auteurs proposent un cadre d'optimisation à l'inférence qui formule le guidage diffusionnel comme un problème d'optimisation sous contraintes. La clé : remplacer la perturbation d'échantillonnage dans le processus de débruitage (backward process) par une correction optimisée, ce qui permet d'imposer des contraintes dures ou souples lors du sampling sans ré-entraîner le modèle. Évalué sur la synthèse de saisies dextères avec contraintes de reachability et d'évitement de collision, et sur la manipulation dynamique avec contraintes de suivi au niveau contrôleur, la méthode améliore le taux de succès jusqu'à 20 points de pourcentage sur la saisie dextère et 23 points de pourcentage sur la manipulation visuomotrice par rapport à la meilleure baseline testée. L'enjeu est ce que les auteurs nomment l'"embodiment gap" : une politique entraînée dans un espace de tâches générique peut produire des comportements conceptuellement transférables, mais leur exécution sur un corps physique spécifique échoue faute de contraintes cinématiques ou dynamiques respectées. Pour les intégrateurs et les OEM robotiques, cela signifie que les modèles généralistes comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) ne peuvent pas être déployés tels quels sur n'importe quel bras ou manipulateur sans couche d'adaptation. L'approche proposée ici opère uniquement en temps d'inférence, sans modification des poids du modèle, ce qui réduit drastiquement le coût d'adaptation à un nouvel embodiment et la rend potentiellement intégrable dans des pipelines existants sans refonte de l'architecture. Le travail s'inscrit dans la dynamique des politiques de diffusion en robotique, initiée notamment par Diffusion Policy (Chi et al., 2023) et prolongée par les architectures VLA de nouvelle génération. Les méthodes concurrentes de guidage par gradient (gradient guidance) et de projection constituent les baselines, et la méthode proposée les surpasse en préservant mieux la qualité des saisies tout en augmentant l'exécutabilité au niveau contrôleur. Dans un secteur où Physical Intelligence, Covariant ou 1X Technologies misent sur des politiques génératives à grande échelle pour atteindre la généralisation inter-robots, cette approche d'optimisation à l'inférence offre un levier d'adaptation pragmatique sans nécessiter de nouvelles données d'entraînement ni de fine-tuning coûteux.

RechercheActu
1 source
Regarder en arrière pour avancer : vérification temporelle des politiques génératives de robots
4arXiv cs.RO 

Regarder en arrière pour avancer : vérification temporelle des politiques génératives de robots

Des chercheurs proposent Temporal Verification (TeV), un cadre de vérification d'actions pour les VLA (vision-language-action) à flow-matching, détaillé dans un preprint arXiv. Il s'agit d'un travail académique, sans produit commercial, sans partenaire industriel et sans volume de déploiement annoncé. Le principe tient en trois étapes. Un « token temporel » résume l'historique récent d'observations et d'actions du robot. À partir de lui, TeV construit des paires positives et négatives sans démonstration d'expert supplémentaire ni annotation de préférence, puis entraîne par contraste un vérificateur à base d'énergie. Ce vérificateur attribue une énergie plus basse aux séquences d'actions (action chunks) de meilleure qualité et cohérentes avec la trajectoire en cours. Le paysage d'énergie appris sert aussi à guider les échantillons intermédiaires du flux vers les zones de basse énergie, avant la sélection finale parmi plusieurs candidats. Les auteurs revendiquent un classement fiable des candidats, de meilleurs taux de réussite et des trajectoires plus lisses, en simulation et en conditions réelles. Le résumé ne donne ni chiffres, ni noms de robots, ni noms de benchmarks, ni nombre de tâches testées. Le problème visé est connu. Les politiques génératives sont entraînées sur des démonstrations hétérogènes, ce qui produit des séquences d'actions sous-optimales. Leurs erreurs s'accumulent jusqu'à pousser le robot hors distribution, dans des états dont il sort difficilement. La vérification à l'inférence (test-time scaling) échantillonne plusieurs actions et laisse un vérificateur choisir. Les approches existantes sont décrites comme « myopes » : elles jugent chaque candidat sur l'observation courante seule, sans tenir compte de la continuité de la trajectoire. Elles exigent souvent de gros vérificateurs et des démonstrations expertes en plus. Si TeV tient ses promesses hors laboratoire, il abaisserait le coût d'amélioration de VLA déjà déployés, sans réentraîner la politique de base. Il intéresserait donc les intégrateurs qui cherchent plus de robustesse sans collecter de nouvelles données. Deux réserves s'imposent. Les gains réels ne sont pas chiffrés dans le résumé. Et échantillonner plusieurs candidats puis les évaluer ajoute de la latence, un coût à mesurer sur du matériel embarqué à cadence de contrôle élevée. Ce travail s'inscrit dans la montée du calcul à l'inférence pour la robotique, après ses succès sur les modèles de langage. Les VLA à flow-matching de type Pi-0 en sont la cible naturelle, et d'autres équipes explorent la vérification ou le reranking d'actions. TeV se distingue par la mémoire temporelle et l'absence de données supplémentaires. Il faudra attendre la lecture complète de l'article pour juger des benchmarks, des robots utilisés, du surcoût de calcul et de la comparaison avec les vérificateurs concurrents. Le code et les évaluations indépendantes diront si l'approche dépasse le stade du preprint.

RecherchePaper
1 source