Aller au contenu principal
RecherchearXiv cs.RO 

RFPO : optimisation de politique par flux rectifié pour le contrôle de l'IA incarnée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du groupe AIGeeksGroup publient sur arXiv (2610.10453) RFPO, pour Rectified Flow Policy Optimization, un cadre d'optimisation de politiques basées sur les flows, conçu pour que le contrôle reste fiable avec une seule étape d'intégration numérique. Le déploiement s'appuie sur un seul « étudiant » flow exécuté en un pas d'Euler. L'entraînement combine un Reflow en ligne sensible à la récompense, qui rectifie les trajectoires de transport induites par l'étudiant pendant l'apprentissage on-policy, et un contrôleur gaussien PPO gelé, qui fournit une supervision complémentaire dans l'espace des actions à budget d'intégration complet et intermédiaire. Les tests couvrent quatre plateformes : Unitree Go2, Boston Dynamics Spot, Unitree H1 et Unitree G1. En exécution à un pas, les retours restent à moins de 2,4 % de ceux obtenus à 64 pas, avec initialisation nulle comme aléatoire. Sur le Go2, un pas conserve 98,5 % de la récompense à 64 pas. La latence moyenne d'inférence embarquée passe de 4,39 ms à 0,08 ms, soit une accélération de 54,9 fois. Des expériences sur robot réel valident une locomotion stable à un pas. Le code et un site web sont publiés.

L'enjeu est très concret pour l'embarqué. Les politiques de diffusion et de flow matching séduisent par leur expressivité sur les actions continues, mais leur intégration itérative d'ODE coûte du calcul et de la latence, ce qui pèse sur les boucles de contrôle rapides et sur les budgets énergétiques des robots mobiles. Réduire naïvement le nombre de pas dégrade le contrôle, car une politique optimisée en pas complets n'est pas contrainte à rester fiable sous intégration grossière. Les auteurs nomment cet écart « few-step discretization gap ». Passer de 4,39 ms à 0,08 ms libère de la marge pour des fréquences de contrôle élevées ou pour des calculateurs modestes. Il faut toutefois lire ces chiffres avec prudence : les scores principaux viennent de simulation, la validation réelle est présentée comme qualitative (stabilité de la marche) sans taux de réussite ni durée. Les tâches sont de la locomotion, pas de la manipulation, où la multimodalité des actions est plus exigeante. Le gain porte aussi sur la latence de la politique seule, pas sur la chaîne perception-contrôle complète.

Le travail s'inscrit dans l'effort pour rendre les politiques génératives exploitables en temps réel, après la diffusion à nombreuses étapes, puis les approches de distillation, de consistency models et de flow matching à peu de pas. Il s'écarte de la distillation classique, car l'étudiant est rectifié pendant l'apprentissage par renforcement et non après coup. L'usage d'un PPO gaussien gelé comme guide rappelle que les baselines simples restent solides en locomotion. Les plateformes choisies, majoritairement Unitree, reflètent la domination du matériel chinois bon marché dans la recherche académique. Aucun acteur européen n'est cité. La suite logique serait une extension à la manipulation, à des politiques vision-langage-action de grande taille et à davantage de tests sur robot réel avec des métriques publiées.

À lire aussi

Ancrage physique des politiques génératives : diffusion guidée par l'optimisation pour le contrôle robotique
1arXiv cs.RO 

Ancrage physique des politiques génératives : diffusion guidée par l'optimisation pour le contrôle robotique

Des chercheurs ont publié le 24 juin 2026 sur arXiv (référence 2606.24208) une méthode visant à corriger un angle mort des politiques robotiques génératives : les sorties produites par les modèles de diffusion peuvent être statistiquement valides mais physiquement infaisables. En pratique, un modèle génératif de haute qualité peut planifier une saisie (grasp), un waypoint ou une trajectoire qui viole des contraintes d'atteignabilité (reachability), d'évitement de collision ou d'exécutabilité en boucle fermée, rendant le déploiement direct sur robot impossible. Les auteurs proposent un cadre d'optimisation à l'inférence qui formule le guidage diffusionnel comme un problème d'optimisation sous contraintes. La clé : remplacer la perturbation d'échantillonnage dans le processus de débruitage (backward process) par une correction optimisée, ce qui permet d'imposer des contraintes dures ou souples lors du sampling sans ré-entraîner le modèle. Évalué sur la synthèse de saisies dextères avec contraintes de reachability et d'évitement de collision, et sur la manipulation dynamique avec contraintes de suivi au niveau contrôleur, la méthode améliore le taux de succès jusqu'à 20 points de pourcentage sur la saisie dextère et 23 points de pourcentage sur la manipulation visuomotrice par rapport à la meilleure baseline testée. L'enjeu est ce que les auteurs nomment l'"embodiment gap" : une politique entraînée dans un espace de tâches générique peut produire des comportements conceptuellement transférables, mais leur exécution sur un corps physique spécifique échoue faute de contraintes cinématiques ou dynamiques respectées. Pour les intégrateurs et les OEM robotiques, cela signifie que les modèles généralistes comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) ne peuvent pas être déployés tels quels sur n'importe quel bras ou manipulateur sans couche d'adaptation. L'approche proposée ici opère uniquement en temps d'inférence, sans modification des poids du modèle, ce qui réduit drastiquement le coût d'adaptation à un nouvel embodiment et la rend potentiellement intégrable dans des pipelines existants sans refonte de l'architecture. Le travail s'inscrit dans la dynamique des politiques de diffusion en robotique, initiée notamment par Diffusion Policy (Chi et al., 2023) et prolongée par les architectures VLA de nouvelle génération. Les méthodes concurrentes de guidage par gradient (gradient guidance) et de projection constituent les baselines, et la méthode proposée les surpasse en préservant mieux la qualité des saisies tout en augmentant l'exécutabilité au niveau contrôleur. Dans un secteur où Physical Intelligence, Covariant ou 1X Technologies misent sur des politiques génératives à grande échelle pour atteindre la généralisation inter-robots, cette approche d'optimisation à l'inférence offre un levier d'adaptation pragmatique sans nécessiter de nouvelles données d'entraînement ni de fine-tuning coûteux.

RechercheActu
1 source
OGPO : optimisation de politique générative en une étape pour le contrôle de robots en temps réel
2arXiv cs.RO 

OGPO : optimisation de politique générative en une étape pour le contrôle de robots en temps réel

Des chercheurs publient OGPO (One-Step Generative Policy Optimization), un cadre d'apprentissage pour le contrôle robotique en temps réel, dont la version 2 vient d'être diffusée sur arXiv (2601.20701). Il vise un problème précis : les politiques de contrôle fondées sur la diffusion ou le flow matching génèrent les actions en plusieurs étapes d'échantillonnage, ce qui limite leur usage dès que la latence compte. Réduire ce nombre d'étapes à un seul dégrade d'ordinaire la qualité de représentation et la performance sur la tâche. Les auteurs décrivent un compromis à trois pôles entre vitesse, fidélité et performance. OGPO associe une architecture légère au principe d'« interval velocity » pour une inférence en une étape sans distillation, tandis qu'une technique de « représentation spreading » évite la dégradation des représentations. Une phase d'apprentissage par renforcement (RL) on-policy affine ensuite cette politique rapide et stable. Sur les benchmarks RoboMimic et OpenAI Gym, la méthode égale ou dépasse des références multi-étapes, avec une inférence 5 à 20 fois plus rapide et une fréquence de contrôle supérieure à 120 Hz. Un déploiement physique sur un bras Franka Emika Panda est présenté comme validation. L'intérêt tient à la place des politiques génératives dans la robotique actuelle. Diffusion et flow matching sont devenus des choix courants pour représenter des comportements multimodaux, y compris dans plusieurs architectures VLA (vision-langage-action). Leur coût d'inférence impose pourtant des compromis : fréquences de contrôle basses, découpage des actions en blocs (chunking), ou matériel de calcul embarqué plus lourd. Une politique à plus de 120 Hz sans distillation, si les résultats tiennent, rapprocherait ces méthodes des boucles de contrôle réactives, utiles pour la manipulation fine ou le contact. L'ajout du RL on-policy répond à une limite connue de l'apprentissage par imitation, dont la performance reste bornée par la qualité des démonstrations. Les réserves sont claires : RoboMimic et Gym sont des benchmarks académiques, la validation réelle se limite à un seul bras et le résumé ne détaille ni les tâches physiques, ni le taux de réussite, ni le matériel de calcul. Le gain de 5 à 20 fois dépend des références choisies. Ce travail s'inscrit dans une course à l'accélération des politiques génératives. Diffusion Policy a imposé le paradigme, les approches de flow matching comme Pi-0 l'ont repris à plus grande échelle, et plusieurs équipes explorent la distillation en peu d'étapes ou le fine-tuning par RL de ces politiques. OGPO prend une voie sans distillation, en combinant vitesse et amélioration par renforcement. Il s'agit ici d'une publication de recherche, sans produit ni déploiement industriel annoncé. La suite dépendra des preuves sur des tâches plus variées, sur des robots différents et, surtout, de son intégration dans de grands modèles VLA. Une page de projet accompagne l'article.

RecherchePaper
1 source
IA incarnée sous contrôle : gouvernance à l'exécution pour agents contraints par des politiques
3arXiv cs.RO 

IA incarnée sous contrôle : gouvernance à l'exécution pour agents contraints par des politiques

Des chercheurs ont publié sur arXiv (2604.07833) un cadre architectural pour la gouvernance d'exécution des agents incarnés, ces systèmes IA capables d'agir sur des robots, outils ou environnements physiques. La proposition centrale est une couche de gouvernance dédiée, externe à la boucle d'inférence de l'agent, chargée de cinq fonctions : vérification de politiques, admission de capacités, surveillance d'exécution, gestion des rollbacks et déclenchement d'override humain. Cette architecture formalise une frontière de contrôle entre l'agent incarné, des modules de capacité baptisés ECMs (Embodied Capability Modules) et la couche de gouvernance runtime. Les auteurs ont validé l'approche sur 1 000 essais de simulation randomisés couvrant trois dimensions de gouvernance : taux d'interception des actions non autorisées à 96,2 %, réduction des continuations non sécurisées de 100 % à 22,2 % en cas de dérive d'exécution, et 91,4 % de récupération avec conformité totale aux politiques, tous significativement supérieurs aux baselines testés (p<0,001). L'enjeu dépasse la robotique académique. À mesure que des agents IA obtiennent une autorité d'exécution réelle sur des bras industriels, des AMR (Autonomous Mobile Robots) ou des systèmes cyber-physiques, leur contrôlabilité devient un problème d'ingénierie système critique. L'approche dominante actuelle consiste à enfouir la logique de sécurité à l'intérieur de la boucle agent, ce qui rend l'audit difficile et la standardisation quasi impossible dans des environnements réglementés (santé, industrie critique). En externalisant la gouvernance dans une couche séparée, les auteurs proposent un modèle où la politique d'usage peut être modifiée ou vérifiée sans toucher aux poids du modèle, répondant à un besoin concret des intégrateurs industriels qui composent avec plusieurs fournisseurs et des référentiels de sécurité imposés par leurs clients. Ce papier s'inscrit dans un mouvement plus large de "safety at deployment", distinct de l'alignment par entraînement (RLHF, Constitutional AI). Il dialogue avec les architectures de contrôle comme ROS 2 et les travaux sur les systèmes multi-agents à responsabilité distribuée. Le contexte concurrentiel est direct : OpenAI, Google DeepMind, Figure AI, Physical Intelligence et Sanctuary AI développent tous des agents incarnés à capacité d'exécution croissante, mais la gouvernance runtime reste un angle mort industriel. Une telle architecture trouverait une application prioritaire dans les déploiements d'humanoïdes en environnement contrôlé, entrepôts ou lignes d'assemblage, où les opérateurs exigent des garanties d'auditabilité que les architectures end-to-end ne fournissent pas encore.

UEL'architecture de gouvernance externe proposée répond directement aux exigences d'auditabilité et de traçabilité de l'AI Act pour les systèmes d'IA à haut risque, offrant aux intégrateurs robotiques européens un cadre de référence concret pour démontrer la conformité de leurs agents incarnés sans modifier les poids des modèles.

RechercheOpinion
1 source
Co-design Gym : un benchmark unifié pour la co-optimisation de la morphologie et de la politique de contrôle
4arXiv cs.RO 

Co-design Gym : un benchmark unifié pour la co-optimisation de la morphologie et de la politique de contrôle

Une équipe de chercheurs publie sur arXiv (identifiant 2610.02366) Co-Design Gym, une suite de benchmarks dédiée à l'optimisation conjointe de la morphologie d'un agent et de sa politique de contrôle. L'ensemble couvre 20 familles d'environnements, avec plus de 85 configurations de co-conception prédéfinies. Les domaines vont de la manipulation robotique et de la locomotion à la coopération multi-robots, en passant par les dynamiques déformables et molles, les jeux vidéo, les réseaux électriques, les réseaux sans fil, la course de F1, les entrepôts multi-agents et le contrôle optimal. Les auteurs y ajoutent une évaluation systématique d'algorithmes de co-conception représentatifs, pour dresser l'état de l'art actuel. Il s'agit d'un travail de recherche académique : aucun produit, déploiement industriel ni donnée de performance matérielle n'est annoncé, et le résumé ne chiffre pas les résultats de cette comparaison. L'intérêt tient à une hypothèse implicite de la plupart des benchmarks d'apprentissage par renforcement et de robotique : l'agent est figé, seule la politique s'apprend. Or la morphologie conditionne les politiques que l'on peut découvrir, et la meilleure morphologie dépend elle-même des politiques qu'elle autorise. Optimiser les deux séparément donne donc des résultats sous-optimaux. Pour les roboticiens et les intégrateurs, la question est concrète : choix du nombre de degrés de liberté, de la géométrie des membres, de l'emplacement des actionneurs ou de la préhension. Ces décisions se prennent aujourd'hui surtout par ingénierie et itération manuelle, et la co-conception reste peu comparable d'une étude à l'autre. Un banc d'essai commun permettrait de mesurer sur une base homogène ce que ces méthodes apportent réellement, et de vérifier si les gains observés sur des cas isolés se généralisent. L'élargissement à des domaines hors robotique (réseaux, énergie) suggère aussi que la méthode vise un usage plus large que les seuls humanoïdes. Ce travail s'inscrit dans une littérature sur la co-optimisation forme-contrôle qui existe depuis des années, mais dont les résultats sont dispersés entre des environnements ad hoc, ce qui freine les comparaisons. Co-Design Gym adopte le format des suites de type Gym, devenues le standard pour l'apprentissage de politiques, afin de favoriser un progrès cumulatif. Le résumé ne précise ni les algorithmes testés, ni les scores, ni la disponibilité du code, des points à vérifier dans le texte complet. Il reste aussi à voir si ces environnements, simulés, transféreront vers du matériel réel, où l'écart simulation-réalité pèse encore sur la fabrication de morphologies optimisées.

RecherchePaper
1 source