Aller au contenu principal
Interprétation des variables latentes de contrôle pour l'identification de systèmes via Conditional Flow Matching
RecherchearXiv cs.RO 

Interprétation des variables latentes de contrôle pour l'identification de systèmes via Conditional Flow Matching

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (référence 2608.23887v1) une méthode qui rend interprétables les représentations latentes utilisées par les politiques de contrôle adaptatif de drones quadrirotors. Ces politiques, entraînées pour s'ajuster automatiquement à des dynamiques changeantes comme l'usure des actionneurs ou une charge variable, encodent en interne un vecteur latent qui capture l'état du système, mais ce latent reste une boîte noire propre à la politique, sans lien explicite avec les paramètres physiques réels du robot. L'équipe décode chaque latent opérationnel en une distribution de modèles physiques de quadrirotor grâce au conditional flow matching, une technique générative qui produit un ensemble de modèles plausibles plutôt qu'un jeu unique de paramètres, car plusieurs configurations physiques différentes peuvent produire un comportement en boucle fermée similaire. Cette distribution sert ensuite à deux usages sans modifier la politique de bas niveau déjà entraînée: le réglage prédictif en ligne d'un contrôleur de haut niveau, et l'analyse de robustesse face à des perturbations spécifiées. Sous des dynamiques d'actionneurs perturbées, le réglage prédictif basé sur les modèles décodés réduit l'erreur RMSE de suivi de position de 23% et l'erreur RMSE de cap de 45% par rapport à des gains fixes. Sous des perturbations de force gaussiennes, les ensembles de modèles décodés prédisent fidèlement l'évolution de l'erreur de suivi latérale.

Ce travail cible un problème récurrent du contrôle robotique appris: les politiques adaptatives entraînées par renforcement, notamment via la randomisation de domaine, s'ajustent bien en pratique mais restent opaques pour les ingénieurs qui doivent diagnostiquer un échec, régler un contrôleur en aval ou garantir une marge de robustesse avant déploiement. En transformant un vecteur latent abstrait en un ensemble de modèles physiques interprétables, la méthode permet un diagnostic et un réglage post-hoc de politiques figées, sans réentraînement ni accès au code source de la politique, un besoin direct pour les équipes d'intégration devant certifier des systèmes de contrôle appris avant un déploiement industriel.

La publication s'inscrit dans la lignée des travaux sur le contrôle conditionné par latent, une approche courante pour l'adaptation rapide de robots à des dynamiques inconnues, d'abord en simulation puis en transfert vers le réel. Les auteurs positionnent leur contribution comme un pont entre les politiques de bout en bout, difficiles à auditer, et les méthodes de contrôle classique fondées sur des modèles physiques identifiés. Les expériences restent pour l'instant limitées à des quadrirotors simulés soumis à des perturbations d'actionneurs et à des forces gaussiennes; aucune validation sur matériel réel ni extension à d'autres plateformes n'est annoncée à ce stade.

Dans nos dossiers

À lire aussi

Conception de trajectoires à découplage informationnel pour l'identification de systèmes sim-vers-réel
1arXiv cs.RO 

Conception de trajectoires à découplage informationnel pour l'identification de systèmes sim-vers-réel

Des chercheurs proposent l'Informationally Decoupled Trajectory Design (IDTD), un cadre de conception de trajectoires d'exploration pour l'identification de système en simulation vers réel (arXiv 2610.10905). L'identification par échantillonnage ajuste un simulateur pour qu'il reproduise la dynamique du système cible, ce qui fournit des paramètres physiques interprétables et améliore le transfert sim-to-real. Le problème apparaît quand les trajectoires collectées ne distinguent pas les effets de paramètres différents: plusieurs combinaisons peuvent alors expliquer les mêmes données, et les estimations deviennent peu fiables. IDTD construit l'objectif de la politique d'exploration à partir du score du complément de Schur, dérivé de la matrice d'information de Fisher. Le score est normalisé par l'information propre à chaque paramètre, le meilleur segment de trajectoire est retenu pour chacun d'eux, puis les scores sont agrégés par un logarithme. La trajectoire optimisée se compose ainsi d'intervalles complémentaires, chacun révélant un sous-ensemble de paramètres dont la contribution au mouvement peut être attribuée sans ambiguïté. Les tests couvrent plusieurs environnements simulés, d'un système linéaire simple au quadrupède Go2, à l'humanoïde G1 et au quadrirotor Crazyflie. L'erreur d'identification des paramètres diminue en moyenne de 39,6 % par rapport à la meilleure méthode d'exploration active antérieure, et le transfert de politique en aval s'améliore. Les auteurs valident aussi la conception de trajectoires sur un humanoïde K1 réel: les paramètres identifiés reflètent fidèlement la dynamique du système physique. Le résumé ne précise ni le nombre de paramètres estimés, ni les baselines exactes, ni l'ampleur du gain de transfert, et la validation matérielle ne porte que sur une plateforme. Il s'agit de résultats de recherche, sans produit ni déploiement. L'enjeu est pratique pour les équipes qui entraînent des politiques de locomotion ou de manipulation en simulation. Le sim-to-real reste un goulet d'étranglement: la randomisation de domaine contourne l'erreur de modèle sans la corriger, alors que l'identification explicite offre des paramètres interprétables, mais seulement si les données les distinguent. En traitant la conception de l'excitation comme un problème de séparabilité des paramètres, IDTD cible une cause de dérive souvent invisible, des paramètres compensés les uns par les autres. Pour un intégrateur, cela peut réduire le temps de calibration d'un robot neuf et rendre les jumeaux numériques plus fiables. L'approche s'applique à des morphologies variées, des drones aux humanoïdes, ce qui suggère une méthode générique plutôt qu'un réglage propre à une plateforme. Le gain moyen de 39,6 % est mesuré surtout en simulation, et l'écart avec la robustesse réelle reste à démontrer à plus grande échelle. Ce travail s'inscrit dans la lignée de l'identification optimale par information de Fisher, issue de la théorie du contrôle, et des méthodes d'exploration active récentes qui l'étendent aux robots appris. Le choix du G1 d'Unitree, du Go2 et du K1 reflète la place prise par les plateformes humanoïdes et quadrupèdes abordables dans la recherche, car elles permettent des validations matérielles à faible coût. Aucune suite n'est annoncée dans le résumé, mais les extensions logiques sont des essais sur davantage de robots réels, des tâches de manipulation et l'intégration dans des chaînes d'entraînement de politiques à grande échelle, là où la qualité du simulateur conditionne directement le résultat.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Contrôle des systèmes autonomes aligné sur la mission et informé par l'apprentissage : formulation et fondements
2arXiv cs.RO 

Contrôle des systèmes autonomes aligné sur la mission et informé par l'apprentissage : formulation et fondements

Une équipe de recherche publie sur arXiv (référence 2507.04356, version 3) un article intitulé "Mission-Aligned Learning-Informed Control of Autonomous Systems: Formulation and Foundations". Le papier propose un cadre formel d'optimisation à deux niveaux pour piloter des agents physiques autonomes: robots industriels et de service, drones, dispositifs de contrôle embarqués. Les auteurs prennent comme cas d'étude stylisé la robotique d'assistance aux soins, domaine où l'approche classique repose sur une procédure d'apprentissage par renforcement (RL) à deux étages, un niveau bas décidant des mouvements physiques et un niveau haut gérant les tâches conceptuelles. Leur contribution consiste à reformuler cette architecture comme un schéma d'optimisation bi-niveau intégrant du contrôle classique au niveau bas et de la planification classique au niveau haut, le tout couplé à une capacité d'apprentissage. Aucun robot, entreprise ni chiffre de déploiement n'est cité: il s'agit d'un travail théorique posant les fondations mathématiques du cadre, sans expérimentation matérielle rapportée. Pour l'industrie robotique, l'intérêt tient moins à une performance chiffrée qu'à la promesse de fiabilité et de sécurité physique dans des systèmes qui restent aujourd'hui largement des boîtes noires. En combinant RL, contrôle et planification symbolique plutôt que du RL de bout en bout, les auteurs visent une architecture plus interprétable, un enjeu direct pour les intégrateurs et les régulateurs devant certifier des robots évoluant près d'humains. Le travail s'inscrit dans un débat plus large du secteur: les politiques d'apprentissage à grande échelle progressent vite en démonstration, mais laissent ouvertes des questions de garantie de sécurité et d'auditabilité des décisions, souvent exigées avant un déploiement industriel réel. Le contexte évoqué est celui d'une hausse rapide des investissements en recherche et en capital vers les agents physiques autonomes, tous secteurs confondus. Historiquement, les architectures hiérarchiques de RL à deux niveaux séparent déjà décisions motrices bas niveau et objectifs haut niveau, mais sans intégration formelle avec des méthodes de contrôle et de planification classiques, plus anciennes et mieux comprises en termes de garanties. En articulant ces trois familles de méthodes dans un seul cadre, l'article se positionne comme un travail de fondation plutôt qu'une preuve de concept appliquée, laissant à des travaux ultérieurs la validation expérimentale sur des plateformes robotiques réelles.

RecherchePaper
1 source
Modélisation de robots continus par Flow Matching conditionné sur l'action
3arXiv cs.RO 

Modélisation de robots continus par Flow Matching conditionné sur l'action

Une équipe de recherche a publié en mai 2026 (arXiv:2605.09216) une approche d'apprentissage automatique pour prédire la forme en régime stationnaire des robots continus à tendons (TDCRs, tendon-driven continuum robots). Le système combine une plateforme matérielle imprimée en 3D, un pipeline de collecte de données RGB-D multi-caméras, et un modèle de flow matching conditionné par l'état moteur, qui associe directement les commandes d'actionneurs à la géométrie 3D résultante sous forme de nuage de points. Les expériences couvrent des TDCRs simulés à 2, 3 et 5 modules sous MuJoCo, ainsi que des robots réels à 2 et 3 modules. Sur les métriques Chamfer Distance (CD) et Earth Mover's Distance (EMD), la méthode surpasse les approches antérieures de modélisation de déformables 3D et d'auto-modélisation robotique. Une extension en simulation montre que le même schéma conditionnel peut intégrer la charge utile en bout de bras comme variable d'entrée supplémentaire. Ce résultat est notable pour les intégrateurs de robots chirurgicaux, d'inspection en espace confiné ou de manipulation flexible, trois domaines où les TDCRs sont candidats naturels mais restent difficiles à contrôler précisément. Les méthodes analytiques classiques, basées sur la théorie des tiges de Cosserat, requièrent une caractérisation fine des paramètres de friction et de rigidité, souvent non reproductibles d'un exemplaire à l'autre en raison de la variabilité fabrication. L'approche présentée délègue cette complexité à la donnée : un échantillonnage de configurations quasi-statiques suffit à entraîner le modèle, sans connaissance du modèle physique. Le conditionnement par payload ouvre la voie à une planification adaptative en charge variable, ce que les modèles analytiques actuels gèrent mal en temps réel. Le flow matching, popularisé depuis 2022 comme alternative aux modèles de diffusion pour sa rapidité d'inférence, est ici appliqué pour la première fois à l'auto-modélisation cinématique de robots continus, selon les auteurs. Les approches concurrentes reposent soit sur des modèles physiques paramétriques, soit sur des réseaux neuronaux entraînés sur des représentations volumétriques ou de pose d'extrémité, sans géométrie complète. La plateforme 3D imprimée vise à rendre la méthode reproductible à faible coût. L'article reste un preprint sans déploiement annoncé ; les prochaines étapes naturelles incluent l'extension au contrôle en boucle fermée et la validation sur des robots à plus de 5 modules.

RecherchePaper
1 source
Bi-MoDe : apprentissage par imitation à contrôle bilatéral via décodage conditionné par modificateur pour moduler vitesse d'exécution et intensité de contact
4arXiv cs.RO 

Bi-MoDe : apprentissage par imitation à contrôle bilatéral via décodage conditionné par modificateur pour moduler vitesse d'exécution et intensité de contact

Bi-MoDe (Bilateral Control-based Imitation Learning via Modifier-Conditioned Decoding) est un nouveau framework de recherche en robotique décrit dans une publication arXiv (2609.16040v1, mise en ligne mi-septembre 2026, texte intégral et matériel additionnel disponibles sur mertcookimg.github.io/bi-mode). Il s'appuie sur l'apprentissage par imitation à contrôle bilatéral, une méthode qui capture simultanément la position et la force appliquée pendant une démonstration, ce qui la rend adaptée à des tâches de manipulation impliquant un contact physique soutenu avec l'environnement. La contribution technique consiste à injecter un latent contraint dans chaque couche du décodeur Transformer générant les actions, via une technique de conditionnement appelée adaLN-Zero, afin qu'un opérateur puisse spécifier au moment de l'exécution comment une tâche apprise doit être réalisée, par exemple rapidement ou lentement, avec douceur ou fermeté. Les chercheurs ont testé la méthode sur une tâche réelle unique, l'essuyage d'un tableau blanc, en combinant des modificateurs temporels (vitesse) et physiques (intensité du contact). L'enjeu dépasse la simple démonstration technique : la plupart des politiques d'imitation actuelles produisent un comportement figé, calé sur les démonstrations d'entraînement, sans possibilité de moduler finement la force ou le rythme sans réentraîner le modèle. Pour des intégrateurs industriels manipulant des pièces fragiles ou des opérations à cadence variable, pouvoir ajuster l'intensité de contact à la volée serait un vrai gain d'exploitabilité. Les résultats indiquent une amélioration du respect des consignes physiques par rapport à une base de référence par action-chunking, avec un contrôle temporel comparable, et une étude d'ablation montre que le conditionnement du décodeur et la composition dans l'espace latent doivent être combinés pour obtenir cette précision. Le travail s'inscrit dans la lignée du contrôle bilatéral, technique de téléopération historiquement utilisée pour transmettre le retour de force dans l'apprentissage par imitation, un axe de recherche distinct des approches VLA généralistes comme GR00T N2 ou Pi-0. Il s'agit toutefois d'un preprint arXiv non encore évalué par les pairs, validé sur une seule tâche en laboratoire, sans acteur industriel ni feuille de route de déploiement annoncée à ce stade.

RecherchePaper
1 source