Aller au contenu principal
Contrôle de Koopman différentiable et adaptatif, guidé par la physique, pour un vol stable sous perturbations inconnues
RecherchearXiv cs.RO 

Contrôle de Koopman différentiable et adaptatif, guidé par la physique, pour un vol stable sous perturbations inconnues

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (arXiv:2506.08319) un cadre de commande hybride baptisé DEKC (Differentiable data-Enabled Koopman Control), conçu pour permettre à des systèmes robotiques de voler ou de se déplacer de manière précise dans des environnements non structurés, malgré des perturbations extérieures non modélisées. L'approche combine un modèle physique nominal du système avec un réseau de neurones profond chargé de paramétrer la "lifting function" de l'opérateur de Koopman, un outil mathématique qui projette des dynamiques non linéaires dans un espace linéaire global, simplifiant ainsi la conception du contrôleur. Point central de la contribution : les perturbations (forces aérodynamiques, charges suspendues) sont modélisées non pas comme du bruit aléatoire, mais comme un système dynamique à part entière dont l'évolution temporelle est apprise et anticipée. Un mécanisme de mise à jour par gradient rétropropagé en ligne permet une adaptation en temps réel aux incertitudes variables. Les validations expérimentales couvrent des simulations sur un robot spatial amarré (tethered space robot) et des essais réels sur quadrirotor soumis à des perturbations aérodynamiques et à des charges utiles suspendues lors de trajectoires agiles.

L'intérêt industriel tient à la dualité que DEKC résout : les méthodes d'apprentissage pur offrent une bonne capacité d'approximation mais exigent un entraînement hors ligne massif et ne fournissent aucune garantie théorique de stabilité, tandis que les contrôleurs robustes classiques restent purement réactifs, corrigeant les erreurs au lieu de les anticiper. DEKC adopte une posture proactive en intégrant la trajectoire future estimée des perturbations directement dans la loi de commande, ce qui réduit les erreurs de suivi sur des manoeuvres rapides. La validation sur quadrirotor physique constitue un argument concret de passage du simulateur au réel, un défi fréquemment sous-estimé dans les publications de contrôle.

L'opérateur de Koopman est un formalisme de contrôle établi depuis plusieurs décennies, mais son application combinée à des réseaux différentiables et à une prédiction explicite des perturbations représente une direction de recherche active depuis 2020 environ. Les approches concurrentes incluent les contrôleurs adaptatifs à base de Gaussian Process (GP-MPC), les réseaux neuronaux résiduels couplés à un MPC classique, et les méthodes d-Learning entièrement sans modèle. DEKC se distingue en conservant la structure physique tout en apprenant uniquement la dynamique résiduelle, ce qui réduit la charge de données. L'article reste un preprint non encore évalué par les pairs ; aucune timeline de déploiement industriel ni partenariat avec un intégrateur n'est mentionné.

Dans nos dossiers

À lire aussi

Contrôle adaptatif de précision basé sur un modèle pour la poussée planaire sur table en dynamique incertaine
1arXiv cs.RO 

Contrôle adaptatif de précision basé sur un modèle pour la poussée planaire sur table en dynamique incertaine

Une équipe de chercheurs a publié une nouvelle version (v2) d'un article sur arXiv (2510.03768) décrivant un système de contrôle pour la manipulation par poussée non préhensile sur table, c'est-à-dire déplacer un objet en le poussant plutôt qu'en le saisissant avec une pince. Le système combine un modèle de dynamique appris, bâti sur une architecture récurrente GRU enrichie de couches non linéaires, avec un contrôleur MPPI (Model Predictive Path Integral), une méthode d'optimisation par échantillonnage. L'entraînement se fait entièrement en simulation, avec randomisation de domaine pour faciliter le transfert vers le réel. Les auteurs valident l'approche en simulation puis sur un bras robotique Franka Panda équipé d'un suivi sans marqueurs. Les résultats montrent des taux de réussite élevés pour le positionnement de précision sous des seuils stricts, ainsi que de bonnes performances en suivi de trajectoire, évitement d'obstacles, changement de côté de poussée et longueurs de poussée variables. L'apport principal tient à la polyvalence : un seul modèle appris couvre plusieurs tâches simplement en changeant la fonction objectif du contrôleur, sans réentraînement. Cela contraste avec la majorité des travaux antérieurs sur la poussée pilotée par les données, généralement limités à une capacité étroite (changement de côté, précision ou entraînement mono-tâche) et devant être réentraînés pour chaque nouvel objectif. Pour des équipes travaillant sur la manipulation non préhensile en industrie, réarrangement d'objets, alignement de pièces, tri sans préhenseur dédié, ce résultat suggère qu'un modèle de dynamique unique peut remplacer plusieurs politiques spécialisées, réduisant le coût d'ingénierie. Le transfert sim-to-réel réussi, sans données réelles pour l'entraînement, confirme aussi la viabilité de cette approche pour un déploiement rapide sur du nouveau matériel. Le travail s'inscrit dans la lignée des méthodes de poussée pilotées par les données, apparues en réaction aux limites des approches analytiques classiques, trop dépendantes d'une modélisation manuelle précise de la friction et des contacts. Le système reste pour l'instant restreint à un seul type d'objet : les auteurs indiquent l'étendre via des longueurs de poussée plus variées et un contrôleur équilibré réduisant le nombre d'étapes pour les objectifs à horizon long. Aucun calendrier de déploiement industriel n'est mentionné ; il s'agit à ce stade d'une contribution de recherche académique, sans acteur français ou européen identifié dans le texte.

RecherchePaper
1 source
Échantillonnage génératif par blocs d'actions pour un contrôle adaptatif de la rigidité en collaboration homme-robot physique
2arXiv cs.RO 

Échantillonnage génératif par blocs d'actions pour un contrôle adaptatif de la rigidité en collaboration homme-robot physique

Une équipe de recherche a publié sur arXiv (2608.25284, août 2026) une méthode de contrôle adaptatif de raideur articulaire pour la collaboration physique homme-robot, basée sur l'échantillonnage génératif de séquences d'actions. À partir d'une image RGB et d'estimations de couple externe aux articulations, la politique générative tire plusieurs séquences d'actions futures ; leur variance pilote en continu la raideur et l'amortissement du robot, une forte dispersion le rendant plus compliant, une faible dispersion plus ferme. Sur une tâche réelle de transport collaboratif à quatre directions possibles, la méthode atteint un taux de réussite de 0,95, contre 0,83 pour une raideur fixe et 0,69 pour une politique déterministe, la variance grimpant précisément quand la direction voulue par l'humain reste ambiguë. Le résultat s'adresse aux intégrateurs de cobots, bras d'assistance et exosquelettes confrontés à l'arbitrage entre un robot trop rigide, qui impose sa trajectoire, et un robot trop compliant, sans assistance utile. Utiliser la dispersion d'un modèle génératif comme proxy d'incertitude sur l'intention humaine, sans reconnaissance de geste explicite, offre un signal de contrôle peu coûteux ; l'écart avec la politique déterministe (0,95 contre 0,69) confirme l'intérêt d'une modélisation stochastique de l'action, alors que le secteur cherche à rendre les politiques VLA exploitables au-delà du laboratoire. Le résultat reste toutefois obtenu sur une seule tâche à quatre directions, avec un volume d'essais limité typique d'un preprint, et sa transposition à des manipulations plus complexes n'est pas démontrée. Ce travail prolonge les recherches sur le contrôle d'impédance variable en interaction physique homme-robot, en détournant l'échantillonnage de séquences d'actions, technique popularisée par les politiques récentes de type action chunking (dans la veine des approches diffusion policy ou des modèles VLA comme Pi-0 ou GR00T N2), pour en extraire un signal d'incertitude plutôt qu'une action à exécuter. La comparaison se limite à deux références internes, raideur fixe et politique déterministe, sans confrontation à un système commercial : une contribution académique en preprint, non un produit ou un pilote industriel. Aucune entreprise ni calendrier de déploiement n'est mentionné dans l'article ; les suites évoquées porteraient sur des tâches de manipulation plus riches et une validation auprès de davantage de participants.

RecherchePaper
1 source
ReconVLA : un cadre VLA guidé par l'incertitude et la détection des défaillances pour le contrôle robotique
3arXiv cs.RO 

ReconVLA : un cadre VLA guidé par l'incertitude et la détection des défaillances pour le contrôle robotique

Des chercheurs ont mis en ligne en avril 2026 sur arXiv (référence 2604.16677) un framework nommé ReconVLA, conçu pour doter les modèles vision-langage-action (VLA) d'une capacité jusque-là absente : estimer leur propre degré de confiance avant d'agir. ReconVLA applique la prédiction conforme (conformal prediction) directement sur les tokens d'action produits par un VLA pré-entraîné, sans modification ni réentraînement du modèle. Cette couche génère des intervalles d'incertitude calibrés, corrélés à la qualité d'exécution et au taux de succès de la tâche. Le même mécanisme est étendu à l'espace d'état du robot pour détecter des configurations anormales avant qu'une défaillance ne survienne. L'évaluation couvre des tâches de manipulation variées en simulation et sur robot réel. L'absence de mesure de confiance calibrée est aujourd'hui l'un des principaux verrous à l'industrialisation des VLA. Un modèle comme Pi-0 (Physical Intelligence), OpenVLA ou GR00T N2 (NVIDIA) peut produire une action avec une assurance apparente même lorsque la scène perçue sort de sa distribution d'entraînement. ReconVLA contourne ce problème sans toucher au modèle sous-jacent : les intégrateurs peuvent envelopper n'importe quel VLA existant avec cette surcouche de sécurité. En pratique, le framework réduit les erreurs catastrophiques et fournit un signal exploitable par les superviseurs humains ou les systèmes de fail-safe industriels. Il convient de souligner que les résultats présentés restent à l'échelle laboratoire, sans validation sur des lignes de production réelles. La prédiction conforme est une méthode statistique bien établie dans la communauté du machine learning certifié, mais son application aux VLA robotiques reste émergente. Ces architectures ont connu une accélération notable depuis 2023 avec RT-2 (Google DeepMind), puis OpenVLA, Pi-0 et GR00T N2, chacune promettant un contrôle généraliste sans garantie formelle de comportement hors distribution. ReconVLA s'inscrit dans une tendance visant à rendre ces modèles auditables et déployables dans des contextes à risque industriel ou réglementé. Les prochaines étapes naturelles incluent l'intégration avec des pipelines temps réel et la validation sur des horizons de tâches plus longs, domaines où la calibration de l'incertitude devient critique pour les décideurs industriels.

UEImpact indirect : si validé à l'échelle industrielle, ce framework faciliterait le déploiement de VLA dans des environnements réglementés européens (AI Act, sécurité machines), sans nécessiter de réentraînement des modèles existants.

RechercheOpinion
1 source
ErgoSurf : contrôle ergodique pour la couverture de surfaces inconnues
4arXiv cs.RO 

ErgoSurf : contrôle ergodique pour la couverture de surfaces inconnues

Des chercheurs présentent ErgoSurf, un framework de contrôle ergodique en ligne qui permet à un robot de couvrir systématiquement une surface inconnue tout en maintenant un contact stable, pour des tâches comme l'inspection, le nettoyage, le ponçage ou le polissage. Contrairement aux méthodes ergodiques classiques, qui exigent une géométrie connue à l'avance ou un scan visuel préalable, ErgoSurf reconstruit la surface en temps réel à partir du seul retour tactile recueilli pendant l'exécution. Le système repose sur un modèle de surface implicite gaussien (GPIS, Gaussian Process Implicit Surface) qui apprend la géométrie globale à partir de nuages de points échantillonnés sur les plans tangents aux points de contact observés, ajustés itérativement au modèle. Une analogie avec la diffusion de chaleur produit des champs de potentiel qui guident l'exploration ergodique et se traduisent en trajectoires robotiques lisses. La méthode a été validée à la fois en simulation et sur robot réel, avec des erreurs de reconstruction de surface proches de la vérité terrain. Cette approche lève une limite pratique majeure du contrôle ergodique: sa dépendance à une cartographie préalable, par vision ou autre capteur, qui cantonnait son usage aux environnements connus ou statiques. En couvrant une surface tout en la découvrant par le seul toucher, ErgoSurf ouvre la voie à des applications sur des pièces non cartographiées ou dont la géométrie varie d'un exemplaire à l'autre, un cas fréquent en inspection ou finition industrielle. Pour les intégrateurs, l'intérêt est de réduire la dépendance à des capteurs de vision coûteux et de rendre les robots de contact plus robustes en environnement mal connu ou changeant, dans la lignée d'une robotique de contact tournée vers des méthodes tactiles, moins fragiles que la vision face aux occlusions ou à la poussière en atelier. Le contrôle ergodique est une technique établie de planification de trajectoire, utilisée pour l'exploration et la couverture selon une distribution spatiale voulue, mais historiquement centrée sur la recherche d'information plutôt que sur le contact physique direct. Les travaux précédents sur la couverture de surfaces reposaient sur une géométrie connue ou un scan visuel initial, ce qui limitait leur transfert vers des environnements non pré-modélisés. Publié en prépublication sur arXiv, ErgoSurf combine apprentissage de géométrie par processus gaussien et planification ergodique en ligne pour lever cette contrainte. Sans calendrier de transfert industriel annoncé, la validation sur robot réel, au-delà de la simulation, laisse entrevoir une prochaine étape vers des tâches concrètes de ponçage, polissage ou inspection en environnement moins contrôlé.

RecherchePaper
1 source