Aller au contenu principal
Une architecture de contrôle robuste au niveau des tâches pour les systèmes dynamiques appris
RecherchearXiv cs.RO 

Une architecture de contrôle robuste au niveau des tâches pour les systèmes dynamiques appris

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente une architecture de contrôle nommée L1-DS (L1-augmented Dynamical Systems), décrite dans un article arXiv (2511.09790v2, version corrigée) sur l'apprentissage par démonstration basé sur les systèmes dynamiques (DS). Le problème ciblé est le "task-exécution mismatch" : l'écart entre la trajectoire planifiée et celle réellement exécutée par le robot, dû à des dynamiques non modélisées, des perturbations persistantes et la latence du système. La solution associe un contrôleur stabilisateur nominal et un contrôleur adaptatif L1, plus un sélecteur de cible fondé sur une Dynamic Time Warping (DTW) fenêtrée qui corrige le désalignement temporel pour un suivi cohérent en phase. L'approche est validée sur deux jeux de données de référence, LASA et IROS handwriting, utilisés pour évaluer la reproduction de trajectoires d'écriture manuscrite par bras robotique.

Le sujet touche un point sensible pour les intégrateurs qui déploient des modèles de mouvement appris par démonstration sur du matériel réel : en simulation, ces systèmes dynamiques produisent des trajectoires stables et répétables, mais en conditions réelles, frottements, retards d'actionneurs et perturbations font dériver le robot de la trajectoire prévue. L1-DS ne remplace aucun modèle de mouvement existant : il s'ajoute comme couche de contrôle robuste par-dessus n'importe quel schéma de LfD basé sur les systèmes dynamiques, une brique potentiellement compatible avec des pipelines déjà en place plutôt qu'une nouvelle méthode d'apprentissage. Cette approche s'oppose dans son esprit aux architectures Vision-Language-Action (VLA) récentes, qui misent sur la généralisation par apprentissage bout-en-bout à partir de très larges volumes de données : ici, la robustesse repose sur des garanties de contrôle classiques plutôt que sur l'échelle des données d'entraînement.

L'apprentissage par démonstration basé sur les systèmes dynamiques s'appuie sur des travaux plus anciens comme les Dynamic Movement Primitives et les modèles de mélange de gaussiennes stables, utilisés depuis plus d'une décennie pour générer des trajectoires à partir d'un petit nombre de démonstrations humaines. Le contrôle adaptatif L1 provient de la robotique aérienne, où il est recherché pour sa capacité à réagir rapidement aux incertitudes sans compromettre la stabilité. Publié en deuxième version sur arXiv sous la référence 2511.09790, ce travail reste une contribution de recherche académique : aucune application industrielle, aucun partenariat avec un fabricant de robots ni aucun déploiement sur matériel commercial n'est mentionné. La suite logique, non annoncée par les auteurs, serait une validation sur bras robotique physique dans des tâches de manipulation industrielle, au-delà des benchmarks d'écriture utilisés ici.

Dans nos dossiers

À lire aussi

Manipulation dynamique de corde apprise par contrôle itératif au niveau tâche
1arXiv cs.RO 

Manipulation dynamique de corde apprise par contrôle itératif au niveau tâche

Des chercheurs ont publié une méthode d'apprentissage itératif au niveau tâche (Task-Level Iterative Learning Control, ILC) pour la manipulation dynamique de cordes par bras robotique. La démonstration porte sur le "flying knot", un nœud exécuté en mouvement dans l'espace tridimensionnel, tâche non planaire réputée difficile à automatiser. La méthode combine une unique démonstration humaine et un modèle simplifié de corde, et s'entraîne directement sur matériel réel sans recourir à de larges bases de données ni à de la simulation massive. À chaque itération, l'algorithme inverse un modèle couplé robot-corde en résolvant un programme quadratique (QP) pour propager les erreurs dans l'espace tâche vers des corrections d'action. Sept types de cordes ont été testés: chaîne métallique, tube chirurgical en latex, cordes tressées et toronnées, avec des diamètres de 7 à 25 mm et des densités de 0,013 à 0,5 kg/m. Le système atteint 100 % de réussite en 10 essais ou moins sur l'ensemble des configurations. Le transfert entre types de cordes différents s'effectue en 2 à 5 essais supplémentaires pour la plupart des paires testées. Ce résultat contredit une hypothèse courante dans la manipulation d'objets déformables (DOM): la robustesse ne passe pas nécessairement par des jeux de données massifs ou des milliers d'heures de simulation. Une seule démonstration humaine suffit à amorcer l'apprentissage, et la convergence s'effectue en moins de dix essais réels sur matériel physique, même pour des cordes aussi différentes qu'une chaîne rigide et un tube en latex souple. La capacité de transfert inter-corde en 2 à 5 essais est particulièrement significative: elle indique que le modèle interne capture suffisamment la dynamique pour s'adapter à de nouvelles propriétés mécaniques sans redémarrer l'apprentissage. Pour les intégrateurs travaillant sur du câblage automatisé, de la couture industrielle ou du conditionnement de produits souples, c'est une piste crédible vers des systèmes moins gourmands en données et plus rapidement reconfigurables sur ligne. L'ILC est une technique de contrôle classique, ici adaptée au niveau tâche plutôt qu'au niveau signal bas, ce qui la rend plus générique face à la variabilité des objets déformables. Les approches concurrentes en DOM font généralement appel à des réseaux de neurones entraînés sur simulation ou à l'apprentissage par imitation à grande échelle, deux méthodes coûteuses en données et exposées au reality gap. L'absence totale de simulation dans cette méthode est un choix délibéré qui contourne ce problème au prix d'itérations physiques, un compromis acceptable dès lors que le nombre d'essais reste faible. Les travaux sont disponibles en prépublication sur arXiv (2602.21302) et accompagnés d'un site de démonstration vidéo (flying-knots.github.io). Les suites naturelles incluent l'extension à des nœuds plus complexes, l'intégration sur des manipulateurs industriels multi-DOF, et des validations en environnements non contrôlés.

RecherchePaper
1 source
Apprentissage de dynamiques neuronales ODE adaptées au contexte pour le contrôle robotique adaptatif
2arXiv cs.RO 

Apprentissage de dynamiques neuronales ODE adaptées au contexte pour le contrôle robotique adaptatif

Des chercheurs ont proposé un modèle de dynamique contextuel fondé sur les équations différentielles ordinaires neuronales (Neural ODE) pour améliorer le contrôle de robots opérant dans des environnements incertains et variables. Le travail, déposé en juin 2026 sur arXiv (référence 2606.15469), cible les perturbations que les contrôleurs classiques peinent à absorber: variations des conditions de contact, effets aérodynamiques et perturbations externes imprévues. La méthode repose sur une procédure d'entraînement en deux phases: le modèle inspecte l'historique des états et des actions du robot pour inférer les facteurs environnementaux courants, sans capteurs dédiés supplémentaires. La compatibilité avec le MPC (Model Predictive Control) est intégrée dès la conception. Les validations portent sur trois plateformes distinctes: un drone quadrirotor en simulation, un robot sphérique Sphero BOLT et un bras manipulateur industriel Fanuc, ces deux derniers testés en conditions réelles. L'enjeu central est la dérive de modèle lors du déploiement: un robot calibré en laboratoire voit ses performances se dégrader dès que l'environnement change, que ce soit un sol différent, une charge variable ou des turbulences. Par rapport aux approches récurrentes classiques (LSTM, GRU), les Neural ODE présentent un avantage structurel: elles modélisent la dynamique en temps continu, ce qui améliore la cohérence physique et simplifie l'interface avec les solveurs MPC. L'inférence du contexte depuis le seul historique actions-états, sans instrumentation additionnelle, réduit la barrière d'intégration pour les industriels. Le test sur un Fanuc, bras omniprésent en production manufacturière, ancre les résultats dans une réalité opérationnelle tangible. Point de réserve: l'article est un preprint et l'abstract ne publie aucune métrique chiffrée de performance, ce qui rend l'évaluation indépendante difficile à ce stade. Les Neural ODE ont été introduites en 2018 par Chen et al. (NeurIPS) comme alternative aux réseaux récurrents pour modéliser des systèmes dynamiques continus. Leur application au contrôle robotique adaptatif répond à un obstacle persistant du secteur: le sim-to-real gap, qui fragilise la fiabilité des systèmes autonomes hors conditions contrôlées. Les approches concurrentes comprennent les processus gaussiens (GP) pour l'adaptation en ligne, les algorithmes méta-apprenants (MAML, PEARL) et l'identification de systèmes en temps réel. Ce travail se distingue par l'inférence contextuelle implicite, couplée nativement au MPC plutôt qu'ajoutée en couche. Le code source est ouvert sur GitHub et des démonstrations vidéo sont accessibles. La prochaine étape logique serait une validation sur des tâches de manipulation à charge variable ou un déploiement en environnement industriel non contrôlé.

RecherchePaper
1 source
Robuste aux perturbations : contrôle cinématique sécurisé pour robots à architecture fermée
3arXiv cs.RO 

Robuste aux perturbations : contrôle cinématique sécurisé pour robots à architecture fermée

Une équipe de recherche publie une nouvelle version (v3) d'un article arXiv (2512.05292) consacré au contrôle cinématique sûr et robuste aux perturbations pour les robots industriels à architecture fermée. Le problème visé est concret : la plupart des systèmes robotiques commerciaux embarquent un contrôleur de couple en boucle interne verrouillé, que l'utilisateur ne peut ni modifier ni inspecter, alors que seule la boucle externe, qui envoie des commandes cinématiques comme la position ou la vitesse, reste accessible. Les auteurs proposent un module additionnel, facile à intégrer à cette boucle externe, combinant un contrôle par rejet de perturbation et une fonction de barrière de contrôle (control barrier function) robuste. L'objectif est d'assurer à la fois un suivi de trajectoire performant et une sécurité garantie sur l'ensemble du système dynamique du bras manipulateur, malgré un contrôleur interne imparfait et un modèle dynamique incertain. La méthode est validée par une analyse de stabilité, une preuve formelle de sécurité, et des essais matériels sur un bras manipulateur PUMA, avec une vidéo de démonstration disponible en ligne. L'intérêt pour l'industrie robotique tient à la contrainte qu'elle contourne : de nombreux bras industriels commerciaux ne donnent accès qu'aux commandes cinématiques, jamais au contrôle de couple bas niveau, propriétaire et fermé. Une solution qui garantit précision de suivi et sécurité formelle sans nécessiter cet accès intéresse directement les intégrateurs qui doivent ajouter des garanties de sécurité (collaboration humain-robot, environnements partagés) sur du matériel existant, sans réingénierie du contrôleur constructeur. Elle répond aussi à un point sensible du secteur : la robustesse face à l'écart entre modèle théorique et comportement réel, souvent négligée dans les démonstrations qui supposent un contrôleur bas niveau idéal. Le travail s'inscrit dans la lignée des recherches combinant rejet de perturbation et fonctions de barrière de contrôle, deux familles d'outils bien établies en théorie du contrôle, mais rarement unifiées pour ce cas d'usage précis des architectures fermées. Les auteurs revendiquent une simplicité d'implémentation et une robustesse supérieures aux approches existantes, sans toutefois préciser dans le résumé quels systèmes commerciaux concrets bénéficieraient directement de cet add-on au-delà du prototype PUMA testé en laboratoire.

RecherchePaper
1 source
Attaques trojans sur les contrôleurs de réseaux de neurones pour systèmes robotiques
4arXiv cs.RO 

Attaques trojans sur les contrôleurs de réseaux de neurones pour systèmes robotiques

Des chercheurs ont publié sur arXiv (référence 2602.05121v2) une démonstration de faisabilité d'attaques par backdoor, dites attaques "Trojan", ciblant des contrôleurs neuronaux embarqués dans des systèmes robotiques. Le vecteur d'attaque étudié est un robot mobile à propulsion différentielle, dont le contrôleur de suivi de trajectoire et de stabilisation de pose est implémenté sous forme de réseau de neurones. Les auteurs ont conçu un module Trojan parallèle, léger, conçu pour être inséré dans le réseau principal sans modifier ses poids. Ce module reste inactif en fonctionnement normal, puis s'active dès qu'une condition de déclenchement très précise est détectée, définie conjointement par la pose courante du robot et ses paramètres objectifs. À l'activation, le module corrompt directement les commandes de vitesse des roues, provoquant des comportements non désirés, potentiellement dangereux. L'attaque est validée en simulation selon deux scénarios distincts. Ce travail met en lumière un risque souvent sous-estimé dans la robotique industrielle et les AMR (robots mobiles autonomes) : la chaîne d'approvisionnement en modèles neuronaux. Dès lors qu'un contrôleur est fourni par un tiers, entraîné sur une infrastructure externe, ou acquis via un pipeline de fine-tuning non audité, l'intégrateur ne peut pas garantir l'absence de modules cachés. La discrétion du Trojan, dormant jusqu'à un trigger très spécifique, le rend difficilement détectable par les tests fonctionnels classiques. Pour les COO industriels et les équipes sécurité, cela signifie que les approches de validation de modèles actuelles, orientées performance, sont insuffisantes face à des attaques intentionnelles. Les attaques par backdoor sur les réseaux de neurones sont documentées depuis 2017 dans le domaine de la classification d'images, mais leur transposition aux systèmes de contrôle robotique en temps réel est plus récente et plus critique : une erreur de classification est bénigne, une dérive de trajectoire sur un robot industriel peut provoquer des dommages matériels ou humains. Ce papier s'inscrit dans un corpus croissant qui questionne la robustesse des architectures VLA (Vision-Language-Action) et des contrôleurs neuronaux génériques. Les suites logiques sont des méthodes de détection (analyse spectrale des poids, tests adversariaux ciblés) et des protocoles de certification des modèles embarqués, un chantier encore largement ouvert pour les organismes de standardisation comme l'ISO ou l'IEC.

UELes intégrateurs européens d'AMR et robots industriels utilisant des contrôleurs neuronaux fournis par des tiers sont directement exposés à ce vecteur d'attaque ; les travaux de normalisation ISO/IEC sur la certification des modèles embarqués deviennent un chantier prioritaire pour le marché européen.

RechercheOpinion
1 source