Aller au contenu principal
Cadre d'apprentissage par tranches pour l'identification en ligne des perturbations dans le contrôle d'attitude SO(3) d'un quadrotor
RecherchearXiv cs.RO 

Cadre d'apprentissage par tranches pour l'identification en ligne des perturbations dans le contrôle d'attitude SO(3) d'un quadrotor

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (identifiant 2508.14422, version 4) un framework d'apprentissage géométrique appelé "Sliced Learning", conçu pour l'identification en ligne de perturbations dans le contrôle d'attitude des quadrotors selon le groupe de rotations SO(3). Le coeur du système est le module SANM (Sliced Adaptive-Neuro Mapping), qui décompose le problème d'identification de haute dimension en plusieurs sous-mappings de faible dimension, chacun traité par un réseau de neurones peu profond combiné à des lois adaptatives. Ces composants sont mis à jour en ligne via une adaptation basée sur les fonctions de Lyapunov, à une fréquence de 400 Hz, sur des microcontrôleurs à ressources limitées de type STM32. La convergence exponentielle du système est démontrée mathématiquement malgré des perturbations variables dans le temps et des incertitudes sur les moments d'inertie, et les résultats sont validés par des expériences en conditions réelles.

L'intérêt principal de ce travail réside dans la capacité d'adaptation neuronale en temps réel à 400 Hz sur un MCU embarqué classique, un seuil rarement atteint dans la littérature sur le contrôle adaptatif des drones. Contrairement aux approches conventionnelles qui apprennent à partir des états du système, la stratégie "learning-from-error" exploite la représentation d'erreur en algèbre de Lie, ce qui préserve la structure géométrique intrinsèque de SO(3) et autorise une décomposition axiale du problème. Pour les intégrateurs de systèmes drones et les équipes de contrôle embarqué, cela représente un module d'identification de perturbations à la fois léger, interprétable et certifiable sur le plan de la stabilité, trois critères déterminants pour des applications industrielles ou de défense.

Le contrôle d'attitude géométrique des quadrotors sur SO(3) est un domaine actif depuis les années 2010, avec des travaux fondateurs de Lee, Leok et McClamroch qui ont formalisé des contrôleurs évitant les singularités des angles d'Euler. L'identification de perturbations en ligne reste un verrou face aux vents, variations de charge et dérives d'inertie, et les approches neuronales existantes sont généralement trop lourdes pour tenir sur MCU embarqué, forçant le recours à des calculateurs plus puissants. Ce travail se positionne dans cet espace de contrainte, avec une validation hardware sur STM32, mais sans annoncer de déploiement commercial ni de partenariat industriel à ce stade, ce qui le situe clairement au niveau de la preuve de concept académique.

Dans nos dossiers

À lire aussi

Apprentissage en une démonstration pour la manipulation robotique à contacts riches, par identification des interactions physiques
1arXiv cs.RO 

Apprentissage en une démonstration pour la manipulation robotique à contacts riches, par identification des interactions physiques

Un preprint publié sur arXiv (arXiv:2608.24741v1, août 2026) présente une méthode de Learning from Demonstration (LfD) qui modélise explicitement les interactions physiques entre un robot et son environnement, notamment la création et la rupture de contact pendant une manipulation. Un contrôleur hybride position-force suit la trajectoire démontrée par un humain jusqu'à ce que les conditions de transition liées au contact, identifiées durant cette démonstration, soient atteintes. La méthode a été validée sur un robot réel via quatre tâches riches en contacts, ouverture de portes et de serrures, prise et vissage de boulons, dégagement d'objets coincés et suivi de contour de surface, chacune apprise à partir d'une seule démonstration et sans connaissance préalable de la tâche. Cette approche tranche avec la tendance dominante de la manipulation robotique, où les modèles vision-langage-action (VLA) à grande échelle exigent des milliers de démonstrations pour généraliser. En rendant explicite la physique du contact plutôt que de la confier à un réseau de neurones opaque, les auteurs visent une interprétabilité rare dans la littérature du LfD, où l'on sait précisément pourquoi et quand le robot change de comportement. Pour des intégrateurs industriels confrontés à des tâches d'assemblage ou de maintenance à forte variabilité géométrique, comme le boulonnage ou le verrouillage, l'intérêt tient à une programmation par démonstration unique, robuste aux variations imprévues et généralisable quand ces variations sont connues à l'avance, ce qui contredit l'idée que seule l'échelle des données garantit une manipulation fiable. Le travail s'inscrit dans un courant du LfD qui, selon les auteurs, néglige généralement la modélisation explicite du contact physique, alors que celui-ci est central dans la plupart des tâches de manipulation réelles. Ils présentent leur contribution comme un moyen de combler cette lacune d'interprétabilité en apprentissage à partir de très peu d'exemples, en détaillant comment robustesse, généralisation et adaptabilité peuvent être implémentées explicitement plutôt que laissées à l'apprentissage statistique. Publié comme preprint non encore évalué par les pairs, sans indication d'institution ni de calendrier de valorisation industrielle, il se positionne comme une contribution méthodologique plutôt qu'un produit, dans un paysage de la manipulation robotique dominé par des modèles fondationnels de type VLA entraînés sur de vastes corpus de démonstrations.

RecherchePaper
1 source
Ce qui compte pour le transfert de l'apprentissage par renforcement en simulation vers l'apprentissage en ligne sur des robots réels
2arXiv cs.RO 

Ce qui compte pour le transfert de l'apprentissage par renforcement en simulation vers l'apprentissage en ligne sur des robots réels

Une étude empirique menée sur trois plateformes robotiques distinctes a testé l'apprentissage par renforcement (RL) en ligne directement sur des robots physiques, à travers 100 sessions d'entraînement réelles. Les chercheurs ont systématiquement isolé les choix de conception algorithmiques, matériels et expérimentaux habituellement laissés implicites dans les travaux précédents sur le sujet. Résultat principal : certains réglages par défaut largement utilisés dans la pratique du RL se révèlent contre-productifs sur du matériel réel, tandis qu'un ensemble restreint de choix de conception robustes, faciles à adopter dans le cadre standard du RL, permet d'obtenir un apprentissage stable sur différentes tâches et différents types de robots. Il s'agit, selon les auteurs, de la première étude empirique à grande échelle de ce type portant sur ces choix de conception. Cette cartographie répond à un point de friction bien identifié chez les intégrateurs et équipes de recherche robotique : le RL en ligne sur robot réel reste réputé fragile, coûteux en ingénierie et peu reproductible d'une plateforme à l'autre, ce qui pousse la majorité des équipes vers l'apprentissage en simulation (sim-to-real) ou l'imitation à partir de démonstrations. En identifiant quels réglages par défaut nuisent réellement à l'apprentissage et lesquels le stabilisent, ce travail réduit potentiellement l'effort d'ingénierie nécessaire pour déployer du RL en ligne directement sur du hardware, sans passer par un simulateur intermédiaire. C'est un signal utile pour évaluer si le RL en ligne peut devenir une option pratique face aux architectures VLA (vision-langage-action) qui dominent actuellement la communication du secteur, en offrant une alternative plus frugale en données de démonstration. Le papier s'inscrit dans une lignée de travaux cherchant à combler l'écart entre les promesses du RL en robotique, démontrées depuis longtemps en simulation, et sa fiabilité en conditions réelles, où le coût d'échantillonnage et les risques matériels limitent les expérimentations à grande échelle. Contrairement aux annonces de plateformes humanoïdes commerciales, ce travail relève de la recherche fondamentale reproductible, avec des ablations systématiques plutôt qu'une démonstration ponctuelle. Publié sur arXiv en tant que version révisée ("replace"), il ouvre la voie à des protocoles standardisés que d'autres laboratoires pourront reprendre et à des comparaisons futures avec des approches sim-to-real ou par imitation sur les mêmes tâches.

RecherchePaper
1 source
L'apprentissage par imitation continu reste-t-il ancré ? Un benchmark à perturbations linguistiques pour la rétention des tâches en robotique
3arXiv cs.RO 

L'apprentissage par imitation continu reste-t-il ancré ? Un benchmark à perturbations linguistiques pour la rétention des tâches en robotique

Un benchmark publié sur arXiv (2610.00542v1) s'attaque à une question que les évaluations classiques d'apprentissage par imitation continu laissent de côté : un robot qui conserve ses anciennes compétences reste-t-il réellement guidé par le langage ? Les auteurs construisent un protocole fondé sur LIBERO, avec des variantes d'instructions qui préservent le sens (paraphrases) et d'autres qui le modifient, pour les quatre suites Goal, Spatial, Object et Long. Les expériences de politiques portent surtout sur LIBERO-Goal. Les politiques y sont évaluées après chaque étape d'apprentissage séquentiel, avec les instructions originales puis paraphrasées. Plusieurs méthodes représentatives d'imitation continue sont comparées dans leurs hypothèses d'origine. Trois diagnostics complètent les métriques habituelles d'apprentissage et d'oubli : la robustesse sémantique, l'adaptation à l'objectif et la sensibilité au langage. Le matériel complémentaire est publié sur une page projet intitulée « stillgrounded ». Le résultat principal tient en une phrase : de bonnes performances en apprentissage continu ne garantissent pas un ancrage langagier fiable. Une politique peut afficher un taux de réussite élevé sans avoir conservé le lien entre l'instruction et l'action. Elle peut s'appuyer sur des indices de scène, des associations d'objets ou une structure de tâche mémorisée. Pour les intégrateurs et les responsables techniques qui envisagent des robots pilotés par VLA (vision-language-action) et mis à jour en continu, le point est concret. Un robot qui exécute correctement « ses » tâches en conditions de test peut échouer ou agir de façon incohérente si la consigne est reformulée ou modifiée. Cela relativise aussi les scores de benchmark en rétention de tâches, qui peuvent surestimer la fiabilité réelle d'une compétence retenue. Ces diagnostics permettent de distinguer une compétence conservée et correctement guidée d'une compétence conservée par simple mémorisation du contexte. Il s'agit d'un travail académique en simulation : aucun chiffre de performance n'est donné dans le résumé, et la portée des conclusions reste à vérifier dans le détail des expériences, qui se concentrent sur une seule suite. Ce travail s'inscrit dans le prolongement de LIBERO, benchmark de référence pour l'apprentissage tout au long de la vie en manipulation robotique, devenu terrain d'essai courant pour les politiques conditionnées par le langage. La question de l'ancrage rejoint des critiques déjà formulées sur les modèles VLA, soupçonnés d'ignorer partiellement le texte au profit de régularités visuelles. Aucun acteur industriel n'est directement concerné : il s'agit d'un outil d'évaluation, pas d'un produit. Sa valeur dépendra de son adoption par les équipes qui développent des politiques généralistes et des méthodes d'apprentissage continu. La suite logique serait son extension aux autres suites de LIBERO, puis à des politiques de grande taille et à des données réelles, seules capables de montrer si l'écart entre rétention et ancrage se retrouve hors simulation.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
NanoBench : un jeu de données multitâche pour l'identification, le contrôle et l'estimation d'état des nano-quadrirotors
4arXiv cs.RO 

NanoBench : un jeu de données multitâche pour l'identification, le contrôle et l'estimation d'état des nano-quadrirotors

NanoBench est un jeu de données benchmark open-source multitâches consacré aux nano-quadrotors, construit à partir du Crazyflie 2.1, plateforme commerciale de 27 grammes au décollage, testée dans une arène équipée d'un système de capture de mouvement Vicon à précision millimétrique. Le dataset regroupe 172 enregistrements de vol répartis en trois catégories : excitation multi-fréquence, suivi de trajectoires géométriques à trois régimes de vitesse, et vol stationnaire longue durée jusqu'à décharge complète de la batterie. Chaque enregistrement synchronise, par corrélation gyroscopique sur une grille de recherche de 1 milliseconde, la vérité terrain Vicon, les données IMU brutes, les estimations du filtre de Kalman étendu embarqué, les variables internes du contrôleur PID et les commandes PWM des moteurs, échantillonnées à 100 Hz, ainsi que la télémétrie batterie à 10 Hz. Le papier, publié sur arXiv (2603.09908v2, version révisée), définit des protocoles d'évaluation standardisés, des répartitions train/test et des lignes de base open-source pour trois tâches : identification de système non linéaire, benchmarking de contrôleurs en boucle fermée, et évaluation de l'estimation d'état embarquée. L'enjeu tient au vide identifié dans les benchmarks aériens existants, calibrés sur des véhicules de plusieurs centaines de grammes à quelques kilogrammes et limités à des données d'état de haut niveau. À l'échelle nano, l'aérodynamique à faible nombre de Reynolds, les non-linéarités des moteurs DC sans noyau et les contraintes de calcul embarqué sévères invalident les modèles et contrôleurs conçus pour des drones plus lourds, sans qu'aucun jeu de données public ne permette jusqu'ici de les recaler avec des signaux au niveau actionneur. Selon les auteurs, NanoBench est le premier dataset public à réunir commandes moteurs, variables internes de contrôleur et sorties d'estimateur avec une vérité terrain millimétrique sur une plateforme nano-aérienne commerciale, ce qui en fait une référence potentielle pour la recherche en contrôle et estimation d'état appliquée aux essaims de micro-drones ou à l'inspection en espaces confinés. Le choix du Crazyflie 2.1 comme plateforme de référence s'explique par son statut de standard de facto dans les laboratoires de robotique aérienne, en raison de son faible coût et de sa large diffusion, ce qui permet une reproductibilité directe des résultats sans matériel propriétaire. La mention "replace" sur arXiv signale une version révisée d'un travail déjà soumis. Les auteurs annoncent la mise à disposition ouverte du dataset complet, des protocoles d'évaluation et des baselines, posant les bases d'une comparaison future des méthodes de modélisation, de contrôle et d'estimation d'état spécifiques aux nano-quadrotors, un segment jusqu'ici sous-desservi par les benchmarks génériques de la robotique aérienne.

UEAucun acteur européen n'est cite, mais le Crazyflie, plateforme standard dans de nombreux laboratoires de robotique aérienne européens, pourrait bénéficier indirectement de ce benchmark.

RecherchePaper
1 source