Aller au contenu principal
Vol de vent en soufflerie pour drones optimisé par apprentissage en ligne
RecherchearXiv cs.RO 

Vol de vent en soufflerie pour drones optimisé par apprentissage en ligne

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article de recherche (arXiv), pas d'actualité produit, voici la traduction/résumé en trois paragraphes.

Une équipe de chercheurs vient de publier sur arXiv (2608.03378) un algorithme d'apprentissage en ligne pour piloter le champ d'écoulement d'air complexe d'une soufflerie verticale multi-ventilateurs, destinée à tester des robots aériens. La méthode associe un modèle physique simplifié à un apprentissage itératif fondé sur des mesures réelles, permettant une convergence rapide et économe en essais vers le profil d'air recherché. Les auteurs démontrent sa polyvalence en générant des profils uniformes, gaussiens et paraboliques. Fait notable, l'algorithme produit aussi un flux d'air conçu pour le vol plané passif, améliorant nettement les performances d'un robot planeur testé dans l'installation. La méthode reste par ailleurs robuste lorsque le nombre de ventilateurs actifs varie.

Cette avancée intéresse la recherche en robotique aérienne, où les souffleries à ventilateurs multiples servent de banc d'essai standard avant tout vol extérieur de drones. Façonner un profil d'air complexe exige d'ordinaire une modélisation CFD lourde ou un calibrage manuel à chaque changement de configuration ; l'apprentissage en ligne proposé réduit ce travail à quelques cycles de mesure et correction, abaissant coût et temps de reconfiguration. La capacité à générer un flux dédié au vol plané passif intéresse particulièrement les drones de longue endurance, susceptibles d'exploiter des courants ascendants pour économiser de l'énergie. Il s'agit toutefois d'un résultat académique validé en laboratoire sur un prototype, pas d'un produit commercialisé ni déployé en conditions réelles.

Le travail s'inscrit dans une tendance des laboratoires d'aérodynamique à remplacer les souffleries classiques, coûteuses et peu reconfigurables, par des installations à ventilateurs multiples pilotées numériquement, capables de simuler rafales et turbulences sans pièces mobiles supplémentaires. L'approche se distingue des méthodes existantes, généralement dépendantes d'une modélisation fine par mécanique des fluides numérique, en s'appuyant sur un apprentissage itératif guidé directement par les mesures du flux réel, plus rapide à mettre en œuvre et adaptable à de nouvelles géométries de soufflerie. Les auteurs annoncent vouloir tester la méthode sur des robots aériens plus complexes et explorer son intégration dans des protocoles de test standardisés pour drones.

Dans nos dossiers

À lire aussi

Apprentissage par renforcement basé sur un modèle pour le contrôle robotique via optimisation en ligne
1arXiv cs.RO 

Apprentissage par renforcement basé sur un modèle pour le contrôle robotique via optimisation en ligne

Des chercheurs ont publié sur arXiv (arXiv:2510.18518v2) un algorithme d'apprentissage par renforcement basé sur un modèle (MBRL) conçu pour contrôler des systèmes robotiques complexes directement dans le monde réel, sans passer par une phase de simulation intensive. L'approche construit un modèle de dynamique à partir des données d'interaction en temps réel, puis effectue des mises à jour de politique guidées par ce modèle appris. Les validations expérimentales ont été conduites sur deux plateformes distinctes : un bras d'excavatrice hydraulique et un bras robot souple. Dans les deux cas, l'algorithme atteint des performances comparables aux méthodes model-free en quelques heures d'entraînement, là où ces dernières réclament habituellement des millions d'interactions simulées. La robustesse de l'adaptation a également été évaluée sous conditions de charge utile (payload) aléatoire, avec des résultats stables malgré le changement de dynamique. L'enjeu principal est la réduction de ce que le secteur appelle le "sim-to-real gap" : l'écart entre les politiques apprises en simulation et leur comportement réel une fois déployées sur du matériel. Les pipelines dominants, adoptés aussi bien par des labos académiques que par des industriels comme Boston Dynamics ou Figure AI, reposent sur des millions de rollouts en simulation avant tout contact avec un robot physique, ce qui introduit un biais systématique difficile à corriger. Cet algorithme court-circuite cette étape en apprenant directement sur données réelles, avec une garantie formelle de progression : les auteurs démontrent des bornes de regret sous-linéaires (sublinear regret bounds) sous hypothèses d'optimisation stochastique en ligne, ce qui est rare dans la littérature MBRL appliquée à la robotique physique. Pour un intégrateur ou un industriel, cela se traduit par une réduction potentielle du temps de mise en service sur des tâches à dynamique variable (variation de charge, usure mécanique, changement de matériau). Ce travail s'inscrit dans un débat structurant du champ : model-based vs model-free RL pour la robotique physique. Les méthodes model-free comme PPO ou SAC dominent les benchmarks simulés mais peinent à s'adapter efficacement en production réelle. Des approches hybrides comme MBPO ou DreamerV3 ont tenté de combler cet écart, mais rarement validées sur des systèmes aussi hétérogènes qu'un bras hydraulique industriel et un manipulateur souple. La prochaine étape naturelle serait une validation sur des plateformes humanoïdes ou des AMR (autonomous mobile robots) à haute dimension, où les enjeux de sample efficiency sont directement liés aux coûts d'exploitation et à la durée de vie des actionneurs.

RecherchePaper
1 source
Apprentissage topologique en ligne pour la commande de formation par déplacement
2arXiv cs.RO 

Apprentissage topologique en ligne pour la commande de formation par déplacement

Une équipe de recherche a publié sur arXiv (arXiv:2606.23901, juin 2026) un nouveau cadre de contrôle de formation multi-robots baptisé TOLD, pour Topological Online Learning for Displacement-based. La contribution centrale est une adaptation en temps réel des poids d'interaction entre agents, c'est-à-dire la topologie du graphe de communication, plutôt que de réguler uniquement les commandes individuelles de chaque robot. Deux variantes sont proposées : OGF (Online Gradient Flow), à poids non contraints, et OExpGF (Online Exponential Gradient Flow), à poids convexes non négatifs. Les simulations portent sur douze robots soumis à des perturbations intermittentes et montrent une réduction médiane de l'erreur cumulée de distorsion de formation (Root Mean Distortion Error) comprise entre 1,2 % et 33,14 % lorsque TOLD est combiné à des contrôleurs nodaux existants. Les expériences matérielles ont été conduites sur des nano-quadrotors Crazyflie 2.0 (Bitcraze), avec des réductions de distorsion médiane de 62 % pour OGF et 31,4 % pour OExpGF par rapport à un consensus à poids fixes. L'intérêt de TOLD réside dans le déplacement du point d'intervention : là où les approches robustes classiques agissent sur les entrées individuelles de chaque agent sans toucher à la structure du réseau, TOLD modifie dynamiquement les liaisons d'interaction pour minimiser directement la distorsion de formation. Pour un ingénieur systèmes ou un intégrateur de flottes AMR ou de drones, cela signifie potentiellement une meilleure résilience face aux pannes de communication ou aux perturbations environnementales sans nécessiter de reconfigurer l'architecture de contrôle. Sur le plan théorique, OExpGF garantit la convergence asymptotique pour des agents à intégrateur simple sur graphes orientés, propriété formellement établie dans l'article, ce qui lui confère une solidité analytique supérieure à OGF, lequel n'assure que la bornitude de l'erreur. Il convient de contextualiser les résultats : les expériences matérielles s'appuient sur les Crazyflie 2.0, des plateformes open-source de 27 grammes conçues pour la recherche académique, loin des conditions industrielles. L'article est une prépublication arXiv, non encore évaluée par les pairs. Le domaine du contrôle de formation par consensus est très actif, avec des contributions récentes sur les contrôleurs robustes nodaux, les approches par apprentissage distribué et les méthodes basées sur la théorie spectrale des graphes. TOLD se positionne dans un espace encore peu exploré, l'adaptation topologique en ligne, dont la transférabilité vers des flottes de robots terrestres ou des drones industriels (UAV inspection, logistique entrepôt) reste à démontrer dans des environnements moins contrôlés.

UELes résultats pourraient intéresser les laboratoires européens de robotique en essaim (LAAS-CNRS, ETH Zurich), mais aucun acteur français ou européen n'est directement impliqué ; la plateforme Crazyflie de Bitcraze (Suède) est le seul lien indirect avec l'UE.

RecherchePaper
1 source
Découpage Q adaptatif pour l'apprentissage par renforcement hors ligne vers en ligne
3arXiv cs.RO 

Découpage Q adaptatif pour l'apprentissage par renforcement hors ligne vers en ligne

Des chercheurs ont publié sur arXiv (arXiv:2605.05544, mai 2026) une méthode appelée Adaptive Q-Chunking (AQC), visant à résoudre une limitation structurelle de l'apprentissage par renforcement offline-to-online avec action chunking. Toutes les approches existantes appliquent une taille de chunk fixe à chaque état, ce qui est sous-optimal : près d'un contact physique, des chunks courts sont nécessaires pour un contrôle réactif ; en déplacement libre, des chunks longs améliorent l'attribution du crédit temporel. La solution naïve, entraîner un critique par taille de chunk puis comparer les valeurs Q, échoue systématiquement par désalignement des échelles de remise (discount-scale mismatch) et dégénère en bruit dans les états à faible valeur. AQC corrige ce double problème en comparant l'avantage relatif de chaque horizon par rapport à une baseline normalisée par le facteur de remise, rendant les comparaisons non biaisées même en l'absence de signal discriminant. La méthode atteint des taux de succès état de l'art sur les benchmarks OGBench et Robomimic, et améliore significativement les performances de modèles VLA à grande échelle sur les tâches RoboCasa-GR1. L'enjeu est concret pour les équipes qui intègrent des modèles Vision-Language-Action en production. Ces architectures, dont Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA et Helix de Figure AI, prédisent des séquences d'actions dont l'efficacité dépend directement de la granularité temporelle de ces séquences. AQC est applicable sans modifier l'architecture sous-jacente, ce qui en fait un correctif plug-and-play pour des pipelines existants. Les auteurs fournissent également des bornes formelles sur l'immunité au bruit du sélecteur d'avantage et sur la dominance en valeur du chunking adaptatif face à toute taille fixe, donnant une assise théorique à des performances que les benchmarks confirment empiriquement. L'action chunking s'est imposé comme paradigme de référence en manipulation apprise depuis ACT (Action Chunking with Transformers, Chi et al., 2023) et Diffusion Policy. La limitation d'une taille fixe était documentée mais sans solution rigoureuse. Des approches concurrentes adressent la granularité temporelle via la planification hiérarchique ou le fine-tuning online de politiques de diffusion, sans résoudre le biais de comparaison entre horizons. AQC se positionne comme correctif algorithmique orthogonal, applicable en surcouche de ces méthodes. Les résultats présentés portent intégralement sur des environnements simulés ; la validation sur plateformes physiques reste à établir, le gap sim-to-real demeurant une variable non résolue dans ce domaine.

RechercheOpinion
1 source
Robo-ValueRL : une estimation fiable de la valeur pour l'apprentissage par renforcement hors ligne vers en ligne
4arXiv cs.RO 

Robo-ValueRL : une estimation fiable de la valeur pour l'apprentissage par renforcement hors ligne vers en ligne

Des chercheurs publient Robo-ValueRL, un framework d'apprentissage par renforcement offline-to-online pour la manipulation robotique, décrit dans un article arXiv (2607.09866v1) diffusé cette semaine. Le système entraîne un estimateur de valeur conditionné par l'historique des actions, dont la fiabilité est mesurée via deux métriques, la progression globale et la préférence locale. Ces estimations de valeur alimentent ensuite deux étapes : un pré-entraînement de politique par cohérence conditionnée à la qualité des données, puis un module d'adaptation résiduelle appliqué lors des déploiements en ligne. Les expériences s'appuient sur un volume conséquent, 240 heures de démonstrations hors ligne et plus de 3 000 trajectoires de rollout en ligne. Sur deux tâches de précision, l'insertion de puces électroniques au millimètre près et le désassemblage générique de blocs, le système atteint respectivement 86% et 84% de taux de réussite. L'apport principal ne se situe pas dans un nouveau record de performance mais dans la démonstration d'un lien direct entre la fiabilité de la fonction de valeur et la qualité de la politique finale. Concrètement, un estimateur de valeur fiable permet de prioriser les données de meilleure qualité parmi un ensemble hétérogène de démonstrations, ce qui bat le clonage comportemental classique, indifférent à la qualité des données, et stabilise la phase d'amélioration en ligne. Pour les équipes qui construisent des pipelines de RL robotique à partir de données de téléopération ou de simulation de qualité inégale, ce résultat justifie d'investir dans le diagnostic de la fonction de valeur plutôt que de simplement augmenter le volume de données ou la taille des modèles de politique. Le travail s'inscrit dans la tendance actuelle du secteur à combiner pré-entraînement hors ligne sur de larges jeux de démonstrations et affinage en ligne par rollouts réels, une approche jugée prometteuse pour la manipulation robotique généralisable mais dont la complexité technique rend la reproduction et le diagnostic difficiles, un point que les auteurs soulignent explicitement comme motivation de leur étude. Robo-ValueRL se positionne comme un banc d'essai unifié plutôt qu'un produit fini, destiné à isoler l'effet de la fiabilité de l'estimation de valeur des autres composants du pipeline. L'article ne précise pas de suite industrielle ni de partenaire de déploiement identifié à ce stade, le travail restant à un niveau de recherche académique.

RecherchePaper
1 source