Aller au contenu principal
RecherchearXiv cs.RO 

Conception de trajectoires à découplage informationnel pour l'identification de systèmes sim-vers-réel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent l'Informationally Decoupled Trajectory Design (IDTD), un cadre de conception de trajectoires d'exploration pour l'identification de système en simulation vers réel (arXiv 2610.10905). L'identification par échantillonnage ajuste un simulateur pour qu'il reproduise la dynamique du système cible, ce qui fournit des paramètres physiques interprétables et améliore le transfert sim-to-real. Le problème apparaît quand les trajectoires collectées ne distinguent pas les effets de paramètres différents: plusieurs combinaisons peuvent alors expliquer les mêmes données, et les estimations deviennent peu fiables. IDTD construit l'objectif de la politique d'exploration à partir du score du complément de Schur, dérivé de la matrice d'information de Fisher. Le score est normalisé par l'information propre à chaque paramètre, le meilleur segment de trajectoire est retenu pour chacun d'eux, puis les scores sont agrégés par un logarithme. La trajectoire optimisée se compose ainsi d'intervalles complémentaires, chacun révélant un sous-ensemble de paramètres dont la contribution au mouvement peut être attribuée sans ambiguïté.

Les tests couvrent plusieurs environnements simulés, d'un système linéaire simple au quadrupède Go2, à l'humanoïde G1 et au quadrirotor Crazyflie. L'erreur d'identification des paramètres diminue en moyenne de 39,6 % par rapport à la meilleure méthode d'exploration active antérieure, et le transfert de politique en aval s'améliore. Les auteurs valident aussi la conception de trajectoires sur un humanoïde K1 réel: les paramètres identifiés reflètent fidèlement la dynamique du système physique. Le résumé ne précise ni le nombre de paramètres estimés, ni les baselines exactes, ni l'ampleur du gain de transfert, et la validation matérielle ne porte que sur une plateforme. Il s'agit de résultats de recherche, sans produit ni déploiement.

L'enjeu est pratique pour les équipes qui entraînent des politiques de locomotion ou de manipulation en simulation. Le sim-to-real reste un goulet d'étranglement: la randomisation de domaine contourne l'erreur de modèle sans la corriger, alors que l'identification explicite offre des paramètres interprétables, mais seulement si les données les distinguent. En traitant la conception de l'excitation comme un problème de séparabilité des paramètres, IDTD cible une cause de dérive souvent invisible, des paramètres compensés les uns par les autres. Pour un intégrateur, cela peut réduire le temps de calibration d'un robot neuf et rendre les jumeaux numériques plus fiables. L'approche s'applique à des morphologies variées, des drones aux humanoïdes, ce qui suggère une méthode générique plutôt qu'un réglage propre à une plateforme. Le gain moyen de 39,6 % est mesuré surtout en simulation, et l'écart avec la robustesse réelle reste à démontrer à plus grande échelle.

Ce travail s'inscrit dans la lignée de l'identification optimale par information de Fisher, issue de la théorie du contrôle, et des méthodes d'exploration active récentes qui l'étendent aux robots appris. Le choix du G1 d'Unitree, du Go2 et du K1 reflète la place prise par les plateformes humanoïdes et quadrupèdes abordables dans la recherche, car elles permettent des validations matérielles à faible coût. Aucune suite n'est annoncée dans le résumé, mais les extensions logiques sont des essais sur davantage de robots réels, des tâches de manipulation et l'intégration dans des chaînes d'entraînement de politiques à grande échelle, là où la qualité du simulateur conditionne directement le résultat.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

1arXiv cs.RO 

Apprentissage par renforcement sim-vers-réel pour véhicules de surface autonomes avec identification de système

Des chercheurs proposent un simulateur et une chaîne d'entraînement destinés aux navires de surface autonomes (ASV), publiés sur arXiv (2610.12202). Le travail vise à entraîner par apprentissage par renforcement (RL) des politiques de contrôle pour le suivi de trajectoire et le maintien de position (station keeping), en partant d'une dynamique de véhicule inconnue. La méthode n'exige qu'un modèle CAD et un court jeu de trajectoires relevées en eau libre. Ces données servent à approximer puis à affiner les paramètres hydrodynamiques et ceux des propulseurs, par identification de système (SysID). Les auteurs rapportent un transfert zéro-shot du simulateur vers le réel sur un ASV BlueBoat, sur les deux tâches, sans connaissance préalable de l'hydrodynamique ni des hélices. L'abstract ne donne ni taux de réussite, ni erreurs de suivi, ni durée des essais, ni nombre de trajectoires nécessaires à l'identification. L'intérêt tient à la barrière que ce travail cherche à lever. Les simulateurs d'ASV existants gèrent rarement les environnements parallèles, indispensables pour entraîner des politiques RL à grande échelle. Ils réclament aussi des paramètres hydrodynamiques précis, issus de solveurs de mécanique des fluides numérique (CFD) ou d'essais en bassin de traction, deux étapes coûteuses et longues. Si le résultat se confirme, un intégrateur pourrait déployer un contrôleur appris sur une coque nouvelle ou modifiée après quelques sorties en mer, sans campagne de caractérisation. Cela renforcerait l'idée que le sim-to-real passe par une identification légère plutôt que par une modélisation exacte. Les réserves sont nettes: la validation semble porter sur une seule plateforme, la BlueBoat, petite et de recherche, et l'abstract ne mentionne aucun test sous vent, vagues ou courants marqués. Ces conditions sont pourtant le cœur des « environnements marins dynamiques » invoqués. Sans métriques chiffrées ni comparaison annoncée avec un contrôleur classique de type PID, l'avantage du RL reste à démontrer. Ce travail s'inscrit dans la tendance du RL massivement parallèle, popularisée en robotique terrestre par des simulateurs GPU, qui a peu atteint le domaine maritime faute d'outils adaptés. La BlueBoat, plateforme compacte de Blue Robotics, est répandue dans la recherche et l'inspection, ce qui facilite la reproduction. L'approche rejoint les travaux de calibration de simulateurs à partir de données réelles, déjà courants pour les drones et les robots à pattes. La suite logique serait un test sur des coques plus grandes, en conditions de mer difficiles, et une publication du code ou du simulateur. L'abstract n'annonce ni pilote industriel ni calendrier. Il s'agit donc d'un résultat de recherche et non d'un produit disponible.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Interprétation des variables latentes de contrôle pour l'identification de systèmes via Conditional Flow Matching
2arXiv cs.RO 

Interprétation des variables latentes de contrôle pour l'identification de systèmes via Conditional Flow Matching

Des chercheurs publient sur arXiv (référence 2608.23887v1) une méthode qui rend interprétables les représentations latentes utilisées par les politiques de contrôle adaptatif de drones quadrirotors. Ces politiques, entraînées pour s'ajuster automatiquement à des dynamiques changeantes comme l'usure des actionneurs ou une charge variable, encodent en interne un vecteur latent qui capture l'état du système, mais ce latent reste une boîte noire propre à la politique, sans lien explicite avec les paramètres physiques réels du robot. L'équipe décode chaque latent opérationnel en une distribution de modèles physiques de quadrirotor grâce au conditional flow matching, une technique générative qui produit un ensemble de modèles plausibles plutôt qu'un jeu unique de paramètres, car plusieurs configurations physiques différentes peuvent produire un comportement en boucle fermée similaire. Cette distribution sert ensuite à deux usages sans modifier la politique de bas niveau déjà entraînée: le réglage prédictif en ligne d'un contrôleur de haut niveau, et l'analyse de robustesse face à des perturbations spécifiées. Sous des dynamiques d'actionneurs perturbées, le réglage prédictif basé sur les modèles décodés réduit l'erreur RMSE de suivi de position de 23% et l'erreur RMSE de cap de 45% par rapport à des gains fixes. Sous des perturbations de force gaussiennes, les ensembles de modèles décodés prédisent fidèlement l'évolution de l'erreur de suivi latérale. Ce travail cible un problème récurrent du contrôle robotique appris: les politiques adaptatives entraînées par renforcement, notamment via la randomisation de domaine, s'ajustent bien en pratique mais restent opaques pour les ingénieurs qui doivent diagnostiquer un échec, régler un contrôleur en aval ou garantir une marge de robustesse avant déploiement. En transformant un vecteur latent abstrait en un ensemble de modèles physiques interprétables, la méthode permet un diagnostic et un réglage post-hoc de politiques figées, sans réentraînement ni accès au code source de la politique, un besoin direct pour les équipes d'intégration devant certifier des systèmes de contrôle appris avant un déploiement industriel. La publication s'inscrit dans la lignée des travaux sur le contrôle conditionné par latent, une approche courante pour l'adaptation rapide de robots à des dynamiques inconnues, d'abord en simulation puis en transfert vers le réel. Les auteurs positionnent leur contribution comme un pont entre les politiques de bout en bout, difficiles à auditer, et les méthodes de contrôle classique fondées sur des modèles physiques identifiés. Les expériences restent pour l'instant limitées à des quadrirotors simulés soumis à des perturbations d'actionneurs et à des forces gaussiennes; aucune validation sur matériel réel ni extension à d'autres plateformes n'est annoncée à ce stade.

RecherchePaper
1 source
SE(2) : un maillage de navigation pour la planification de trajectoires
3arXiv cs.RO 

SE(2) : un maillage de navigation pour la planification de trajectoires

Des chercheurs proposent le SE(2) Navigation Mesh (SE(2) NavMesh), une nouvelle représentation cartographique pour la navigation globale des robots terrestres dans des environnements complexes à plusieurs niveaux, comme les bâtiments multi-étages ou les entrepôts encombrés. Publiée sur arXiv sous la référence 2607.01454v1, l'étude part d'un constat: les nuages de points et les cartes d'occupation volumétrique manquent de structure de surface explicite pour estimer la franchissabilité du terrain, tandis que la recherche de chemin directe sur des maillages triangulaires denses reste trop coûteuse en calcul. Les navmesh classiques, qui découpent l'espace en polygones traversables, supposent que la franchissabilité ne dépend pas de l'orientation du robot, ce qui les rend inadaptés aux robots non circulaires évoluant dans des espaces contraints. Le SE(2) NavMesh corrige ce défaut en évaluant la franchissabilité via des masques d'empreinte au sol et en construisant un graphe organisé en couches spécifiques à chaque orientation, avec une connectivité translationnelle et rotationnelle explicite. Les auteurs introduisent aussi une stratégie de recherche de chemin en deux temps, baptisée A-String Pulling-A (ASA), qui optimise hiérarchiquement la position puis le cap du robot, ainsi qu'une méthode en ligne mettant à jour incrémentalement le NavMesh à partir de flux de nuages de points pendant la reconstruction géométrique de l'environnement. En simulation, le SE(2) NavMesh capture plus de 50% de surface traversable en plus qu'un navmesh classique, et le pipeline SE(2) NavMesh + ASA surpasse systématiquement les méthodes d'échantillonnage de référence dans les espaces confinés. Des expériences réelles sur robot physique confirment la génération en temps réel et une navigation réussie dans plusieurs environnements. Cette avancée cible un angle mort persistant de la navigation robotique: la plupart des pipelines actuels traitent le robot comme un disque, une approximation valable pour des AMR circulaires mais qui échoue dès qu'un châssis allongé, asymétrique ou muni d'un bras déployé doit se faufiler entre des obstacles serrés. Pour les intégrateurs qui déploient des robots logistiques ou des plateformes mobiles à bras manipulateur dans des entrepôts, usines ou bâtiments à plusieurs niveaux, cette limite se traduit par des chemins sous-optimaux, des blocages évitables ou des marges de sécurité excessives qui réduisent l'espace exploitable. En démontrant qu'une représentation sensible à l'orientation peut être calculée et mise à jour en temps réel, y compris pendant la reconstruction de la carte, les auteurs répondent à une objection fréquente: que ce type d'approche serait trop coûteux pour tourner en embarqué. Le gain de plus de 50% en surface traversable exploitable n'est pas un détail marginal, il implique potentiellement moins de détours et une meilleure utilisation de l'espace dans des contextes où chaque mètre carré compte, comme les micro-fulfillment centers ou les couloirs étroits d'établissements de santé. Le travail s'inscrit dans la lignée des recherches sur la planification de trajectoire pour robots terrestres, longtemps tiraillées entre deux extrêmes: les cartes d'occupation, simples à construire mais pauvres en information de franchissabilité, et les maillages triangulaires denses, riches en détail mais trop lourds pour une recherche de chemin en temps réel. Les navmesh polygonaux classiques, utilisés de longue date dans le jeu vidéo puis adoptés par la robotique mobile, avaient déjà réglé le problème du coût de calcul, mais au prix de l'hypothèse simplificatrice d'une franchissabilité indépendante de l'orientation. Le SE(2) NavMesh se positionne comme une extension directe de cette famille de méthodes, en ajoutant la dimension manquante sans revenir à la complexité des maillages denses. Les auteurs valident leur approche à la fois en simulation et sur un robot physique réel, ce qui traduit une volonté de rapprocher rapidement cette technique du terrain plutôt que de la cantonner au stade théorique. Les suites attendues pour ce type de travaux incluent généralement l'intégration dans des piles logicielles de navigation existantes et des tests à plus grande échelle sur des flottes hétérogènes.

RecherchePaper
1 source
MA-LIPP : planification coopérative de trajectoires informatives multi-agents sensible à la charge pour équipes de robots hétérogènes
4arXiv cs.RO 

MA-LIPP : planification coopérative de trajectoires informatives multi-agents sensible à la charge pour équipes de robots hétérogènes

Une équipe de recherche présente MA-LIPP (Multi-Agent Load-Aware Informative Path Planning), une méthode de planification de trajectoire pour des équipes hétérogènes de robots devant collecter des échantillons physiques sur le terrain et les ramener en laboratoire. Le système coordonne les robots via des "dead drops" asynchrones : un robot dépose des échantillons en un point que récupère, plus tard, un second robot, sans rendez-vous synchrone entre les deux. Les auteurs formalisent le problème comme un programme quadratique en variables mixtes-entières (MIQP) exact, complété par une heuristique de recherche à grand voisinage par paires (Pairwise Large-Neighborhood Search, LNS) pour les cas réels de plus grande taille. Sur des instances allant jusqu'à 12 robots, cette heuristique égale l'optimum exact dans 95,5% des cas certifiés et réduit la variance postérieure pondérée de 16,1 à 19,8% par rapport à une méthode séquentielle de référence. Le travail, publié sur arXiv (2609.21167), reste une contribution algorithmique validée en simulation, sans déploiement matériel annoncé. Le verrou que cible MA-LIPP est structurel en robotique de terrain : dans la planification informative sous contrainte de charge (LIPP) à robot unique, la même machine doit à la fois détecter les points d'intérêt et transporter tous les échantillons collectés, ce qui multiplie les retours au dépôt et limite fortement la zone couverte. Répartir les rôles entre robots précis dédiés à l'échantillonnage et robots à forte capacité dédiés au transport lève ce goulot d'étranglement, mais complexifie la coordination : il faut décider quand, où, quoi et à qui transférer la charge. Pour les intégrateurs de robotique de terrain, en surveillance environnementale, géologie ou inspection de sites dangereux, ce résultat indique qu'une coordination asynchrone bien formalisée peut accroître significativement la couverture spatiale sans synchronisation coûteuse entre robots, un argument en faveur des flottes hétérogènes plutôt que des robots généralistes isolés. Ce travail prolonge les recherches sur l'Informative Path Planning, qui guide un robot vers les emplacements maximisant l'information recueillie sur un champ inconnu comme une contamination ou une composition du sol, et ses variantes "load-aware" intégrant le coût croissant du transport à mesure que les échantillons s'accumulent. L'apport de MA-LIPP est d'étendre ce cadre au multi-robot en traitant les échanges asynchrones de charge comme des variables de décision à part entière plutôt que comme une contrainte annexe. Les deux méthodes proposées, le MIQP exact pour certifier l'optimalité sur des instances réduites et l'heuristique LNS pour passer à l'échelle, ouvrent la voie à une validation en conditions réelles, non détaillée dans l'abstract, qui devra probablement traiter l'autonomie énergétique et la tolérance aux pannes de robots en mission.

RecherchePaper
1 source