Aller au contenu principal
RecherchearXiv cs.RO 

Navigation autonome de gouttelettes par apprentissage par renforcement basé sur un modèle : transfert direct et dynamiques émergentes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs décrivent, dans un preprint arXiv (2610.08852), la première plateforme robotique de navigation autonome en boucle fermée d'une goutte de liquide sur une surface ouverte et non confinée, pilotée par apprentissage par renforcement basé sur modèle (model-based RL). Le dispositif repose sur une planche inclinable à deux axes recouverte d'un mince film d'huile de silicone, qui fait glisser la goutte par gravité, tandis qu'une caméra placée au-dessus fournit le retour visuel en temps réel. La politique apprise a été entraînée sur seulement 50 à 150 épisodes physiques selon la complexité géométrique des trajectoires, sans simulation ni modèle analytique. L'ensemble du pipeline d'entraînement s'exécute en moins de 90 minutes. Les auteurs revendiquent trois résultats: un transfert zero-shot vers des géométries jamais vues, une découverte autonome d'une stratégie de dépiégeage oscillatoire quand la goutte reste collée, et cette durée d'apprentissage très courte.

L'intérêt tient à la nature du problème. Une goutte est de la matière molle et déformable, dont la dynamique n'est que partiellement observable: hystérésis de l'angle de contact, ancrage capillaire et hétérogénéités de surface rendent les contrôleurs classiques à base de modèle peu fiables. Montrer qu'un apprentissage directement sur matériel, avec une centaine d'essais, suffit à maîtriser ce régime est un argument concret en faveur de la sample efficiency du RL basé sur modèle, là où l'on associe souvent le RL robotique à des millions d'interactions simulées et au casse-tête du sim-to-real. Pour les laboratoires autonomes (self-driving labs, SDL), qui automatisent la découverte de molécules et de matériaux en boucle fermée, cela comble une lacune: la manipulation physique de liquides sur surface ouverte reste hors de portée des plateformes robotiques actuelles, qui s'appuient surtout sur des pipettes, des canaux microfluidiques ou des bras manipulant des contenants rigides. Le comportement oscillatoire de dépiégeage, non programmé, illustre aussi un intérêt de l'apprentissage: faire émerger des stratégies que l'on n'aurait pas pensé à coder.

Quelques réserves s'imposent. Il s'agit d'une preuve de concept de laboratoire, avec une goutte unique, un substrat lubrifié et un environnement contrôlé. Le résumé ne donne ni taux de réussite, ni précision de positionnement, ni vitesse, ni comparaison chiffrée avec un contrôleur classique. La notion de « première plateforme » reste une revendication des auteurs et la généralisation à d'autres fluides, volumes ou surfaces n'est pas démontrée. Le travail prolonge la lignée du RL appliqué aux microrobots rigides, qu'il étend à la matière déformable, et s'inscrit dans la montée des SDL et des approches de type électromouillage ou digital microfluidics, dont il se distingue par l'absence de confinement. Les prochaines étapes logiques seraient le multi-gouttes, la fusion et le dosage de gouttes, puis l'intégration dans de véritables boucles de découverte chimique, sans calendrier annoncé à ce stade.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

NavRL++ : un cadre système pour améliorer le transfert simulation-réel dans la navigation robotique par apprentissage par renforcement
1arXiv cs.RO 

NavRL++ : un cadre système pour améliorer le transfert simulation-réel dans la navigation robotique par apprentissage par renforcement

Une équipe de chercheurs a publié NavRL++, un cadre de navigation autonome par apprentissage par renforcement (RL) conçu spécifiquement pour réduire l'écart entre simulation et déploiement réel. Présenté sur arXiv (2605.15559), le système propose à la fois un nouveau pipeline d'entraînement et de déploiement et une étude empirique systématique qui isole les facteurs dégradant les performances en conditions réelles : bruit de capteurs, échecs de perception, latence système et réponse du contrôleur. Les auteurs ont validé leur approche sur plusieurs plateformes physiques, dont des robots aériens et quadrupèdes, sur des tâches de navigation comme l'exploration et l'inspection, en obtenant un transfert zéro-shot depuis la simulation. Le problème que NavRL++ cherche à résoudre est structurel : la quasi-totalité des travaux récents en navigation par RL se concentre sur la conception du framework d'apprentissage (représentations d'entrée, espaces d'actions, fonctions de récompense), sans analyser rigoureusement pourquoi les politiques entraînées en sim échouent en réel. NavRL++ répond à cela avec deux contributions techniques. La première est le perturbation-aware fine-tuning, une stratégie post-entraînement qui injecte explicitement les perturbations identifiées lors de l'étude empirique pour rendre la politique plus robuste. La seconde est une politique à raisonnement temporel basée sur un Transformer, qui exploite une fenêtre d'observation courte pour lisser le contrôle et compenser la dégradation perceptuelle typique du monde réel. Les résultats quantitatifs montrent des performances supérieures aux baselines RL dans des environnements statiques et dynamiques, et comparables aux planificateurs classiques à optimisation en contexte statique. Le défi du sim-to-real reste l'un des verrous majeurs à la commercialisation de la navigation autonome par RL, notamment pour les robots mobiles en environnements industriels non structurés. La plupart des approches existantes, comme les travaux issus de Berkeley (BADGR, RECON) ou les pipelines de navigation d'Agility Robotics et Boston Dynamics, contournent partiellement le problème via de la simulation photo-réaliste ou du domain randomization intensif. NavRL++ adopte une approche complémentaire : diagnostiquer empiriquement les sources d'écart plutôt que de les masquer. La prochaine étape naturelle sera de tester cette méthodologie sur des flottes de robots en déploiement continu, notamment dans des scénarios entrepôt ou inspection d'infrastructures où la latence et la fiabilité des capteurs sont des contraintes opérationnelles dures.

RecherchePaper
1 source
WOMBET : transfert d'expérience par modèle du monde pour un apprentissage par renforcement robuste et efficace
2arXiv cs.RO 

WOMBET : transfert d'expérience par modèle du monde pour un apprentissage par renforcement robuste et efficace

Une équipe de chercheurs présente WOMBET (World Model-Based Experience Transfer), un cadre d'apprentissage par renforcement (RL) publié sur arXiv sous la référence 2604.08958 (troisième version, indiquant un travail en révision active). Le constat de départ est simple : en robotique, collecter des données d'entraînement est coûteux et potentiellement risqué, ce qui freine l'adoption du RL réel. WOMBET répond à ce problème en deux temps. D'abord, un modèle du monde (world model) est appris sur une tâche source, et sert à générer synthétiquement un jeu de données hors-ligne via une planification pénalisée par l'incertitude épistémique. Les trajectoires générées sont ensuite filtrées selon deux critères : rendement cumulé élevé et faible incertitude. Ensuite, un agent s'affine en ligne sur la tâche cible, avec un échantillonnage adaptatif qui équilibre progressivement données offline (issues du world model) et données online (issues de l'environnement réel), assurant une transition stable. Les auteurs formalisent également que l'objectif pénalisé constitue une borne inférieure du rendement vrai, et décomposent l'erreur finie en termes de décalage de distribution et d'erreur d'approximation. Le gain pratique est réel : WOMBET améliore la vitesse de convergence et les performances finales sur des benchmarks de contrôle continu (probablement DeepMind Control Suite ou MuJoCo, non précisés dans l'abstract) par rapport à des baselines solides. Pour la robotique industrielle, où chaque heure de collecte sur robot physique se paie cher, la capacité à générer des données fiables via un modèle appris, tout en contrôlant leur qualité par l'incertitude, est un levier concret. La double garantie -- théorique et empirique -- est rare dans ce domaine et renforce la crédibilité de l'approche au-delà d'un simple résultat expérimental. Ce travail s'inscrit dans un courant actif qui associe world models et RL offline-to-online, où des systèmes comme DreamerV3 ou TD-MPC2 font référence. WOMBET se distingue en ciblant explicitement le problème du transfert inter-tâche, là où la majorité des approches existantes supposent un jeu de données fixe et pré-collecté. Aucune entreprise ni partenariat industriel n'est mentionné ; il s'agit de recherche académique à stade préprint. Trois versions déposées suggèrent des révisions significatives en cours, possiblement vers une soumission en conférence (NeurIPS, ICML, CoRL). Les prochaines étapes naturelles seraient une validation sur hardware réel et une comparaison avec des méthodes de sim-to-real transfer plus classiques.

RecherchePaper
1 source
DODGER : apprentissage par renforcement guidé par la sécurité pour la navigation de robots parmi des obstacles dynamiques
3arXiv cs.RO 

DODGER : apprentissage par renforcement guidé par la sécurité pour la navigation de robots parmi des obstacles dynamiques

Des chercheurs publient sur arXiv (2609.38873) DODGER, un cadre d'apprentissage par renforcement (RL) « guidé par la sécurité » pour la navigation de robots au milieu d'obstacles dynamiques, comme des piétons. La méthode s'appuie sur les fonctions barrières de contrôle (CBF), un outil mathématique qui définit un ensemble d'états sûrs et sert à corriger une commande dangereuse avant son exécution. Elle a été évaluée de trois façons : une analyse de sécurité sur une voiture de Dubins (modèle cinématique simplifié), une simulation d'humanoïde en modèle complet (full-order), puis des essais réels sur un humanoïde équipé d'une perception par LiDAR. Le robot atteint des cibles en évitant plusieurs obstacles mobiles, sans filtre de sécurité à l'exécution. Le résumé ne donne ni taux de collision, ni vitesse d'obstacle, ni nombre d'essais, ni modèle d'humanoïde. Il s'agit d'un travail de recherche, sans produit ni déploiement. L'intérêt tient à une limite des approches CBF-RL actuelles. Elles n'exécutent en entraînement que des actions déjà filtrées. L'agent explore donc moins, ce qui pèse surtout en environnement dynamique, où la sécurité dépend du mouvement relatif entre robot et obstacle. DODGER inverse la logique : les actions produites par la politique pilotent directement les rollouts d'entraînement. Les références filtrées par CBF et les violations de contraintes ne servent qu'à orienter l'apprentissage vers l'évitement. Si cela tient à plus grande échelle, la politique embarquée n'aurait plus besoin d'un solveur de sécurité en ligne. Cela réduirait la charge de calcul et les risques de conflit entre filtre et politique. Pour un intégrateur, la question est de savoir si l'on peut se passer d'un filtre redondant dans des sites partagés avec des opérateurs humains. Les garanties restent empiriques : une politique sans filtre en ligne ne offre plus de certificat formel à l'exécution. Aucune comparaison chiffrée avec les méthodes concurrentes n'apparaît dans le résumé. Le travail prolonge les méthodes qui intègrent les CBF dans le RL, déjà utilisées pour la locomotion et la navigation de robots à pattes, et rejoint l'effort actuel pour transférer des politiques apprises en simulation vers des humanoïdes réels. Il reste au stade de préprint (v1), sans relecture par les pairs. Les prochaines étapes à surveiller sont la publication des taux de succès et de collision face aux baselines à filtre, les tests avec des obstacles plus nombreux et plus rapides, des piétons réels en environnement non contrôlé, et d'autres plateformes humanoïdes. Aucune annonce de pilote industriel ni d'échéance n'accompagne ce préprint.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
COLSON : navigation sociale contrôlable par apprentissage par renforcement basé sur la diffusion
4arXiv cs.RO 

COLSON : navigation sociale contrôlable par apprentissage par renforcement basé sur la diffusion

Des chercheurs proposent COLSON (Controllable Learning-based Social Navigation), une méthode de navigation sociale pour robots mobiles autonomes (AMR) en milieux piétons, fondée sur l'apprentissage par renforcement couplé à des modèles de diffusion. Publiée sur arXiv (2503.13934v2), cette étude traite d'un verrou persistant pour les robots de service : naviguer de façon fluide et socialement cohérente parmi des piétons dynamiques, sans violer leurs espaces de proximité ni générer de comportements erratiques. Les approches à base de règles telles qu'ORCA ou DWA montrent leurs limites dans les environnements denses, tandis que les méthodes de deep RL conventionnelles reposent sur des distributions gaussiennes qui contraignent la variété des trajectoires produites. COLSON contourne cette limitation en exploitant les distributions d'actions plus riches offertes par les modèles de diffusion appliqués au RL, capables de représenter des comportements multimodaux (hésiter, contourner à gauche ou à droite) que les politiques gaussiennes tendent à lisser. L'apport central de la méthode est sa capacité de généralisation à des scénarios inédits sans ré-entraînement. Dans les démonstrations présentées, le robot adapte son comportement à des obstacles statiques absents du jeu d'entraînement, ou change d'objectif pour accompagner un piéton cible tout en évitant les autres passants. Pour les intégrateurs d'AMR en milieux hospitaliers, aéroportuaires ou logistiques, cette propriété de contrôlabilité zero-shot est stratégiquement importante : elle réduit le coût de re-paramétrage à chaque nouveau site de déploiement. Elle valide aussi partiellement l'hypothèse que les diffusion models peuvent atténuer le sim-to-real gap en navigation sociale, en générant des distributions d'actions plus robustes face à l'imprévu. Le champ de la social navigation par deep RL est actif depuis une décennie, avec des travaux fondateurs comme CADRL (2017), SARL et CrowdNav. L'application des modèles de diffusion au RL dans la robotique est plus récente, s'appuyant notamment sur Diffusion Policy (Columbia/MIT, 2023) dans le domaine de la manipulation. COLSON transfère cette logique vers la planification de mouvement en espace ouvert. Il s'agit à ce stade d'un preprint académique avec validation uniquement en simulation ; aucun déploiement sur robot réel ni partenariat industriel n'est mentionné, ce qui invite à tempérer les conclusions. Les éditeurs actifs sur la navigation sociale autonome incluent Boston Dynamics, ANYbotics et Clearpath Robotics, et côté européen Enchanted Tools (France) ou PAL Robotics (Espagne) pour les robots de service. Les prochaines étapes naturelles seraient une validation en environnement réel et un benchmarking sur les datasets standardisés ETH/UCY.

UELes intégrateurs AMR européens (dont Enchanted Tools en France, PAL Robotics en Espagne) pourraient à terme bénéficier de la contrôlabilité zero-shot de COLSON pour réduire les coûts de redéploiement multi-sites, mais la méthode reste validée uniquement en simulation sans partenariat industriel déclaré.

RecherchePaper
1 source