Traduction et apprentissage conjoint agent-environnement assisté par recherche pour la recherche de chemins multi-agents à vie longue avec rotations
Des chercheurs publient sur arXiv (2608.05588) une nouvelle méthode pour la planification de trajectoires multi-agents en continu (LMAPF), le problème qui consiste à replanifier sans collision les déplacements d'une flotte de robots dont chacun reçoit un nouvel objectif dès qu'il atteint le précédent. Les auteurs introduisent un modèle plus réaliste, baptisé LMAPF-R2, dérivé du fonctionnement d'entrepôts automatisés réels : il intègre des contraintes de sécurité robustes et la rotation sur place des robots, deux éléments souvent ignorés par les planificateurs entraînés par apprentissage. Leur méthode, SJRL (Search-Aided Joint Reinforcement Learning), combine des politiques neuronales avec Causal PIBT, un planificateur de recherche en une étape qui résout les collisions et propage les intentions des agents, et une formulation d'apprentissage par renforcement qui optimise conjointement la politique des robots et une politique d'environnement apprenant le coût des arêtes du graphe pour guider les déplacements via une recherche de Dijkstra inversée. Les résultats montrent des gains significatifs sur Causal-PIBT dans plusieurs cartes à haute densité, avec une validation en réalité mixte associant 8 robots physiques et 248 robots virtuels.
L'enjeu concerne directement les exploitants de flottes de robots mobiles autonomes (AMR) en entrepôt, où la plupart des benchmarks académiques de MAPF simplifient encore les déplacements à de simples sauts de case en case, sans rotation ni contrainte physique, un écart classique entre démonstration académique et comportement réel des robots. En intégrant ces contraintes dès la conception du modèle plutôt qu'en les traitant comme un post-traitement, les auteurs réduisent cet écart et rendent les résultats plus transférables à des systèmes industriels concrets. La validation à l'échelle mixte, mêlant robots physiques et simulation, reste rare dans ce champ de recherche où la quasi-totalité des publications s'arrête à la simulation pure ; c'est un signal de maturité qui mérite d'être noté, même s'il s'agit encore d'un prototype de laboratoire et non d'un déploiement commercial.
Le MAPF s'est imposé comme problème central de la logistique automatisée avec la généralisation des flottes d'AMR popularisées par Kiva Systems puis Amazon Robotics dans les années 2010, et sa variante "lifelong", où les objectifs arrivent en continu, modélise mieux les opérations réelles d'entrepôt que les formulations statiques classiques. Causal PIBT, utilisé ici comme référence, appartient à la lignée des planificateurs par recherche et héritage de priorité, dominante avant l'essor récent des approches neuronales. SJRL s'inscrit dans une tendance qui hybride recherche classique et apprentissage par renforcement pour dépasser les limites de chaque approche isolée. L'abstract ne mentionne ni partenaire industriel, ni acteur français ou européen, ni calendrier de déploiement : il s'agit à ce stade d'une contribution académique.
Dans nos dossiers




