Aller au contenu principal
RecherchearXiv cs.RO 

HiRAD : un système flexible de routage d'AGV à grande échelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Publié sur arXiv le 10 septembre 2026 (référence 2609.09752), HiRAD est un système de routage par apprentissage par renforcement hiérarchique pour flottes d'AGV en entrepôt, conçu pour l'espace continu plutôt que la grille. Il combine une représentation spatio-temporelle par pas de temps rendant le mouvement continu différentiable, une séparation entre choix de cap et contrôle de vitesse qui réduit l'espace d'action, et un pipeline de décision asynchrone événementiel abaissant la complexité d'inférence de O(n²) à O(n) et la latence par pas jusqu'à 71%. Sur des graphes aléatoires et deux cartes d'entrepôt simulées, HiRAD réduit le makespan de 45% à 63% par rapport aux méthodes comparées, sans partenaire industriel ni déploiement réel associé à ces résultats.

L'enjeu dépasse l'exercice académique: les solveurs classiques de Multi-Agent Pathfinding butent sur une explosion combinatoire et un temps de calcul super-quadratique, avec des modèles de mouvement en grille éloignés de la cinématique réelle des véhicules. Les approches RL récentes gagnent en flexibilité via des politiques décentralisées, mais exigent des millions d'épisodes d'entraînement et une observation complète de la carte à chaque étape, d'où des modèles lourds et une latence incompatible avec le contrôle temps réel industriel. En conciliant décomposition hiérarchique de l'action et architecture événementielle, HiRAD attaque directement ce compromis qui freinait jusqu'ici l'adoption du RL en logistique d'entrepôt à grande échelle, un sujet suivi de près par les intégrateurs et opérateurs de flottes AMR/AGV.

Le routage de flottes d'AGV est étudié depuis des décennies via des algorithmes exacts comme Conflict-Based Search ou la planification priorisée, limités par le même mur combinatoire dès que le nombre de véhicules ou la taille de l'entrepôt augmente. Les travaux récents en RL décentralisé ont ouvert une voie alternative, mais restaient pénalisés par des temps de convergence de plusieurs millions d'épisodes et une latence d'inférence trop élevée pour la production. HiRAD répond aux deux limites à la fois, sans dépendance annoncée à un fournisseur particulier, dans un marché où le français Exotec, Geek+ ou Locus Robotics déploient déjà des flottes commerciales. Le papier reste toutefois une contribution de recherche validée en simulation, sans pilote industriel ni calendrier de déploiement annoncé.

Dans nos dossiers

À lire aussi

Vers un apprentissage robotique prédictif, aligné et à grande échelle
1arXiv cs.RO 

Vers un apprentissage robotique prédictif, aligné et à grande échelle

Le papier arXiv 2607.11270, publié le 14 juillet 2026, présente Lumo-2, un modèle latent monde-action développé pour la robotique conçu pour générer des actions en raisonnant sur la dynamique du monde dans un espace latent plutôt qu'en clonant du comportement observé. L'idée centrale est que la qualité de génération d'actions dépend de la géométrie de cet espace latent : les auteurs montrent que les objectifs classiques de tokenisation d'actions basés sur la reconstruction biaisent les représentations vers la fidélité du signal brut, ce qui désaligne la qualité de reconstruction et la performance de contrôle réelle. Pour corriger cela, ils proposent un alignement multi-étapes des modalités, où les représentations d'actions sont progressivement rapprochées de la dynamique du monde latente, de la vision et du langage. Le papier revendique des gains sur des tâches réelles de manipulation dexterous et à long horizon face à des modèles vision-langage-action (VLA) et monde-action (WAM) de référence, sans toutefois publier de chiffres précis de taux de réussite, de temps de cycle ou de comparaison nommée dans le résumé disponible : à ce stade, il s'agit d'une annonce de recherche, pas d'un produit déployé ni de résultats benchmarkés vérifiables publiquement. Si les résultats se confirment à l'échelle et hors distribution, cela renforcerait l'hypothèse selon laquelle le raisonnement prédictif structuré, et non la seule imitation de trajectoires, est la voie vers des politiques robotiques généralisables, un sujet clé alors que des labs et startups (Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, Figure avec Helix) cherchent tous à faire tenir leurs VLA face à des environnements réels imprévisibles plutôt qu'à des démonstrations scénarisées. Ce travail s'inscrit dans la lignée des modèles monde-action apparus depuis 2024-2025, qui tentent de combiner la prédiction vidéo façon world models avec la génération de commandes motrices. Aucun acteur français ou européen n'est cité dans cette publication, et aucune date de suivi, de code ouvert ou de déploiement industriel n'est mentionnée à ce stade.

RechercheActu
1 source
AssemPlanner : un cadre de planification de tâches multi-agents pour les systèmes d'assemblage flexibles
2arXiv cs.RO 

AssemPlanner : un cadre de planification de tâches multi-agents pour les systèmes d'assemblage flexibles

Une équipe de chercheurs a publié le 12 mai 2026 sur arXiv (référence 2605.08831) un framework de planification de tâches pour systèmes d'assemblage flexibles baptisé AssemPlanner. Le système prend en entrée des descriptions de tâches en langage naturel et les convertit automatiquement en séquences d'opérations de production exécutables. Son architecture repose sur plusieurs agents spécialisés : SchedAgent, qui joue le rôle de moteur de raisonnement central, KnowledgeAgent, chargé de fournir les connaissances métier, LineBalanceAgent, responsable de l'équilibrage des lignes, ainsi qu'un graphe de scène représentant l'état physique de l'environnement. Le code source et les jeux de données sont publiés en accès libre sur GitHub, ce qui facilite la reproductibilité des résultats. L'intérêt industriel de cette approche réside dans la réduction du temps de reconfiguration d'une ligne d'assemblage lors du passage à un nouveau produit. Dans les systèmes actuels, cette phase mobilise plusieurs experts pendant des périodes significatives, ce qui constitue un frein majeur à la flexibilité de la production. En substituant une interface en langage naturel à la configuration manuelle, AssemPlanner vise à abaisser la barrière d'entrée pour les intégrateurs et les responsables de production. Le recours à l'approche ReAct (Reasoning + Acting) permet à SchedAgent d'ajuster dynamiquement ses décisions en fonction des retours des autres agents, contrairement aux pipelines statiques traditionnels qui nécessitent une reprogrammation explicite dès que les contraintes du procédé changent. Cela pourrait réduire concrètement les délais de mise en production pour les PME industrielles et les intégrateurs spécialisés en automatisation. AssemPlanner s'inscrit dans la dynamique plus large des systèmes multi-agents LLM appliqués à l'automatisation industrielle, un champ en expansion rapide depuis 2023. L'architecture ReAct, introduite par des chercheurs de Google et Princeton en 2022, est ici transposée dans un contexte de manufacturing réel plutôt que symbolique. Les approches concurrentes incluent les systèmes experts classiques, la planification par jumeaux numériques, et des frameworks comme TaskMatrix ou AutoGen adaptés à des verticaux industriels. Il convient de souligner que le papier reste une contribution académique : aucun déploiement en environnement de production réel n'est documenté à ce stade, et les performances annoncées devront être validées hors contexte contrôlé.

RechercheActu
1 source
SPARC : annotation spatiale fiable à partir de démonstrations robotiques à grande échelle
3arXiv cs.RO 

SPARC : annotation spatiale fiable à partir de démonstrations robotiques à grande échelle

Des chercheurs du groupe Intuitive Robots ont publié sur arXiv (réf. 2606.13497) SPARC, acronyme de Spatial Annotations from Robot Demonstrations with Reliability Calibration. Il s'agit d'un pipeline automatique qui annote des démonstrations robotiques avec des métadonnées spatiales structurées -- boîtes englobantes, trajectoires d'objets, labels de phase de manipulation -- tout en attribuant à chaque annotation un score de fiabilité calibré. Évalué sur 1 700 démonstrations annotées manuellement, couvrant des morphologies et des scénarios variés, SPARC conserve trois fois plus d'échantillons aux points de fonctionnement haute précision par rapport aux pipelines de détection classiques, tout en surpassant ces mêmes baselines sur la précision de localisation. L'équipe introduit également IA-Bench (Interaction-Aware Bench), un benchmark dédié à mesurer la précision des modèles dans la localisation des objets manipulés au fil d'une démonstration. Le code, les données et les modèles sont disponibles publiquement. L'enjeu est directement lié à la scalabilité de l'entraînement des politiques robotiques et des modèles de fondation incarnés (embodied foundation models). Les pipelines d'annotation automatique existants produisent des labels en volume, mais sans signal de qualité fiable : la confiance du détecteur est mal calibrée pour prédire la correction d'une annotation, ce qui oblige les équipes ML à choisir entre bruit et perte de données. SPARC contourne ce dilemme en exploitant la structure spatio-temporelle propre aux tâches robotiques pour générer un signal de fiabilité intrinsèque. Les politiques entraînées sur ces annotations surpassent les baselines dans des scènes réelles encombrées et visuellement ambiguës, ce qui suggère que la qualité du signal d'annotation compte autant que le volume brut de données -- une hypothèse que le secteur commence seulement à tester systématiquement. Le problème de l'annotation à grande échelle est un goulot d'étranglement bien identifié dans la robotique d'apprentissage par imitation, notamment depuis l'émergence des Visual Language Action models (VLA) tels que pi-0 de Physical Intelligence ou OpenVLA de Berkeley. Ces architectures consomment des milliers de démonstrations annotées avec précision, et la vérification humaine ne passe pas à l'échelle. SPARC s'inscrit dans un effort plus large, parallèle aux travaux de Google DeepMind sur RoboAgent ou aux pipelines de données de Hugging Face LeRobot, pour industrialiser la production de datasets robotiques de qualité. La prochaine étape logique sera de valider SPARC sur des distributions d'environnements plus larges et sur des tâches de manipulation longue durée, deux axes où le sim-to-real gap reste ouvert.

UELes laboratoires européens (CEA-List, INRIA, universités) travaillant sur l'apprentissage par imitation peuvent directement exploiter ce pipeline open-source pour améliorer la qualité de leurs datasets robotiques sans coût d'annotation humaine supplémentaire.

RecherchePaper
1 source
Hi-WM : un modèle du monde centré sur l'humain pour l'entraînement robotique à grande échelle
4arXiv cs.RO 

Hi-WM : un modèle du monde centré sur l'humain pour l'entraînement robotique à grande échelle

Une équipe de recherche présente Hi-WM (Human-in-the-World-Model), un cadre de post-entraînement pour politiques robotiques généralisées, publié sur arXiv (2604.21741). L'approche remplace l'exécution physique par un modèle du monde appris : la politique est d'abord déroulée en boucle fermée dans ce simulateur interne, et lorsqu'une trajectoire devient incorrecte ou risquée, un opérateur humain intervient directement dans le modèle pour fournir des actions correctives courtes. Hi-WM met en cache les états intermédiaires et supporte le rollback et le branchement, ce qui permet de réutiliser un seul état d'échec pour générer plusieurs continuations correctives distinctes. Les trajectoires ainsi produites sont réinjectées dans le jeu d'entraînement. Évalué sur trois tâches de manipulation réelle (objets rigides et déformables) avec deux architectures de politique différentes, le système affiche un gain de 37,9 points en taux de succès réel par rapport à la politique de base, et de 19,0 points par rapport à une ligne de base en boucle fermée dans le modèle du monde. La corrélation entre les évaluations dans le modèle et les performances réelles atteint r = 0,953. Ce résultat adresse un goulot d'étranglement structurel du déploiement robotique : le post-entraînement actuel exige du temps robot, des resets de scène, une supervision opérateur en continu, autant de contraintes qui rendent la correction itérative coûteuse à l'échelle. En décorrélant la phase corrective de l'exécution physique, Hi-WM densifie la supervision précisément là où la politique échoue, sans mobiliser le matériel. La forte corrélation sim-to-real (r > 0,95) est notable : elle suggère que le modèle du monde est suffisamment fidèle pour qualifier les politiques avant déploiement, ce qui contredit en partie l'hypothèse que l'évaluation dans le modèle reste trop éloignée des conditions réelles pour être exploitable. Les modèles du monde conditionnés sur les actions sont étudiés depuis plusieurs années principalement pour la génération de données synthétiques et l'évaluation de politiques, notamment dans les travaux autour des VLA (Vision-Language-Action models) et des politiques généralisées comme celles portées par Physical Intelligence (Pi-0) ou les recherches internes de Google DeepMind. Hi-WM repositionne ces modèles comme substrat correctif actif, une troisième fonction jusqu'ici peu explorée. Les suites naturelles incluent l'extension à des tâches de locomotion, la réduction du coût de construction du modèle du monde, et l'intégration dans des pipelines de fine-tuning continu pour robots déployés en environnement industriel variable.

RechercheOpinion
1 source