
Robots sociaux : apprendre la navigation en détectant les jambes humaines
Des chercheurs présentent CALF (Convolutional Attention for Leg Features), une architecture neuronale de bout en bout qui permet à un robot mobile de naviguer parmi des piétons en interprétant directement le mouvement des jambes détecté par un LiDAR 2D. Le constat de départ est simple : la plupart des robots de navigation sociale portent leur LiDAR près du sol, où le capteur perçoit surtout des jambes en mouvement plutôt que des silhouettes humaines complètes, alors que les méthodes d'apprentissage existantes continuent de modéliser les piétons comme de simples cercles. CALF combine couches convolutives, mécanisme d'attention et MLP pour produire des commandes de navigation à partir de ces données brutes. La politique est entraînée par apprentissage par renforcement profond dans LegNav, un simulateur 2D léger développé pour l'occasion, qui associe un lancer de rayons LiDAR et un nouveau modèle de démarche piétonne. Écrit en JAX, LegNav permet d'entraîner une politique CALF prête au déploiement en moins d'une heure sur un seul GPU grand public. La méthode a été validée en conditions réelles par un déploiement zero-shot sur un robot TurtleBot 4, produisant des trajectoires fluides et jugées socialement conformes.
Ce travail cible un point aveugle fréquent des systèmes de navigation sociale : la simplification excessive de la perception humaine, qui limite la finesse des comportements d'évitement et d'anticipation en environnement piéton dense. En démontrant qu'une politique entraînée uniquement en simulation transfère avec succès vers un robot réel sans réentraînement, l'étude apporte un élément concret au débat sur l'écart entre simulation et réalité (sim-to-real gap) dans la robotique mobile, un enjeu central pour les intégrateurs qui déploient des AMR (robots mobiles autonomes) en entrepôt, en hôpital ou en espace public. Le coût d'entraînement réduit, moins d'une heure sur un GPU standard, abaisse également la barrière d'accès pour les équipes de recherche appliquée.
Cette publication s'inscrit dans un courant de recherche plus large sur la navigation sociale des robots, où la représentation fine des piétons (pose, démarche, intention) est identifiée comme un levier clé pour dépasser les modèles géométriques simplistes hérités de la robotique classique. L'article, disponible sur arXiv (2607.27922v1), ouvre la voie à des extensions possibles vers des capteurs additionnels ou des scénarios de foule plus denses, sans que les auteurs n'annoncent à ce stade de calendrier de déploiement industriel.
Dans nos dossiers




