IndoorBEV : un système léger de perception BEV par LiDAR en temps réel pour robots mobiles d'intérieur
Des chercheurs publient sur arXiv (2610.00355) IndoorBEV, un système de perception LiDAR conçu pour les robots mobiles d'intérieur. Le modèle ne compte que 0,6 million de paramètres et occupe 2,3 Mo de stockage. Sur un NVIDIA AGX Orin, il consomme 21,52 Mo de mémoire GPU par inférence et affiche une latence moyenne de 169,6 ms, pour une échéance de perception fixée à 200 ms. Le taux de dépassement de cette échéance est de 1,8 %. Le système produit simultanément des cartes sémantiques en vue de dessus (BEV, bird's-eye view) et des boîtes englobantes orientées pour les objets. Il repose sur une représentation BEV « consciente de la hauteur » : pour chaque cellule, la distribution verticale des points est résumée par des statistiques de hauteur et un encodage multi-fréquence, ce qui permet à de simples convolutions 2D de traiter une information 3D. Un encodeur léger fusionne ces indices géométriques avec des représentations locales multi-échelles et un contexte global compact, puis des têtes de prédiction découplées génèrent les sorties. L'évaluation couvre des scènes simulées, des scans réels de robots et un jeu de données ouvert de nuages de points d'intérieur.
L'enjeu est très concret pour les intégrateurs et les équipes qui embarquent de la perception sur des plateformes à budget calcul limité. Les méthodes à base de points ou de voxels restent coûteuses, tandis que les BEV classiques, issus surtout de la conduite autonome, sacrifient la géométrie verticale, un handicap dans des intérieurs encombrés où tables, étagères, suspensions et objets en surplomb comptent. Avec un modèle de 2,3 Mo, IndoorBEV laisse l'essentiel du GPU disponible pour la navigation, la planification ou d'autres réseaux sur la même machine. Les auteurs affirment ainsi qu'encoder explicitement la hauteur dans une représentation 2D compacte est une voie viable. Quelques réserves s'imposent : il s'agit d'une préimpression non relue par les pairs, une latence moyenne de 169,6 ms sous une échéance de 200 ms laisse une marge mince, soit environ 6 images par seconde, ce qui est modeste pour un robot rapide, et le résumé ne donne aucun chiffre de précision, ni comparaison chiffrée avec des modèles concurrents. L'affirmation d'un « compromis favorable » reste donc à vérifier dans l'article complet.
Ce travail s'inscrit dans la série des architectures BEV, popularisées par la conduite autonome (PointPillars, BEVFusion) et désormais adaptées aux contraintes de l'embarqué. Le choix de l'AGX Orin, plateforme de référence pour la robotique mobile, rend les résultats comparables à ce que les intégrateurs déploient réellement. Les concurrents sont les réseaux voxel creux et les approches point à point, plus précis mais plus lourds, ainsi que les modèles de fondation de perception 3D, qui visent la généralité plutôt que la frugalité. Aucune annonce de déploiement industriel, de code ou de pilote n'accompagne la publication à ce stade. La suite logique consisterait à publier des benchmarks comparatifs, à tester le système sur des robots en conditions réelles de logistique ou de service, et à vérifier sa tenue face à des environnements dynamiques et à des capteurs LiDAR de résolutions différentes.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




