
Prédiction d'occupation sémantique multimodale panoramique pour robots quadrupèdes
Des chercheurs présentent PanoMMOcc, premier jeu de données réel d'occupation sémantique multimodale panoramique conçu pour des robots quadrupèdes, réunissant quatre modalités de capteurs collectées dans des scènes variées. A partir de ce jeu de données, l'équipe propose VoxelHound, un framework de perception d'occupation adapte a la locomotion sur pattes et a l'imagerie sphérique a 360 degrés. Il repose sur deux modules : Vertical Jitter Compensation (VJC), qui corrige les perturbations de point de vue provoquées par le tangage et le roulis du corps pendant la marche, et Multimodal Information Prompt Fusion (MIPF), qui fusionne les indices visuels panoramiques avec les modalités auxiliaires pour affiner la prédiction volumétrique. Sur le benchmark établi a partir de PanoMMOcc, VoxelHound revendique des résultats état de l'art avec un gain de +4.16 points de mIoU par rapport aux méthodes existantes. Le jeu de données et le code source doivent être publies sur le dépôt GitHub SXDR/PanoMMOcc, référençant le papier sous l'identifiant arXiv 2603.13108, dans une version révisée.
L'enjeu tient au fait que les méthodes de prédiction d'occupation actuelles ont été conçues pour des véhicules a roues et reposent lourdement sur des indices RGB, une approche mal adaptee aux robots a pattes dont le corps oscille verticalement a chaque cycle de marche, dégradant la cohérence spatiale des modèles existants. En fournissant le premier jeu de données réel et un benchmark spécifiques a ce cas d'usage, ce travail comble un manque concret pour les intégrateurs qui cherchent a déployer des quadrupèdes dans des environnements dynamiques comme des entrepôts ou des chantiers extérieurs. Le gain de +4.16 en mIoU reste toutefois une mesure interne, évaluée sur le benchmark propre des auteurs, sans comparaison indépendante tierce a ce stade.
La prédiction d'occupation 3D s'est surtout développée dans le contexte de la conduite autonome, avec des architectures pensées pour des plateformes a roues stables et des rigs multi-cameras fixes. L'essor de plateformes quadrupèdes commerciales, capables de franchir des terrains irréguliers, a mis en évidence l'absence d'outils de perception robustes a ce type de mouvement non rigide. La publication conjointe du dataset et du code vise a faciliter les recherches futures sur la perception 3D multimodale panoramique pour les systèmes robotiques incarnes. Il s'agit pour l'instant d'un travail de recherche académique, sans annonce de déploiement industriel ni de partenaire commercial associe.
Dans nos dossiers




