CrowdOcc : complétion sémantique de scènes par vision monoculaire pour robots quadrupèdes en intérieur bondé
Une équipe de chercheurs publie CrowdOcc, un jeu de données RGB-D et un cadre de complétion sémantique de scène (SSC, semantic scene complétion) monoculaire destinés aux robots quadrupèdes évoluant dans des intérieurs fréquentés. Le jeu de données compte 25,1 K images issues de 11 scènes d'intérieur, avec des annotations d'occupation sémantique 3D construites par « découplage statique/dynamique », c'est-à-dire en traitant séparément la géométrie fixe de l'environnement et les personnes en mouvement. Le cadre repose sur deux modules. Le premier, NGSGF (Normal Guided Scene Geometry Fusion), complète la projection 3D guidée par la profondeur avec des normales de surface, afin de rendre la géométrie plus robuste aux occlusions. Le second, HCSI (Human-Centric Sparse Interaction), modélise de façon sélective, en 3D, les relations entre personnes ainsi qu'entre une personne et son environnement local. Sur le jeu de test à scènes disjointes, la méthode atteint 15,80 d'IoU, 11,40 de mIoU et 46,23 d'IoU sur la classe « humain ». Il s'agit d'un résultat de recherche académique, sans produit ni déploiement associé.
L'enjeu porte sur une hypothèse rarement testée : la perception 3D des robots mobiles est surtout validée dans des scènes statiques ou peu peuplées. Or, dans une foule, les personnes masquent les murs, le mobilier et le sol, et leur propre occupation prédite est souvent incomplète ou mal placée. Pour un quadrupède opérant dans un hall, un commerce ou un site d'inspection partagé avec des employés, c'est la fiabilité de la carte d'occupation locale, donc de la planification de trajectoire et de l'évitement, qui est en jeu. Le fait de se limiter à une seule caméra, avec profondeur, va dans le sens de plateformes à faible coût et à capteurs réduits. Les chiffres appellent toutefois à la prudence : 15,80 d'IoU et 11,40 de mIoU restent modestes en valeur absolue. Le jeu de données est aussi petit (11 scènes), et la généralisation n'est démontrée que sur des scènes d'intérieur invisibles du même corpus. L'écart avec une robustesse exploitable en production est donc probablement important, d'autant que les résumés ne donnent ni latence ni cadence d'inférence embarquée.
Ces travaux prolongent la lignée de la complétion sémantique de scène monoculaire, née dans le contexte de la conduite autonome (SemanticKITTI, approches de type MonoScene), puis étendue à l'occupation 3D en intérieur. La plupart de ces références supposent des scènes statiques ou des points de vue de véhicule, et non celui d'un quadrupède, plus bas et plus instable. CrowdOcc comble ce vide avec un banc d'essai dédié aux scènes peuplées. Les prochaines étapes naturelles sont l'évaluation sur une plateforme réelle, la mesure du temps d'inférence embarqué et l'extension à davantage de scènes. Le papier ne mentionne aucun acteur industriel ou européen précis. Il s'adresse aux équipes qui développent des quadrupèdes commerciaux et aux laboratoires travaillant sur la navigation en environnement humain.
Pas d\'impact direct sur la France/UE




