Aller au contenu principal
RecherchearXiv cs.RO 

CrowdOcc : complétion sémantique de scènes par vision monoculaire pour robots quadrupèdes en intérieur bondé

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie CrowdOcc, un jeu de données RGB-D et un cadre de complétion sémantique de scène (SSC, semantic scene complétion) monoculaire destinés aux robots quadrupèdes évoluant dans des intérieurs fréquentés. Le jeu de données compte 25,1 K images issues de 11 scènes d'intérieur, avec des annotations d'occupation sémantique 3D construites par « découplage statique/dynamique », c'est-à-dire en traitant séparément la géométrie fixe de l'environnement et les personnes en mouvement. Le cadre repose sur deux modules. Le premier, NGSGF (Normal Guided Scene Geometry Fusion), complète la projection 3D guidée par la profondeur avec des normales de surface, afin de rendre la géométrie plus robuste aux occlusions. Le second, HCSI (Human-Centric Sparse Interaction), modélise de façon sélective, en 3D, les relations entre personnes ainsi qu'entre une personne et son environnement local. Sur le jeu de test à scènes disjointes, la méthode atteint 15,80 d'IoU, 11,40 de mIoU et 46,23 d'IoU sur la classe « humain ». Il s'agit d'un résultat de recherche académique, sans produit ni déploiement associé.

L'enjeu porte sur une hypothèse rarement testée : la perception 3D des robots mobiles est surtout validée dans des scènes statiques ou peu peuplées. Or, dans une foule, les personnes masquent les murs, le mobilier et le sol, et leur propre occupation prédite est souvent incomplète ou mal placée. Pour un quadrupède opérant dans un hall, un commerce ou un site d'inspection partagé avec des employés, c'est la fiabilité de la carte d'occupation locale, donc de la planification de trajectoire et de l'évitement, qui est en jeu. Le fait de se limiter à une seule caméra, avec profondeur, va dans le sens de plateformes à faible coût et à capteurs réduits. Les chiffres appellent toutefois à la prudence : 15,80 d'IoU et 11,40 de mIoU restent modestes en valeur absolue. Le jeu de données est aussi petit (11 scènes), et la généralisation n'est démontrée que sur des scènes d'intérieur invisibles du même corpus. L'écart avec une robustesse exploitable en production est donc probablement important, d'autant que les résumés ne donnent ni latence ni cadence d'inférence embarquée.

Ces travaux prolongent la lignée de la complétion sémantique de scène monoculaire, née dans le contexte de la conduite autonome (SemanticKITTI, approches de type MonoScene), puis étendue à l'occupation 3D en intérieur. La plupart de ces références supposent des scènes statiques ou des points de vue de véhicule, et non celui d'un quadrupède, plus bas et plus instable. CrowdOcc comble ce vide avec un banc d'essai dédié aux scènes peuplées. Les prochaines étapes naturelles sont l'évaluation sur une plateforme réelle, la mesure du temps d'inférence embarqué et l'extension à davantage de scènes. Le papier ne mentionne aucun acteur industriel ou européen précis. Il s'adresse aux équipes qui développent des quadrupèdes commerciaux et aux laboratoires travaillant sur la navigation en environnement humain.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Coordination continue de robots quadrupèdes par découverte de compétences sémantiques
1arXiv cs.RO 

Coordination continue de robots quadrupèdes par découverte de compétences sémantiques

Des chercheurs ont publié sur arXiv (réf. 2606.08102) un framework appelé Conquer, conçu pour coordonner des équipes de robots quadrupèdes en apprentissage continu, c'est-à-dire sans avoir à réentraîner le système à chaque nouvelle tâche. L'approche repose sur une bibliothèque de compétences sémantiques organisée autour d'un cycle récupérer-adapter-mettre à jour : avant d'exécuter une tâche inconnue, le système construit un descripteur sémantique à partir des informations pré-exécution, retrouve la compétence la plus proche dans la bibliothèque, l'adapte, puis intègre les trajectoires réelles pour enrichir la base. Le backbone SAG (Self-Allies-Goal) permet de gérer des équipes de taille variable en modélisant explicitement l'état propre de chaque robot, le contexte de ses coéquipiers et l'objectif de la tâche. En simulation, Conquer atteint un taux de succès moyen final de 95,6 %, avec un transfert positif démontré vers de nouvelles tâches et un oubli catastrophique qualifié de négligeable. Des essais en conditions réelles ont été conduits sur des équipes de Unitree Go2, le quadrupède commercial d'Unitree Robotics. Ce résultat compte parce qu'il s'attaque à l'un des verrous fondamentaux de la robotique multi-agents : les méthodes de type MARL (apprentissage par renforcement multi-agents) existantes entraînent des politiques spécifiques à une famille de tâches fermée, ce qui les rend inutilisables dans des environnements industriels où les missions évoluent en permanence. Conquer propose une alternative où de nouvelles compétences de coordination s'accumulent sans effacer les précédentes, un prérequis pour tout déploiement réel dans des entrepôts ou sur des lignes de production à géométrie variable. La capacité à gérer des équipes de taille arbitraire est également non triviale : la plupart des approches supposent un nombre fixe d'agents. À noter cependant que les métriques de succès sont issues de simulation, et que les vidéos de déploiement sur Go2 restent des démonstrations sélectionnées, sans données quantifiées sur les taux d'échec terrain ni sur les temps de cycle réels. La coordination multi-quadrupèdes s'est intensifiée avec la disponibilité de robots comme le Go2 d'Unitree (lancé à moins de 2 700 dollars en version grand public), qui abaisse le coût d'expérimentation en laboratoire. La problématique de l'apprentissage continu en robotique est partagée par plusieurs groupes de recherche, notamment autour des architectures VLA (Vision-Language-Action) qui cherchent elles aussi à éviter la réinitialisation à chaque nouvelle tâche. Conquer se positionne dans un espace encore peu industrialisé, entre les approches MARL classiques et les frameworks généralistes de type foundation model. Les prochaines étapes logiques seraient des évaluations en entrepôt réel sur des tâches de manutention collaboratives, domaine où des acteurs comme Exotec (France) ou Boston Dynamics investissent sur des flottes mixtes humanoïdes et quadrupèdes.

RecherchePaper
1 source
Prédiction d'occupation sémantique multimodale panoramique pour robots quadrupèdes
2arXiv cs.RO 

Prédiction d'occupation sémantique multimodale panoramique pour robots quadrupèdes

Des chercheurs présentent PanoMMOcc, premier jeu de données réel d'occupation sémantique multimodale panoramique conçu pour des robots quadrupèdes, réunissant quatre modalités de capteurs collectées dans des scènes variées. A partir de ce jeu de données, l'équipe propose VoxelHound, un framework de perception d'occupation adapte a la locomotion sur pattes et a l'imagerie sphérique a 360 degrés. Il repose sur deux modules : Vertical Jitter Compensation (VJC), qui corrige les perturbations de point de vue provoquées par le tangage et le roulis du corps pendant la marche, et Multimodal Information Prompt Fusion (MIPF), qui fusionne les indices visuels panoramiques avec les modalités auxiliaires pour affiner la prédiction volumétrique. Sur le benchmark établi a partir de PanoMMOcc, VoxelHound revendique des résultats état de l'art avec un gain de +4.16 points de mIoU par rapport aux méthodes existantes. Le jeu de données et le code source doivent être publies sur le dépôt GitHub SXDR/PanoMMOcc, référençant le papier sous l'identifiant arXiv 2603.13108, dans une version révisée. L'enjeu tient au fait que les méthodes de prédiction d'occupation actuelles ont été conçues pour des véhicules a roues et reposent lourdement sur des indices RGB, une approche mal adaptee aux robots a pattes dont le corps oscille verticalement a chaque cycle de marche, dégradant la cohérence spatiale des modèles existants. En fournissant le premier jeu de données réel et un benchmark spécifiques a ce cas d'usage, ce travail comble un manque concret pour les intégrateurs qui cherchent a déployer des quadrupèdes dans des environnements dynamiques comme des entrepôts ou des chantiers extérieurs. Le gain de +4.16 en mIoU reste toutefois une mesure interne, évaluée sur le benchmark propre des auteurs, sans comparaison indépendante tierce a ce stade. La prédiction d'occupation 3D s'est surtout développée dans le contexte de la conduite autonome, avec des architectures pensées pour des plateformes a roues stables et des rigs multi-cameras fixes. L'essor de plateformes quadrupèdes commerciales, capables de franchir des terrains irréguliers, a mis en évidence l'absence d'outils de perception robustes a ce type de mouvement non rigide. La publication conjointe du dataset et du code vise a faciliter les recherches futures sur la perception 3D multimodale panoramique pour les systèmes robotiques incarnes. Il s'agit pour l'instant d'un travail de recherche académique, sans annonce de déploiement industriel ni de partenaire commercial associe.

RecherchePaper
1 source
Robot quadrupède : apprentissage par renforcement de bout en bout pour monter et descendre des escaliers en intervention incendie intérieure
3arXiv cs.RO 

Robot quadrupède : apprentissage par renforcement de bout en bout pour monter et descendre des escaliers en intervention incendie intérieure

Des chercheurs ont développé une approche d'apprentissage par renforcement profond en deux étapes pour entraîner des robots quadrupèdes Unitree Go2 à monter et descendre des escaliers de manière autonome, dans le cadre de recherches en intérieur lors d'incendies. L'étude, publiée sur arXiv (2602.03087v2, version révisée), s'appuie entièrement sur le moteur de simulation Isaac Lab de NVIDIA. Dans une première phase, les robots sont entraînés sur un terrain abstrait en forme de pyramide d'escaliers. Dans une seconde phase, la politique apprise est transférée vers des configurations d'escaliers réalistes et variées, droits, en L et en spirale, représentatives des bâtiments réels. Le système repose sur une perception locale par carte de hauteur et une formulation de navigation basée sur une ligne centrale, qui unifie l'apprentissage de la navigation et de la locomotion sans recourir à une planification hiérarchique séparée. L'enjeu pratique est direct: lors d'une recherche primaire en intérieur après un départ de feu, un robot doit balayer rapidement des zones dangereuses, repérer des victimes potentielles et surveiller des matériaux inflammables, souvent en empruntant des cages d'escalier de formes différentes selon les bâtiments. La difficulté classique pour les quadrupèdes n'est pas seulement de gravir des marches, mais de généraliser ce savoir-faire à des topologies d'escaliers jamais vues, sans replanification lourde à chaque changement de géométrie. En démontrant qu'une politique unique, entraînée d'abord sur un terrain simplifié puis affinée sur des cas réalistes, généralise à des formes variées à partir de perception locale seulement, les auteurs apportent un élément de preuve en faveur des architectures de bout en bout face aux pipelines de navigation classiques, plus modulaires mais plus coûteux à adapter. Le travail reste cependant limité à la simulation: aucun transfert vers un robot physique n'est rapporté dans cette version, ce qui laisse ouverte la question du sim-to-real. Le Go2 d'Unitree, plateforme quadrupède abordable largement utilisée dans la recherche académique, sert ici de base matérielle de référence, dans un secteur où Boston Dynamics (Spot) et ANYbotics occupent le segment industriel haut de gamme. Isaac Lab, environnement de simulation robotique de NVIDIA basé sur Isaac Sim, s'impose comme plateforme standard pour ce type d'entraînement RL à grande échelle. Les auteurs présentent aussi une analyse empirique des taux de réussite, de l'efficacité et des modes d'échec à mesure que la difficulté des escaliers augmente, un exercice de transparence utile pour situer les limites actuelles de la méthode avant d'envisager des essais sur robot réel.

RecherchePaper
1 source
Système d'automatisation de titres modulaire pour la robotique en intérieur, basé sur un modèle vision-langage-action
4arXiv cs.RO 

Système d'automatisation de titres modulaire pour la robotique en intérieur, basé sur un modèle vision-langage-action

Une équipe de recherche présente un système modulaire conçu pour le CMU Vision-Language-Action (VLA) Challenge, une compétition universitaire visant à faire exécuter des instructions en langage naturel par un agent robotique autonome évoluant en intérieur. L'architecture repose sur deux pipelines parallèles. Le premier, dédié à la perception, construit en temps réel une carte voxel sémantique de l'environnement à partir de flux caméra, en s'appuyant sur des embeddings issus du modèle OwlViT. Le second traite le langage : il classifie les commandes utilisateur grâce à un modèle vision-langage (VLM). La cartographie est bornée dans le temps, avec une limite d'exploration fixée à 500 secondes, au-delà de laquelle le système continue d'opérer avec une carte partielle plutôt que d'attendre une couverture complète. La requête classifiée est ensuite ancrée dans le contexte géométrique et sémantique de cette carte pour générer un prompt détaillé soumis au VLM, produisant en sortie une action exploitable par le robot. L'intérêt de ce travail dépasse le cadre du concours : il illustre concrètement comment combler l'écart entre instruction en langage naturel et action robotique physique, un défi central pour toute la famille des modèles VLA actuellement en déploiement industriel, de Pi-0 à GR00T N2 en passant par Helix. En imposant une contrainte de temps stricte sur la cartographie, les auteurs mettent en lumière un problème rarement traité frontalement dans les démonstrations commerciales : la robustesse face à une perception incomplète, plus représentative des conditions réelles que des environnements soigneusement scannés en amont. Le CMU VLA Challenge s'inscrit dans une vague de benchmarks académiques cherchant à standardiser l'évaluation des architectures VLA modulaires, en concurrence avec les approches end-to-end privilégiées par les laboratoires industriels. Les prochaines étapes attendues concernent la publication des résultats comparatifs de la compétition et l'éventuelle extension de cette architecture voxel-plus-VLM à des plateformes robotiques réelles au-delà du cadre expérimental du challenge.

RecherchePaper
1 source