Aller au contenu principal
RecherchearXiv cs.RO 

Kairos : prévision ancrée de la présence et du flux directionnel dans des graphes de scène 4D

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié en septembre 2026 sur arXiv décrit Kairos, une mémoire prédictive de flux directionnel pour la navigation robotique en environnement humain, qui étend les scene graphs 3D hiérarchiques (3DSG) en une version 4D intégrant le temps. Chaque voxel de la géométrie reconstruite stocke un mélange directionnel et un taux de présence, et des prédicteurs spectraux estiment, pour tout instant futur, la probabilité de présence humaine ainsi que la distribution complète des directions de déplacement des personnes. Les auteurs ont testé le système sur trois environnements réels : un campus universitaire parcouru par un robot, un centre commercial, et le hall d'une gare filmé en continu pendant onze mois, et publient leur code sur GitHub sous le dépôt IacopomC/kairos.

L'enjeu est la planification de trajectoire à long terme pour des robots évoluant parmi des humains, en anticipant non seulement si un lieu sera occupé mais dans quelle direction les gens s'y déplaceront, avec une incertitude qui se resserre au fil des observations accumulées. Les approches existantes réduisent chaque emplacement à un simple taux d'occupation scalaire ou figent la distribution directionnelle dans le temps, alors que Kairos combine les deux et reste compétitif face à des modèles dédiés d'occupation et de flux entraînés sur l'intégralité du flux de détections, bien qu'il n'apprenne que sur la fraction de données visible par un robot en patrouille, un scénario plus réaliste pour un déploiement à couverture capteur partielle. Sur une tâche de planification visant à maximiser les rencontres humaines, les trajectoires issues de Kairos croisent davantage de personnes que celles calculées sur des cartes statiques, à taux de succès égal.

Ce travail prolonge les scene graphs 3D hiérarchiques, une représentation sémantique de carte de plus en plus utilisée en robotique, en y ajoutant une dimension temporelle, et sa mémoire reste cohérente même après des corrections de fermeture de boucle lors du SLAM, un point technique important pour un déploiement de longue durée. Le domaine de la prévision de flux piétons oppose habituellement deux familles concurrentes, l'une réduisant l'activité future à un taux scalaire, l'autre figeant une distribution directionnelle complète, et Kairos se positionne comme une synthèse des deux. Le code est publié en accès libre, ouvrant la voie à des comparaisons par d'autres équipes de recherche en navigation robotique, mais il s'agit à ce stade d'un travail académique évalué sur des jeux de données existants, sans annonce de déploiement commercial ni de partenariat industriel.

Dans nos dossiers

À lire aussi

Prior-SG : segmentation de régions par tâche et a priori pour graphes de scène dans des environnements arbitraires
1arXiv cs.RO 

Prior-SG : segmentation de régions par tâche et a priori pour graphes de scène dans des environnements arbitraires

Une équipe de recherche présente Prior-SG, un nouveau framework pour construire des graphes de scène 3D hiérarchiques destinés au raisonnement spatial des robots mobiles autonomes. Publié sur arXiv cette semaine (2608.06170), le système traite la génération du graphe comme un problème d'alignement probabiliste. Pendant qu'il explore, le robot agrège en continu son flux RGB-D dans un Instance Graph ancré physiquement, via une fusion de features multi-échelle à vocabulaire ouvert. Il infère ensuite la sémantique fonctionnelle des lieux par une estimation Maximum A Posteriori, guidée par un Prior Graph généré dynamiquement par un grand modèle de langage. Un champ aléatoire de Markov fusionne experts visuels, géométriques et objets discrets avec ces priors pour lever les ambiguïtés locales. Testé sur des environnements simulés et réels à plan ouvert, Prior-SG dépasse les références récentes en précision de segmentation sémantique. L'enjeu dépasse la performance brute. Les méthodes existantes de graphes de scène reposent sur du clustering visuel local ou sur des heuristiques géométriques strictes, comme la séparation des pièces par des murs, qui échouent dès que l'environnement sort du schéma classique : entrepôt logistique, loft, plateau de bureaux en open space. Pour les intégrateurs de robotique de service, ce verrou limitait le déploiement hors des démonstrations en appartements standards. Prior-SG montre qu'un robot peut délimiter des frontières fonctionnelles distantes sans murs physiques, un pas concret contre l'écart classique entre démo et déploiement réel. Plus notable, le système offre une flexibilité ontologique en zero-shot : le robot restructure entièrement son découpage spatial selon la tâche demandée, sans réentraînement, une capacité clé pour la planification de tâches en environnements non structurés. Ce travail s'inscrit dans la lignée des recherches sur les graphes de scène 3D hiérarchiques, un axe porté par la généralisation des capteurs RGB-D et des modèles de vision à vocabulaire ouvert. Les approches précédentes restaient dépendantes de règles géométriques figées, adaptées aux logements standards mais peu robustes face aux environnements réels hétérogènes. L'apport principal de Prior-SG est de déléguer à un LLM la génération dynamique des priors structurels, plutôt que de les coder à la main, une tendance de fond en robotique qui place les grands modèles de langage en couche de raisonnement au-dessus de la perception brute. Les auteurs ne mentionnent ni partenariat industriel ni calendrier de déploiement : il s'agit pour l'instant d'une contribution académique, dont l'adoption dépendra de son intégration dans des frameworks de navigation plus larges.

RecherchePaper
1 source
PreSIST : prédire la persistance des objets via vision-langage dans des scènes en monde ouvert
2arXiv cs.RO 

PreSIST : prédire la persistance des objets via vision-langage dans des scènes en monde ouvert

Des chercheurs présentent PreSIST (Predictive Scene-conditioned Instance Survival over Time), une méthode qui permet à un robot de prédire combien de temps un objet va rester à sa position observée, plutôt que de simplement constater après coup qu'il a bougé. Le système combine des estimations de "priors" de persistance, calculées à partir des propriétés de l'objet et du contexte de la scène, avec un filtre probabiliste qui affine ces prédictions au fil des nouvelles observations. Deux variantes ont été développées : PreSIST-Lang, qui s'appuie directement sur un modèle vision-langage (VLM) pour raisonner sur le contexte, et PreSIST-Vis, un modèle uniquement visuel entraîné par distillation à partir des pseudo-labels générés par PreSIST-Lang, pensé pour un déploiement plus léger et plus rapide en conditions réelles. Les auteurs ont aussi constitué un nouveau jeu de données d'annotations de persistance d'objets en environnement ouvert et non contrôlé, sur lequel les deux variantes surpassent les approches de référence existantes. L'enjeu dépasse la simple curiosité académique : les robots déployés sur de longues durées, en entrepôt, en environnement domestique ou en espace public, doivent maintenir une carte de leur environnement à jour sans revisiter physiquement chaque zone en permanence. Les systèmes actuels réagissent après coup, en recalant leur carte seulement quand ils reconstatent qu'un objet a disparu ou changé de place, ce qui coûte du temps de calcul et impose des repassages fréquents. PreSIST exploite le bon sens contextuel des VLM, capables de distinguer par exemple qu'une voiture arrêtée à un feu rouge ne restera probablement pas là contrairement à une voiture garée sur une place de parking, pour anticiper ces changements avant même de les observer. Pour des intégrateurs travaillant sur la navigation autonome ou la maintenance de cartes sémantiques, cela ouvre la voie à des architectures de perception moins gourmandes en re-scans constants. Ce travail s'inscrit dans la continuité des recherches sur la cartographie sémantique et le SLAM dynamique en environnement ouvert, où la difficulté historique était justement l'absence de raisonnement proactif sur le changement. L'arrivée des VLM comme brique de raisonnement contextuel change la donne face aux méthodes purement géométriques ou fondées sur la seule reconnaissance de classe d'objet. Les auteurs positionnent leur jeu de données annoté comme une ressource ouverte pour de futurs travaux sur la prédiction de persistance en monde ouvert.

RecherchePaper
1 source
Graphes de scène probabilistes : représentation hiérarchique et système en temps réel
3arXiv cs.RO 

Graphes de scène probabilistes : représentation hiérarchique et système en temps réel

Des chercheurs présentent dans un nouvel article publié sur arXiv (référence 2609.23144v1) un système de représentation de scènes 3D pour la perception robotique baptisé Probabilistic Scene Graph (PSG). Contrairement aux scene graphs classiques, qui figent une structure d'entités, de relations et d'attributs sémantiques, PSG modélise une distribution de probabilité sur l'ensemble des graphes possibles : une structure discrète (objets, relations, sémantique) couplée à des états continus qui les situent dans l'espace, avec une incertitude explicite sur les deux composantes. La géométrie est portée directement par les nœuds plutôt que puisée dans une carte métrique construite à part ; la carte, quand elle est utile, découle du graphe et non l'inverse. Les auteurs instancient cette idée via des Hierarchical Graphs of Gaussians (HGG) : chaque objet est représenté par une gaussienne à covariance complète sous une croyance Normal-Inverse-Wishart, le même schéma étant réappliqué récursivement pour affiner la résolution de surface. Le pipeline combine un alignement grossier-vers-fin fondé uniquement sur le graphe et une optimisation imbriquée Expectation-Maximization / factor-graph qui raffine conjointement poses, paramètres d'objets et géométrie interne. Testé sur six jeux de données (intérieur RGB-D, extérieur LiDAR, scénarios multimodaux), le système tourne à la cadence des capteurs avec une mémoire quasi constante. Ce travail cible une limite structurelle des scene graphs 3D en robotique : l'incertitude y est aujourd'hui traitée en aval, jamais propagée pendant la construction du graphe lui-même. Pour les équipes développant des piles de perception pour navigation autonome, manipulation ou SLAM sémantique, cette lacune fragilise les graphes face au bruit capteur ou aux fusions d'observations erronées. En couplant nativement structure sémantique et incertitude géométrique, PSG vise des cartes robustes même avec des données partielles ou ambiguës, un enjeu direct pour les intégrateurs fusionnant des capteurs hétérogènes en conditions réelles. Les résultats revendiqués, précision « état de l'art » et alignement de graphe en zero-shot, restent des mesures de benchmark académique et non un déploiement industriel validé. L'approche prolonge les travaux sur les scene graphs 3D hiérarchiques utilisés en robotique pour structurer la perception au-delà des nuages de points ou cartes d'occupation, mais rompt avec ces systèmes déterministes en adoptant un cadre bayésien complet où chaque étape (association, fusion, raffinement de pose) manipule des croyances plutôt que des estimations ponctuelles. Elle se positionne face aux pipelines de cartographie sémantique classiques et aux méthodes de reconstruction par gaussiennes issues de la vision par ordinateur, dont elle reprend la représentation continue en l'intégrant à une structure de graphe discrète. L'article, classé comme nouvelle soumission arXiv, ne mentionne aucun partenariat industriel ni feuille de route de déploiement : c'est à ce stade une contribution de recherche évaluée sur données publiques, dont l'adoption dépendra de sa reproduction par la communauté.

RecherchePaper
1 source
LIFD : diffusion ancrée pour une mémoire de scène 3D dans la manipulation robotique
4arXiv cs.RO 

LIFD : diffusion ancrée pour une mémoire de scène 3D dans la manipulation robotique

Un article de recherche publié sur arXiv (arXiv:2609.19796v1) présente LIFD (Look, Imagine, Focus, and Do), un système de mémoire de scène tridimensionnelle persistante destiné à la manipulation robotique en conditions d'observabilité partielle, c'est-à-dire lorsque des zones vues par le robot sortent du champ de la caméra à mesure qu'il ou la scène se déplace. Le système apprend une représentation en tokens de scène à partir d'un accord multi-vues, puis la complète en déploiement à partir d'une seule image RGB et d'une mémoire récurrente, grâce à un modèle de rectified-flow combiné à un mécanisme d'attention croisée guidée par des ancrages géométriques. Sur les bancs d'essai de simulation LIBERO et MetaWorld, la version dite "Staged" de LIFD atteint respectivement 91,6% et 79,8% de taux de réussite moyen, avec un gain de 3,1 points de pourcentage sur LIBERO par rapport à un entraînement joint classique. Sur un bras robotique réel UR5e, testé sur quatre familles de tâches avec seulement dix démonstrations par famille, LIFD obtient 56,0% de réussite moyenne contre 40,5% pour OpenVLA-7B, un modèle vision-langage-action de référence dans le secteur. Ce résultat s'attaque à une limite connue des politiques de manipulation actuelles: la plupart des architectures VLA raisonnent sur la vue courante et perdent la trace des objets ou surfaces qui sortent du cadre, ce qui fragilise les tâches nécessitant de se souvenir d'un état antérieur de la scène. En montrant qu'une mémoire de scène compacte peut être inférée à partir d'une unique caméra RGB et de la proprioception au moment du déploiement, sans capteurs multi-vues ni LIDAR embarqués, LIFD répond à une contrainte très concrète pour les intégrateurs: le coût et la complexité du capteur. L'écart de performance avec OpenVLA-7B en régime few-shot (dix démonstrations) est aussi un signal pour les décideurs B2B, car il suggère qu'une mémoire spatiale explicite peut compenser en partie le besoin de données massives, un frein habituel à l'adoption des VLA en environnement industriel réel. Sur le plan méthodologique, LIFD s'appuie sur un entraînement en deux temps: une phase de représentation supervisée par des signaux multi-vues et géométriques, suivie d'une politique de manipulation reliée à cette représentation via des "slot features" compactes. Les auteurs comparent explicitement deux régimes d'entraînement, "Staged" et "Joint", le premier se révélant supérieur, et positionnent leur approche face à OpenVLA-7B comme référence VLA open-source établie. Il s'agit à ce stade d'un travail de recherche publié en preprint, validé sur des simulateurs standards du domaine (LIBERO, MetaWorld) et un unique bras collaboratif UR5e en laboratoire, sans annonce de pilote industriel ni de calendrier de déploiement à plus grande échelle.

RecherchePaper
1 source