Aller au contenu principal
GEM-Occ : de l'évidence géométrique visuelle à la mémoire d'occupation sémantique incarnée
RecherchearXiv cs.RO 

GEM-Occ : de l'évidence géométrique visuelle à la mémoire d'occupation sémantique incarnée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Résumé rédigé pour l'article scientifique arXiv 2607.05543 (GEM-Occ / HIOcc) :

Une équipe de recherche publie GEM-Occ, un nouveau système de mémoire spatiale pour agents robotiques évoluant en intérieur, accompagné de HIOcc, un benchmark qui unifie trois jeux de données de référence : ScanNet, ScanNet++ et Matterport3D, sous un format commun d'occupation sémantique creuse. Contrairement aux approches existantes limitées à la prédiction sur une seule vue ou à la perception au niveau d'une pièce, HIOcc évalue la cartographie sémantique sur trois échelles : locale, au niveau de la pièce en temps réel, et au niveau du bâtiment entier à partir de vues panoramiques connectées. GEM-Occ, de son côté, traite les prédictions de géométrie visuelle comme des preuves transitoires plutôt que comme un état de carte persistant : il les convertit en évidence d'occupation gaussienne sémantique et en évidence de rayons d'espace libre, puis les fusionne dans une mémoire hiérarchique via des mises à jour causales tenant compte de la visibilité et de l'incertitude. Cette mémoire s'organise en caches locaux, sous-cartes par pièce et graphe à l'échelle du bâtiment, interrogeable à tout moment par splatting gaussien vers occupation.

Cette publication s'attaque à un angle mort réel de la navigation robotique en intérieur : la plupart des méthodes actuelles de cartographie sémantique tiennent bien sur une pièce isolée mais se dégradent sur des environnements connectés de grande taille, typiquement les bâtiments à plusieurs étages qu'un robot de service ou un agent domestique doit mémoriser durablement. En démontrant une amélioration mesurable sur la stabilité de carte en ligne, la cohérence lors de revisites de lieux déjà explorés, et le raisonnement sur l'espace libre, GEM-Occ répond directement à un écart connu entre démonstrations en laboratoire sur environnement unique et déploiement réel multi-pièces. Pour les équipes qui conçoivent des piles de perception pour robots mobiles autonomes (AMR) ou humanoïdes destinés à des environnements industriels ou domestiques complexes, ce travail suggère qu'une mémoire hiérarchique explicite pourrait remplacer avantageusement les représentations par nuage de points classiques, plus coûteuses à maintenir sur le long terme.

Le travail s'inscrit dans la lignée des recherches sur l'occupation sémantique, un champ qui a longtemps privilégié la prédiction ponctuelle à partir d'une image RGB-D unique, sans traiter la question de la mémoire persistante à l'échelle d'un bâtiment. GEM-Occ se positionne face aux méthodes de cartographie basées sur des représentations gaussiennes ainsi qu'aux baselines d'occupation indoor existantes, qu'il dépasse selon les auteurs sur l'ensemble des régimes d'évaluation de HIOcc. La publication de ce benchmark unifié, s'appuyant sur trois jeux de données déjà largement utilisés par la communauté (ScanNet, ScanNet++, Matterport3D), devrait faciliter les comparaisons futures entre approches de cartographie sémantique et accélérer les travaux sur la navigation longue durée des agents incarnés, un prérequis pour tout déploiement robotique au-delà du prototype de laboratoire.

Dans nos dossiers

À lire aussi

1arXiv cs.RO 

GenVid2Robot : de la génération vidéo à la manipulation robotique par cohérence rigide-géométrique

Des chercheurs ont publié le 13 juillet 2026 sur arXiv (2607.09191v1) GenVid2Robot, un système qui transforme des vidéos générées par IA en trajectoires exécutables sur un robot manipulateur réel. Le problème de départ: une vidéo générée peut sembler visuellement plausible sans être physiquement exécutable, faute de géométrie métrique, d'ancrage de préhension, de faisabilité cinématique ou de retour d'exécution. GenVid2Robot part d'une observation RGB-D initiale et d'une instruction de tâche, échantillonne des ancres sémantiques pertinentes sur la première image réelle, puis suit ces ancres à travers les candidats vidéo générés. Un modèle SE(3) relatif et épars vérifie si le mouvement 2D observé est cohérent avec la géométrie 3D des ancres; seul le mouvement validé géométriquement est transféré au robot. Ce mouvement est ensuite appliqué à la pose réelle de l'organe terminal (TCP) au moment de la saisie, déterminée par une préhension contrainte par masque, et un module de compensation de profondeur borné corrige les erreurs locales dues au bruit RGB-D ou aux déplacements de contact. L'enjeu dépasse la démonstration technique isolée: les modèles de génération vidéo (type Sora, Veo ou Genie) sont de plus en plus présentés comme des sources de "priors" de mouvement pour la robotique, mais l'écart entre vidéo plausible et action exécutable reste l'un des obstacles majeurs à leur usage réel, aux côtés du problème classique du sim-to-real. En filtrant les hypothèses de mouvement par cohérence géométrique plutôt qu'en rejouant directement une trajectoire, GenVid2Robot répond directement au risque d'échec en conditions réelles que redoutent intégrateurs et équipes R&D travaillant sur les architectures vision-langage-action (VLA). Le travail s'inscrit dans la lignée des approches combinant modèles génératifs et politiques robotiques, aux côtés d'efforts comme Pi-0, GR00T N2 ou Helix qui cherchent à exploiter des priors visuels ou vidéo à grande échelle. À ce stade, il s'agit d'une publication de recherche avec expériences sur robot réel, non d'un produit commercialisé; les auteurs ne précisent pas de calendrier de déploiement industriel.

RecherchePaper
1 source
Mémoire analytique centrée sur les concepts pour la manipulation incarnée à base d'agents
2arXiv cs.RO 

Mémoire analytique centrée sur les concepts pour la manipulation incarnée à base d'agents

Une équipe de recherche a soumis le 30 juin 2026 sur arXiv (arXiv:2606.29774) un cadre de mémoire structurée pour agents de manipulation robotique à long horizon. Baptisé "analytic concept-centric memory", le système organise l'expérience autour de concepts analytiques : chaque objet est représenté par ses parties sémantiques, des gabarits paramétriques, des poses ancrées dans l'espace, ses affordances et ses états de manipulation. Deux couches supplémentaires complètent l'architecture : une mémoire de transitions enregistrant les effets des actions sur l'état de scène, et une mémoire de compétences (skill memory) stockant des politiques réutilisables ancrées dans ces gabarits. À l'exécution, l'agent effectue une récupération coarse-to-fine pour identifier objets pertinents, états courants et compétences applicables. Les auteurs valident leur approche sur des tâches de manipulation dépendantes de la mémoire, la généralisation à des objets articulés (portes, tiroirs) et une évaluation en environnement réel. La gestion de mémoire reste un goulet d'étranglement critique en manipulation longue durée. Les agents actuels, y compris ceux fondés sur des architectures VLA (Vision-Language-Action), peinent à réutiliser les connaissances acquises lors d'interactions passées, forçant une replanification coûteuse à chaque nouvelle tâche. Ce cadre montre que structurer explicitement la mémoire autour de concepts physiques améliore le taux de complétion de tâches, la précision de récupération, la réidentification d'objets et la généralisation de compétences inter-objets, par rapport aux baselines non structurées et aux représentations vectorielles par embeddings. Pour les intégrateurs industriels, c'est un signal que la réutilisabilité des compétences sans réentraînement complet commence à devenir atteignable, ce qui réduit potentiellement les coûts de déploiement dans des environnements variables. La manipulation robotique à long horizon est un chantier actif chez plusieurs acteurs majeurs : Google DeepMind avec ses architectures RT-2 et SayCan, Physical Intelligence et son modèle Pi-0, Boston Dynamics, ainsi que des laboratoires comme Stanford et ETH Zurich. Ce travail s'inscrit dans une lignée cherchant à concilier planification symbolique structurée et politiques neuronales, deux paradigmes longtemps opposés. Ce preprint n'a pas encore été soumis à revue par les pairs, et les benchmarks restent des environnements de laboratoire contrôlés. La démonstration sur une plateforme industrielle réelle, avec la diversité des objets, le bruit sensoriel et les contraintes temps réel, reste à établir. Les prochaines étapes naturelles incluent l'intégration avec des VLA à grande échelle et l'évaluation sur des manipulateurs ou humanoïdes en contexte de production semi-réelle.

RechercheOpinion
1 source
3arXiv cs.RO 

MEMORA : mémoire d'action incarnée à partir de vidéos égocentriques pour le raisonnement et la planification

Des chercheurs présentent MEMORA, un système de mémoire d'action incarnée pour la planification robotique à long horizon, détaillé dans un article publié le 17 juillet 2026 sur arXiv (2607.14252v1). L'architecture repose sur un cycle formation-consolidation-récupération et quatre magasins de mémoire typés : Environment Memory (lieux), Entity Memory (identité et états des objets), Activity Memory (procédures répétées) et Inferred Knowledge (régularités déduites de l'expérience). Les auteurs ont construit MEMORA-Bench, évalué sur 45 heures de vidéos égocentriques issues d'une extension du jeu de données EPIC-KITCHENS-100 couvrant 18 participants, avec des tâches de planification ancrée en mémoire incluant des objectifs inédits. Testée sur quatre modèles de langage à poids ouverts, la version complète de MEMORA obtient les meilleurs résultats agrégés parmi toutes les conditions comparées, avec un gain jusqu'à 20,5 points de précision sur l'évaluation de mémoire et une amélioration relative jusqu'à 16,6% du score de plan ancré au robot en généralisation hors distribution. Une étude qualitative de déploiement sur deux tâches robotiques illustre l'interfaçage entre plans en langage naturel et contrôle réel. L'enjeu dépasse le simple score de benchmark. La plupart des modèles vision-langage-action actuels, de Pi-0 à GR00T N2 en passant par Helix, raisonnent surtout à partir de la scène présente, sans mémoire persistante des lieux, états d'objets ou procédures déjà rencontrées. Or planifier à long horizon dans un entrepôt, une cuisine industrielle ou un atelier suppose de se souvenir où est rangé tel outil ou quelle procédure a déjà fonctionné. En montrant qu'une mémoire éditable et consolidée améliore la généralisation à des objectifs inédits, MEMORA plaide pour une architecture hybride perception-action plus mémoire structurée, plutôt qu'un modèle unique de bout en bout. Pour les équipes de recherche robotique, le signal est que le goulot d'étranglement du raisonnement long horizon tient autant à l'absence de représentation persistante de l'expérience qu'à la politique d'action elle-même. Ce travail s'inscrit dans la recherche émergente sur l'agentivité incarnée à mémoire longue, en marge des humanoïdes commerciaux comme Figure 03 ou Optimus. À ce stade, MEMORA reste un travail académique évalué sur benchmark et testé qualitativement sur seulement deux tâches robotiques, loin d'un déploiement industriel. Les auteurs le positionnent comme complémentaire aux modèles VLA existants, une couche de contexte en amont plutôt qu'un concurrent. La suite logique serait une intégration à des pipelines VLA en conditions réelles et une extension du benchmark au-delà des tâches de cuisine, vers la logistique ou l'assemblage. Détails et code sur la page projet des auteurs.

RecherchePaper
1 source
SemGeoNav : une approche de navigation visuelle guidée par la sécurité, combinant raisonnement sémantique et planification géométrique
4arXiv cs.RO 

SemGeoNav : une approche de navigation visuelle guidée par la sécurité, combinant raisonnement sémantique et planification géométrique

Des chercheurs ont proposé SemGeoNav, un framework de navigation visuelle hiérarchique publié sur arXiv en juin 2026 (arXiv:2606.16400), conçu pour les robots devant atteindre des cibles définies par des images dans des environnements ouverts. L'architecture combine deux couches distinctes : un module de raisonnement sémantique de haut niveau issu des modèles apprenants end-to-end, et un planificateur géométrique local responsable de la sécurité immédiate. Un mécanisme de lissage temporel de trajectoire vient compléter l'ensemble pour garantir des déplacements continus et stables. Les expériences ont été menées sur un robot quadrupède Unitree Go2 dans des environnements réels, et les résultats indiquent des taux de succès supérieurs ainsi que des temps de navigation plus courts que deux baselines de référence du domaine, ViNT et NoMaD. L'apport principal de SemGeoNav réside dans le traitement d'une tension structurelle bien documentée en robotique autonome : les modèles end-to-end apprenants, en particulier les architectures de type VLA (Vision-Language-Action), excellent dans la compréhension sémantique de haut niveau mais manquent de contraintes géométriques explicites, ce qui génère des comportements imprévisibles face aux obstacles en environnement non structuré. À l'inverse, les planificateurs géométriques classiques (champ de potentiel, DWA) garantissent la sécurité locale mais peinent à interpréter des cibles visuelles haute dimension. L'approche hybride hiérarchique de SemGeoNav apporte une réponse architecturale à ce problème de fiabilité opérationnelle, avec des implications directes pour les intégrateurs déployant des robots mobiles en entrepôt ou en environnement industriel non balisé. ViNT et NoMaD, tous deux issus du Berkeley AI Research Lab, constituent les références dominantes en navigation visuelle généraliste à cible imageante. SemGeoNav se positionne explicitement contre ces deux modèles en revendiquant de meilleures performances terrain. Il s'inscrit dans un courant plus large qui remet en question les architectures purement end-to-end au profit de systèmes hybrides modulaires, une direction également explorée par plusieurs équipes européennes et asiatiques. Ce preprint ne publie pas de métriques standardisées comme le SPL (Success weighted by Path Length) ou les benchmarks HM3D/MP3D, ce qui rend difficile toute comparaison directe avec l'état de l'art; une validation à plus grande échelle et sur des jeux de données partagés constituerait la prochaine étape crédible pour ce travail.

RecherchePaper
1 source