Aller au contenu principal
Robots relationnels : des graphes de scène pour comprendre les commandes en langage naturel
RecherchearXiv cs.RO 

Robots relationnels : des graphes de scène pour comprendre les commandes en langage naturel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent une méthode pour améliorer la capacité des robots à comprendre des commandes en langage naturel en enrichissant les graphes de scène 3D (3D scene graphs, 3DSG) de relations spatiales explicites entre objets. L'étude, publiée sur arXiv (2602.04635v2), combine deux pipelines construits à partir de modèles existants : un pipeline basé sur un grand modèle de langage (LLM) pour identifier l'objet cible à partir d'une commande en vocabulaire ouvert, et un pipeline basé sur un modèle vision-langage (VLM) qui ajoute des relations spatiales en vocabulaire ouvert au graphe de scène à partir d'images capturées pendant la cartographie du lieu. Les auteurs ont testé deux LLM sur 14 scènes différentes, avec 905 énoncés en langage naturel (786 générés de façon procédurale, 119 rédigés par des humains), pour évaluer la tâche d'ancrage de l'objet cible (target object grounding).

Le résultat principal est que l'ajout de relations spatiales explicites améliore mesurablement la capacité des LLM à identifier le bon objet dans l'environnement, comblant un manque fréquent des 3DSG existants qui omettent ces relations alors que les humains s'appuient dessus pour décrire leur environnement. Pour les concepteurs de robots domestiques, d'entrepôt ou d'assistance, cela touche directement au goulot d'étranglement entre compréhension du langage et action physique concrète, un enjeu central pour les modèles vision-langage-action (VLA) et l'interaction homme-robot en conditions réelles plutôt qu'en démonstration contrôlée. L'étude montre aussi que générer ces relations spatiales en vocabulaire ouvert via un VLM est faisable directement depuis les images capturées par le robot, sans supervision manuelle.

Ce travail s'inscrit dans la lignée des recherches sur les graphes de scène sémantiques pour la robotique cognitive, où la représentation de l'environnement sert de pont entre perception et planification d'actions. Les auteurs notent toutefois que leur analyse ne permet pas de trancher entre relations en vocabulaire ouvert ou fermé, une question qui reste ouverte pour les travaux futurs. Il s'agit d'une contribution académique à un stade de recherche, sans déploiement produit ni partenaire industriel annoncé.

À lire aussi

VeriGraph : graphes de scène pour la vérification de plans de robots
1arXiv cs.RO 

VeriGraph : graphes de scène pour la vérification de plans de robots

Des chercheurs ont publié VeriGraph (arXiv:2411.10446v3), un système de planification robotique qui combine des modèles vision-langage (VLM) avec un mécanisme de vérification formelle des actions. Le principe central repose sur l'utilisation de graphes de scène comme représentation intermédiaire : à partir d'images en entrée, le système construit un graphe capturant les objets présents et leurs relations spatiales, puis s'en sert pour valider et corriger en boucle les séquences d'actions générées par un planificateur LLM. Les gains rapportés sur des tâches de manipulation sont significatifs : +58 % de taux de complétion sur les tâches guidées par langage, +56 % sur des puzzles tangram, et +30 % sur les tâches guidées par image, par rapport aux méthodes de référence testées. Ce résultat pointe un problème structurel bien documenté dans le domaine : les VLM et LLM génèrent des plans plausibles en surface mais géométriquement ou physiquement incorrects, un objet posé sur une surface inexistante, une saisie dans un ordre impossible. VeriGraph traite ce gap en introduisant une couche de vérification symbolique ancrée dans l'état réel de la scène, ce qui réduit les hallucinations de planification sans nécessiter de fine-tuning du modèle sous-jacent. Pour les intégrateurs industriels et les équipes robotique, cela suggère une voie pragmatique : greffer un vérificateur léger sur des LLM généralistes plutôt que de tout réentraîner, ce qui abaisse potentiellement le coût d'adaptation à de nouveaux environnements. VeriGraph s'inscrit dans un courant de recherche actif autour des architectures hybrides neuro-symboliques pour la robotique, où des travaux comme SayPlan (Rana et al.), LLMTAMP ou les approches PDDL-guided cherchent tous à contraindre la génération de plans par des vérificateurs formels ou géométriques. La nouveauté ici réside dans l'usage du graphe de scène comme interface universelle entre perception et planification. Les auteurs publient le code sur un site dédié, ce qui facilite la reproductibilité, mais les expériences restent en environnement simulé ou de laboratoire contrôlé, aucun déploiement en conditions industrielles réelles n'est mentionné à ce stade.

RechercheOpinion
1 source
Prompting d'équipes de robots en langage naturel
2arXiv cs.RO 

Prompting d'équipes de robots en langage naturel

Des chercheurs présentent un framework permettant de piloter des équipes de robots multiples via des instructions en langage naturel de haut niveau, sans avoir besoin d'appeler un grand modèle de langage au moment du déploiement. La méthode exploite les capacités de raisonnement d'un LLM pour décomposer une tâche collective en sous-tâches, mais uniquement en amont : cette logique est ensuite distillée dans un réseau de neurones récurrent (RNN) minuscule, capable d'encoder un automate fini déterministe (DFA) représentant la séquence et les conditions de la tâche. Pour l'exécution décentralisée, chaque robot s'appuie sur un réseau de neurones sur graphe (GNN) conditionné par les états cachés du RNN et par les embeddings du langage, ce qui permet une prise de décision locale en temps réel sans communication centralisée. Le travail, publié sur arXiv (2509.24575v2, version révisée), a été évalué en simulation et sur des tâches multi-robots réelles nécessitant un comportement séquentiel et collaboratif, avec une démonstration disponible sur le site du projet (sites.google.com/view/prompting-teams). L'intérêt principal est de contourner un problème concret pour l'industrie robotique : les grands modèles de langage interprètent bien des consignes ambiguës, mais leur latence, leur coût de calcul et leur dépendance réseau les rendent inadaptés à l'embarqué temps réel sur des flottes de robots opérant en entrepôt, sur chantier ou en zone sans connectivité fiable. En distillant le raisonnement du LLM dans un modèle RNN léger exécutable à bord, les auteurs proposent de combiner compréhension du langage naturel et contrôle décentralisé robuste, sans le point de défaillance unique d'une architecture centralisée ni la fragilité d'un pipeline interrogeant un LLM à chaque étape. Pour les intégrateurs de flottes multi-robots, cela teste une hypothèse encore peu validée dans le secteur : transférer la sémantique d'un LLM vers un contrôle embarqué temps réel sans perte de robustesse, moyennant un travail d'ingénierie de distillation propre à chaque tâche. Ce travail s'inscrit dans une recherche en robotique multi-agents visant à exploiter les LLM pour la planification de haut niveau tout en conservant un contrôle bas niveau classique et vérifiable, une tension déjà abordée par des approches combinant LLM et machines à états ou logique temporelle. Contrairement aux architectures interrogeant un modèle de fondation à chaque décision, cette proposition mise sur une distillation en amont, proche des méthodes de compression de politiques utilisées pour déployer des agents de renforcement complexes sur du matériel contraint. Publié en tant que "replace" sur arXiv, l'article laisse ouvertes les questions de généralisation à des vocabulaires de tâches plus larges et de passage à l'échelle au-delà des équipes testées en laboratoire, étapes nécessaires avant toute adoption industrielle.

RecherchePaper
1 source
Raisonnement sémantique relationnel sur des graphes de scènes 3D pour la recherche interactive d'objets en monde ouvert
3arXiv cs.RO 

Raisonnement sémantique relationnel sur des graphes de scènes 3D pour la recherche interactive d'objets en monde ouvert

Des chercheurs présentent SCOUT (Scene Graph-Based Exploration with Learned Utility), un système permettant à un robot domestique de retrouver un objet inconnu dans un environnement ouvert, sans carte préalable ni liste d'objets fixe. Publié sur arXiv (2603.05642v2), le travail propose de représenter l'environnement sous forme de graphes de scène 3D, où chaque pièce, chaque frontière inexplor ée et chaque objet reçoit un score d'utilité calculé à partir d'heuristiques relationnelles : la probabilité qu'un objet cible se trouve dans telle pièce (containment), ou qu'il soit co-localisé avec d'autres objets connus (co-occurrence). Le robot explore ainsi en priorité les zones les plus prometteuses, sans interroger un LLM à chaque étape. Pour conserver la généralisation en vocabulaire ouvert, les auteurs introduisent un cadre de distillation procédurale hors ligne : les connaissances relationnelles sont extraites d'un grand modèle de langage une fois, puis compressées dans des modèles légers exécutables directement sur le robot. Un benchmark symbolique baptisé SymSearch est également proposé pour évaluer le raisonnement sémantique dans ce type de tâches. L'enjeu central est l'équilibre entre pertinence sémantique et faisabilité temps réel, un point de friction majeur pour les intégrateurs en robotique de service. Les méthodes fondées sur la similarité d'embeddings vision-langage (type CLIP) sont rapides mais échouent sur les relations contextuelles : un robot cherchant un médicament ne déduit pas spontanément "salle de bain" depuis un embedding. Les LLMs résolvent cela mais sont trop lents et trop coûteux pour un déploiement embarqué. SCOUT, selon les évaluations menées en simulation et dans des environnements physiques réels, égale les performances des LLMs tout en restant computationnellement léger, ce qui ouvre la voie à une navigation sémantique réactive sur du matériel standard. La démonstration en environnement réel, avec des contraintes de capteurs et de navigation authentiques, atténue en partie le reproche habituel de sim-to-real gap, même si aucune métrique quantitative de transfert n'est détaillée dans le résumé. Ce travail s'inscrit dans un champ actif depuis les approches de navigation sémantique par graphes de scène (ScanQA, SceneGraph-Fusion, 3DSG), face auxquelles SCOUT se distingue par la distillation offline plutôt que par l'appel LLM en ligne. Les concurrents directs incluent les méthodes basées sur ESC, CoNaV ou L3MVN, qui exploitent des embeddings ou des LLMs pour guider l'exploration. Aucune intégration industrielle ni partenariat commercial n'est annoncé à ce stade : il s'agit d'une contribution académique avec benchmark et expériences réelles, dont la prochaine étape naturelle serait une évaluation sur des plateformes robotiques standards comme Spot ou Hello Robot Stretch.

RecherchePaper
1 source
Enrichir le contexte spatial et temporel pour l'apprentissage par imitation robotique avec des graphes de scène
4arXiv cs.RO 

Enrichir le contexte spatial et temporel pour l'apprentissage par imitation robotique avec des graphes de scène

Des chercheurs ont publié le 1er juin 2026 sur arXiv (2606.01072) une méthode d'apprentissage par imitation qui exploite des graphes de scène dynamiques comme mécanisme de mémoire structurée pour les robots mobiles. Le principe : pendant l'exécution d'une tâche, le robot maintient un graphe de scène mis à jour en continu, qui encode les relations entre objets et leur évolution dans le temps. Plutôt que de traiter uniquement les observations courantes du capteur, le système capitalise sur l'historique accrété de l'environnement pour inférer des politiques d'action. Les validations couvrent deux régimes : manipulation mobile en simulation (environnements à grande échelle spatialement) et manipulation sur table en conditions réelles. Les auteurs rapportent une amélioration substantielle des performances par rapport aux baselines, particulièrement sur des tâches nécessitant un raisonnement à long terme, sans donner de métriques chiffrées précises dans l'abstract. Ce travail s'attaque à deux verrous persistants du déploiement de robots apprenants dans des environnements non-structurés. Le premier est l'observabilité partielle : dans un appartement ou un bureau, le champ de vision d'un robot ne capture qu'une fraction de l'espace pertinent, et les objets manipulés disparaissent régulièrement du cadre. Le second est l'horizon temporel : des tâches comme "ranger la cuisine" enchaînent des dizaines de sous-tâches dont les dépendances ne sont pas localement visibles. En substituant un graphe de scène explicite et structuré à une mémoire implicite (fenêtre d'observations brutes, état caché LSTM), l'approche donne au robot une représentation interprétable et modulaire du contexte. Pour les intégrateurs industriels et les équipes qui déploient des politiques d'imitation dans des environnements semi-structurés, c'est une piste crédible pour réduire le gap entre démo de labo et robustesse opérationnelle, même si les expériences restent pour l'instant confinées à la simulation et au tabletop. L'apprentissage par imitation (behavioral cloning, GAIL, DAgger) a connu un regain d'intérêt majeur avec l'essor des Visual Language Action models (VLA) comme Pi-0 de Physical Intelligence, RT-2 de Google DeepMind, ou OpenVLA. Les graphes de scène sont une technique éprouvée en vision par ordinateur et en navigation robotique (travaux de Armeni, Rosinol, Chang notamment), mais leur intégration dans des pipelines d'imitation learning reste peu explorée. Les approches concurrentes pour gérer la mémoire à long terme incluent les transformers avec attention sur un historique d'observations, les représentations de tâches hiérarchiques (task graphs), et les world models latents. Ce preprint n'étant pas encore évalué par les pairs, ses résultats méritent confirmation sur des benchmarks plus larges et des environnements réellement non-structurés avant de pouvoir orienter des décisions d'architecture. Les auteurs n'annoncent pas de code public ni de suite industrielle à ce stade.

RechercheOpinion
1 source