Aller au contenu principal
RecherchearXiv cs.RO 

LOCUS : discrimination de conteneurs par repères à l'aide de graphes spatiaux

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent LOCUS (Landmark-Oriented Container Discrimination Using Spatial Graphs), une méthode destinée à aider un robot à décider où chercher un objet qui n'est pas visible, par exemple dans quel meuble ou conteneur d'une pièce. Le système entraîne un réseau de neurones sur graphes (GNN) qui met à jour des embeddings CLIP sur un graphe de scène complet de l'environnement, en faisant circuler l'information entre nœuds selon leur proximité. Ces embeddings sont enrichis par des connaissances sémantiques issues d'une fusion d'ontologies domestiques. L'évaluation en simulation repose sur un graphe de scène sans bruit, tiré des métadonnées du simulateur, ce qui rend l'approche indépendante du détecteur. LOCUS surpasse quatre références (choix aléatoire, similarité cosinus avec CLIP, Tidybot et un planificateur à base de LLM) dans la majorité des types de pièces et des configurations testés. Les auteurs ne donnent pas, dans le résumé, de chiffres de performance. Une démonstration sur un manipulateur mobile physique couvre un pipeline d'exploration complet, avec des étiquettes de graphe produites par le détecteur Detic.

L'enjeu dépasse la recherche d'objets domestiques. Le raisonnement sur les relations spatiales et sémantiques reste un point faible des robots déployés hors environnements structurés, et la similarité CLIP seule peine à départager des conteneurs proches, à la fois par leur position et par leur sens. Ici, la décision tient compte de ce qui est physiquement plausible et de ce qui est sémantiquement probable. Pour un intégrateur, c'est un levier de réduction du temps d'exploration, donc de productivité, dans la logistique, le soin ou la maison. Il faut toutefois relativiser. Le principal protocole chiffré utilise un graphe parfait issu du simulateur, et la robustesse au bruit n'est montrée que par une démonstration réelle unique, sans statistiques. L'écart entre simulation et déploiement reste donc largement ouvert, et la domination sur « la majorité » des configurations suppose que certaines échappent à LOCUS.

Ces travaux s'inscrivent dans la recherche sur les graphes de scène et la navigation guidée par le langage, où CLIP s'est imposé comme brique sémantique par défaut et où les planificateurs LLM prolifèrent. Le choix de Tidybot comme référence rappelle la filiation avec la manipulation domestique pilotée par des modèles de langage. L'approche concurrence ainsi les méthodes purement LLM, plus coûteuses et moins ancrées dans la géométrie, tout comme les modèles vision-langage-action de bout en bout, qui n'exploitent pas explicitement la structure spatiale. Il s'agit d'une publication académique (arXiv, 1re version), sans produit, sans calendrier ni partenaire industriel annoncé. Les suites naturelles seraient une évaluation sur graphes bruités à grande échelle, des essais dans plusieurs domiciles réels et une intégration avec des modèles de fondation pour la manipulation.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Localisation par graphe de facteurs assistée par contact pour l'échantillonnage sous-marin
1arXiv cs.RO 

Localisation par graphe de facteurs assistée par contact pour l'échantillonnage sous-marin

Des chercheurs publient sur arXiv (référence 2608.26932v1) un système baptisé « Contact-Aided Factor-Graph Localization », conçu pour les véhicules sous-marins autonomes effectuant des prélèvements rapprochés sur le fond marin. Le système fusionne, dans un graphe de facteurs de type smoothing, les événements de contact d'un manipulateur à succion avec l'odométrie visuelle adaptative, des détections d'objets par apprentissage, et les capteurs embarqués, dont un loch Doppler (DVL) couplé à une centrale inertielle. Les facteurs d'odométrie visuelle et de repérage d'amers (bearing-range) sont pondérés selon les statistiques d'inliers, afin d'éviter que des images visuellement pauvres ne déstabilisent l'estimateur, tandis que les contacts physiques sont traités comme des facteurs à haute confiance générant des fermetures de boucle implicites, sans reconnaissance de lieu basée sur l'apparence. Le système peut s'initialiser entièrement en ligne, pendant le mouvement. Les auteurs ont validé l'approche en bassin, en environnement portuaire et en simulation. Pour les intégrateurs et opérateurs de robotique sous-marine, l'apport tient au traitement du contact physique comme primitive de localisation à part entière, et non comme simple sous-produit de la manipulation. Sur les fonds marins plats et peu texturés, les caméras orientées vers le bas souffrent d'ambiguïté d'échelle, de dégénérescence latérale et d'un suivi de features instable, tandis que la fusion inertielle-DVL seule ne corrige aucune dérive structurelle. En exploitant les événements de succion du bras manipulateur comme contraintes géométriques informatives, le système réduit la dérive de trajectoire et améliore la précision de revisite d'objets, comparé à une navigation par filtrage classique ou à des formulations en graphe sans contact. Le résultat conforte l'idée que l'interaction physique incarnée peut compenser la dégradation perceptuelle propre aux environnements sous-marins, un problème structurel pour l'échantillonnage automatisé en eaux profondes ou en zones de biofouling. L'estimation d'état sous-marine reste historiquement dépendante du couple DVL/centrale inertielle, complété ponctuellement par odométrie visuelle ou acoustique, deux approches connues pour dériver en l'absence de repères stables. Le papier s'inscrit dans une lignée de recherches sur la localisation SLAM sous-marine appliquée au prélèvement, à l'inspection d'infrastructures immergées ou à la biologie marine, un segment où les essais en conditions réelles au-delà du bassin ou du port restent rares. Les auteurs ne précisent ni calendrier de déploiement industriel ni partenaire commercial; les résultats publiés se limitent à des tests contrôlés, sans validation en mer ouverte ou en grande profondeur, ce qui laisse ouverte la question du passage à l'échelle vers des missions d'échantillonnage autonome en environnement opérationnel.

RecherchePaper
1 source
Enrichir le contexte spatial et temporel pour l'apprentissage par imitation robotique avec des graphes de scène
2arXiv cs.RO 

Enrichir le contexte spatial et temporel pour l'apprentissage par imitation robotique avec des graphes de scène

Des chercheurs ont publié le 1er juin 2026 sur arXiv (2606.01072) une méthode d'apprentissage par imitation qui exploite des graphes de scène dynamiques comme mécanisme de mémoire structurée pour les robots mobiles. Le principe : pendant l'exécution d'une tâche, le robot maintient un graphe de scène mis à jour en continu, qui encode les relations entre objets et leur évolution dans le temps. Plutôt que de traiter uniquement les observations courantes du capteur, le système capitalise sur l'historique accrété de l'environnement pour inférer des politiques d'action. Les validations couvrent deux régimes : manipulation mobile en simulation (environnements à grande échelle spatialement) et manipulation sur table en conditions réelles. Les auteurs rapportent une amélioration substantielle des performances par rapport aux baselines, particulièrement sur des tâches nécessitant un raisonnement à long terme, sans donner de métriques chiffrées précises dans l'abstract. Ce travail s'attaque à deux verrous persistants du déploiement de robots apprenants dans des environnements non-structurés. Le premier est l'observabilité partielle : dans un appartement ou un bureau, le champ de vision d'un robot ne capture qu'une fraction de l'espace pertinent, et les objets manipulés disparaissent régulièrement du cadre. Le second est l'horizon temporel : des tâches comme "ranger la cuisine" enchaînent des dizaines de sous-tâches dont les dépendances ne sont pas localement visibles. En substituant un graphe de scène explicite et structuré à une mémoire implicite (fenêtre d'observations brutes, état caché LSTM), l'approche donne au robot une représentation interprétable et modulaire du contexte. Pour les intégrateurs industriels et les équipes qui déploient des politiques d'imitation dans des environnements semi-structurés, c'est une piste crédible pour réduire le gap entre démo de labo et robustesse opérationnelle, même si les expériences restent pour l'instant confinées à la simulation et au tabletop. L'apprentissage par imitation (behavioral cloning, GAIL, DAgger) a connu un regain d'intérêt majeur avec l'essor des Visual Language Action models (VLA) comme Pi-0 de Physical Intelligence, RT-2 de Google DeepMind, ou OpenVLA. Les graphes de scène sont une technique éprouvée en vision par ordinateur et en navigation robotique (travaux de Armeni, Rosinol, Chang notamment), mais leur intégration dans des pipelines d'imitation learning reste peu explorée. Les approches concurrentes pour gérer la mémoire à long terme incluent les transformers avec attention sur un historique d'observations, les représentations de tâches hiérarchiques (task graphs), et les world models latents. Ce preprint n'étant pas encore évalué par les pairs, ses résultats méritent confirmation sur des benchmarks plus larges et des environnements réellement non-structurés avant de pouvoir orienter des décisions d'architecture. Les auteurs n'annoncent pas de code public ni de suite industrielle à ce stade.

RechercheOpinion
1 source
Estimation de forme des robots continus par graphes de facteurs et développement de Magnus
3arXiv cs.RO 

Estimation de forme des robots continus par graphes de facteurs et développement de Magnus

Des chercheurs ont publié le 22 avril 2026 sur arXiv une méthode de reconstruction de forme pour manipulateurs continus (continuum robots), ces bras flexibles à courbure infinie utilisés notamment en chirurgie mini-invasive et en inspection de conduites. Le système combine une paramétrisation GVS (Geometric Variable Strain) en basse dimension avec un graphe de facteurs, les deux éléments étant liés par un facteur cinématique inédit dérivé de l'expansion de Magnus du champ de déformation. Évalué en simulation sur un robot continu à câbles de 0,4 m de longueur, le pipeline atteint des erreurs de position moyennes inférieures à 2 mm dans trois configurations de capteurs distinctes, et divise par six l'erreur d'orientation par rapport à une ligne de base par régression de processus gaussien (GP) lorsque seules des mesures de position sont disponibles. Aucun déploiement matériel réel n'est encore rapporté : il s'agit d'un résultat de simulation validé sur préprint, pas d'un produit commercialisé. L'intérêt pour les intégrateurs et les équipes de R&D est double. D'abord, la méthode produit un vecteur d'état compact directement exploitable par des boucles de contrôle model-based, ce que les approches purement probabilistes basées sur la discrétisation spatiale des tiges de Cosserat ne permettent pas sans un coût computationnel croissant avec la résolution. Ensuite, l'incertitude reste quantifiée, ce que les méthodes paramétriques classiques sacrifient au profit de la compacité. Pour le secteur chirurgical en particulier, où la redondance et la sécurité certifiable sont des prérequis réglementaires, la combinaison compacité-incertitude représente un progrès méthodologique tangible, à condition qu'il se confirme sur hardware réel. Les manipulateurs continus constituent un axe de recherche actif depuis les années 2000, porté notamment par les laboratoires travaillant sur la chirurgie robotique (Intuitive Surgical côté industriel, groupes académiques comme le King's College London ou la TU Delft côté recherche). Les approches concurrentes incluent les modèles de tige de Cosserat discrétisés, les réseaux de neurones pour la cinématique directe et les processus gaussiens, chacun présentant un compromis différent entre précision, temps de calcul et structure probabiliste. La prochaine étape attendue est une validation expérimentale sur banc physique avec bruit de capteur réel, condition sine qua non avant toute intégration dans un système de contrôle clinique ou industriel.

UELes laboratoires européens actifs en robotique chirurgicale (dont TU Delft) pourraient intégrer cette brique algorithmique dans leurs travaux sur les boucles de contrôle certifiables, à condition d'une validation hardware confirmée.

RecherchePaper
1 source
Planification certifiée par échantillonnage à l'aide de graphes d'ensembles convexes
4arXiv cs.RO 

Planification certifiée par échantillonnage à l'aide de graphes d'ensembles convexes

Des chercheurs publient sur arXiv (référence 2608.29770v1) la première mesure chiffrée d'un écart resté largement ignoré dans la planification de trajectoire par graphes d'ensembles convexes (GCS), une famille de planificateurs réputés produire des trajectoires sans collision "par construction". Le problème: le générateur de régions convexes sous-jacent ne garantit cette absence de collision que de façon probabiliste, et aucun planificateur GCS existant ne vérifie réellement cette propriété avant de livrer sa réponse. Sur une bibliothèque bimanuelle à 14 degrés de liberté (DOF) mise à l'échelle, les auteurs mesurent que 3,2 % des échantillons d'interface entre régions sont en réalité en collision. Le planificateur de référence testé, GCS* (approche par recherche), transforme cette erreur de volume en 62 % d'erreur de réponse: 18 des 29 requêtes de pick-and-place évaluées retournent des trajectoires faisant pénétrer les bras jusqu'à 91 mm dans les étagères, tout en étant rapportées comme des succès. Ce résultat met en défaut une hypothèse de confort répandue dans la planification de mouvement robotique, celle voulant que les garanties théoriques "correct par construction" des GCS se traduisent automatiquement en fiabilité opérationnelle. Pour des intégrateurs déployant des bras robotiques en environnement encombré (entrepôt, cellule industrielle, picking bimanuel), cela signale un risque concret de collisions silencieuses, d'autant plus critique que l'espace de configuration est dense avec deux bras. Les correctifs évidents échouent: durcir dix fois le contrat d'acceptation des régions, générer des régions certifiées par sommes de carrés, ou imposer des marges uniformes, détruisent tous la connectivité nécessaire à la planification avant même d'obtenir une garantie de solidité, révélant une tension structurelle entre sécurité et faisabilité dans cette famille d'algorithmes. Face à ce constat, les auteurs proposent un planificateur qui certifie chaque réponse plutôt que de faire confiance à la génération de régions en amont: il échantillonne les recouvrements et faces partagées de la décomposition convexe, élague la recherche via une borne informée admissible, vérifie en continu le candidat proposé à chaque tour par une chaîne de certificats de dégagement sans paramètre de résolution arbitraire, répare les échecs par des détours locaux internes aux régions, puis revérifie le polissage convexe final. Sur les mêmes 29 requêtes, ce planificateur ne produit aucune réponse invalide, contre 21 pour la référence, atteint sa première réponse certifiée en 0,11 seconde contre 1,59 seconde pour la version non vérifiée, et reproduit exactement l'optimum de référence chaque fois que celui-ci est physiquement valide. L'article, un pré-print de recherche sans affiliation industrielle précisée, ne mentionne ni calendrier de déploiement ni partenaire commercial.

RecherchePaper
1 source