Aller au contenu principal
RecherchearXiv cs.RO 

GLoTouch : perception haptique du global au local avec une pince parallèle, pour rechercher, reconnaître et saisir des objets sans vision externe

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un groupe de chercheurs présente GLoTouch, un système de perception haptique conçu pour permettre à un robot de chercher, reconnaître et saisir un objet uniquement par le toucher, sans caméra externe, dans un environnement sombre ou peu éclairé. L'architecture repose sur un gripper parallèle classique à faible nombre de degrés de liberté et fonctionne en deux temps. Dans la phase globale, la pince tient une sonde passive de grande portée dont la géométrie est connue à l'avance: les mesures de force au contact permettent de localiser l'objet candidat, d'estimer grossièrement son contour et sa hauteur à l'échelle du conteneur qui l'entoure. Dans la phase locale, le robot repose cette sonde et utilise des capteurs visuotactiles bilatéraux montés sur le même gripper pour recueillir des observations fines de surface, comparées directement à un modèle 3D cible fourni, sans entraînement spécifique à cet objet. Le système a été évalué à la fois en simulation et sur un robot réel; les auteurs, publiant sur arXiv en septembre 2026 (référence 2609.27695), annoncent l'ouverture future du code source, sans préciser à ce stade de date. L'abstract ne communique aucun chiffre de payload, de temps de cycle ou de taux de réussite quantifié.

L'intérêt pour l'industrie robotique tient au problème visé plus qu'aux résultats chiffrés: la quasi-totalité des systèmes de manipulation actuels, y compris les modèles vision-langage-action (VLA) qui dominent la recherche en robotique généraliste, dépendent d'une perception visuelle qui s'effondre dès que la lumière manque, un cas fréquent en logistique nocturne, en tri de conteneurs fermés ou en intervention en milieu confiné. GLoTouch propose une alternative en montrant qu'un gripper parallèle low-cost, sans capteurs externes ni DOF supplémentaires, peut unifier exploration spatiale grossière et perception géométrique fine dans un seul pipeline tactile. C'est une preuve de concept de recherche, pas un produit prêt au déploiement: l'absence de métriques comparatives et le stade encore expérimental invitent à la prudence avant toute extrapolation vers un usage industriel.

Le travail s'inscrit dans un courant de recherche tactile robotique qui s'appuie sur des capteurs visuotactiles bilatéraux, sans qu'aucune affiliation ou financement ne soit précisé dans le résumé. Cette approche répond à une limite connue de ce champ: la plupart des méthodes tactiles existantes se cantonnent à la manipulation fine locale sans traiter la recherche spatiale à l'échelle d'un contenant. Aucun acteur français ou européen n'est cité dans cette publication. La suite annoncée se limite à la publication du code source, sans calendrier de pilote industriel ni partenaire nommé.

À lire aussi

Relocalisation globale 3D hiérarchique hors ligne/en ligne avec LiDAR synthétique et recherche par descripteurs
1arXiv cs.RO 

Relocalisation globale 3D hiérarchique hors ligne/en ligne avec LiDAR synthétique et recherche par descripteurs

Une équipe de chercheurs a publié le 11 mai 2026 (arXiv:2605.07741) un framework hiérarchique offline/online pour la relocalisation globale 3D de robots mobiles. Le système s'appuie sur une simulation synthétique de scans LiDAR dans une carte préexistante pour construire, en phase hors-ligne, un index de descripteurs géométriques associés à des positions candidates. En ligne, une estimation grossière de la pose est d'abord obtenue par retrieval global dans cet espace de descripteurs, puis affinée par registration de nuages de points pour produire une estimation 6-DoF précise. Sur banc expérimental en environnement réel 3D, la méthode atteint un temps de relocalisation moyen de 3 secondes et une précision moyenne de 8 centimètres, avec une amélioration d'un ordre de grandeur en efficacité computationnelle par rapport aux méthodes de référence. L'enjeu central est la scalabilité : dans les grands espaces industriels ou logistiques, les approches existantes de relocalisation globale souffrent d'un espace de recherche de poses trop vaste et d'un overhead de calcul prohibitif pour une exploitation temps réel. En découplant la phase coûteuse (génération des descripteurs, indexation) de la phase en ligne, ce framework rend la relocalisation 6-DoF viable sur des cartes de grande envergure sans matériel embarqué surpuissant. Pour un intégrateur AMR ou un équipementier de systèmes de navigation autonome, un temps de cycle de 3 secondes à 8 cm de précision représente un seuil opérationnel crédible pour des déploiements en entrepôt ou en environnement industriel non structuré. Il reste cependant à noter que les expériences publiées ne précisent pas la taille des environnements testés ni les conditions de densité du nuage de points, deux paramètres déterminants pour évaluer la généralisation. La relocalisation globale par LiDAR est un problème actif depuis plusieurs années, avec des approches comme PointNetVLAD, BEVPlace ou OverlapNet servant de baselines courantes. Ce travail se distingue par l'utilisation de scans synthétiques pour pré-peupler l'index, une stratégie qui supprime la dépendance à une collecte exhaustive de données réelles dans la carte, mais dont la robustesse face au sim-to-real gap sensoriel reste à valider sur des capteurs hétérogènes. Aucun partenaire industriel ni code open-source n'est mentionné dans la pré-publication ; une validation sur des benchmarks publics comme MulRan ou Oxford RobotCar permettrait de mieux situer ce travail dans l'écosystème existant.

RecherchePaper
1 source
Vers une manipulation d'objets de haute précision : politique visuomotrice guidée par SAM3, avec mémoire persistante et conditionnement visuel ciblé
2arXiv cs.RO 

Vers une manipulation d'objets de haute précision : politique visuomotrice guidée par SAM3, avec mémoire persistante et conditionnement visuel ciblé

Une équipe de recherche présente FOM-SAM3, un système de manipulation robotique combinant le modèle de segmentation SAM3 avec une mémoire persistante d'objets, décrit dans un article publié sur arXiv (référence 2609.21621v1). Le système cible la manipulation fine d'objets, c'est-à-dire la capacité d'un robot à saisir un objet précis parmi d'autres visuellement similaires. La méthode, baptisée FOM-SAM3, apprend des jetons de mémoire réutilisables à partir d'un nombre limité d'images d'enregistrement multi-vues, tout en gardant le modèle SAM3 entièrement gelé, via un apprentissage de type "un contre tous" qui encode la reconnaissance de l'objet cible et le rejet des objets similaires. Ces jetons sont stockés dans une banque de mémoire réutilisable. Les chercheurs y associent un module nommé Focused Spatial-Appearance Encoding (FSAE), qui combine les caractéristiques d'apparence locale de l'objet avec les coordonnées de sa boîte englobante pour piloter des politiques d'action existantes, Diffusion Policy et Action Chunking with Transformers. Le dispositif a été validé sur un jeu de données maison, FO-30, comprenant 30 objets physiques répartis en quatre catégories larges, et testé sur trois tâches de manipulation avec un robot réel. L'enjeu pointé par les auteurs est un angle mort connu des politiques visuomotrices actuelles: un conditionnement au niveau de la scène ne permet pas de sélectionner explicitement un objet, tandis qu'un conditionnement au niveau de la catégorie ne distingue pas deux objets similaires appartenant à la même catégorie. Pour l'industrie, cela concerne directement les cas d'usage où un robot doit saisir une référence précise au milieu de produits quasi identiques, un problème récurrent en logistique et en tri industriel. Les résultats rapportés montrent une robustesse aux objets distracteurs, une capacité de discrimination entre objets proches, et une extensibilité à de nouveaux objets sans réentraîner le modèle de segmentation de base. Ce travail s'inscrit dans la lignée des recherches qui cherchent à coupler des modèles de segmentation générique comme SAM3 à des politiques d'action robotique, plutôt qu'à entraîner des architectures visuomotrices de bout en bout. Il reste à ce stade un article de recherche déposé sur arXiv, non encore revu par les pairs, validé en laboratoire sur un jeu de données restreint de 30 objets et trois tâches, sans annonce de déploiement industriel ni de partenaire commercial associé.

RechercheActu
1 source
Vers des objectifs de navigation par le langage : une approche vision-langage pour la navigation sémantique de robots mobiles par perception RGB-D
3arXiv cs.RO 

Vers des objectifs de navigation par le langage : une approche vision-langage pour la navigation sémantique de robots mobiles par perception RGB-D

Une équipe de recherche présente un framework open source de navigation sémantique piloté par le langage naturel pour robots mobiles, publié sur arXiv (2607.13624v1). Le système, bâti sur des composants modulaires ROS 2, traduit des requêtes en langage naturel comme "va vers la boîte aux lettres" en objectifs de navigation exécutables. Concrètement, le pipeline identifie l'objet cible mentionné dans la phrase, estime sa position dans l'espace à partir de données RGB-D, puis génère un point de navigation transmis à la pile Nav2 de ROS 2 pour l'exécution autonome. Les auteurs ont validé l'approche à la fois en simulation et en conditions réelles, sur deux plateformes distinctes : un TurtleBot3 Waffle et un Unitree Go2 équipé d'une caméra RealSense. Le code sera publié en open source après acceptation de l'article. Cette architecture illustre une tendance de fond dans la robotique mobile : le passage d'une navigation pilotée par coordonnées ou par carte à une navigation pilotée par l'intention exprimée en langage naturel, sans expertise technique requise de l'utilisateur. Pour les intégrateurs, l'intérêt réside moins dans la performance brute que dans la portabilité : en s'appuyant sur ROS 2 et sur des topics et services standardisés, le framework promet une adaptation à différentes plateformes robotiques via une simple reconfiguration plutôt qu'un développement spécifique par robot. Le système va au-delà des commandes directes en interprétant aussi des requêtes contextuelles et en générant du feedback en langage naturel, deux capacités clés pour une interaction homme-robot fluide dans des environnements domestiques ou logistiques où les utilisateurs finaux ne sont pas des opérateurs formés. Ce travail s'inscrit dans la vague plus large des architectures vision-langage-action qui traversent la robotique depuis l'essor de modèles comme Pi-0 ou GR00T N2, même si ceux-ci ciblent surtout la manipulation plutôt que la navigation pure. Plutôt qu'une approche end-to-end déléguant tout le raisonnement à un modèle unique, les auteurs optent pour une architecture modulaire combinant perception RGB-D, compréhension du langage et planification via Nav2, une pile de navigation déjà largement adoptée dans l'écosystème ROS 2 académique et industriel. L'ambition de portabilité multi-plateforme et la publication annoncée du code positionnent ce travail comme une brique réutilisable plutôt qu'une démonstration isolée, même si, à ce stade, rien n'indique un calendrier de diffusion précis ni des tests en environnements plus complexes ou à grande échelle.

RecherchePaper
1 source
Architecture de contrôle pour la préhension sûre d'objets fragiles avec une pince à positionnement grossier
4arXiv cs.RO 

Architecture de contrôle pour la préhension sûre d'objets fragiles avec une pince à positionnement grossier

Une équipe de recherche a publié le 14 septembre 2026 sur arXiv (identifiant 2609.12737) une nouvelle architecture de contrôle destinée à la préhension sûre d'objets fragiles par des pinces robotiques à commande de position "grossière", c'est-à-dire dépourvues de capteurs de force intégrés sophistiqués. La méthode combine une estimation de contact force/couple fondée sur la géométrie de l'objet avec un contrôleur d'admittance adaptatif : le système calcule en continu la force de contact nécessaire pour maintenir une prise stable sur un objet aux propriétés inconnues, sans capteur tactile dédié. Les auteurs ont testé leur algorithme sur des objets variés en taille, forme, rigidité et poids. Les résultats rapportés montrent une absence de glissement et l'application d'une force minimale suffisante pour éviter toute déformation excessive de l'objet saisi. L'abstract ne précise ni le bras robotique utilisé, ni de métriques chiffrées de type charge utile, degrés de liberté ou temps de cycle, ni de nom d'entreprise ou de laboratoire : il s'agit d'un article de recherche déposé en preprint, non encore validé par relecture par les pairs. L'enjeu pratique pour les intégrateurs industriels est réel : la majorité des pinces robotiques déployées en usine ou en logistique restent des systèmes à commande de position simples, sans capteurs force/couple coûteux aux doigts. Une méthode qui reconstitue le retour de force par géométrie plutôt que par capteur dédié pourrait rendre la préhension adaptative accessible sur du matériel bas coût existant, un enjeu pour la manipulation d'objets fragiles en logistique, agroalimentaire, électronique ou pour les mains de robots humanoïdes. Cela reste toutefois une preuve de concept en laboratoire, pas une solution commercialisée ni déployée en production. Ce travail s'inscrit dans la lignée des recherches sur la préhension compliante, qui cherchent à reproduire le réflexe humain d'ajustement de force en temps réel, un axe distinct des approches concurrentes reposant sur des capteurs tactiles matriciels ou des politiques apprises de type VLA entraînées sur de larges jeux de données. L'abstract ne mentionne aucun pilote industriel, partenariat ni calendrier de déploiement : les prochaines étapes, non précisées par les auteurs, porteraient vraisemblablement sur une validation à plus grande échelle et sur des plateformes robotiques réelles.

RecherchePaper
1 source