Aller au contenu principal
De la segmentation de verrerie transparente à l'évitement de collision : un pipeline de perception en temps réel sensible aux contours
RecherchearXiv cs.RO 

De la segmentation de verrerie transparente à l'évitement de collision : un pipeline de perception en temps réel sensible aux contours

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié le 4 août 2026 sur arXiv (référence 2608.04769) un système de segmentation d'instance en temps réel conçu pour éviter les collisions avec du matériel de laboratoire transparent, en s'appuyant uniquement sur une caméra. Partant du constat que la réfraction et les reflets spéculaires rendent la texture interne des objets en verre peu fiable, mais que leurs contours restent visuellement stables, l'équipe a ajouté à un modèle de segmentation d'instance "one-stage" une branche de détection de contours, un mécanisme d'attention guidé par ces contours et un module SimAM sans paramètre supplémentaire. Elle a aussi construit LabGlass-IS, un jeu de données de 3485 images réparties en 21 catégories de verrerie de laboratoire réelle. Le modèle obtient un score Boundary F de 97,80, devançant de 18,93 points le cadre FastSAM piloté par YOLO, tout en tournant à 7,1 millisecondes par image et en n'utilisant que 2,85% des paramètres du concurrent le plus proche en précision. Une triangulation multi-vues des centroïdes de masques calcule ensuite des positions 3D pour des contraintes de volume englobant conservatrices, et sur robot réel le pipeline atteint un taux de réussite d'évitement de collision de 93,3%.

Ce résultat cible un angle mort classique de la robotique de laboratoire : la verrerie transparente échappe souvent aux capteurs de profondeur usuels (lidar, stéréo), car elle ne réfléchit ni ne diffuse la lumière comme un objet opaque. Un système purement visuel, léger et rapide, capable de repérer fioles, béchers ou tubes à essai sans capteur de profondeur dédié, réduit le coût matériel d'une cellule robotisée et ouvre la voie à des bras collaboratifs travaillant à proximité de verrerie fragile sans contact accidentel. Le gain computationnel, moins de 3% des paramètres d'un concurrent à précision comparable pour une inférence sous les 10 millisecondes, est ce qui rend l'approche déployable en périphérie, sur du matériel embarqué peu coûteux plutôt que sur un serveur GPU distant : un critère décisif pour un intégrateur qui doit justifier le coût par poste automatisé en pharma, chimie ou biotech.

La segmentation d'objets transparents est un problème documenté depuis plusieurs années en vision par ordinateur ; les méthodes génériques comme les variantes de SAM pilotées par YOLO peinent sur ces surfaces faute de texture interne exploitable, ce qui explique le choix des auteurs de comparer leur approche à FastSAM piloté par YOLO. Le code (TransYOLO_3D) et des vidéos de démonstration sont publiés en accès libre sur GitHub, ce qui permet une réplication indépendante, un point notable puisqu'il s'agit d'un prétirage arXiv non encore relu par les pairs. Les auteurs présentent leur pipeline perception-vers-action comme une preuve de faisabilité plutôt qu'un produit fini ; la suite logique serait une validation à plus grande échelle en conditions réelles de laboratoire, au-delà des essais contrôlés décrits dans l'article.

Dans nos dossiers

À lire aussi

Automatisation en temps réel de la perception RGB-D pour marteaux-piqueurs autonomes en mine : autofiltrage, segmentation des roches et génération de poses de fragmentation
1arXiv cs.RO 

Automatisation en temps réel de la perception RGB-D pour marteaux-piqueurs autonomes en mine : autofiltrage, segmentation des roches et génération de poses de fragmentation

Les chercheurs à l'origine de ce papier arXiv (référence 2607.20748v1) présentent un système de perception en temps réel destiné à automatiser les brise-roches hydrauliques utilisés en exploitation minière, notamment lors des opérations de réduction secondaire souterraine. Aujourd'hui, ces machines sont pilotées à distance par téléopération, ce qui limite fortement la cadence de travail. Le pipeline proposé combine une caméra RGB-D, de la segmentation d'instance par image et un traitement géométrique de nuage de points pour générer simultanément des poses de frappe faisables mécaniquement et une reconstruction 3D de l'espace de travail débarrassée du bras robotique lui-même, une étape nécessaire pour que le système ne confonde pas sa propre structure avec les roches à fragmenter. L'ensemble tourne sur du matériel embarqué à environ 10 Hz, pour une latence totale d'environ 675 millisecondes, un niveau de réactivité jugé compatible avec un asservissement en boucle fermée. Les tests ont été menés sur un scénario réduit à l'échelle, reproduisant les conditions typiques d'un chantier souterrain. Pour le secteur minier, cette publication illustre une tendance de fond: l'automatisation progressive d'équipements lourds historiquement pilotés à la main, un segment resté en retrait par rapport à l'automatisation des véhicules de transport minier (camions autonomes) déjà répandue chez les grands opérateurs. Contrairement à des annonces marketing sur des robots humanoïdes en usine, il s'agit ici d'un travail de recherche mesuré et transparent sur ses limites: le prototype n'a été validé qu'en environnement réduit et contrôlé, pas sur un chantier minier réel, ce qui laisse ouvert l'écart classique entre démonstration en laboratoire et déploiement industriel. Le contexte est celui d'une industrie minière cherchant à réduire l'exposition des opérateurs aux zones dangereuses et à améliorer la productivité des opérations de dégagement de blocs rocheux surdimensionnés, un goulot d'étranglement récurrent après les tirs de mine. Les auteurs ne mentionnent pas de partenariat industriel ni de calendrier de commercialisation; la suite logique évoquée par ce type de travaux académiques est généralement un passage à l'échelle réelle et une validation en conditions souterraines effectives, étapes qui restent à venir.

RecherchePaper
1 source
REACT : un modèle d'état entièrement à impulsions pour la perception temporelle événementielle en temps réel
2arXiv cs.RO 

REACT : un modèle d'état entièrement à impulsions pour la perception temporelle événementielle en temps réel

Des chercheurs présentent REACT, un modèle d'état spiking (state-space model) entièrement neuromorphique pour la perception événementielle en temps réel, dans un preprint arXiv (2609.19204v1) publié le 18 septembre 2026. À la différence des méthodes qui agrègent les événements captés par une caméra événementielle en images ou en fenêtres temporelles, ce qui introduit un délai d'intégration, REACT traite chaque événement individuellement via un neurone spiking à valeurs complexes baptisé C-SiLIF, dont la dynamique continue suit l'intervalle physique entre deux événements. Testé sur la reconnaissance de gestes et sur l'estimation du temps avant collision (TTC) à partir de flux événementiels complets, sans boîte englobante ni information de localisation de la cible, REACT atteint sur le jeu de données EvTTC une erreur relative de TTC de 9,59% avec 4,6 ms de latence d'inférence de bout en bout, à seulement 0,15 point de pourcentage de la meilleure méthode apprise existante. À la vitesse d'approche moyenne du jeu de données, cette latence correspond à 4 cm de déplacement du véhicule, contre 1 mètre pour la méthode concurrente la plus rapide. Une quantification INT8 ramène la consommation énergétique estimée de 18,5 à 2,8 millijoules pour 32 768 événements. Pour les systèmes robotiques évoluant en environnement dynamique (véhicules autonomes, robots mobiles, évitement de collision), ce travail s'attaque au goulot d'étranglement des caméras événementielles: leur résolution temporelle microseconde est aujourd'hui neutralisée par des pipelines d'apprentissage qui rebinnent les événements en trames, réintroduisant la latence que ces capteurs étaient censés éliminer. En égalant quasiment la précision des meilleures méthodes apprises classiques tout en réduisant d'un facteur 25 environ la distance parcourue pendant l'inférence, REACT apporte un argument concret en faveur des réseaux à impulsions pour la perception embarquée temps réel, un terrain longtemps cantonné à des démonstrations peu compétitives face au deep learning conventionnel. Le gain énergétique via quantification INT8 (facteur 6,6 environ) intéresse directement les intégrateurs de drones, d'AMR ou de systèmes ADAS contraints en puissance de calcul. Ce travail prolonge les recherches sur la vision événementielle, portée depuis plus d'une décennie par des capteurs asynchrones de type DVS, et sur les réseaux de neurones à impulsions, approche neuromorphique censée rapprocher le calcul du fonctionnement de la rétine biologique. Les auteurs pointent que l'essentiel des méthodes actuelles ignore l'asynchronie native des événements en les regroupant artificiellement en fenêtres temporelles; le neurone C-SiLIF vise justement à la préserver. Publié comme preprint arXiv de type "new", donc pas encore évalué par les pairs, le travail reste au stade de validation sur benchmarks (EvTTC, reconnaissance de gestes) comparés à des méthodes apprises existantes, sans partenaire industriel, déploiement réel ni calendrier de commercialisation mentionnés à ce stade.

RecherchePaper
1 source
Téléopération en temps réel sans collision grâce à une planification de trajectoire différentiable par contraintes
3arXiv cs.RO 

Téléopération en temps réel sans collision grâce à une planification de trajectoire différentiable par contraintes

Des chercheurs ont publié en juin 2026 sur arXiv (arXiv:2606.08725) une méthode de planification de trajectoire en temps réel pour la téleopération sans collision de bras manipulateurs. Le problème central : en téleopération, l'opérateur ne contrôle que la pose de l'effecteur terminal (position et orientation de l'outil), sans piloter individuellement les articulations. Cela provoque régulièrement des auto-collisions du bras sur lui-même ou des collisions avec les obstacles de l'environnement de travail. L'approche proposée reformule les contraintes d'évitement de collision en les rendant différentiables via la dualité en optimisation convexe, une formulation récente adaptée ici au contexte de la téleopération. Le robot est représenté géométriquement par des capsules (cylindres à extrémités hémisphériques), l'environnement par des polytopes. La méthode a été validée en simulation sur des scénarios à nombre variable d'obstacles, puis testée physiquement sur un bras UR5e de Universal Robots dans une session de téleopération réelle. Les résultats indiquent des temps de calcul inférieurs aux méthodes de référence, tout en autorisant une modélisation géométrique plus fidèle, produisant des trajectoires plus lisses et garantissant l'absence de collision. L'enjeu industriel est direct : les approches existantes contraignent les développeurs à choisir entre précision géométrique et performance de calcul. Approximer robot et obstacles par des sphères simplifie la différentiabilité mais introduit des marges de sécurité artificiellement larges, restreignant l'espace de travail utile. À l'inverse, approximer les dérivées dégrade la convergence du solveur et augmente la latence, incompatible avec les exigences temps réel de la téleopération. En utilisant la dualité convexe, ce travail contourne les deux compromis simultanément. Pour un intégrateur déployant des cellules robotisées téléopérées, cela représente potentiellement moins de zones interdites inutiles et une meilleure réactivité du système. La téleopération connaît un regain d'intérêt important depuis 2023, portée par les besoins en collecte de données pour l'apprentissage par imitation dans les robots humanoïdes et par les applications en environnements dangereux ou médicaux. Les méthodes concurrentes incluent les contrôleurs réactifs basés sur des champs de potentiel, les planificateurs par échantillonnage (RRT, CHOMP) et les approches de contrôle optimal à horizon glissant avec modèles en sphères. L'approche ici, fondée sur la programmation différentiable et les contraintes duales convexes, s'inscrit dans une tendance plus large d'intégration des outils d'optimisation différentiable dans la robotique de manipulation. Le travail est un preprint non encore évalué par les pairs ; les prochaines étapes probables concernent l'extension à des configurations à plus grand nombre de degrés de liberté et à des environnements dynamiques.

UEApplicable aux intégrateurs européens déployant des cellules téléopérées (chirurgie, environnements dangereux), mais aucun acteur FR/EU n'est directement impliqué dans ce preprint.

RecherchePaper
1 source
Où toucher, comment entrer en contact : un cadre hiérarchique RL-MPC pour une manipulation sim-vers-réel sensible à la géométrie
4arXiv cs.RO 

Où toucher, comment entrer en contact : un cadre hiérarchique RL-MPC pour une manipulation sim-vers-réel sensible à la géométrie

Une équipe de recherche propose une architecture hiérarchique combinant apprentissage par renforcement (RL) et commande prédictive (MPC) pour la manipulation dextre en contact riche, détaillée dans un article arXiv (2601.10930, quatrième révision). Le système sépare la décision en deux niveaux: une politique RL de haut niveau détermine "où toucher", c'est à dire un point de contact sur la surface de l'objet ainsi qu'une pose cible à atteindre après ce contact, un concept que les auteurs nomment "intention de contact". Un contrôleur MPC de bas niveau, dit à contact implicite, prend ensuite le relais pour optimiser en temps réel les modes de contact locaux et replanifier la trajectoire du robot à travers la dynamique de contact, non lissée par nature. Le framework a été testé sur des tâches de manipulation non préhensile: poussée généralisée sur des objets de formes variées, réorientation par pivotement ou basculement, et repositionnement assisté par l'environnement. Les résultats annoncés montrent un taux de réussite élevé, un transfert simulation vers réel sans réentraînement (zero shot), et surtout un besoin en données dix fois inférieur à celui des politiques de bout en bout classiques. Cette approche s'attaque directement à l'un des points faibles des politiques end to end actuelles, y compris les modèles vision langage action de type VLA: leur appétit en données et leur difficulté à transférer proprement de la simulation vers le réel. En réintroduisant une décomposition géométrique explicite plutôt que de tout confier à un réseau appris de bout en bout, les auteurs cherchent à concilier la généralisation apprise par renforcement avec la robustesse physique garantie par la commande prédictive. Pour les équipes travaillant sur la manipulation robotique, la promesse d'un facteur dix sur les données nécessaires est significative si elle se confirme au delà des tâches non préhensiles testées ici. Le travail s'inscrit dans un courant de recherche plus large sur la manipulation en contact riche, domaine où la difficulté vient précisément de devoir raisonner conjointement sur la géométrie globale des objets et sur une dynamique de contact non lisse, difficile à différentier et à planifier. Contrairement aux approches purement data driven qui dominent la littérature récente, ce travail mise sur une structure hybride inspirée de la robotique classique. L'article, republié dans sa quatrième version, ne précise pas de calendrier de déploiement matériel à plus grande échelle ni de partenariat industriel.

RecherchePaper
1 source