Aller au contenu principal
RecherchearXiv cs.RO 

GlassFormer : apprentissage de la segmentation du verre en temps réel par fusion radar-profondeur

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent sur arXiv (2609.36844) GlassFormer, un réseau de segmentation de surfaces transparentes qui fusionne un radar à ondes millimétriques avec un capteur RGB-D. Le réseau est un transformeur léger, et le radar y est injecté par attention inter-modale sous la forme d'un a priori spatial. Les auteurs l'évaluent sur deux jeux de test : un split mixte couvrant tous les types de scènes, où GlassFormer atteint 0,88 mIoU, et un split dédié aux conditions de faible luminosité, conçu pour mettre en difficulté les méthodes purement visuelles, où il atteint 0,59 mIoU. Ils affirment que l'inférence tourne en temps réel sur des plateformes à ressources limitées. L'article ne donne ni la carte embarquée testée, ni la fréquence d'images, ni la taille des jeux de données dans son résumé. Il s'agit d'un travail de recherche, sans produit ni déploiement associé.

Le vitrage est un cas d'échec connu de la perception robotique. La caméra RGB voit l'arrière-plan derrière la vitre, et les capteurs de profondeur (LiDAR, temps de vol, RGB-D) renvoient des mesures invalides ou celles du fond. Un robot mobile peut alors prendre une cloison vitrée, une porte ou un miroir pour de l'espace libre. C'est un risque de collision, et aussi un risque de sécurité pour les AMR et les humanoïdes qui évoluent dans les bureaux, hôpitaux, halls, commerces et entrepôts vitrés. L'idée centrale est d'exploiter l'incohérence entre modalités : le radar réfléchit fortement sur le verre, alors que la vision et la profondeur échouent au même endroit. Le résultat sur le split faible luminosité est le plus instructif. Les indices visuels appris par les approches RGB (reflets, contours, contexte sémantique) se dégradent dans le noir, en cas d'éblouissement ou face à un verre sans texture. Les 0,59 mIoU montrent que le radar aide beaucoup, mais qu'un problème reste ouvert : le score est nettement inférieur à celui du split mixte. Les gains face aux bases visuelles restent à vérifier, car le résumé ne les chiffre pas. Ils sont évalués sur les splits des auteurs, sans preuve de généralisation à d'autres capteurs ou bâtiments.

Jusqu'ici, la segmentation du verre reposait surtout sur des réseaux RGB ou RGB-D, qui apprennent des indices visuels et fonctionnent bien sous un éclairage et un angle favorables. Le radar millimétrique est déjà présent sur beaucoup de plateformes mobiles pour sa robustesse à la lumière, à la poussière et à la fumée, mais il reste peu utilisé pour la cartographie sémantique fine. Pour les intégrateurs, cela ouvre la voie à des capteurs peu coûteux ajoutés aux piles de perception existantes, au lieu de LiDAR plus chers. Les prochaines étapes probables sont des tests sur robot réel, des comparaisons avec des méthodes multimodales concurrentes, la publication du jeu de données et du code, et une intégration à la navigation. Rien de tel n'est annoncé à ce stade.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Vol en formation serrée de quadricoptères en temps réel : apprentissage résiduel préservant la platitude
1arXiv cs.RO 

Vol en formation serrée de quadricoptères en temps réel : apprentissage résiduel préservant la platitude

Des chercheurs ont mis au point un cadre d'apprentissage capable de compenser en temps réel les perturbations aérodynamiques qui affectent les quadrirotors volant en formation serrée. Le problème ciblé est le downwash, ce souffle descendant généré par chaque drone qui perturbe ses voisins et peut provoquer des collisions s'il n'est pas modélisé. La méthode, un apprentissage de dynamique résiduelle informé par la physique, corrige les équations de mouvement du système multi-drones tout en préservant sa "flatness" différentielle, une propriété mathématique qui permet de calculer directement les commandes à partir de la trajectoire désirée. Cette flatness préservée autorise un contrôleur par linéarisation par bouclage, peu coûteux en calcul et réglable avec des techniques de contrôle linéaire classiques, qui annule les perturbations par compensation feedforward. Sur banc d'essai matériel, l'approche réduit l'erreur moyenne de suivi de trajectoire de 31% par rapport aux contrôleurs de référence sans compensation. Elle égale la précision d'un contrôle prédictif non linéaire (NMPC) de pointe tout en demandant un ordre de grandeur de calcul en moins, avec un vol en formation stable atteint avec moins de 30 secondes de données d'entraînement et une boucle de contrôle à 5 millisecondes. Pour l'industrie des essaims de drones, ce résultat s'attaque à un goulot d'étranglement connu: les modèles capables de compenser les interactions aérodynamiques en formation serrée, comme le NMPC, sont précis mais trop gourmands en calcul pour les cartes embarquées limitées des petits quadrirotors. En divisant la charge de calcul par un ordre de grandeur sans sacrifier la précision, la méthode ouvre la voie à des vols en formation serrée sur du matériel contraint en ressources, un enjeu direct pour les intégrateurs travaillant sur les light shows, l'inspection coordonnée ou la logistique par essaims. Le fait de n'exiger que 30 secondes de données contredit aussi l'hypothèse répandue selon laquelle l'apprentissage de dynamiques aérodynamiques complexes nécessite de vastes jeux de données collectées en vol, ce qui réduit le coût de déploiement sur de nouvelles configurations de flotte. Le downwash et les interactions aérodynamiques en formation serrée constituent un défi ancien en robotique aérienne, traité jusqu'ici soit par des modèles physiques simplifiés peu précis, soit par du contrôle prédictif non linéaire coûteux en calcul, référence de performance du domaine. Ce travail se positionne explicitement face au NMPC, visant à l'égaler en précision avec une charge de calcul bien moindre plutôt qu'à le dépasser en performance brute. Les auteurs présentent leurs résultats comme une première démonstration de vol en formation stable obtenue avec un volume de données aussi faible et une fréquence de boucle aussi élevée. Il s'agit toutefois d'expériences matérielles en conditions contrôlées, et le passage à des flottes plus nombreuses ou à des environnements extérieurs reste à démontrer.

RecherchePaper
1 source
Fusion multimodale pour le transfert simulation-réel en apprentissage par renforcement visuel
2arXiv cs.RO 

Fusion multimodale pour le transfert simulation-réel en apprentissage par renforcement visuel

Une équipe de recherche a soumis sur arXiv (identifiant 2507.09180, actuellement à la version 4) une architecture de fusion multimodale pour améliorer le transfert sim-to-real en apprentissage par renforcement visuel appliqué à la manipulation robotique. L'approche combine deux flux d'entrée, RGB et profondeur (depth), traités en parallèle par des réseaux convolutifs séparés (CNN stems), dont les représentations fusionnées sont transmises à un vision transformer (ViT) scalable. L'information de profondeur, naturellement robuste aux variations d'apparence de scène, fournit des détails spatiaux 3D absents des images RGB seules. Le pipeline intègre un schéma d'apprentissage contrastif à tokens masqués et non masqués pour améliorer l'efficacité d'échantillonnage, combiné à une randomisation de domaine progressive (curriculum-based domain randomization) pour stabiliser l'entraînement. En simulation, la méthode surpasse les baselines comparées. La validation clé se fait en transfert zéro-shot : sans ré-entraînement sur données réelles, le modèle réalise des tâches de manipulation physique. Le sim-to-real gap reste l'obstacle central en robotique d'apprentissage : les politiques entraînées en simulation échouent fréquemment face à la variabilité visuelle du monde réel. La fusion RGB + depth attaque directement ce problème en réduisant la dépendance aux indices visuels fragiles comme l'éclairage ou les textures. L'apprentissage contrastif à tokens partiels suggère une meilleure invariance aux perturbations apparentes sans nécessiter de volumes massifs de données réelles. Pour les intégrateurs industriels et les équipes de développement en manipulation, le transfert zéro-shot validé expérimentalement est un signal concret : la politique capture des abstractions géométriques suffisamment générales pour opérer hors simulation, ce qui est précisément la promesse que le secteur cherche à tenir depuis des années. Ce travail s'inscrit dans une compétition de représentations visuelles pour la robotique qui inclut la randomisation de domaine agressive popularisée par OpenAI dès 2017, les encodeurs préentraînés par masquage (MAE, R3M, DINOv2), et les politiques vision-langage-action (VLA) comme pi0 de Physical Intelligence ou OpenVLA. L'originalité revendiquée est la fusion RGB + depth au niveau du transformer plutôt qu'en aval, couplée au curriculum adaptatif. Le passage à la version 4 sur arXiv signale un travail en révision active, probablement vers une conférence type ICRA ou IROS. Les prochaines étapes attendues incluent une validation sur benchmarks standardisés (RLBench, MetaWorld) et des tests sur plateformes physiques plus complexes.

RecherchePaper
1 source
De la segmentation de verrerie transparente à l'évitement de collision : un pipeline de perception en temps réel sensible aux contours
3arXiv cs.RO 

De la segmentation de verrerie transparente à l'évitement de collision : un pipeline de perception en temps réel sensible aux contours

Des chercheurs ont publié le 4 août 2026 sur arXiv (référence 2608.04769) un système de segmentation d'instance en temps réel conçu pour éviter les collisions avec du matériel de laboratoire transparent, en s'appuyant uniquement sur une caméra. Partant du constat que la réfraction et les reflets spéculaires rendent la texture interne des objets en verre peu fiable, mais que leurs contours restent visuellement stables, l'équipe a ajouté à un modèle de segmentation d'instance "one-stage" une branche de détection de contours, un mécanisme d'attention guidé par ces contours et un module SimAM sans paramètre supplémentaire. Elle a aussi construit LabGlass-IS, un jeu de données de 3485 images réparties en 21 catégories de verrerie de laboratoire réelle. Le modèle obtient un score Boundary F de 97,80, devançant de 18,93 points le cadre FastSAM piloté par YOLO, tout en tournant à 7,1 millisecondes par image et en n'utilisant que 2,85% des paramètres du concurrent le plus proche en précision. Une triangulation multi-vues des centroïdes de masques calcule ensuite des positions 3D pour des contraintes de volume englobant conservatrices, et sur robot réel le pipeline atteint un taux de réussite d'évitement de collision de 93,3%. Ce résultat cible un angle mort classique de la robotique de laboratoire : la verrerie transparente échappe souvent aux capteurs de profondeur usuels (lidar, stéréo), car elle ne réfléchit ni ne diffuse la lumière comme un objet opaque. Un système purement visuel, léger et rapide, capable de repérer fioles, béchers ou tubes à essai sans capteur de profondeur dédié, réduit le coût matériel d'une cellule robotisée et ouvre la voie à des bras collaboratifs travaillant à proximité de verrerie fragile sans contact accidentel. Le gain computationnel, moins de 3% des paramètres d'un concurrent à précision comparable pour une inférence sous les 10 millisecondes, est ce qui rend l'approche déployable en périphérie, sur du matériel embarqué peu coûteux plutôt que sur un serveur GPU distant : un critère décisif pour un intégrateur qui doit justifier le coût par poste automatisé en pharma, chimie ou biotech. La segmentation d'objets transparents est un problème documenté depuis plusieurs années en vision par ordinateur ; les méthodes génériques comme les variantes de SAM pilotées par YOLO peinent sur ces surfaces faute de texture interne exploitable, ce qui explique le choix des auteurs de comparer leur approche à FastSAM piloté par YOLO. Le code (TransYOLO_3D) et des vidéos de démonstration sont publiés en accès libre sur GitHub, ce qui permet une réplication indépendante, un point notable puisqu'il s'agit d'un prétirage arXiv non encore relu par les pairs. Les auteurs présentent leur pipeline perception-vers-action comme une preuve de faisabilité plutôt qu'un produit fini ; la suite logique serait une validation à plus grande échelle en conditions réelles de laboratoire, au-delà des essais contrôlés décrits dans l'article.

RecherchePaper
1 source
Apprentissage rapide de l'écriture manuscrite dextérique par estimation jacobienne en temps réel
4arXiv cs.RO 

Apprentissage rapide de l'écriture manuscrite dextérique par estimation jacobienne en temps réel

Une équipe de recherche a publié le 11 septembre 2026 sur arXiv (référence 2609.11775) un contrôleur permettant à une main robotique anthropomorphe d'écrire avec un stylo tenu en main, sans simulation ni démonstrations préenregistrées. La méthode repose sur une estimation en temps réel du jacobien de la tâche pour l'ensemble main-objet, calculée directement sur le robot physique et fonctionnant uniquement sur le processeur d'un ordinateur portable. Le contrôleur commence à écrire après environ 18 secondes d'initialisation et continue de s'adapter en continu, sans modèle cinématique ou de contact préétabli. Testée sur trois mains anthropomorphes, une physique et deux simulées, la formulation atteint sur le robot physique une précision moyenne de 0,6 millimètre dans le plan, pour des lettres et des formes tracées en l'air et sur papier. Cette démonstration s'attaque à un problème non résolu de la robotique humanoïde: la manipulation dextre in-hand d'un objet saisi. Les approches dominantes, apprentissage par renforcement en simulation et apprentissage par imitation à partir de démonstrations humaines, butent sur les limites des simulateurs actuels face à la richesse des contacts main-objet et sur le coût de collecte de démonstrations dextres. En s'affranchissant de ces contraintes via un contrôleur analytique adaptatif, les auteurs proposent une alternative légère en calcul et en données, transposable d'une main à une autre sans réentraînement complet, un enjeu concret pour les intégrateurs cherchant à équiper des mains dextres sans les cycles de développement lourds du RL ou de l'IL. Le papier revendique la première démonstration d'une main anthropomorphe traçant des trajectoires arbitraires à trait unique avec un stylo saisi par mouvement purement intra-main, une affirmation encore à valider, puisqu'il s'agit d'une prépublication arXiv non relue par des pairs. Le travail se positionne comme une alternative aux architectures vision-langage-action et aux pipelines RL/IL utilisés par les laboratoires de manipulation dextre humanoïde. Aucun partenaire industriel, financement ni date de déploiement commercial n'est mentionné: il s'agit d'une preuve de concept technique, pas d'un produit prêt à l'emploi. Les suites attendues portent sur l'extension à des tâches plus complexes que l'écriture et sur la robustesse de l'estimateur face à des objets de forme et de masse variables.

RecherchePaper
1 source