Aller au contenu principal
RecherchearXiv cs.RO 

GUARD : débruitage et segmentation de nuages de points tenant compte de l'incertitude géométrique pour le démontage robotisé de disques durs

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (octobre 2026) GUARD, un cadre de débruitage et de segmentation de nuages de points conçu pour le démontage robotisé de disques durs (HDD). Le problème visé est celui des artefacts « fantômes » structurés, produits par le scan et la reconstruction. Localement, ils ressemblent à de vrais composants, mais ils sont incohérents avec la géométrie d'ensemble, et un réseau de segmentation peut leur attribuer une étiquette plausible. GUARD filtre et segmente en une seule passe avant. Il combine un transformer géométrique multi-échelle et un processus gaussien à random Fourier features multi-bande passante, qui estime une incertitude géométrique par point. L'entropie prédictive complète ce score. Sur 2 745 nuages de points réels de HDD, le mIoU de PointNet++ passe de 0,7739 à 0,8318. Sur des échantillons ScanNet annotés manuellement, l'incertitude géométrique détecte les points corrompus avec un F1 de 0,7931, contre 0,2212 pour l'entropie seule. Des tests complémentaires sur ShapeNetPart et ScanNet portent sur différents types de corruption et différents backbones.

L'intérêt tient à la distinction entre confiance sémantique et fiabilité géométrique. Un classifieur sûr de lui peut se tromper sur un point qui n'existe pas physiquement, et dans une cellule de démontage cela peut mener à une mauvaise estimation de pose ou à une prise sur un composant fantôme. L'écart de F1 entre les deux signaux suggère que l'entropie, utilisée comme filtre par défaut, rate l'essentiel de ces erreurs. Le résultat reste à relativiser : le gain de 5,8 points de mIoU est réel mais modeste. Le F1 de 0,7931 repose sur un jeu ScanNet annoté à la main, de taille non précisée. Le résumé ne mentionne ni taux de succès de préhension, ni temps d'inférence, ni test en cellule robotisée. Les auteurs reconnaissent aussi un compromis entre suppression des artefacts et conservation des structures informatives.

Le démontage de HDD est un cas d'usage typique du recyclage électronique, où la variabilité des modèles et la qualité des scans limitent l'automatisation. Le travail s'inscrit dans cette logique : fiabiliser la perception avant la manipulation. Il s'agit d'un préprint, sans validation par les pairs, sans pilote industriel ni partenaire annoncé, et l'article ne cite aucun acteur européen. La comparaison porte surtout sur PointNet++ avec et sans GUARD, ce qui laisse ouverte la question de la performance face à d'autres backbones récents ou à des filtres statistiques classiques. Un site de projet est annoncé. La suite logique serait une validation de bout en bout, qui mesurerait l'effet du filtrage sur les taux de réussite de saisie et de démontage.

Dans nos dossiers

À lire aussi

UCON : navigation tenant compte de l'incertitude par réassociation historique en environnements dynamiques
1arXiv cs.RO 

UCON : navigation tenant compte de l'incertitude par réassociation historique en environnements dynamiques

UCON, un nouvel algorithme de navigation autonome pour environnements dynamiques, a été publie sur arXiv le 25 septembre 2026 sous la référence 2609.29419v1. Le système s'attaque a deux problèmes récurrents en robotique mobile : l'instabilité de la perception, qui provoque des changements d'identité entre obstacles suivis et des estimations de mouvement peu fiables, et le décalage entre incertitude et optimisation, qui empêche d'intégrer proprement cette incertitude dans le calcul de trajectoire. La solution combine un mécanisme de reassociation historique au niveau des points, qui exploite des fragments de nuages de points passes pour retrouver une cible perdue et maintenir la continuité de son identité, avec un filtre de Kalman fournissant une estimation anisotrope de l'état de mouvement et une propagation de la covariance. Les états prédits et leurs covariances sont ensuite convertis en secteurs d'incertitude, intégrés comme termes de cout différentiables dans le module d'optimisation de trajectoire. Les auteurs annoncent des tests en simulation et en conditions réelles, et promettent l'ouverture du code source, sans date de publication précisée. Pour les intégrateurs de robots mobiles autonomes (AMR) évoluant parmi des obstacles mouvants, humains ou autres robots, la perte d'identité d'une cible suivie est une source classique de replanifications brusques ou dangereuses. En reliant explicitement l'incertitude de perception au calcul de trajectoire, plutôt que de traiter ces deux étapes séparément, UCON s'attaque directement a ce point de friction technique, pertinent pour la fiabilité des déploiements industriels en entrepôt ou en usine. Les auteurs revendiquent une performance supérieure aux méthodes de l'état de l'art tout en conservant une bonne efficacité de calcul, mais ces comparaisons proviennent de leurs propres benchmarks et l'abstract ne fournit aucun chiffre concret, ni taux de réussite, ni temps de calcul, ni fréquence de traitement, ce qui rend l'ampleur réelle du gain difficile a juger avant la publication complète. Le texte se présente comme un article de recherche nouvellement annonce sur arXiv, sans nom d'institution, de laboratoire ou d'entreprise associe dans le résume, et sans lien vers un dépôt de code a ce stade. Il s'inscrit dans un courant de recherche plus large visant a réconcilier robustesse perceptuelle et planification de mouvement sous incertitude pour la navigation en environnement dynamique, un axe suivi par de nombreux groupes académiques travaillant sur les AMR et la navigation robotique. Aucun acteur concurrent n'est nomme explicitement, la comparaison restant générique aux "méthodes de l'état de l'art". La suite logique reste la publication du code promise par les auteurs et, vraisemblablement, une parution reviewee détaillant les résultats chiffres.

RecherchePaper
1 source
GUARD : détection de risque par ancrage d'incertitude et ablation pour les VLA à diffusion
2arXiv cs.RO 

GUARD : détection de risque par ancrage d'incertitude et ablation pour les VLA à diffusion

Une équipe de recherche publie GUARD (Grounding Uncertainty and Ablation-based Risk Detection), une méthode de détection d'échec en temps de test pour les politiques VLA (vision-langage-action) fondées sur la diffusion, sans modifier le modèle préentraîné. Le principe consiste à mesurer l'influence des entrées indexées par token dans le cache clé-valeur (KV) du modèle vision-langage, à construire des caches contrefactuels en supprimant les entrées KV les plus saillantes, puis à comparer les réponses de débruitage obtenues avec le conditionnement original. GUARD en tire un flux de diagnostics, sensibilité, entropie d'attention, biais de modalité et efficacité de l'ancrage, calibrés en ligne et traités par un classifieur temporel léger. La méthode est testée sur cinq combinaisons politique-benchmark : les modèles Pi0 (Physical Intelligence), SmolVLA (Hugging Face) et Alpamayo-1.5 (Nvidia), évalués sur les bancs d'essai LIBERO, SimplerEnv, MetaWorld et PhysicalAI-AV, avec des tâches jamais vues à l'entraînement. GUARD obtient le meilleur score ROC-AUC sur quatre des cinq configurations de tâches inédites et se classe deuxième sur la dernière, avec un gain moyen de 5,73 points de pourcentage sur le meilleur moniteur concurrent, tout en restant à 0,19 point du meilleur résultat obtenu sur des tâches déjà vues. Ce travail s'attaque à un problème concret pour quiconque déploie des politiques VLA en robotique : ces modèles génèrent des actions plausibles même quand leur perception de la tâche est mal ancrée dans l'image ou la consigne textuelle, ce qui produit des échecs silencieux difficiles à anticiper avant exécution. Pour les intégrateurs qui évaluent des VLA génératifs comme Pi0 ou GR00T pour du pick-and-place, de la manipulation ou de la conduite autonome, disposer d'un signal d'alerte transférable d'une tâche à l'autre, d'une politique à l'autre et d'un robot à l'autre change la donne : un tel signal permettrait de déclencher un arrêt ou une intervention humaine avant qu'une action erronée ne soit exécutée, plutôt que de constater l'échec après coup. C'est aussi une réponse indirecte à un doute récurrent du secteur sur les VLA à diffusion : leur fluidité gestuelle masque parfois un raisonnement multimodal fragile, et GUARD propose d'auditer ce raisonnement interne plutôt que de se fier au seul comportement observé en sortie. GUARD s'inscrit dans une littérature croissante de moniteurs d'exécution pour politiques robotiques génératives, portée par l'essor rapide des VLA depuis des modèles comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure, déployés ou testés sur des plateformes humanoïdes et des bras manipulateurs. La méthode se positionne face aux approches existantes de détection d'anomalie en temps réel, qu'elle surpasse en moyenne sur des tâches inédites tout en restant compétitive sur des tâches connues, un compromis généralisation-précision central pour toute solution visée à la production. Les auteurs évaluent leur approche exclusivement en simulation et sur des jeux de données benchmark (LIBERO, SimplerEnv, MetaWorld, PhysicalAI-AV), sans validation sur robot physique à ce stade : cette publication arXiv relève donc de la recherche amont plutôt que d'un outil prêt à déployer, et une vérification en conditions réelles reste l'étape naturelle avant toute intégration industrielle.

RecherchePaper
1 source
GWM-VLA : une modélisation latente du monde tenant compte de la géométrie pour le VLA
3arXiv cs.RO 

GWM-VLA : une modélisation latente du monde tenant compte de la géométrie pour le VLA

Publié sur arXiv sous la référence 2608.07619 (août 2026), GWM-VLA est un nouveau cadre de modélisation latente du monde pour les modèles vision-langage-action (VLA) utilisés en manipulation robotique. L'architecture combine trois éléments : un module d'encodage multi-vues géométriquement conscient, nommé VGGT-Ω, qui agrège à chaque pas de temps les flux de plusieurs caméras pour construire un état multi-vues cohérent ; un modèle du monde latent qui prédit uniquement les tokens de patch de l'étape suivante pour une vue cible unique, la caméra de poignet du bras robotique dans les expériences, plutôt que de reconstruire l'intégralité de la scène multi-vues ; et une représentation d'action latente partagée qui conditionne à la fois ce modèle du monde et une tête d'action par flow-matching, entraînée simultanément par supervision de prédiction latente et par les actions robotiques réelles. Les auteurs testent le système en simulation et sur robot réel, sans détailler de chiffres de performance dans le résumé public. L'enjeu vise une faiblesse connue des VLA : leurs performances de manipulation, solides en conditions contrôlées, se dégradent souvent face à des changements visuels ou environnementaux comme l'éclairage, la position de caméra ou l'arrière-plan. La plupart des modèles du monde latents existants encodent chaque vue caméra indépendamment et prédisent la dynamique globale de la scène sans modéliser explicitement les relations géométriques entre vues, ce qui fragilise la robustesse. En imposant une cohérence géométrique multi-vues dès l'encodage, GWM-VLA s'inscrit dans les efforts récents pour combler l'écart entre démonstrations en laboratoire et déploiement réel, un point sensible pour les intégrateurs qui évaluent des politiques VLA de type Pi-0, GR00T N2 ou Helix pour des lignes de production ou de la logistique, où la variabilité des scènes est la norme plutôt que l'exception. GWM-VLA s'ajoute à une vague de recherches associant modélisation du monde et apprentissage d'actions pour renforcer la généralisation des politiques robotiques, un axe explore en parallèle par plusieurs laboratoires travaillant sur les architectures VLA à grande échelle. L'article ne précise ni l'affiliation institutionnelle des auteurs ni de comparaison chiffrée avec des bases de référence publiées, ce qui en fait pour l'instant une contribution académique en preprint, non revue par les pairs, plutôt qu'un produit ou un déploiement industriel. Aucune date de publication en conférence, aucun partenariat industriel ni feuille de route de déploiement ne sont mentionnés ; la validation indépendante de la robustesse annoncée reste donc à établir par la communauté.

RecherchePaper
1 source
Calibration optimale tenant compte de l'incertitude pour le problème AX=YB
4arXiv cs.RO 

Calibration optimale tenant compte de l'incertitude pour le problème AX=YB

Une équipe de chercheurs a publié le 7 mai 2026 sur arXiv (identifiant 2605.04809) une méthode d'optimisation pour la calibration main-oeil, problème dit AX=YB, qui consiste à déterminer la transformation géométrique rigide entre un capteur (caméra ou lidar) et l'effecteur d'un robot. L'algorithme proposé est itératif, formulé en algèbre de Lie, et respecte strictement les contraintes structurelles du groupe SE(3) tout en synchronisant les mises à jour des paramètres de calibration. Plutôt que de modéliser explicitement l'incertitude des données, approche jugée trop difficile à généraliser, les auteurs introduisent une métrique d'incertitude relative entre sources de mesure, utilisée pour pondérer dynamiquement chaque observation pendant l'optimisation. Sur jeux de données synthétiques à forte incertitude, la méthode améliore la précision d'estimation d'au moins 67 % par rapport aux approches existantes, selon des simulations numériques et des expériences réelles présentées dans l'article. L'enjeu industriel est concret : la calibration main-oeil conditionne toute application robotique guidée par vision, qu'il s'agisse de soudure, d'assemblage, de palettisation ou de contrôle qualité. Dans les scénarios à grande plage de travail ou en surcharge mécanique, typiques des robots 6-DOF à payload supérieur à 50 kg, les données de calibration sont contaminées par des incertitudes difficiles à quantifier : flexions structurelles, jeux mécaniques, dérive thermique. Les méthodes classiques comme Tsai-Lenz ou Shah traitent ces perturbations de façon uniforme, sans pondération adaptative. L'approche proposée ajuste au contraire l'influence de chaque paire de mesures pendant l'optimisation, ce qui peut réduire les temps de recalibration en production et améliorer la répétabilité sur cellules robotisées existantes sans changer de matériel. Le problème AX=YB est étudié en robotique depuis les travaux fondateurs de Shiu et Ahmad (1987) et Tsai et Lenz (1989). Les approches concurrentes exploitent les quaternions duaux (Daniilidis, 1999), les décompositions de Kronecker, ou plus récemment l'apprentissage automatique avec données visuelles denses. L'article positionne son apport principal sur deux points de friction récurrents dans les déploiements réels : la qualité de l'initialisation et la robustesse aux incertitudes non modélisées. Aucun code source ni partenaire industriel ne sont mentionnés dans le préprint disponible. Une intégration dans des frameworks de calibration open-source comme Kalibr ou easy_handeye constituerait la prochaine étape naturelle vers une adoption pratique.

UELes intégrateurs robotiques européens déployant des cellules 6-DOF à forte charge (KUKA, ABB) pourraient bénéficier d'une meilleure répétabilité de calibration sans changement matériel, sous réserve d'une publication du code dans des frameworks open-source comme Kalibr ou easy_handeye.

RecherchePaper
1 source