G6D : solveur de pose 6D RGB-D sans apprentissage pour la manipulation robotique
Un preprint arXiv publié en septembre 2026 (référence 2609.23566v1, page projet sur ai4control.github.io/G6D-Project-Page) présente G6D, un solveur d'estimation de pose 6D pour la manipulation robotique qui fonctionne sans apprentissage automatique. À partir d'une image RGB-D, d'un masque de l'objet, des paramètres intrinsèques de la caméra et d'un modèle CAO, l'algorithme génère des hypothèses de pose par mise en correspondance géométrique avec des gabarits de référence, puis les affine en comparant silhouette et profondeur observées. Le nombre d'hypothèses est ajustable pour arbitrer précision et temps de calcul, et une configuration purement CPU, sans GPU, est proposée. Les auteurs rapportent des résultats sur LineMOD et cinq jeux BOP19, complétés par des essais réels de pick-and-place sur robot.
Le problème visé est concret pour les intégrateurs : sur un robot, la perception partage un budget de calcul limité avec la planification et le contrôle, ce qui complique l'embarquement des modèles de vision volumineux qu'utilisent les méthodes zero-shot récentes. En s'appuyant uniquement sur la géométrie, sans modèle préentraîné ni réentraînement par objet, G6D promet un déploiement plus léger et une chaîne de traitement interprétable, contrairement aux représentations apprises opaques. La mention de "performance avancée" dans le résumé reste toutefois du vocabulaire d'abstract académique, et les benchmarks cités (LineMOD, BOP19) mesurent la recherche, pas un déploiement industriel à l'échelle ; l'article ne précise pas avoir été relu par des pairs.
G6D s'inscrit dans une tension classique du secteur entre modèles zero-shot à large échelle, capables de généraliser à des objets inédits mais coûteux en embarqué, et méthodes géométriques classiques, plus frugales mais historiquement moins robustes à la généralisation. En s'appuyant sur un modèle CAO par objet plutôt que sur de l'apprentissage profond, G6D vise les cas où le calcul embarqué est contraint, un scénario courant en préhension industrielle. Le code et les ressources sont publics sur la page du projet, ouvrant la voie à une reproduction indépendante des résultats, mais aucun pilote industriel ni partenariat n'est annoncé : le travail reste, à ce stade, au niveau de la publication de recherche.
Dans nos dossiers




