Attention-DP3 : politique de diffusion 3D avec conditionnement attentionnel aligné sur la géométrie
Attention-DP3, présenté dans un article publié sur arXiv (2609.13318v1), conserve telle quelle l'architecture de diffusion de DP3 (3D Diffusion Policy), une référence pour l'apprentissage par imitation à partir de nuages de points, et lui ajoute un conditionnement attentionnel objet-centré. Le pipeline segmente d'abord les images RGB en vocabulaire ouvert, projette les masques obtenus en 3D via la géométrie de caméra calibrée pour produire des indices géométriques propres à l'objet visé, puis les injecte via un conditionnement dit "tri-champ" combinant trois cartes: un champ de ciblage pour localiser l'objet, un champ de saillance intra-cible pour isoler sa géométrie utile à la tâche, et un champ d'arrière-plan pour supprimer distracteurs et encombrement. La méthode est testée sur les bancs d'essai simulés Adroit, DexArt et MetaWorld ainsi que sur un bras robotique réel SO101, plateforme low-cost associée à l'écosystème open-source LeRobot. Elle dépasse systématiquement DP3 et atteint l'état de l'art sur l'ensemble des benchmarks, avec un écart grimpant jusqu'à 31% en scène fortement encombrée, là où DP3 voit ses performances chuter nettement dès que le nombre de distracteurs augmente. Le code est publié en accès libre sur GitHub (zhangzhongbo2213/Attention-DP3).
Le travail s'attaque à une faiblesse connue des politiques de diffusion 3D: un nuage de points reste ambigu dès qu'un objet est partiellement occlus ou mêlé à des distracteurs visuellement proches, une situation courante en bin picking ou en kitting industriel, loin des scènes épurées des démonstrations académiques. Pour les équipes déjà construites autour de DP3, l'intérêt tient au fait que le gain de robustesse provient d'un module ajouté en amont, sans changer le backbone ni exiger de données d'entraînement supplémentaires, ce qui en ferait une mise à niveau relativement peu coûteuse. Le résultat nuance aussi le narratif dominant autour des modèles VLA en image 2D comme Pi-0 ou GR00T N2, en montrant qu'un ancrage géométrique explicite peut traiter une partie du problème de généralisation en environnement encombré, plutôt que la seule mise à l'échelle des données. La validation reste toutefois académique, limitée à trois simulateurs et un seul bras réel low-cost, sans déploiement industriel annoncé.
DP3 s'est imposé ces dernières années comme une base de référence pour l'apprentissage de politiques visuomotrices à partir de nuages de points, en parallèle des modèles VLA fondés sur l'image RGB comme Pi-0, GR00T N2 ou Helix, qui concentrent l'essentiel de l'attention médiatique dans la course humanoïde. Attention-DP3 s'inscrit dans une lignée de travaux cherchant à combler l'écart entre la richesse sémantique de la perception 2D et la pauvreté contextuelle de la géométrie 3D brute, en s'appuyant sur la segmentation ouverte pour ancrer les priors géométriques. Aucun partenaire industriel ni pilote commercial n'est annoncé: les auteurs se limitent à publier le code sur GitHub, laissant aux équipes de recherche et aux intégrateurs le soin de reproduire les résultats et de les valider sur d'autres plateformes que le bras SO101 utilisé pour la démonstration réelle.
Dans nos dossiers




