RoboMP-DINOv2 : des prompts, pas des filtres, pour une manipulation robotique robuste
Des chercheurs ont publié le 23 septembre 2026 sur arXiv (2609.25506) « RoboMP-DINOv2 : Prompts, Not Filters for Robust Robot Manipulation », une méthode d'encodage visuel pour les politiques de manipulation robotique. RoboMP-DINOv2 traite les masques de segmentation comme des prompts spatiaux injectés dans le traitement, plutôt que comme des filtres supprimant l'arrière-plan : le modèle extrait des features denses via DINOv2 sur l'observation complète, ajoute des embeddings spécifiques à la région aux emplacements masqués, puis contextualise conjointement tokens promptes et non promptes pour prédire l'action. Une variante, RoboMP-DINOv2-MCR, ajoute une randomisation de couleur des régions masquées pour renforcer la robustesse à l'apparence. Sur sept environnements de manipulation simulés, le modèle atteint 60,7% de réussite sous décalages spatiaux et 59,7% sous encombrement de scène, contre 50,7% et 41,0% pour une Diffusion Policy basée sur DINOv2. Face à des couleurs d'objets inédites, la variante MCR atteint 72,5% de réussite contre 35,1% pour le meilleur concurrent entraîné avec randomisation de couleur. Le code est publié en open source sur GitHub.
Ces résultats répondent à un problème concret pour qui déploie des politiques de manipulation hors laboratoire : les encodeurs de vision généralistes ne sont pas conçus pour le contrôle visuomoteur, tandis que les approches object-centric classiques, qui masquent tout sauf l'objet cible, suppriment le contexte de scène parfois nécessaire à l'action. En montrant qu'un encodeur full-scene guidé par prompts spatiaux surpasse à la fois un backbone générique et les filtres par segmentation sur position, encombrement et couleur, l'étude nuance l'idée reçue selon laquelle la robustesse visuelle passe par l'exclusion d'information. Pour les intégrateurs qui construisent des piles de perception au-dessus de politiques VLA, c'est un signal que le choix de l'encodeur visuel pèse autant que l'architecture de la politique elle-même. Ces gains restent toutefois mesurés uniquement en simulation, sans validation sur robot physique ni comparaison directe à des VLA à grande échelle comme GR00T N2 ou Pi-0.
Le travail s'inscrit dans la lignée des politiques de manipulation par imitation construites sur des backbones de vision pré-entraînés, DINOv2 de Meta étant devenu un choix courant en recherche robotique, et prend la Diffusion Policy comme référence de comparaison directe. Il se positionne entre deux familles d'approches existantes, les encodeurs génériques non spécialisés pour le contrôle et les méthodes object-centric à filtrage dur par masque de segmentation. Le code est disponible sur le dépôt GitHub han20192019/RoboMP_DINOv2, ouvrant la voie à des tests sur robot réel et à une intégration dans des piles de politiques plus larges, sans calendrier ni partenaire industriel annoncés pour cette suite.
Dans nos dossiers




