Aller au contenu principal
RecherchearXiv cs.RO 

RoboMP-DINOv2 : des prompts, pas des filtres, pour une manipulation robotique robuste

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié le 23 septembre 2026 sur arXiv (2609.25506) « RoboMP-DINOv2 : Prompts, Not Filters for Robust Robot Manipulation », une méthode d'encodage visuel pour les politiques de manipulation robotique. RoboMP-DINOv2 traite les masques de segmentation comme des prompts spatiaux injectés dans le traitement, plutôt que comme des filtres supprimant l'arrière-plan : le modèle extrait des features denses via DINOv2 sur l'observation complète, ajoute des embeddings spécifiques à la région aux emplacements masqués, puis contextualise conjointement tokens promptes et non promptes pour prédire l'action. Une variante, RoboMP-DINOv2-MCR, ajoute une randomisation de couleur des régions masquées pour renforcer la robustesse à l'apparence. Sur sept environnements de manipulation simulés, le modèle atteint 60,7% de réussite sous décalages spatiaux et 59,7% sous encombrement de scène, contre 50,7% et 41,0% pour une Diffusion Policy basée sur DINOv2. Face à des couleurs d'objets inédites, la variante MCR atteint 72,5% de réussite contre 35,1% pour le meilleur concurrent entraîné avec randomisation de couleur. Le code est publié en open source sur GitHub.

Ces résultats répondent à un problème concret pour qui déploie des politiques de manipulation hors laboratoire : les encodeurs de vision généralistes ne sont pas conçus pour le contrôle visuomoteur, tandis que les approches object-centric classiques, qui masquent tout sauf l'objet cible, suppriment le contexte de scène parfois nécessaire à l'action. En montrant qu'un encodeur full-scene guidé par prompts spatiaux surpasse à la fois un backbone générique et les filtres par segmentation sur position, encombrement et couleur, l'étude nuance l'idée reçue selon laquelle la robustesse visuelle passe par l'exclusion d'information. Pour les intégrateurs qui construisent des piles de perception au-dessus de politiques VLA, c'est un signal que le choix de l'encodeur visuel pèse autant que l'architecture de la politique elle-même. Ces gains restent toutefois mesurés uniquement en simulation, sans validation sur robot physique ni comparaison directe à des VLA à grande échelle comme GR00T N2 ou Pi-0.

Le travail s'inscrit dans la lignée des politiques de manipulation par imitation construites sur des backbones de vision pré-entraînés, DINOv2 de Meta étant devenu un choix courant en recherche robotique, et prend la Diffusion Policy comme référence de comparaison directe. Il se positionne entre deux familles d'approches existantes, les encodeurs génériques non spécialisés pour le contrôle et les méthodes object-centric à filtrage dur par masque de segmentation. Le code est disponible sur le dépôt GitHub han20192019/RoboMP_DINOv2, ouvrant la voie à des tests sur robot réel et à une intégration dans des piles de politiques plus larges, sans calendrier ni partenaire industriel annoncés pour cette suite.

À lire aussi

Modèles du monde pour la manipulation robotique
1arXiv cs.RO 

Modèles du monde pour la manipulation robotique

Des chercheurs ont publié en juin 2026 sur arXiv (2606.24742) un modèle généraliste de valeur pour la manipulation robotique, le WVM (World Value Model). La proposition centrale consiste à substituer les backbones VLM (Vision-Language Model) habituellement utilisés par un modèle de monde, nativement mieux adapté à la modélisation temporelle nécessaire pour évaluer la progression d'une tâche. Sur les benchmarks standards, WVM atteint les meilleures performances connues en Value-Order Correlation (VOC), la métrique de référence pour les modèles de valeur robotiques. L'équipe introduit également Suboptimal-Value-Bench, un benchmark multi-embodiment composé de 800 trajectoires sous-optimales annotées frame par frame par des humains, comblant un angle mort des évaluations existantes qui ne contenaient que des données expertes. L'enjeu est directement opérationnel pour quiconque entraîne des systèmes de manipulation à grande échelle : les données collectées en conditions réelles sont rarement uniformément expertes. Un modèle de valeur précis permet de pondérer ou filtrer ces trajectoires hétérogènes, améliorant la qualité de l'entraînement sans nettoyage manuel coûteux. WVM démontre des gains de performance sur plusieurs approches d'extraction de politique, en simulation comme en déploiement réel, ce qui renforce la thèse que l'estimation de valeur est un composant orthogonal et complémentaire au choix d'architecture de politique. La robustesse maintenue sur données sous-optimales est l'aspect le plus significatif : c'est précisément dans ce régime que les VLMs classiques décrochent, leurs préentraînements sur observations visuelles statiques ne suffisant pas à capturer les dynamiques temporelles longues. La montée en puissance des VLA comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA a rendu critique la question de la qualité des données d'entraînement à grande échelle. L'approche WVM s'inscrit dans une tendance émergente qui consiste à spécialiser les composants : un backbone temporel dédié pour l'évaluation de la valeur, distinct du modèle d'action. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans cet article purement académique. Les prochaines étapes naturelles incluent l'intégration du WVM dans des pipelines d'imitation à grande échelle ou en combinaison avec du reinforcement learning offline (IQL, CQL), et une extension à des environnements multi-tâches plus complexes.

RechercheOpinion
1 source
Agir en mètres : apprentissage des interactions métriques pour une manipulation robotique précise
2arXiv cs.RO 

Agir en mètres : apprentissage des interactions métriques pour une manipulation robotique précise

Des chercheurs publient sur arXiv (article 2609.18243, soumis en septembre 2026) un nouveau cadre baptisé "metric interaction framework", conçu pour améliorer la précision des modèles de manipulation robotique conditionnés par le langage, qu'il s'agisse de Vision-Language-Action models (VLA) ou de World-Action Models (WAM). Le système repose sur deux composants : les Interaction-Centric Tokens (ICT), qui représentent explicitement la trajectoire de pose de l'effecteur terminal par rapport aux objets manipulés et sont débruités conjointement avec les actions, et le Metric Action Interaction Field (MAIF), qui fait attention aux caractéristiques métriques du nuage de points de la scène pour générer des corrections d'action conditionnées par la géométrie. Ajouté à des modèles VLA et WAM existants via une adaptation en deux étapes, avec peu de paramètres et d'étapes d'entraînement supplémentaires, le framework produit des gains de taux de réussite de 0,80 point sur le benchmark LIBERO, 3,59 points sur RoboTwin 2.0, 6,80 points sur des tâches réelles et 7,45 points sur leurs variantes hors distribution. Ce travail s'attaque à un angle mort récurrent des VLA actuels : ces modèles excellent souvent à comprendre sémantiquement une consigne mais laissent implicites les relations métriques précises entre le geste, l'objet et la géométrie de la scène, ce qui limite leur fiabilité dès que la configuration spatiale change. En ancrant explicitement les actions dans un espace cartésien partagé à l'échelle métrique, les auteurs cherchent à combler l'écart entre démonstration en environnement contrôlé et robustesse en conditions réelles, un point sensible pour les intégrateurs industriels qui reprochent aux VLA génériques leur fragilité hors distribution. Le fait que la méthode s'ajoute, sans refonte lourde, à des baselines existantes en fait potentiellement un module d'amélioration incrémentale plutôt qu'une architecture concurrente, ce qui est notable dans un secteur où chaque nouveau papier revendique une rupture complète. Le papier s'inscrit dans la lignée des travaux cherchant à doter les modèles de manipulation robotique d'un raisonnement spatial plus explicite, en réponse aux limites documentées des architectures VLA purement sémantiques face à des tâches exigeant du contact précis avec des objets. Les résultats restent validés sur des benchmarks de simulation standards (LIBERO, RoboTwin 2.0) et un nombre limité de tâches réelles, sans indication de partenaire industriel, de déploiement commercial ni de calendrier de suite ; il s'agit à ce stade d'une contribution académique destinée à être reprise et testée par d'autres équipes de recherche en robotique manipulative.

RecherchePaper
1 source
Relier sémantique et physique : des LLM contraints pour une manipulation robotique sûre et fiable
3arXiv cs.RO 

Relier sémantique et physique : des LLM contraints pour une manipulation robotique sûre et fiable

Des chercheurs présentent un système qui relie raisonnement en langage naturel et exécution physique sûre pour la manipulation robotique, décrit dans un article publié le 29 août 2026 sur arXiv (2608.29379v1). Le pipeline part d'observations RGB-D pour construire un modèle de scène explicite tenant compte des collisions, puis contraint les décisions d'un grand modèle de langage via des appels d'outils validés par schéma selon le Model Context Protocol (MCP), rejetant les commandes mal formées avant qu'elles n'atteignent le robot. Chaque appel validé est ensuite traduit de façon déterministe dans un pipeline MoveIt Task Constructor, où les mouvements candidats sont vérifiés contre la scène reconstruite avant exécution, une étape de type "vérifier puis agir". Testé sur un bras robotique physique UFactory 850, le système atteint jusqu'à 80% de réussite sur dix essais par tâche pour des opérations de versement impliquant liquides, matières granulaires et solides discrets, et 90% de réussite sur une tâche de saisie-et-dépose avec la même architecture. L'intérêt de ces travaux tient à la démonstration chiffrée d'un problème bien identifié dans la robotique pilotée par LLM: un plan verbalement cohérent peut être physiquement infaisable si la cinématique et les collisions ne sont pas vérifiées avant exécution. Les auteurs montrent qu'une politique scriptée classique surpasse légèrement leur méthode sur la tâche la plus simple, mais chute à seulement 10% de réussite sur la tâche la plus difficile, contre 60% pour leur approche contrainte. Pour les intégrateurs industriels et les équipes robotique, ce résultat suggère qu'ajouter une couche de validation formelle entre le langage et l'action améliore surtout la robustesse sur les cas complexes, plutôt que la performance brute sur les cas faciles où des solutions scriptées suffisent déjà. Ce travail s'inscrit dans la lignée des recherches sur le "language-action gap", l'écart entre la capacité des LLM à décomposer des instructions en séquences d'actions et leur incapacité native à garantir la faisabilité physique de ces actions dans un environnement encombré et perçu de façon imparfaite. La solution proposée combine plusieurs briques existantes, le MCP pour la validation structurée des appels d'outils côté langage, et MoveIt Task Constructor pour la planification de mouvement sous contraintes cinématiques et de collision côté robot, plutôt que d'introduire une nouvelle architecture de bout en bout. Les tests restent limités à un seul bras robotique et un nombre réduit d'essais par tâche, ce qui invite à la prudence avant toute extrapolation vers des déploiements industriels à plus grande échelle.

RecherchePaper
1 source
LIFD : diffusion ancrée pour une mémoire de scène 3D dans la manipulation robotique
4arXiv cs.RO 

LIFD : diffusion ancrée pour une mémoire de scène 3D dans la manipulation robotique

Un article de recherche publié sur arXiv (arXiv:2609.19796v1) présente LIFD (Look, Imagine, Focus, and Do), un système de mémoire de scène tridimensionnelle persistante destiné à la manipulation robotique en conditions d'observabilité partielle, c'est-à-dire lorsque des zones vues par le robot sortent du champ de la caméra à mesure qu'il ou la scène se déplace. Le système apprend une représentation en tokens de scène à partir d'un accord multi-vues, puis la complète en déploiement à partir d'une seule image RGB et d'une mémoire récurrente, grâce à un modèle de rectified-flow combiné à un mécanisme d'attention croisée guidée par des ancrages géométriques. Sur les bancs d'essai de simulation LIBERO et MetaWorld, la version dite "Staged" de LIFD atteint respectivement 91,6% et 79,8% de taux de réussite moyen, avec un gain de 3,1 points de pourcentage sur LIBERO par rapport à un entraînement joint classique. Sur un bras robotique réel UR5e, testé sur quatre familles de tâches avec seulement dix démonstrations par famille, LIFD obtient 56,0% de réussite moyenne contre 40,5% pour OpenVLA-7B, un modèle vision-langage-action de référence dans le secteur. Ce résultat s'attaque à une limite connue des politiques de manipulation actuelles: la plupart des architectures VLA raisonnent sur la vue courante et perdent la trace des objets ou surfaces qui sortent du cadre, ce qui fragilise les tâches nécessitant de se souvenir d'un état antérieur de la scène. En montrant qu'une mémoire de scène compacte peut être inférée à partir d'une unique caméra RGB et de la proprioception au moment du déploiement, sans capteurs multi-vues ni LIDAR embarqués, LIFD répond à une contrainte très concrète pour les intégrateurs: le coût et la complexité du capteur. L'écart de performance avec OpenVLA-7B en régime few-shot (dix démonstrations) est aussi un signal pour les décideurs B2B, car il suggère qu'une mémoire spatiale explicite peut compenser en partie le besoin de données massives, un frein habituel à l'adoption des VLA en environnement industriel réel. Sur le plan méthodologique, LIFD s'appuie sur un entraînement en deux temps: une phase de représentation supervisée par des signaux multi-vues et géométriques, suivie d'une politique de manipulation reliée à cette représentation via des "slot features" compactes. Les auteurs comparent explicitement deux régimes d'entraînement, "Staged" et "Joint", le premier se révélant supérieur, et positionnent leur approche face à OpenVLA-7B comme référence VLA open-source établie. Il s'agit à ce stade d'un travail de recherche publié en preprint, validé sur des simulateurs standards du domaine (LIBERO, MetaWorld) et un unique bras collaboratif UR5e en laboratoire, sans annonce de pilote industriel ni de calendrier de déploiement à plus grande échelle.

RecherchePaper
1 source