Aller au contenu principal
PROBE : questions-réponses visuelles ancrées dans la manipulation avec des agents VLM
RecherchearXiv cs.RO 

PROBE : questions-réponses visuelles ancrées dans la manipulation avec des agents VLM

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Publié le 19 août 2026 sur arXiv (2608.17129), le framework PROBE évalue et entraîne des VLM capables de manipuler des objets pour répondre à des questions visuelles, une tâche formalisée sous le nom de Manipulation-Grounded Visual Question Answering (MG-VQA). Les auteurs construisent PROBE-Sim, un simulateur de table avec objets du quotidien et un bras doté d'outils de préhension et de poussée, puis PROBE-Bench : 150 tâches en six types de questions sur des scènes encombrées, où les méthodes agentiques à base d'outils battent la perception seule de 8,0% en moyenne. Le finetuning PROBE-Agent, qui distille les trajectoires d'un grand modèle enseignant vers un modèle open-weight plus petit, porte ce gain à 11,5%, avec généralisation à des objets inédits et une première validation sim-to-real sur table réelle.

Ce travail pointe une limite peu documentée des VLM actuels : performants en ancrage 2D et raisonnement spatial sur des scènes statiques, ils peinent dès qu'une action de manipulation modifie la scène à interpréter. Pour les concepteurs de modèles vision-language-action et les intégrateurs de robotique de service, cela suggère que le reality gap ne se limite pas au contrôle moteur mais touche aussi le raisonnement visuel, longtemps jugé résolu par des benchmarks statiques. Les gains chiffrés restent des moyennes internes sur des tâches hétérogènes et valent comme signal directionnel plutôt que comme mesure absolue ; ils indiquent néanmoins qu'une brique de raisonnement dynamique manipulation-perception se rapproche, condition préalable à des robots d'assistance à domicile ou d'inventaire en entrepôt capables de gérer du désordre réel.

PROBE s'inscrit dans la continuité des travaux combinant VLM et usage agentique d'outils, actif depuis que ces modèles ont démontré de solides capacités de planification sur des scènes fixes. Il s'agit d'une contribution académique publiée sur arXiv, évaluée majoritairement dans PROBE-Sim, avec une validation réelle limitée à des environnements de table contrôlés plutôt qu'à un déploiement domestique effectif. Le choix de distiller un grand modèle enseignant vers un modèle open-weight plus petit suit une pratique courante en robotique, où le coût d'inférence embarqué pousse à compresser des modèles de fondation volumineux, sans calendrier de déploiement ni partenaire industriel annoncé.

Dans nos dossiers

À lire aussi

ProcVLM : un modèle VLA apprenant des récompenses de progression ancrées dans les procédures pour la manipulation robotique
1arXiv cs.RO 

ProcVLM : un modèle VLA apprenant des récompenses de progression ancrées dans les procédures pour la manipulation robotique

Une équipe de recherche a publié en mai 2026 sur arXiv (référence 2605.08774) ProcVLM, un modèle vision-langage conçu pour générer des signaux de récompense denses dans les tâches de manipulation robotique à longue durée. Contrairement aux approches existantes qui s'appuient sur des étiquettes de succès en fin de trajectoire ou sur une interpolation temporelle, ProcVLM ancre son estimation de progression dans la structure procédurale de la tâche et dans les changements visuels au sein de chaque sous-étape. Le modèle adopte un paradigme "raisonner avant d'estimer" : il infère d'abord les actions atomiques restantes avant de chiffrer l'avancement global. Pour l'entraîner à grande échelle, les auteurs ont constitué ProcCorpus-60M, un corpus de 60 millions de trames annotées issues de 30 jeux de données embodied, dont est dérivé ProcVQA, un benchmark couvrant l'estimation de progression, la segmentation d'actions et la planification prospective. L'enjeu est direct pour les intégrateurs et les équipes travaillant sur la manipulation longue durée, comme l'assemblage multi-étapes, le conditionnement ou la maintenance industrielle. Les modèles de récompense classiques, en confondant temps écoulé et progression réelle, sont incapables de détecter stagnation, étapes manquées ou états d'échec intermédiaires. ProcVLM produit des estimations discriminantes intra-trajectoire, ce qui en fait un composant plus utile pour la policy optimization guidée par récompense. Les expériences publiées montrent des gains mesurés sur ProcVQA et sur des benchmarks de modèles de récompense face aux baselines représentatives. Ces résultats restent néanmoins dans le cadre de la simulation et de l'évaluation hors-ligne : aucun déploiement sur robot physique n'est annoncé. Ce travail s'inscrit dans une tendance de fond visant à améliorer la qualité des signaux de supervision pour les modèles vision-langage-action (VLA), un chantier central depuis la publication de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA. Le problème du reward shaping dans les tâches manipulatoires longues est un verrou bien identifié : le sim-to-real gap se double d'un gap supervision-comportement quand les étiquettes de succès sont trop parcimonieuses. ProcVLM propose une réponse méthodologique à ce second verrou via un corpus de supervision synthétique à 60 millions de trames, mais demeure à ce stade un preprint académique sans validation sur hardware réel annoncée. La page projet (procvlm.github.io) est en ligne, sans date de release du code ou des données précisée.

RechercheOpinion
1 source
Prompt visuel pour la manipulation robotique : prise-et-dépose guidée par annotations avec ACT
2arXiv cs.RO 

Prompt visuel pour la manipulation robotique : prise-et-dépose guidée par annotations avec ACT

Un article publié sur arXiv (2508.08748v2, version révisée) décrit un pipeline de perception-action pour des tâches de préhension et de dépose en magasin de proximité, environnement marqué par une forte densité d'objets, des occlusions fréquentes et une grande variabilité de couleur, forme, taille et texture. La méthode repose sur un prompting visuel guidé par annotation : des boîtes englobantes désignent à la fois les objets saisissables et les emplacements de dépose, offrant un guidage spatial structuré au bras robotique. Plutôt qu'une planification de trajectoire classique étape par étape, les auteurs emploient Action Chunking with Transformers (ACT), un algorithme d'apprentissage par imitation qui prédit des séquences d'actions groupées à partir de démonstrations humaines. Le système est évalué sur le taux de réussite des prises et une analyse visuelle du comportement de préhension, sans que le résumé ne publie de chiffres précis. Cette approche cible un verrou concret de la manipulation en environnement non structuré : la planification classique peine face au désordre et aux occlusions typiques d'un rayon de magasin, tandis que les modèles vision-langage-action massifs restent coûteux à entraîner et à déployer. Combiner un guidage visuel léger, par simples boîtes englobantes, avec une politique d'imitation entraînée par chunks d'actions offre une alternative peu gourmande en données pour des intégrateurs visant l'automatisation du picking en retail, sans reconstruction 3D complète de la scène ni lourd transfert sim-to-real. Pour des décideurs B2B, l'intérêt reste surtout méthodologique : l'absence de métriques chiffrées dans le résumé invite à la prudence avant d'en tirer des conclusions de performance industrielle. ACT, brique centrale de l'étude, a été introduite par le projet ALOHA de Stanford pour la manipulation bimanuelle fine à partir de démonstrations téléopérées à bas coût matériel, et s'est depuis imposée comme méthode de référence en apprentissage par imitation, aux côtés d'approches plus généralistes comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure. Contrairement à ces modèles fondation multi-tâches, l'étude reste circonscrite à un pipeline spécialisé pick-and-place, sans nom de robot, de fabricant ni de site de déploiement mentionné : il s'agit d'une contribution de recherche publiée en preprint, non d'un produit commercialisé ni d'un pilote industriel annoncé, et aucune date de déploiement réel n'est précisée.

RecherchePaper
1 source
ReMoBot : apprentissage par imitation en quelques exemples pour la manipulation mobile avec des modèles fondation visuels
3arXiv cs.RO 

ReMoBot : apprentissage par imitation en quelques exemples pour la manipulation mobile avec des modèles fondation visuels

Des chercheurs ont publié ReMoBot (arXiv:2408.15919v4), un framework d'apprentissage par imitation à peu d'exemples conçu pour la manipulation mobile sur robots à vision égocentrique. Évalué sur un Boston Dynamics Spot, le système atteint des taux de succès de 70 % sur la tâche "Table Uncover" et 80 % sur "Gap Cover" en environnement réel, avec seulement 20 démonstrations par tâche. Plutôt que de distiller les démonstrations dans une politique paramétrique classique, ReMoBot adopte une stratégie de récupération : à l'inférence, il identifie dans une base de démonstrations d'experts les séquences les plus pertinentes via une combinaison de similarité d'état, d'alignement temporel des trajectoires et de cohérence des séquences d'actions, puis sélectionne directement les commandes motrices sans aucun entraînement supplémentaire. L'ensemble s'appuie sur des vision foundation models pour extraire des représentations robustes depuis la caméra embarquée du robot, en fonctionnement totalement training-free à l'exécution. L'approche retrieval-based présente deux avantages concrets pour les intégrateurs industriels. D'abord, le coût de collecte de données est drastiquement réduit : 20 démonstrations contre plusieurs centaines requises par les méthodes IL standard (ACT, Diffusion Policy), ce qui accélère le déploiement sur de nouvelles tâches ou variantes. Ensuite, l'absence d'entraînement à l'inférence supprime le risque de surapprentissage sur données insuffisantes, problème récurrent avec les objets déformables où la variabilité des états est élevée. ReMoBot surpasse deux baselines entraînées directement sur données réelles sans transfert sim-to-réel sur deux tâches sur trois. La tâche "Curtain Open" reste problématique, signalant que la manipulation d'objets hautement déformables sous occultations partielles constitue encore un verrou non résolu, y compris pour les approches retrieval. ReMoBot s'inscrit dans la tendance à exploiter les vision foundation models (de la famille DINOv2, CLIP, SAM) pour réduire la dépendance aux données propriétaires et améliorer la généralisation. Sur le Spot de Boston Dynamics, plateforme quadrupède commerciale, la manipulation mobile reste un défi structurel : le robot se déplace en même temps qu'il manipule, rendant l'observation égocentrique partielle et bruitée. Face aux VLA de grande taille comme pi-0 (Physical Intelligence) ou RT-2 (Google DeepMind), qui exigent des volumes de données considérables et une infrastructure d'entraînement lourde, ReMoBot se positionne dans le segment "data-efficient, training-free" particulièrement pertinent pour les intégrateurs ou PME industrielles sans capacité de collecte à grande échelle. La prochaine étape logique serait d'enrichir dynamiquement la base de démonstrations et de valider l'approche dans des environnements industriels hors laboratoire contrôlé.

UELes PME et intégrateurs robotiques européens sans capacité de collecte de données à grande échelle pourraient bénéficier directement de cette approche data-efficient (20 démos vs plusieurs centaines), réduisant la barrière d'entrée au déploiement de manipulation mobile intelligente.

RecherchePaper
1 source
CORE : régularités communes issues de démonstrations visuelles sans actions pour la manipulation robotique
4arXiv cs.RO 

CORE : régularités communes issues de démonstrations visuelles sans actions pour la manipulation robotique

Des chercheurs ont publié fin juin 2026 CORE (Common Outcome Regularities from Action-Free Visual Demonstrations), un cadre d'apprentissage de politique robotique conçu pour exploiter des vidéos humaines sans annotations de mouvements, afin d'entraîner des robots manipulateurs. La méthode s'appuie sur une observation clé : bien que les trajectoires menant à une même tâche varient, leurs états terminaux partagent des configurations d'objets stables, des relations spatiales et des contraintes de contact reproductibles. CORE entraîne d'abord un encodeur d'état terminal par apprentissage contrastif et objectifs temporels auxiliaires, agrège ensuite les embeddings terminaux réussis en prototypes visuels de but (visual goal prototypes), puis injecte ces prototypes comme conditions globales dans la politique de contrôle du robot. Les gains de taux de succès mesurés sur les benchmarks de référence sont de +3,9 points de pourcentage sur Meta-World, +11,1 pp sur RoboTwin 2.0, et jusqu'à +17,0 pp en manipulation réelle. L'enjeu est direct pour les intégrateurs : collecter des démonstrations robotiques est coûteux en équipement, en opérateurs et en temps de setup, tandis que des millions d'heures de vidéos humaines d'assemblage, de logistique ou de cuisine existent déjà. L'écart morphologique entre la main humaine et un préhenseur robotique a jusqu'ici rendu ces vidéos inutilisables pour l'apprentissage par imitation direct. CORE contourne le problème en ne cherchant pas à transférer les actions elles-mêmes, mais uniquement les régularités des états finaux. Le gain de +17 pp en conditions réelles est particulièrement notable car il indique une réduction du fossé sim-to-real sans contrainte sur la morphologie du robot. En surpassant les variantes conditionnées par texte (architecture VLA classique), CORE suggère que les prototypes visuels de but apportent des contraintes géométriques et physiques plus exploitables que les instructions en langage naturel, une nuance importante pour la calibration de politiques multi-tâches. L'apprentissage par imitation depuis des vidéos humaines est un axe de recherche actif, porté notamment par Google DeepMind avec RT-2, Physical Intelligence avec pi-0, et Meta FAIR. Des méthodes comme R3M ou VIP apprennent des représentations visuelles transférables depuis des vidéos humaines, mais CORE cible spécifiquement les états terminaux plutôt que les représentations d'observation générales, ce qui constitue sa distinction architecturale principale. Les benchmarks retenus, Meta-World et RoboTwin 2.0, sont reconnus sans être universellement adoptés, ce qui limite les comparaisons directes avec les résultats concurrents. Aucun partenariat industriel ni déploiement commercial n'est mentionné : il s'agit d'un preprint arXiv, dont les suites dépendront de réplications indépendantes et d'extensions vers des tâches plus complexes, notamment la manipulation en chaîne longue ou en environnements non structurés.

RechercheOpinion
1 source