Spotter : le modèle incarné mène, le VLM réfléchit pour lui
Des chercheurs proposent Spotter, un cadre logiciel qui donne à un modèle incarné (une politique VLA pilotant un robot) la capacité de corriger ses propres échecs grâce à un modèle vision-langage (VLM) qui tourne en parallèle. Les auteurs ont d'abord testé si les modèles actuels savent réparer une erreur connue. Arrêtés au moment d'un échec et autorisés à réessayer, ils y parviennent rarement, que ce soit par leur aléa interne ou à partir d'une description textuelle de l'erreur. La sélection « best-of-N » ne permet pas non plus d'identifier la bonne tentative après un échec. Avec GPT comme VLM, Spotter améliore Cosmos Policy de 5,6 points et π0.5 de 7,5 points sur le benchmark RoboCasa. Sur la configuration Hard de RoboTwin 2.0, π0.5 passe de 47,2 % à 57,0 %. Sur un robot réel, le taux de réussite grimpe de 53 % à 83 %. Le système a aussi été testé avec Qwen, avec des gains similaires selon les auteurs. Le code est publié sur GitHub.
L'intérêt tient à l'architecture. Les approches existantes confient au VLM la planification de chaque étape, le modèle incarné n'étant qu'un outil appelé à la demande. Le VLM se retrouve alors sur le chemin critique, ce qui ajoute de la latence à chaque action. Spotter inverse les rôles : la politique motrice s'exécute en continu, un filtre local léger surveille le déroulement, et le VLM n'intervient que lorsqu'une erreur est détectée. Il l'analyse, propose une correction, puis rend la main. Avec Qwen, un épisode réussi n'est ralenti que de 13 à 16 secondes par rapport à la politique seule, et dddure environ 70 % de moins qu'avec une base de référence pilotée par le VLM, à modèle identique. Pour un intégrateur, c'est un argument concret : la robustesse par raisonnement de haut niveau devient compatible avec des contraintes de temps de cycle. Les résultats contredisent aussi l'idée que l'aléa ou le simple retour textuel suffisent à récupérer d'un échec.
Le contexte est celui de politiques comme π0.5 (Physical Intelligence) ou Cosmos Policy (NVIDIA), entraînées presque uniquement sur des démonstrations réussies. Les auteurs y voient la cause de leur incapacité à se corriger : elles n'ont jamais vu d'échec, et leurs entrées sont trop étroites pour montrer ce qui a mal tourné. Des précautions s'imposent. Il s'agit d'un préprint (arXiv, v1), non relu par des pairs. Les gains les plus nets viennent de GPT, un modèle propriétaire, ce qui soulève des questions de coût et de dépendance au cloud. Le résultat sur robot réel, plus marqué que ceux des simulations, ne précise pas dans le résumé le nombre d'essais ni les tâches. Les suites logiques sont des validations sur davantage de tâches et de plateformes, et une intégration dans les piles VLA industrielles. Aucun acteur français ou européen n'est mentionné dans ce travail.
Dans nos dossiers



