Co-évolution d'orchestrateurs de robots et de politiques grâce au déploiement
Des chercheurs proposent Robo-COP, un cadre où un orchestrateur de robot (un modèle vision-langage, ou VLM, qui décide quand appeler la politique, comment la guider par instructions et quand lui préférer des compétences scriptées) et la politique VLA (vision-language-action) qu'il pilote évoluent ensemble pendant le déploiement. Le système extrait des démonstrations de compétences à partir de ses propres exécutions, affine la politique lorsque ces données répondent à des échecs récurrents, et n'adopte la nouvelle version qu'après avoir vérifié qu'elle améliore les compétences pour lesquelles elle a été entraînée. Sur dix tâches simulées RoboLab, le succès moyen sur tâches tenues à l'écart passe de 64,8 % à 73,8 % par rapport au même dispositif avec une politique figée. Un affinage à calendrier fixe, sans vérification, plafonne à 65,8 %. Sur trois tâches réelles, le succès grimpe de 38,3 % à 50,0 %. Les vidéos et le code sont publiés sur robo-cop.pages.dev (travail de recherche, arXiv 2610.09228).
L'intérêt tient à un goulot d'étranglement connu des systèmes robotiques « agentiques ». Quand l'orchestrateur est bâti autour d'une politique figée, peu pilotable par le langage, il apprend à contourner ses échecs sans jamais les corriger : la politique plafonne les performances de l'ensemble. Affiner la politique seule ne règle rien, car elle se désaccorde alors d'un orchestrateur calibré sur son ancien comportement. Les résultats donnent un ordre de grandeur utile : la vérification avant adoption pèse autant que l'affinage lui-même, puisque l'affinage aveugle n'apporte qu'un point (65,8 % contre 64,8 %), alors que la version contrôlée en apporte neuf. Pour un intégrateur, cela plaide pour traiter les données de production comme un actif d'apprentissage, à condition de disposer d'un garde-fou de non-régression avant toute mise à jour sur le terrain.
Il faut toutefois lire ces chiffres avec prudence. Le gain réel (+11,7 points) repose sur seulement trois tâches, et un taux de 50 % reste très éloigné d'un seuil industriel. Les auteurs ne précisent pas, dans le résumé, le nombre d'essais, la nature des robots ni le coût en données et en calcul. Ce travail s'inscrit dans la montée des architectures où un VLM supervise une politique VLA généraliste, après la vague de modèles comme Pi-0 ou GR00T, dont la généralisation hors domaine d'entraînement reste le point faible en déploiement. La suite logique serait un test sur des flottes réelles, sur la durée, et face à d'autres approches d'apprentissage continu. Aucun pilote commercial ni calendrier n'est annoncé : il s'agit à ce stade d'une démonstration académique.
Dans nos dossiers




