Robo-Harness K1 : maîtriser les agents d'utilisation robotique par augmentation de perception
Des chercheurs présentent Robo-Harness K1, un framework qui transforme la perception 3D en outils interrogeables par un modèle vision-langage (VLM) plutôt que de la réentraîner dans son architecture : profondeur calibrée, ancrages visuels persistants, mesures spatiales et hypothèses de préhension, à partir desquels l'agent sélectionne des mouvements génériques. Sur le benchmark LIBERO-PRO, Gemini 3.7 Flash équipé de K1 atteint 77,8% de réussite contre 61,1% pour GPT-6 Astra en harnais RGB seul, et K1 porte ce dernier à 88,9%. Sans réglage fin, Gemini plus K1 se transfère à trois bras RoboSuite et à des tâches bi-bras RoboTwin, avec 32,0% de réussite sur les tâches faciles et 28,0% sur les difficiles. Entraîné sur seulement 107 épisodes de démonstration issus de l'agent enseignant, un modèle étudiant Qwen3.5-9B atteint 44,2% sur de nouveaux états initiaux et 13,9% sur des conditions inédites, contre respectivement 30,2% et 0% pour OpenVLA.
Le résultat cible une limite connue des modèles vision-langage-action : les VLA de bout en bout exigent d'importants volumes de démonstrations et peuvent dégrader la compréhension acquise au pré-entraînement, tandis qu'un pilotage RGB seul du VLM reste coûteux et dépend de ses capacités brutes. En traitant la géométrie comme une interface d'outils plutôt qu'un module à réentraîner, K1 suggère une voie plus économe en données pour rendre des VLM génériques exploitables en manipulation, un enjeu pour les intégrateurs confrontés à la collecte de démonstrations. L'écart entre 0% pour OpenVLA et 13,9% pour le modèle distillé sur des tâches jamais vues illustre les limites de généralisation de l'apprentissage par pure imitation. Ces scores restent toutefois issus de simulateurs, LIBERO-PRO, RoboSuite et RoboTwin, et non d'un robot physique, laissant ouverte la question du transfert réel.
Le travail se positionne entre deux approches dominantes, les VLA de bout en bout et le pilotage RGB direct de VLM, en gardant le modèle figé et en lui fournissant des outils de perception calibrés, une conception comparée à OpenVLA, référence ouverte de la recherche en apprentissage robotique. Publiée comme nouvelle soumission sur arXiv, la contribution reste académique, sans partenariat industriel ni calendrier de déploiement annoncé. La validation hors simulation, sur robot physique, apparaît comme l'étape suivante pour les auteurs.
Dans nos dossiers




