Connaître son corps : une méthode pour un contrôle robotique direct et auto-améliorant avec des VLM
Une équipe de recherche présente KnowBody, un harnais logiciel qui vient se greffer sur un modèle vision-langage (VLM) déjà entraîné, sans toucher à ses poids, pour lui apprendre concrètement comment le corps d'un robot donné produit un effet. Le système part d'une seule trajectoire hors tâche pour construire un modèle partiel du corps du robot, qui guide ensuite le choix des actions et l'interprétation des interactions passées ; ce modèle est révisé au fil des nouvelles observations, et toute connaissance qui en dépendait est revérifiée avant d'être réutilisée. Sur 32 essais à budget fixe répartis sur quatre tâches confiées à un robot réel, la version initialisée de KnowBody atteint 75% de complétion contre 25% pour le harnais natif du même VLM, avec moins de cycles de planification nécessaires sur les tâches réussies par les deux approches. Lorsque les mises à jour persistantes du modèle de corps sont activées, le nombre de cycles de planification chute de 29 à 53% entre le premier et le cinquième succès enregistré.
Le résultat touche un point de friction central pour l'industrie des modèles vision-langage-action (VLA) : un VLM générique comprend sémantiquement l'objectif d'une tâche, mais ignore par défaut comment les degrés de liberté et les organes effecteurs spécifiques d'un robot donné traduisent cette intention en mouvement. Les approches dominantes comme Pi-0, GR00T N2 ou Helix misent sur l'apprentissage de bout en bout, souvent au prix d'un réentraînement ou d'un fine-tuning par plateforme. KnowBody propose l'inverse : garder le modèle figé et ajouter une couche intermédiaire explicite, interrogeable et corrigible, qui capitalise l'expérience physique du robot. Pour les intégrateurs, l'intérêt est la promesse d'un déploiement d'un même VLM générique sur des corps robotiques différents sans coût de réentraînement, si l'approche tient sur des flottes plus larges.
Ces résultats restent toutefois un travail de recherche préliminaire, publié en preprint sur arXiv (arXiv:2609.28530v1), validé sur seulement quatre tâches et 32 essais en environnement contrôlé, loin d'un déploiement industriel. Aucun nom d'entreprise, de robot commercial ni de site de production n'est associé à ces expériences. La démonstration se positionne néanmoins explicitement en alternative aux stratégies VLA propriétaires actuelles, et la suite logique attendue serait une extension à davantage de tâches, de plateformes robotiques et de conditions réelles pour confirmer la généralisation du mécanisme.
Dans nos dossiers




