
HABILIS Brain 0 : supervision par changement de géométrie pour modèles vision-langage-action et récupération de flux résiduel
Une équipe de recherche a publié le 23 septembre 2026 sur arXiv (référence 2609.25558) une architecture nommée HABILIS Brain 0, construite autour d'un modèle appelé GC-VLA (Geometry-Change Vision-Language-Action). Plutôt que de s'appuyer sur la géométrie de la scène à l'instant présent, comme le font la plupart des politiques vision-langage-action, ce modèle apprend à prédire des tokens de changement géométrique multi-vues sur un horizon de 0,5 seconde, calculés hors ligne à partir de paires d'images avant/après. L'entraînement se fait en quatre étapes: un modèle vision-langage dédié au changement géométrique (GC-VLM), un module d'action continu (ActionExpert) aligné sur les commandes robotiques sans rétropropager de gradients vers le VLM, une phase où cette rétropropagation est activée pour mettre à jour les deux ensembles conjointement, puis, une fois GC-VLA gelé, l'ajout d'un correctif résiduel nommé Geometry-Conditioned Residual Flow (GCRF), piloté par un routeur d'intervention binaire et une politique de vélocité bornée apprise en boucle fermée. Sur le benchmark de simulation LIBERO, GC-VLA seul atteint 95,20% de réussite, et la version complète avec GCRF grimpe à 99,55%.
Ces chiffres proviennent uniquement d'un environnement simulé académique, pas d'un déploiement industriel, une nuance qui compte dans un secteur où l'écart entre performances démontrées et robustesse en conditions réelles reste une source récurrente de scepticisme. L'intérêt de GC-VLA tient surtout à sa promesse d'un préentraînement indépendant de l'embodiment, exploitable sur des vidéos robotiques et égocentriques génériques avant l'alignement spécifique à un bras ou un humanoïde donné, une piste qui parle directement aux intégrateurs cherchant à mutualiser des modèles de perception entre plateformes matérielles différentes plutôt que de réentraîner un modèle par robot. Le score de 99,55% sur LIBERO, bien qu'élevé, reste un résultat de benchmark standard en simulation et ne présume pas d'une performance équivalente hors laboratoire.
Ce travail s'inscrit dans la lignée des politiques vision-langage-action récentes telles que Pi-0, GR00T N2 ou Helix, qui combinent perception, langage et contrôle moteur dans un même réseau, mais s'en distingue par une supervision explicite du changement géométrique plutôt que par une géométrie statique de la scène. La construction en couches successives, VLM figé puis dégelé puis correction résiduelle apprise en boucle fermée, dessine une feuille de route où chaque étape peut être publiée et évaluée séparément avant un éventuel transfert vers du matériel physique, une étape que cette publication n'aborde pas encore.
Dans nos dossiers




