G0.5 : un flux autorégressif unique pour le raisonnement et l'action des robots
G0.5, publie en aout 2026 sur arXiv (2608.11739), est un modèle Vision-Language-Action (VLA) dont un décodeur transformeur unique génère raisonnement et tokens d'action sous un seul objectif, au lieu de séparer un VLM pré-entraine et un expert d'action entraine a part par flow-matching. Trois briques le rendent tenable a l'échelle d'un modèle de fondation : un tokenizeur d'action apprenable traduisant des actions robotiques hétérogènes dans un vocabulaire commun entre robots, un flux de chaine de pensée natif mêlant décomposition de taches, ancrage des objets et indices d'action, et un module de mémoire visuelle injectant plusieurs secondes d'historique. Pre-entraine sur des jeux de données robotiques et des exemples VQA, G0.5 devance les références sur sept protocoles : 76,7% de réussite en fine-tuning réel sur les robots R1lite et R1pro contre 53,3% pour Pi-0.5 et 24,4% pour GR00T-N1.7, 31,4% au BEHAVIOR Challenge 2025 contre 26,3% et 26,1% pour le vainqueur du concours, 82,5% en transfert zero-shot après post-entrainement sur DROID, ainsi que 98,9% sur LIBERO, 93,3% sur RoboTwin 2.0 et 87,3% sur SimplerEnv-Bridge.
Cette fusion compte parce que l'approche dominante du secteur, illustrée par Pi-0.5 (Physical Intelligence) ou GR00T-N1.7 (NVIDIA), traite le VLM comme un simple encodeur de contexte pendant qu'un module sépare décide de l'action. En partageant les mêmes poids entre raisonnement et action, G0.5 suit les instructions plus finement et laisse un prompt piloter la granularité des gestes, l'horizon de tache ou la gestion de scènes hors distribution, sans reentrainement. L'écart de performance en conditions réelles, près du double de Pi-0.5, et la victoire généraliste au BEHAVIOR Challenge face a des politiques spécialisées, appuient empiriquement l'idée qu'un flux autoregressif unique peut tenir a l'échelle.
Le travail s'inscrit dans la lignée des VLA ouverte par RT-2 et OpenVLA, prolongée par la famille Pi de Physical Intelligence, GR00T de NVIDIA ou Helix de Figure, qui ont impose le schéma VLM-encodeur plus expert d'action sépare comme standard de facto. G0.5 s'en écarté en misant sur un flux autoregressif unique, un pari qui reste a confirmer au-delà des benchmarks cites. Il s'agit d'une publication de recherche, sans produit commercialise ni déploiement industriel annonces.
Dans nos dossiers




