GigaBrain-0.7 : faire passer à l'échelle les modèles fondation incarnés grâce à une architecture à trois systèmes
Publié en août 2026 sur arXiv sous la référence 2608.15875, l'article présente GigaBrain-0.7, un modèle de fondation vision-langage-action (VLA) pour robots généralistes. Son architecture à trois systèmes unifie compréhension, prédiction et génération d'action dans un seul réseau. Le préentraînement s'appuie sur plus de 37 000 heures de données robotiques hétérogènes, complété par un entraînement d'alignement en une seule étape qui optimise conjointement la compréhension vision-langage et la génération d'actions multi-embodiment. Le modèle a été évalué sur la plateforme maison Maker H01 et sur des embodiments robotiques courants, en environnements domestiques et industriels, avec des gains revendiqués face à la série précédente GigaBrain-0 et au modèle π0.5 de Physical Intelligence, en généralisation zero-shot, suivi d'instructions et taux de réussite après post-entraînement. Le code et les poids préentraînés seront publiés en open source, sans date précisée.
Cette publication illustre la course à l'échelle des données dans les modèles de fondation robotiques, où le volume d'heures d'entraînement devient un argument compétitif au même titre que l'architecture. Le choix d'une architecture à trois systèmes, couplant prédiction du monde et génération d'action plutôt qu'un VLA purement réactif, reflète une tendance de fond du secteur. Pour les intégrateurs, la généralisation multi-embodiment revendiquée promet de réduire le réentraînement spécifique à chaque plateforme. La comparaison directe avec π0.5 positionne GigaBrain comme concurrent frontal des laboratoires de référence en VLA généralistes, même si les chiffres avancés restent auto-rapportés, sans benchmark indépendant ni valeurs absolues détaillées.
GigaBrain-0.7 prolonge directement la série GigaBrain-0, avec un accent renouvelé sur l'hétérogénéité des données d'entraînement et l'alignement conjoint vision-langage-action. Le positionnement face à π0.5 s'inscrit dans une compétition plus large entre laboratoires développant des modèles de fondation pour robots généralistes, où l'échelle des données et la diversité des embodiments testés servent de critères de différenciation. À ce stade, il s'agit d'une publication de recherche assortie d'une promesse de publication du code et des poids, non d'un produit commercialisé ni d'un déploiement en conditions réelles : la validation indépendante des performances annoncées dépendra de leur disponibilité effective.
Dans nos dossiers




