TaichuAI ouvre le code source de ZDTaichu5.0-9B, son modèle multimodal spatial
TaichuAI a mis en accès libre ZDTaichu5.0-9B, un modèle multimodal fondation d'environ 9 milliards de paramètres, annoncé le 15 septembre et repéré par TMTPost. L'architecture associe un backbone linguistique Qwen3.5-9B à un encodeur visuel C-RADIOv4-H, traite du texte, une ou plusieurs images ainsi que de la vidéo à toute résolution, et gère un contexte allant jusqu'à 128 000 tokens. Sur sa fiche modèle publique, TaichuAI revendique un rang de tête parmi les VLM généralistes de taille comparable (environ 10 milliards de paramètres), avec des scores notables sur des benchmarks spatiaux et incarnés : ViewSpatial 62,50, MMSI-Bench 47,20, MindCube-tiny 78,27, ERQA 48,00 et RoboSpatial 56,00. Sur les suites orientées agents et instructions, le modèle affiche 87,70 sur TAU2-Bench, 71,40 en moyenne générale sur Claw-Eval et 93,70 sur IFEval. La fiche technique décrit aussi un mécanisme de raisonnement récurrent adaptatif à seuil d'entropie, censé allouer davantage d'étapes de calcul aux tokens les plus complexes. Les poids sont disponibles sur Hugging Face sous licence NVIDIA Open Model, avec conservation des mentions Apache 2.0 héritées de Qwen3.5, et le déploiement s'appuie sur une branche personnalisée de vLLM 0.26.0 ainsi qu'une image Docker fournie par TaichuAI pour exposer des points d'accès compatibles OpenAI.
Pour les intégrateurs et chercheurs en IA incarnée, ce lancement fournit un artefact concret et réutilisable plutôt qu'une simple démonstration : un modèle open source de taille moyenne combinant perception spatiale, raisonnement multi-vues et planification de tâches, conçu pour nourrir des pipelines de type VLA (vision-langage-action) au-delà des seuls laboratoires fermés qui dominent ce segment. La couverture fonctionnelle annoncée (comptage dense, ordonnancement de profondeur, distinction égocentrique/allocentrique, planification d'affordances) touche directement aux briques nécessaires à la manipulation robotique et à la navigation. Toutefois, comme pour la plupart des fiches modèles publiées par leurs propres concepteurs, les scores doivent être considérés comme non vérifiés tant que des laboratoires tiers n'ont pas reproduit ces résultats dans des conditions de prompt et de jugement identiques ; l'écart entre performance annoncée et performance réelle reste un point de vigilance classique dans ce secteur.
ZDTaichu5.0-9B s'inscrit dans une vague de modèles multimodaux ouverts à vocation spatiale et incarnée, aux côtés d'efforts comme Pi-0 ou GR00T N2 portés par d'autres acteurs de la robotique générale. En misant sur un format relativement compact (9 milliards de paramètres) plutôt que sur des modèles massifs, TaichuAI cible une adoption plus large par des équipes de recherche disposant de ressources de calcul limitées. Aucune feuille de route de déploiement pilote ni de partenariat industriel n'est mentionnée à ce stade ; le modèle reste, pour l'instant, un artefact de recherche à évaluer plutôt qu'un produit commercial déployé sur le terrain.
Dans nos dossiers




