GLM-5.3 Flash (320B) en déploiement local
Zhipu AI (Z.ai) · sortie août 2026 · licence MIT
Ce qu'il faut retenir
Le premier modèle nativement multimodal de la série GLM-5 : 320 Md de paramètres dont 18 actifs, images comprises, contexte d'un million de tokens. Z.ai le donne devant GLM-5.2 sur l'ensemble de ses bancs, pour un dixième du coût, grâce à une attention hybride qui mêle creuse et linéaire et allège nettement le service des contextes longs. Le meilleur rapport capacité sur VRAM de la sélection au-dessus de 100 Go.
Licence et usage commercial
MIT : usage commercial libre, sans restriction. À noter, Z.ai réserve sa licence maison au GLM-5.3 complet et laisse ce Flash sous MIT.
Sur quelle machine ?
GLM-5.3 Flash (320B) demande ≈ 205 Go de VRAM : le modèle chargé en quantisation Q4, plus la marge du cache KV, qui grandit avec la longueur des conversations et le nombre d'utilisateurs simultanés. Il faut donc 3 RTX PRO 6000 Blackwell Server Edition 96 Go dans un Lenovo ThinkSystem SR650a V4, soit notre configuration Pro, prévue pour jusqu'à 100 utilisateurs et au-delà. Ce dimensionnement est un ordre de grandeur. Nous ne partons jamais de la machine : nous cadrons vos usages, nous en déduisons le modèle, puis la configuration qui le fait tourner, et nous validons par un test sur vos données réelles.
Popularité Hugging Face : 441 348 téléchargements le mois dernier, 1 839 likes.
Déployer GLM-5.3 Flash (320B) chez vous ?
Nous installons ce modèle sur une configuration Pro dans vos locaux, connecté à vos documents et vos outils. Audit gratuit, sans engagement.