Comparatif LLM

GLM-5.3 Flash (320B) en déploiement local

Zhipu AI (Z.ai) · sortie août 2026 · licence MIT

Généraliste Code Raisonnement Vision Config Pro
Taille 320 Md MoE : 18 Md actifs par token
VRAM estimée ≈ 205 Go modèle en Q4 + cache KV
Contexte 1M tokens
Français ●●○ Bon

Ce qu'il faut retenir

Le premier modèle nativement multimodal de la série GLM-5 : 320 Md de paramètres dont 18 actifs, images comprises, contexte d'un million de tokens. Z.ai le donne devant GLM-5.2 sur l'ensemble de ses bancs, pour un dixième du coût, grâce à une attention hybride qui mêle creuse et linéaire et allège nettement le service des contextes longs. Le meilleur rapport capacité sur VRAM de la sélection au-dessus de 100 Go.

Licence et usage commercial

MIT : usage commercial libre, sans restriction. À noter, Z.ai réserve sa licence maison au GLM-5.3 complet et laisse ce Flash sous MIT.

Sur quelle machine ?

GLM-5.3 Flash (320B) demande ≈ 205 Go de VRAM : le modèle chargé en quantisation Q4, plus la marge du cache KV, qui grandit avec la longueur des conversations et le nombre d'utilisateurs simultanés. Il faut donc 3 RTX PRO 6000 Blackwell Server Edition 96 Go dans un Lenovo ThinkSystem SR650a V4, soit notre configuration Pro, prévue pour jusqu'à 100 utilisateurs et au-delà. Ce dimensionnement est un ordre de grandeur. Nous ne partons jamais de la machine : nous cadrons vos usages, nous en déduisons le modèle, puis la configuration qui le fait tourner, et nous validons par un test sur vos données réelles.

Popularité Hugging Face : 441 348 téléchargements le mois dernier, 1 839 likes.

Déployer GLM-5.3 Flash (320B) chez vous ?

Nous installons ce modèle sur une configuration Pro dans vos locaux, connecté à vos documents et vos outils. Audit gratuit, sans engagement.

Demander un audit gratuit