GLM-4.7 Flash en déploiement local
Zhipu AI (Z.ai) · sortie janv. 2026 · licence MIT
Ce qu'il faut retenir
Le format compact de la famille GLM, plébiscité pour le code et les agents : MoE de 31 Md dont environ 3 actifs par token, rapide à l'inférence sur une seule carte.
Licence et usage commercial
MIT : usage commercial libre, sans restriction.
Sur quelle machine ?
GLM-4.7 Flash demande ≈ 25 Go de VRAM : le modèle chargé en quantisation Q4, plus la marge du cache KV, qui grandit avec la longueur des conversations et le nombre d'utilisateurs simultanés. Il faut donc 1 RTX PRO 5000 Blackwell 48 Go dans un Lenovo ThinkStation P3, soit notre configuration Micro, prévue pour jusqu'à 10 utilisateurs. Ce dimensionnement est un ordre de grandeur. Nous ne partons jamais de la machine : nous cadrons vos usages, nous en déduisons le modèle, puis la configuration qui le fait tourner, et nous validons par un test sur vos données réelles.
Popularité Hugging Face : 1 993 167 téléchargements le mois dernier, 1 820 likes.
Déployer GLM-4.7 Flash chez vous ?
Nous installons ce modèle sur une configuration Micro dans vos locaux, connecté à vos documents et vos outils. Audit gratuit, sans engagement.