GLM-5.2 (753B) en déploiement local
Zhipu AI (Z.ai) · sortie juin 2026 · licence MIT
Ce qu'il faut retenir
Un modèle de frontière en poids ouverts, au niveau des meilleurs modèles fermés sur le code : 753 Md de paramètres dont 40 actifs, contexte d'un million de tokens. Son attention latente compressée le rend servable malgré sa taille, avec un cache mémoire modeste (44 Ko par token) au regard de ses 414 Go de poids. Texte seul, et le plus gourmand de la sélection.
Licence et usage commercial
MIT : usage commercial libre, sans restriction, et sans restriction géographique.
Sur quelle machine ?
GLM-5.2 (753B) demande ≈ 425 Go de VRAM : le modèle chargé en quantisation Q4, plus la marge du cache KV, qui grandit avec la longueur des conversations et le nombre d'utilisateurs simultanés. Il faut donc 5 RTX PRO 6000 Blackwell Server Edition 96 Go dans un Lenovo ThinkSystem SR675i V3, soit notre configuration Pro, prévue pour jusqu'à 100 utilisateurs et au-delà. Ce dimensionnement est un ordre de grandeur. Nous ne partons jamais de la machine : nous cadrons vos usages, nous en déduisons le modèle, puis la configuration qui le fait tourner, et nous validons par un test sur vos données réelles.
Popularité Hugging Face : 2 685 029 téléchargements le mois dernier, 5 036 likes.
Déployer GLM-5.2 (753B) chez vous ?
Nous installons ce modèle sur une configuration Pro dans vos locaux, connecté à vos documents et vos outils. Audit gratuit, sans engagement.