DeepSeek V4 Flash en déploiement local
DeepSeek · sortie avr. 2026 · licence MIT
Ce qu'il faut retenir
Le format « Flash » de DeepSeek V4 : 284 Md de paramètres dont 13 actifs par token, proche de l'état de l'art en raisonnement et en code, avec un contexte d'un million de tokens pour les très gros corpus documentaires. Texte seul. DeepSeek le publie déjà en précision FP4 : ses 160 Go de poids ne se compressent pas davantage. Comptez trois cartes de 72 Go, cache compris.
Licence et usage commercial
MIT : usage commercial libre, sans restriction.
Sur quelle machine ?
DeepSeek V4 Flash demande ≈ 185 Go de VRAM : le modèle chargé en quantisation Q4, plus la marge du cache KV, qui grandit avec la longueur des conversations et le nombre d'utilisateurs simultanés. Il faut donc 3 RTX PRO 5000 Blackwell 72 Go dans un Lenovo ThinkStation P8, soit notre configuration Pro, prévue pour jusqu'à 100 utilisateurs et au-delà. Ce dimensionnement est un ordre de grandeur. Nous ne partons jamais de la machine : nous cadrons vos usages, nous en déduisons le modèle, puis la configuration qui le fait tourner, et nous validons par un test sur vos données réelles.
Popularité Hugging Face : 1 748 404 téléchargements le mois dernier, 2 133 likes.
Déployer DeepSeek V4 Flash chez vous ?
Nous installons ce modèle sur une configuration Pro dans vos locaux, connecté à vos documents et vos outils. Audit gratuit, sans engagement.