DeepSeek V4.1 Flash en déploiement local
DeepSeek · sortie sept. 2026 · licence MIT
Ce qu'il faut retenir
Le successeur de V4 Flash, réentraîné de zéro et désormais multimodal : 552 Md de paramètres, dont 8 actifs pour lire la requête et 16 pour écrire la réponse, auxquels s'ajoute une mémoire Engram de 196 Md consultée par table. Contexte d'un million de tokens, avec un cache quatre fois plus léger que celui de V4 Flash, ce qui sert les agents qui relisent de gros volumes. Sur les bancs publiés par DeepSeek, il devance GLM-5.3 en code agentique, sauf sur Terminal-Bench 4.0. Le plus gourmand de la sélection : la recette vLLM officielle réclame 614 Go de VRAM au minimum, et son support, fusionné dans vLLM le lendemain de la sortie, ne passe encore que par une image Docker dédiée.
Licence et usage commercial
MIT : usage commercial libre, sans restriction.
Sur quelle machine ?
DeepSeek V4.1 Flash demande ≈ 614 Go de VRAM : le modèle chargé en quantisation Q4, plus la marge du cache KV, qui grandit avec la longueur des conversations et le nombre d'utilisateurs simultanés. Il faut donc 7 RTX PRO 6000 Blackwell Server Edition 96 Go dans un serveur rackable haute densité, soit notre configuration ETI, prévue pour jusqu'à 100 utilisateurs et au-delà. Ce dimensionnement est un ordre de grandeur. Nous ne partons jamais de la machine : nous cadrons vos usages, nous en déduisons le modèle, puis la configuration qui le fait tourner, et nous validons par un test sur vos données réelles.
Popularité Hugging Face : 244 457 téléchargements le mois dernier, 2 080 likes.
Déployer DeepSeek V4.1 Flash chez vous ?
Nous installons ce modèle sur une configuration ETI dans vos locaux, connecté à vos documents et vos outils. Audit gratuit, sans engagement.