Comparatif LLM

Kimi Linear 48B (MoE) en déploiement local

Moonshot AI (Kimi) · sortie oct. 2025 · licence MIT

Généraliste Vos documents (RAG) Config Standard
Taille 49 Md MoE : 3 Md actifs par token
VRAM estimée ≈ 36 Go modèle en Q4 + cache KV
Contexte 1M tokens
Français ●●○ Bon

Ce qu'il faut retenir

L'architecture à attention linéaire de Moonshot : un contexte d'un million de tokens avec un cache mémoire fortement réduit. Taillé pour interroger de très gros corpus documentaires sans faire exploser la VRAM.

Licence et usage commercial

MIT : usage commercial libre, sans restriction. (Contrairement aux grands Kimi K2, publiés sous une licence MIT modifiée.)

Sur quelle machine ?

Kimi Linear 48B (MoE) demande ≈ 36 Go de VRAM : le modèle chargé en quantisation Q4, plus la marge du cache KV, qui grandit avec la longueur des conversations et le nombre d'utilisateurs simultanés. Il faut donc 1 RTX PRO 5000 Blackwell 72 Go dans un Lenovo ThinkStation P8, soit notre configuration Standard, prévue pour jusqu'à 50 utilisateurs. Ce dimensionnement est un ordre de grandeur. Nous ne partons jamais de la machine : nous cadrons vos usages, nous en déduisons le modèle, puis la configuration qui le fait tourner, et nous validons par un test sur vos données réelles.

Popularité Hugging Face : 179 824 téléchargements le mois dernier, 580 likes.

Déployer Kimi Linear 48B (MoE) chez vous ?

Nous installons ce modèle sur une configuration Standard dans vos locaux, connecté à vos documents et vos outils. Audit gratuit, sans engagement.

Demander un audit gratuit