Comparatif LLM

GPT-OSS 120B en déploiement local

OpenAI · sortie août 2025 · licence Apache 2.0

Généraliste Raisonnement Code Vos documents (RAG) Config Pro
Taille 117 Md MoE : 5,1 Md actifs par token
VRAM estimée ≈ 80 Go modèle en Q4 + cache KV
Contexte 128k tokens
Français ●●○ Bon

Ce qu'il faut retenir

Le grand open-weight d'OpenAI, éprouvé en production : MoE 5,1 Md actifs. Raisonnement de haut niveau à coût d'inférence maîtrisé.

Licence et usage commercial

Apache 2.0 : usage commercial libre, sans restriction.

Sur quelle machine ?

GPT-OSS 120B demande ≈ 80 Go de VRAM : le modèle chargé en quantisation Q4, plus la marge du cache KV, qui grandit avec la longueur des conversations et le nombre d'utilisateurs simultanés. Il faut donc 2 RTX PRO 5000 Blackwell 72 Go dans un Lenovo ThinkStation P8, soit notre configuration Pro, prévue pour jusqu'à 100 utilisateurs et au-delà. Ce dimensionnement est un ordre de grandeur. Nous ne partons jamais de la machine : nous cadrons vos usages, nous en déduisons le modèle, puis la configuration qui le fait tourner, et nous validons par un test sur vos données réelles.

Popularité Hugging Face : 4 897 043 téléchargements le mois dernier, 5 121 likes.

Déployer GPT-OSS 120B chez vous ?

Nous installons ce modèle sur une configuration Pro dans vos locaux, connecté à vos documents et vos outils. Audit gratuit, sans engagement.

Demander un audit gratuit