Comparatif LLM

Gemma 4 12B en déploiement local

Google DeepMind · sortie mai 2026 · licence Apache 2.0

Généraliste Vision Config Micro
Taille 12 Md paramètres (modèle dense)
VRAM estimée ≈ 11 Go modèle en Q4 + cache KV
Contexte 256k tokens
Français ●●○ Bon

Ce qu'il faut retenir

Le modèle « unifié » de Google : texte, images et audio compris nativement par un seul modèle. Idéal sur un petit poste pour les comptes rendus audio et la lecture de documents scannés.

Licence et usage commercial

Apache 2.0 : usage commercial libre, sans restriction (Gemma 4 abandonne l'ancienne licence propriétaire Gemma).

Sur quelle machine ?

Gemma 4 12B demande ≈ 11 Go de VRAM : le modèle chargé en quantisation Q4, plus la marge du cache KV, qui grandit avec la longueur des conversations et le nombre d'utilisateurs simultanés. Il faut donc 1 RTX PRO 5000 Blackwell 48 Go dans un Lenovo ThinkStation P3, soit notre configuration Micro, prévue pour jusqu'à 10 utilisateurs. Ce dimensionnement est un ordre de grandeur. Nous ne partons jamais de la machine : nous cadrons vos usages, nous en déduisons le modèle, puis la configuration qui le fait tourner, et nous validons par un test sur vos données réelles.

Chez Sover.tech

Chez Sover.tech, Gemma 4 12B sert d'abord en interne (il fait tourner Jarvis) et n'est pas mis en avant comme modèle principal : pour un déploiement client, nous recommandons au moins 26 milliards de paramètres. Il reste disponible si vous souhaitez volontairement un tout petit modèle multimodal.

Popularité Hugging Face : 3 342 629 téléchargements le mois dernier, 1 484 likes.

Déployer Gemma 4 12B chez vous ?

Nous installons ce modèle sur une configuration Micro dans vos locaux, connecté à vos documents et vos outils. Audit gratuit, sans engagement.

Demander un audit gratuit