Accueil

Quel LLM installer dans votre entreprise ?

Comparatif des modèles d'IA open weight déployables on-premise, pensé pour les décideurs.

Ce comparatif réunit les modèles déployables en hébergement local : tous sont open weight, c'est-à-dire que leurs poids sont publiés et librement téléchargeables. Leurs données d'entraînement, elles, ne sont pas publiques : c'est ce qui distingue un modèle ouvert d'un logiciel open source. La plupart portent une licence open source classique (Apache 2.0 ou MIT) ; les autres une licence maison, dont nous avons lu les clauses une à une et dont la fiche vous dit ce qu'elle autorise exactement. Dans tous les cas, le déploiement interne en entreprise est libre, usage commercial compris. Ils tournent entièrement dans vos locaux, sans cloud, sur les configurations que nous installons. Filtrez par usage ou par taille de machine : chaque modèle indique la VRAM nécessaire, sa qualité en français et la configuration Sover.tech correspondante. Du poste de travail unique au serveur rackable, du modèle de 21 milliards de paramètres à celui de 753. Données Hugging Face actualisées le 13/09/2026.

GPT-OSS 20B

OpenAI · août 2025

Généraliste Raisonnement Code
  • 21 Md MoE · 3,6 Md actifs
  • Contexte 128k
  • ●●○ Français : BonFR
  • Apache 2.0

Le modèle open-weight d'OpenAI. MoE rapide à l'inférence, raisonnement à niveau d'effort réglable, très bon en agentique et utilisation d'outils.

Voir la fiche

Devstral Small 2 (24B)

Mistral AI 🇫🇷 · déc. 2025

Code
  • 24 Md
  • Contexte 384k
  • ●●● Français : ExcellentFR
  • Apache 2.0

Le spécialiste code de Mistral : agents de code, édition multi-fichiers, contexte 384k. Le choix dev de la configuration TPE, et l'alternative souveraine signée d'un éditeur français.

Voir la fiche

Gemma 4 26B (MoE)

Google DeepMind · mars 2026

Généraliste Vos documents (RAG) Vision
  • 26,5 Md MoE · 4 Md actifs
  • Contexte 256k
  • ●●● Français : ExcellentFR
  • Apache 2.0

Le modèle le plus téléchargé de la génération Gemma 4 : MoE d'environ 4 Md de paramètres actifs, multimodal et très rapide. Une valeur sûre pour un service de 10 à 50 utilisateurs.

Voir la fiche

Qwen3.8 27B

Alibaba (Qwen) · août 2026

Nouveau
Généraliste Code Raisonnement Vos documents (RAG) Vision
  • 27,8 Md
  • Contexte 256k
  • ●●● Français : ExcellentFR
  • Apache 2.0

Le généraliste dense de référence, dans sa génération d'août 2026 : multimodal (images et vidéo), raisonnement à effort réglable, multilingue solide, contexte 256k. Son attention hybride allège fortement le cache mémoire sur les contextes longs. Il est aussi devenu un vrai modèle de code : 73,0 sur Terminal-Bench 2.1 contre 63,4 pour Qwen3.6, à portée des meilleurs modèles fermés. À l'aise dès notre configuration d'entrée.

Voir la fiche

Gemma 4 31B

Google DeepMind · mars 2026

Généraliste Raisonnement Vos documents (RAG) Vision
  • 32,7 Md
  • Contexte 256k
  • ●●● Français : ExcellentFR
  • Apache 2.0

Le grand dense de la génération Gemma 4 et l'un des modèles les plus appréciés du moment : la qualité maximale sur une seule carte, multimodal, excellent multilingue.

Voir la fiche

Qwen3.6 35B (MoE)

Alibaba (Qwen) · avr. 2026

Choix Sover.tech
Code Raisonnement Vision
  • 36 Md MoE · 3 Md actifs
  • Contexte 256k
  • ●●● Français : ExcellentFR
  • Apache 2.0

MoE avec seulement ~3 Md de paramètres actifs : débit très élevé, taillé pour le code agentique et les usages intensifs multi-utilisateurs. Multimodal, contexte 256k.

Voir la fiche

Ornith 1.5 35B (MoE)

DeepReinforce · août 2026

Nouveau
Code Raisonnement Vision
  • 36 Md MoE · 3 Md actifs
  • Contexte 256k
  • ●●○ Français : BonFR
  • MIT

La deuxième génération d'Ornith, toujours 3 Md de paramètres actifs par token sur une seule carte, et toujours sous licence MIT. DeepReinforce la donne devant Qwen3.6 35B sur l'ensemble de ses bancs de code et d'agents, et loin devant les denses de taille comparable comme Gemma 4 31B sur le code agentique. C'est un modèle de raisonnement : il ouvre chaque réponse par un bloc de réflexion, que le serveur d'inférence renvoie à part. Multimodal, contexte 256k.

Voir la fiche

Qwen3 Coder Next (80B)

Alibaba (Qwen) · janv. 2026

Code
  • 80 Md MoE · 3 Md actifs
  • Contexte 256k
  • ●●○ Français : BonFR
  • Apache 2.0

La référence code de Qwen : 80 Md de paramètres dont ~3 actifs par token grâce à une architecture hybride à attention linéaire. La qualité d'un grand modèle avec le débit d'un petit, taillé pour les agents de code et les gros dépôts.

Voir la fiche

Mistral Small 4 (119B)

Mistral AI 🇫🇷 · mars 2026

Généraliste Raisonnement Vision Code
  • 119 Md MoE · 6,5 Md actifs
  • Contexte 1M
  • ●●● Français : ExcellentFR
  • Apache 2.0

Le modèle unifié de Mistral : raisonnement, multimodal et code agentique dans un seul MoE (6,5 Md actifs), avec un contexte d'un million de tokens. Excellent en français, éditeur européen. Le choix souveraineté par excellence.

Voir la fiche

GPT-OSS 120B

OpenAI · août 2025

Généraliste Raisonnement Code Vos documents (RAG)
  • 117 Md MoE · 5,1 Md actifs
  • Contexte 128k
  • ●●○ Français : BonFR
  • Apache 2.0

Le grand open-weight d'OpenAI, éprouvé en production : MoE 5,1 Md actifs. Raisonnement de haut niveau à coût d'inférence maîtrisé.

Voir la fiche

Mistral Medium 3.5 (128B)

Mistral AI 🇫🇷 · mars 2026

Généraliste Vos documents (RAG) Code Vision
  • 128 Md
  • Contexte 256k
  • ●●● Français : ExcellentFR
  • MIT modifiée

Le plus gros modèle dense de la sélection, et le plus français : 128 Md de paramètres, multimodal, contexte 256k, vingt-quatre langues officiellement suivies. Un dense se comporte de façon plus régulière qu'un MoE de taille voisine, au prix d'un calcul plus lourd sur chaque token : le débit est plus faible que celui de Mistral Small 4, pour une qualité de rédaction supérieure. À réserver aux usages où le français prime sur la vitesse.

Voir la fiche

Qwen3.8 Flash Next (180B)

Alibaba (Qwen) · août 2026

Nouveau
Généraliste Code Raisonnement Vos documents (RAG) Vision
  • 180 Md MoE · 6 Md actifs
  • Contexte 256k
  • ●●● Français : ExcellentFR
  • Qwen Community 1.0

L'une des architectures les plus économes de la sélection : 180 Md de paramètres au total, mais 6 seulement actifs par token, dont 51 Md logés dans des embeddings n-gram que l'on peut décharger hors du GPU. Son attention hybride, qui marie Gated DeltaNet et une attention creuse par micro-blocs, vise les charges agentiques à contexte long, là où la latence se paie. Multimodal, contexte 256k natif, extensible à un million.

Voir la fiche

DeepSeek V4 Flash

DeepSeek · juil. 2026

Généraliste Raisonnement Code
  • 284 Md MoE · 13 Md actifs
  • Contexte 1M
  • ●●○ Français : BonFR
  • MIT

Le format « Flash » de DeepSeek V4, dans sa révision de juillet 2026 : 284 Md de paramètres dont 13 actifs par token, proche de l'état de l'art en raisonnement et en code, avec un contexte d'un million de tokens pour les très gros corpus documentaires. DeepSeek annonce cette révision devant son propre V4 Pro d'avril malgré un nombre de paramètres actifs bien inférieur. Texte seul. Publié en précision FP4 : ses 160 Go de poids ne se compressent pas davantage. Comptez trois cartes de 72 Go, cache compris. Son successeur V4.1 Flash, sorti en septembre, demande plus du triple de mémoire : ce V4 reste la porte d'entrée de DeepSeek.

Voir la fiche

GLM-5.3 Flash (320B)

Zhipu AI (Z.ai) · août 2026

Nouveau
Généraliste Code Raisonnement Vision
  • 320 Md MoE · 18 Md actifs
  • Contexte 1M
  • ●●○ Français : BonFR
  • MIT

Le premier modèle nativement multimodal de la série GLM-5 : 320 Md de paramètres dont 18 actifs, images comprises, contexte d'un million de tokens. Z.ai le donne devant GLM-5.2 sur l'ensemble de ses bancs, pour un dixième du coût, grâce à une attention hybride qui mêle creuse et linéaire et allège nettement le service des contextes longs. Le meilleur rapport capacité sur VRAM de la sélection au-dessus de 100 Go.

Voir la fiche

GLM-5.3 (753B)

Zhipu AI (Z.ai) · août 2026

Nouveau
Code Raisonnement Généraliste
  • 753 Md MoE · 40 Md actifs
  • Contexte 1M
  • ●●○ Français : BonFR
  • Z.ai (maison)

Le plus imposant des modèles texte seul de la sélection : 753 Md de paramètres dont 40 actifs, contexte d'un million de tokens. Il reprend le modèle de base de GLM-5.2 et ne doit ses gains qu'au post-entraînement : Z.ai annonce 50 % de mieux sur son banc de code interne et l'état de l'art open weight sur Terminal-Bench 3.0 à sa sortie. Texte seul. Comptez cinq cartes de 96 Go, cache compris.

Voir la fiche

DeepSeek V4.1 Flash

DeepSeek · sept. 2026

Nouveau
Généraliste Code Raisonnement Vision
  • 552 Md MoE · 16 Md actifs
  • Contexte 1M
  • ●●○ Français : BonFR
  • MIT

Le successeur de V4 Flash, réentraîné de zéro et désormais multimodal : 552 Md de paramètres, dont 8 actifs pour lire la requête et 16 pour écrire la réponse, auxquels s'ajoute une mémoire Engram de 196 Md consultée par table. Contexte d'un million de tokens, avec un cache quatre fois plus léger que celui de V4 Flash, ce qui sert les agents qui relisent de gros volumes. Sur les bancs publiés par DeepSeek, il devance GLM-5.3 en code agentique, sauf sur Terminal-Bench 4.0. Le plus gourmand de la sélection : la recette vLLM officielle réclame 614 Go de VRAM au minimum, et son support, fusionné dans vLLM le lendemain de la sortie, ne passe encore que par une image Docker dédiée.

Voir la fiche

Méthodologie. Sélection curée des modèles open weight pertinents pour un déploiement d'entreprise : une licence qui autorise le déploiement interne, usage commercial compris, une qualité éprouvée, un écosystème d'inférence mature (vLLM) et au moins 20 milliards de paramètres. La plupart sont sous Apache 2.0 ou MIT ; pour les licences maison, la fiche du modèle détaille la clause exacte et qui elle vise. La VRAM indiquée est une estimation en usage réel : chargement du modèle en quantisation Q4 plus une marge pour le cache KV. Contexte long et nombre d'utilisateurs simultanés font varier cette part : le dimensionnement précis dépend de votre usage. La machine se déduit du modèle, jamais l'inverse : nous cadrons d'abord vos besoins, nous en tirons le modèle qui y répond, puis la configuration capable de le faire tourner. Les configurations citées ici sont des repères de lecture, pas un catalogue fermé. Les métadonnées (popularité, mises à jour) proviennent de l'API Hugging Face. Quatre familles restent en dehors de cette liste. Celles dont la licence interdit l'usage commercial ou le soumet à un accord préalable. Celles qui, comme DeepSeek V4 Pro ou Kimi K3, dépassent le millier de milliards de paramètres : elles demandent plusieurs serveurs et relèvent de configurations personnalisées. Celles qu'aucun serveur d'inférence mature ne sait encore servir, comme DiffusionGemma et son décodage par diffusion. Et les modèles sous 20 milliards de paramètres : à ce niveau, l'écart de qualité avec la génération au-dessus ne se justifie plus sur les machines que nous installons. Ces cas particuliers, nous les étudions sur demande dans le cadre d'un audit gratuit.

Un modèle vous intéresse ?

Nous dimensionnons la machine, installons le modèle dans vos locaux et le maintenons dans le temps. On fait le point ensemble sur vos usages, gratuitement.

Demander un audit gratuit