Comparatif des modèles d'IA open weight déployables on-premise, pensé pour les décideurs.
Ce comparatif réunit les modèles déployables en hébergement local : tous sont
open weight, c'est-à-dire que leurs poids sont publiés et librement téléchargeables. Leurs données
d'entraînement, elles, ne sont pas publiques : c'est ce qui distingue un modèle ouvert d'un logiciel
open source. La plupart portent une licence open source classique (Apache 2.0 ou MIT) ; les autres une
licence maison, dont nous avons lu les clauses une à une et dont la fiche vous dit ce qu'elle autorise
exactement. Dans tous les cas, le déploiement interne en entreprise est libre, usage commercial compris. Ils
tournent entièrement dans vos locaux, sans cloud, sur les configurations que nous installons. Filtrez par usage
ou par taille de machine : chaque modèle indique la VRAM nécessaire, sa qualité en français et la
configuration Sover.tech correspondante. Du poste de travail unique au serveur rackable, du modèle de
21 milliards de paramètres à celui de 753. Données Hugging Face actualisées le 13/09/2026.
Usage
Machine
Aucun modèle ne correspond à ces critères. Élargissez les filtres.
Le spécialiste code de Mistral : agents de code, édition multi-fichiers, contexte 384k. Le choix dev de la configuration TPE, et l'alternative souveraine signée d'un éditeur français.
Le modèle le plus téléchargé de la génération Gemma 4 : MoE d'environ 4 Md de paramètres actifs, multimodal et très rapide. Une valeur sûre pour un service de 10 à 50 utilisateurs.
Le généraliste dense de référence, dans sa génération d'août 2026 : multimodal (images et vidéo), raisonnement à effort réglable, multilingue solide, contexte 256k. Son attention hybride allège fortement le cache mémoire sur les contextes longs. Il est aussi devenu un vrai modèle de code : 73,0 sur Terminal-Bench 2.1 contre 63,4 pour Qwen3.6, à portée des meilleurs modèles fermés. À l'aise dès notre configuration d'entrée.
Le grand dense de la génération Gemma 4 et l'un des modèles les plus appréciés du moment : la qualité maximale sur une seule carte, multimodal, excellent multilingue.
MoE avec seulement ~3 Md de paramètres actifs : débit très élevé, taillé pour le code agentique et les usages intensifs multi-utilisateurs. Multimodal, contexte 256k.
La deuxième génération d'Ornith, toujours 3 Md de paramètres actifs par token sur une seule carte, et toujours sous licence MIT. DeepReinforce la donne devant Qwen3.6 35B sur l'ensemble de ses bancs de code et d'agents, et loin devant les denses de taille comparable comme Gemma 4 31B sur le code agentique. C'est un modèle de raisonnement : il ouvre chaque réponse par un bloc de réflexion, que le serveur d'inférence renvoie à part. Multimodal, contexte 256k.
La référence code de Qwen : 80 Md de paramètres dont ~3 actifs par token grâce à une architecture hybride à attention linéaire. La qualité d'un grand modèle avec le débit d'un petit, taillé pour les agents de code et les gros dépôts.
Le modèle unifié de Mistral : raisonnement, multimodal et code agentique dans un seul MoE (6,5 Md actifs), avec un contexte d'un million de tokens. Excellent en français, éditeur européen. Le choix souveraineté par excellence.
Le plus gros modèle dense de la sélection, et le plus français : 128 Md de paramètres, multimodal, contexte 256k, vingt-quatre langues officiellement suivies. Un dense se comporte de façon plus régulière qu'un MoE de taille voisine, au prix d'un calcul plus lourd sur chaque token : le débit est plus faible que celui de Mistral Small 4, pour une qualité de rédaction supérieure. À réserver aux usages où le français prime sur la vitesse.
L'une des architectures les plus économes de la sélection : 180 Md de paramètres au total, mais 6 seulement actifs par token, dont 51 Md logés dans des embeddings n-gram que l'on peut décharger hors du GPU. Son attention hybride, qui marie Gated DeltaNet et une attention creuse par micro-blocs, vise les charges agentiques à contexte long, là où la latence se paie. Multimodal, contexte 256k natif, extensible à un million.
Le format « Flash » de DeepSeek V4, dans sa révision de juillet 2026 : 284 Md de paramètres dont 13 actifs par token, proche de l'état de l'art en raisonnement et en code, avec un contexte d'un million de tokens pour les très gros corpus documentaires. DeepSeek annonce cette révision devant son propre V4 Pro d'avril malgré un nombre de paramètres actifs bien inférieur. Texte seul. Publié en précision FP4 : ses 160 Go de poids ne se compressent pas davantage. Comptez trois cartes de 72 Go, cache compris. Son successeur V4.1 Flash, sorti en septembre, demande plus du triple de mémoire : ce V4 reste la porte d'entrée de DeepSeek.
Le premier modèle nativement multimodal de la série GLM-5 : 320 Md de paramètres dont 18 actifs, images comprises, contexte d'un million de tokens. Z.ai le donne devant GLM-5.2 sur l'ensemble de ses bancs, pour un dixième du coût, grâce à une attention hybride qui mêle creuse et linéaire et allège nettement le service des contextes longs. Le meilleur rapport capacité sur VRAM de la sélection au-dessus de 100 Go.
Le plus imposant des modèles texte seul de la sélection : 753 Md de paramètres dont 40 actifs, contexte d'un million de tokens. Il reprend le modèle de base de GLM-5.2 et ne doit ses gains qu'au post-entraînement : Z.ai annonce 50 % de mieux sur son banc de code interne et l'état de l'art open weight sur Terminal-Bench 3.0 à sa sortie. Texte seul. Comptez cinq cartes de 96 Go, cache compris.
Le successeur de V4 Flash, réentraîné de zéro et désormais multimodal : 552 Md de paramètres, dont 8 actifs pour lire la requête et 16 pour écrire la réponse, auxquels s'ajoute une mémoire Engram de 196 Md consultée par table. Contexte d'un million de tokens, avec un cache quatre fois plus léger que celui de V4 Flash, ce qui sert les agents qui relisent de gros volumes. Sur les bancs publiés par DeepSeek, il devance GLM-5.3 en code agentique, sauf sur Terminal-Bench 4.0. Le plus gourmand de la sélection : la recette vLLM officielle réclame 614 Go de VRAM au minimum, et son support, fusionné dans vLLM le lendemain de la sortie, ne passe encore que par une image Docker dédiée.
Méthodologie. Sélection curée des modèles open weight pertinents pour un déploiement
d'entreprise : une licence qui autorise le déploiement interne, usage commercial compris, une qualité
éprouvée, un écosystème d'inférence mature (vLLM) et au moins 20 milliards de paramètres. La plupart sont sous
Apache 2.0 ou MIT ; pour les licences maison, la fiche du modèle détaille la clause exacte et qui elle vise. La VRAM indiquée est une estimation en usage réel :
chargement du modèle en quantisation Q4 plus une marge pour le cache KV. Contexte long et nombre
d'utilisateurs simultanés font varier cette part : le dimensionnement précis dépend de votre usage. La machine
se déduit du modèle, jamais l'inverse : nous cadrons d'abord vos besoins, nous en tirons le modèle qui y répond,
puis la configuration capable de le faire tourner. Les configurations citées ici sont des repères de lecture, pas
un catalogue fermé. Les métadonnées
(popularité, mises à jour) proviennent de l'API Hugging Face. Quatre familles restent en dehors de cette liste.
Celles dont la licence interdit l'usage commercial ou le soumet à un accord préalable. Celles qui, comme
DeepSeek V4 Pro ou Kimi K3, dépassent le millier de milliards de paramètres : elles demandent plusieurs
serveurs et relèvent de configurations personnalisées. Celles qu'aucun serveur d'inférence mature ne sait
encore servir, comme DiffusionGemma et son décodage par diffusion. Et les modèles sous 20 milliards de
paramètres : à ce niveau, l'écart de qualité avec la génération au-dessus ne se justifie plus sur les
machines que nous installons. Ces cas particuliers, nous les étudions sur demande dans le cadre d'un
audit gratuit.
Un modèle vous intéresse ?
Nous dimensionnons la machine, installons le modèle dans vos locaux et le maintenons dans le temps.
On fait le point ensemble sur vos usages, gratuitement.
Bonjour ! Je suis Iris, l'assistante IA de Sover.tech. Une question sur les modèles de ce comparatif ? Décrivez-moi vos usages et votre équipe, je vous aide à choisir le modèle et la configuration adaptés.
Iris est une IA, elle peut se tromper. Ne partagez pas d'informations sensibles.
Session éphémère : aucune trace de votre conversation n'est sauvegardée.