Comparatif des modèles d'IA open weight déployables on-premise, pensé pour les décideurs.
Ce comparatif réunit les modèles déployables en hébergement local : tous sont
open weight, c'est-à-dire que leurs poids sont publiés et librement téléchargeables, sous une licence
réellement open source (Apache 2.0 ou MIT, usage commercial libre). Leurs données d'entraînement, elles, ne
sont pas publiques : c'est ce qui distingue un modèle ouvert d'un logiciel open source. Ils tournent
entièrement dans vos locaux, sans cloud, sur les configurations que nous installons. Filtrez par usage ou par taille de
machine : chaque modèle indique la VRAM nécessaire, sa qualité en français et la configuration Sover.tech
correspondante. Du poste de travail unique au serveur rackable, du modèle de 4 milliards de paramètres à
celui de 753. Données Hugging Face actualisées le 24/08/2026.
Usage
Machine
Aucun modèle ne correspond à ces critères. Élargissez les filtres.
Le plus léger de la sélection, signé Mistral, et pourtant multimodal : il lit les images. Excellent en français, contexte 256k. Idéal pour un poste unique : rédaction, résumé, classification, réponses rapides.
Le petit modèle le plus déployé du marché (plus de 15 millions de téléchargements mensuels). Mode raisonnement activable, très bon en français, écosystème mature. Son contexte natif est de 40k tokens, extensible à 128k par YaRN au prix d'une perte de précision.
Le modèle « unifié » de Google : texte, images et audio compris nativement par un seul modèle. Idéal sur un petit poste pour les comptes rendus audio et la lecture de documents scannés.
Le spécialiste code de Mistral : agents de code, édition multi-fichiers, contexte 384k. Le choix dev de la configuration Micro, et l'alternative souveraine signée d'un éditeur français.
Le modèle le plus téléchargé de la génération Gemma 4 : MoE d'environ 4 Md de paramètres actifs, multimodal et très rapide. Un excellent choix par défaut pour un service de 10 à 50 utilisateurs.
Le généraliste dense de référence, dans sa génération d'août 2026 : multimodal (images et vidéo), raisonnement à effort réglable, multilingue solide, contexte 256k. Son attention hybride allège fortement le cache mémoire sur les contextes longs. Il est aussi devenu un vrai modèle de code : 73,0 sur Terminal-Bench 2.1 contre 63,4 pour Qwen3.6, à portée des meilleurs modèles fermés. À l'aise dès notre configuration d'entrée.
Le format compact de la famille GLM, plébiscité pour le code et les agents : MoE de 31 Md dont environ 3 actifs par token, rapide à l'inférence sur une seule carte.
Le grand dense de la génération Gemma 4 et l'un des modèles les plus appréciés du moment : la qualité maximale sur une seule carte, multimodal, excellent multilingue.
MoE avec seulement ~3 Md de paramètres actifs : débit très élevé, taillé pour le code agentique et les usages intensifs multi-utilisateurs. Multimodal, contexte 256k.
Un MoE de 35 Md dont 3 actifs par token, entraîné à produire lui-même son échafaudage d'agent, sous licence MIT. À sa sortie il devançait nettement les généralistes de sa taille sur les tests d'agents de développement : 64,2 sur Terminal-Bench 2.1 contre 52,5 pour Qwen3.6 35B et 42,1 pour Gemma 4 31B. Une alternative spécialisée, sur une seule carte.
L'architecture à attention linéaire de Moonshot : un contexte d'un million de tokens avec un cache mémoire fortement réduit. Taillé pour interroger de très gros corpus documentaires sans faire exploser la VRAM.
La référence code de Qwen : 80 Md de paramètres dont ~3 actifs par token grâce à une architecture hybride à attention linéaire. La qualité d'un grand modèle avec le débit d'un petit, taillé pour les agents de code et les gros dépôts.
Le modèle unifié de Mistral : raisonnement, multimodal et code agentique dans un seul MoE (6,5 Md actifs), avec un contexte d'un million de tokens. Excellent en français, éditeur européen. Le choix souveraineté par excellence.
Le format « Flash » de DeepSeek V4 : 284 Md de paramètres dont 13 actifs par token, proche de l'état de l'art en raisonnement et en code, avec un contexte d'un million de tokens pour les très gros corpus documentaires. Texte seul. DeepSeek le publie déjà en précision FP4 : ses 160 Go de poids ne se compressent pas davantage. Comptez trois cartes de 72 Go, cache compris.
Un modèle de frontière en poids ouverts, au niveau des meilleurs modèles fermés sur le code : 753 Md de paramètres dont 40 actifs, contexte d'un million de tokens. Son attention latente compressée le rend servable malgré sa taille, avec un cache mémoire modeste (44 Ko par token) au regard de ses 414 Go de poids. Texte seul, et le plus gourmand de la sélection.
Méthodologie. Sélection curée des modèles open-weight pertinents pour un déploiement
d'entreprise : uniquement des licences open source à usage commercial libre (Apache 2.0, MIT), qualité
éprouvée, écosystème d'inférence mature (vLLM). La VRAM indiquée est une estimation en usage réel :
chargement du modèle en quantisation Q4 plus une marge pour le cache KV. Contexte long et nombre
d'utilisateurs simultanés font varier cette part : le dimensionnement précis dépend de votre usage. La machine
se déduit du modèle, jamais l'inverse : nous cadrons d'abord vos besoins, nous en tirons le modèle qui y répond,
puis la configuration capable de le faire tourner. Les configurations citées ici sont des repères de lecture, pas
un catalogue fermé. Les métadonnées
(popularité, mises à jour) proviennent de l'API Hugging Face. Deux familles restent en dehors de cette liste.
Celles dont la licence maison impose des contreparties commerciales, comme Kimi K3, quand bien même elles se
présentent comme ouvertes. Et celles qui, comme DeepSeek V4 Pro, dépassent le millier de milliards de
paramètres : elles demandent plusieurs serveurs et relèvent de configurations personnalisées, que nous
étudions sur demande dans le cadre d'un audit gratuit.
Un modèle vous intéresse ?
Nous dimensionnons la machine, installons le modèle dans vos locaux et le maintenons dans le temps.
On fait le point ensemble sur vos usages, gratuitement.
Bonjour ! Je suis Iris, l'assistante IA de Sover.tech. Une question sur les modèles de ce comparatif ? Décrivez-moi vos usages et votre équipe, je vous aide à choisir le modèle et la configuration adaptés.
Iris est une IA, elle peut se tromper. Ne partagez pas d'informations sensibles.
Session éphémère : aucune trace de votre conversation n'est sauvegardée.