Les meilleurs modèles d'IA en local pour 12 Go de VRAM
18 modèles ouverts tiennent dans 12 Go de mémoire graphique en Q4_K_M avec un contexte de 8K ; 3 ont un score d’intelligence indépendant. Les voici classés, avec le contexte le plus long que chacun accepte.
Les meilleurs choix pour 12 Go
#1 · ECI 139,5
Qwen3.5 9B
- Mémoire
- 5,8 GB
- Contexte max.
- 128K
- Vitesse
- ~76 t/s
#2 · ECI 130,4
Phi-4 14B
- Mémoire
- 10,1 GB
- Contexte max.
- 8K
- Vitesse
- ~45 t/s
#3 · ECI 116,6
Llama 3.1 8B
- Mémoire
- 5,9 GB
- Contexte max.
- 32K
- Vitesse
- ~81 t/s
Vitesses sur RTX 5070, la carte NVIDIA la plus récente avec cette mémoire. Le contexte max. est le plus long qui se charge encore sans déborder dans la RAM.
Tous les modèles notés qui tiennent dans 12 Go
| # | Modèle | ECI | Mémoire | Contexte max. |
|---|---|---|---|---|
| 1 | 139,5 | 5,8 GB | 128K | |
| 2 | 130,4 | 10,1 GB | 8K | |
| 3 | 116,6 | 5,9 GB | 32K |
15 autres qui tiennent mais n’ont pas encore de score indépendant
Les plus gros d’abord, avec le contexte le plus long que chacun accepte.
Ministral 3 14B14B · 16K
Gemma 4 12B12B · 128K
Ministral 3 8B8,9B · 32K
Granite 4.2 8B8,8B · 32K
Gemma 4 E4B8B · 128K
Olmo 3 7B7,3B · 32K
Gemma 4 E2B5,1B · 128K
Qwen3.5 4B4,7B · 256K
Ministral 3 3B3,9B · 64K
Granite 4.2 3B3,7B · 64K
Llama 3.2 3B3,2B · 64K
SmolLM3 3B3,1B · 64K
LFM2.5 2.6B2,7B · 128K
Qwen3.5 2B2,3B · 256K
Qwen3.5 0.8B0,9B · 256K
Mémoire en Q4_K_M avec un contexte de 8K, tampons du logiciel compris. Une quantification plus petite tient dans moins ; un contexte plus long demande plus.
Ce qu’apportent 16 Go
4 modèles notés de plus tiennent dans 16 Go ; les plus intelligents ci-dessous.
Voir le guide 16 Go