Les meilleurs modèles d'IA en local pour 16 Go de VRAM
23 modèles ouverts tiennent dans 16 Go de mémoire graphique en Q4_K_M avec un contexte de 8K ; 7 ont un score d’intelligence indépendant. Les voici classés, avec le contexte le plus long que chacun accepte.
Les meilleurs choix pour 16 Go
#1 · ECI 139,5
Qwen3.5 9B
- Mémoire
- 5,8 GB
- Contexte max.
- 256K
- Vitesse
- ~108 t/s
#2 · ECI 137,8
gpt-oss 20b
- Mémoire
- 11,3 GB
- Contexte max.
- 128K
- Vitesse
- ~299 t/s
#3 · ECI 133,2
Magistral Small 2506
- Mémoire
- 14,9 GB
- Contexte max.
- 8K
- Vitesse
- ~42 t/s
Vitesses sur RTX 5080, la carte NVIDIA la plus récente avec cette mémoire. Le contexte max. est le plus long qui se charge encore sans déborder dans la RAM.
Tous les modèles notés qui tiennent dans 16 Go
| # | Modèle | ECI | Mémoire | Contexte max. |
|---|---|---|---|---|
| 1 | 139,5 | 5,8 GB | 256K | |
| 2 | 137,8 | 11,3 GB | 128K | |
| 3 | 133,2 | 14,9 GB | 8K | |
| 4 | 131,7 | 14,9 GB | 8K | |
| 5 | 131,4 | 14,9 GB | 8K | |
| 6 | 130,4 | 10,1 GB | 16K | |
| 7 | 116,6 | 5,9 GB | 64K |
16 autres qui tiennent mais n’ont pas encore de score indépendant
Les plus gros d’abord, avec le contexte le plus long que chacun accepte.
Devstral Small 2 24B24B · 8K
Ministral 3 14B14B · 32K
Gemma 4 12B12B · 256K
Ministral 3 8B8,9B · 64K
Granite 4.2 8B8,8B · 32K
Gemma 4 E4B8B · 128K
Olmo 3 7B7,3B · 64K
Gemma 4 E2B5,1B · 128K
Qwen3.5 4B4,7B · 256K
Ministral 3 3B3,9B · 64K
Granite 4.2 3B3,7B · 128K
Llama 3.2 3B3,2B · 64K
SmolLM3 3B3,1B · 64K
LFM2.5 2.6B2,7B · 128K
Qwen3.5 2B2,3B · 256K
Qwen3.5 0.8B0,9B · 256K
Mémoire en Q4_K_M avec un contexte de 8K, tampons du logiciel compris. Une quantification plus petite tient dans moins ; un contexte plus long demande plus.
Ce qu’apportent 24 Go
8 modèles notés de plus tiennent dans 24 Go ; les plus intelligents ci-dessous.
Voir le guide 24 Go