Les meilleurs modèles d'IA en local pour 32 Go de VRAM
37 modèles ouverts tiennent dans 32 Go de mémoire graphique en Q4_K_M avec un contexte de 8K ; 15 ont un score d’intelligence indépendant. Les voici classés, avec le contexte le plus long que chacun accepte.
Les meilleurs choix pour 32 Go
#1 · ECI 149,4
Qwen3.8 27B
- Mémoire
- 17 GB
- Contexte max.
- 128K
- Vitesse
- ~66 t/s
#2 · ECI 146,5
Qwen3.6 27B
- Mémoire
- 16,5 GB
- Contexte max.
- 128K
- Vitesse
- ~69 t/s
#3 · ECI 143,9
Qwen3.6 35B A3B
- Mémoire
- 21,2 GB
- Contexte max.
- 256K
- Vitesse
- ~604 t/s
Vitesses sur RTX 5090, la carte NVIDIA la plus récente avec cette mémoire. Le contexte max. est le plus long qui se charge encore sans déborder dans la RAM.
Tous les modèles notés qui tiennent dans 32 Go
| # | Modèle | ECI | Mémoire | Contexte max. |
|---|---|---|---|---|
| 1 | 149,4 | 17 GB | 128K | |
| 2 | 146,5 | 16,5 GB | 128K | |
| 3 | 143,9 | 21,2 GB | 256K | |
| 4 | 142,7 | 18,8 GB | 128K | |
| 5 | 142,5 | 21 GB | 256K | |
| 6 | 141,9 | 16,5 GB | 256K | |
| 7 | 139,6 | 18,3 GB | 128K | |
| 8 | 139,5 | 5,8 GB | 256K | |
| 9 | 137,8 | 11,3 GB | 128K | |
| 10 | 137,4 | 18,3 GB | 128K | |
| 11 | 133,2 | 14,9 GB | 32K | |
| 12 | 131,7 | 14,9 GB | 64K | |
| 13 | 131,4 | 14,9 GB | 64K | |
| 14 | 130,4 | 10,1 GB | 16K | |
| 15 | 116,6 | 5,9 GB | 128K |
22 autres qui tiennent mais n’ont pas encore de score indépendant
Les plus gros d’abord, avec le contexte le plus long que chacun accepte.
Kimi Linear 48B A3B49,1B · 256K
Olmo 3.1 32B Think32,2B · 64K
Nemotron 3.5 Lightning 30B A3B31,6B · 256K
GLM 4.7 Flash31,2B · 128K
North Mini Code 1.030,5B · 256K
Granite 4.2 30B29,3B · 32K
Devstral Small 2 24B24B · 64K
Ministral 3 14B14B · 128K
Gemma 4 12B12B · 256K
Ministral 3 8B8,9B · 128K
Granite 4.2 8B8,8B · 128K
Gemma 4 E4B8B · 128K
Olmo 3 7B7,3B · 64K
Gemma 4 E2B5,1B · 128K
Qwen3.5 4B4,7B · 256K
Ministral 3 3B3,9B · 256K
Granite 4.2 3B3,7B · 128K
Llama 3.2 3B3,2B · 128K
SmolLM3 3B3,1B · 64K
LFM2.5 2.6B2,7B · 128K
Qwen3.5 2B2,3B · 256K
Qwen3.5 0.8B0,9B · 256K
Mémoire en Q4_K_M avec un contexte de 8K, tampons du logiciel compris. Une quantification plus petite tient dans moins ; un contexte plus long demande plus.
Ce qu’apportent 48 Go
1 modèles notés de plus tiennent dans 48 Go ; les plus intelligents ci-dessous.
Voir le guide 48 Go