Die besten lokalen KI-Modelle für 8 GB VRAM
15 offene Modelle passen bei Q4_K_M mit 8K Kontext in 8 GB Grafikspeicher; 2 davon haben eine unabhängige Intelligenzbewertung. Hier sind sie gerankt, mit dem längsten Kontext, den jedes schafft.
Die besten Wahlen für 8 GB
#1 · ECI 139,5
Qwen3.5 9B
- Speicher
- 5,8 GB
- Max. Kontext
- 32K
- Tempo
- ~50 t/s
#2 · ECI 116,6
Llama 3.1 8B
- Speicher
- 5,9 GB
- Max. Kontext
- 16K
- Tempo
- ~54 t/s
Tempo auf RTX 5060 Ti 8GB, der neuesten NVIDIA-Karte mit so viel Speicher. Max. Kontext ist der längste, der noch ohne Auslagern in den RAM lädt.
Alle bewerteten Modelle, die in 8 GB passen
| # | Modell | ECI | Speicher | Max. Kontext |
|---|---|---|---|---|
| 1 | 139,5 | 5,8 GB | 32K | |
| 2 | 116,6 | 5,9 GB | 16K |
13 weitere, die passen, aber noch keine unabhängige Bewertung haben
Größte zuerst, mit dem längsten Kontext, den jedes schafft.
Ministral 3 8B8,9B · 8K
Granite 4.2 8B8,8B · 8K
Gemma 4 E4B8B · 128K
Olmo 3 7B7,3B · 8K
Gemma 4 E2B5,1B · 128K
Qwen3.5 4B4,7B · 128K
Ministral 3 3B3,9B · 32K
Granite 4.2 3B3,7B · 32K
Llama 3.2 3B3,2B · 32K
SmolLM3 3B3,1B · 64K
LFM2.5 2.6B2,7B · 128K
Qwen3.5 2B2,3B · 256K
Qwen3.5 0.8B0,9B · 256K
Speicher bei Q4_K_M mit 8K Kontext, inklusive der Puffer der Software. Kleinere Quantisierung braucht weniger, längerer Kontext mehr.
Was 12 GB dazu bringen
1 weitere bewertete Modelle passen in 12 GB; die intelligentesten davon unten.
Zum 12-GB-Ratgeber