Zum Inhalt

Die besten lokalen KI-Modelle für 32 GB VRAM

37 offene Modelle passen bei Q4_K_M mit 8K Kontext in 32 GB Grafikspeicher; 15 davon haben eine unabhängige Intelligenzbewertung. Hier sind sie gerankt, mit dem längsten Kontext, den jedes schafft.

Die besten Wahlen für 32 GB

Tempo auf RTX 5090, der neuesten NVIDIA-Karte mit so viel Speicher. Max. Kontext ist der längste, der noch ohne Auslagern in den RAM lädt.

Alle bewerteten Modelle, die in 32 GB passen

#ModellECISpeicherMax. Kontext
1QwenQwen3.8 27B149,417 GB128K
2QwenQwen3.6 27B146,516,5 GB128K
3QwenQwen3.6 35B A3B143,921,2 GB256K
4GoogleGemma 4 31B142,718,8 GB128K
5QwenQwen3.5 35B A3B142,521 GB256K
6GoogleGemma 4 26B A4B141,916,5 GB256K
7QwenQwen3 30B A3B Thinking 2507139,618,3 GB128K
8QwenQwen3.5 9B139,55,8 GB256K
9OpenAIgpt-oss 20b137,811,3 GB128K
10QwenQwen3 30B A3B 2507137,418,3 GB128K
11Mistral AIMagistral Small 2506133,214,9 GB32K
12Mistral AIMistral Small 3.2 24B131,714,9 GB64K
13Mistral AIMagistral Small 2509131,414,9 GB64K
14MicrosoftPhi-4 14B130,410,1 GB16K
15MetaLlama 3.1 8B116,65,9 GB128K

22 weitere, die passen, aber noch keine unabhängige Bewertung haben

Größte zuerst, mit dem längsten Kontext, den jedes schafft.

Speicher bei Q4_K_M mit 8K Kontext, inklusive der Puffer der Software. Kleinere Quantisierung braucht weniger, längerer Kontext mehr.

Was 48 GB dazu bringen

1 weitere bewertete Modelle passen in 48 GB; die intelligentesten davon unten.

Zum 48-GB-Ratgeber

Geräte mit 32 GB