Kleinere Alternativen
Modelle, die weniger Speicher als Qwen3.6 35B A3B brauchen und etwa gleich gut oder besser abschneiden.
Qwen · 36B (3B aktiv) · Mixture of Experts
Qwen3.6 35B A3B ist ein 36B-Modell von Qwen mit 256K Token Kontext. In Q4_K_M mit 8K Kontext braucht es etwa 21,2 GB; mit 28 GB bleibt Luft für lange Chats.
Mixture of Experts
Parameter: 36B · Aktiv: 3B
Alle 36B Parameter liegen im Speicher, aber nur 3B arbeiten pro Token – es läuft also so schnell wie ein viel kleineres Modell.
| Quant. | Bits | Speicher | Qualität | Auf deiner Hardware |
|---|---|---|---|---|
| Q2_K | 3,16 | — | Spürbar schlechter | … |
| Q3_K_M | 4 | — | Etwas Verlust | … |
| Q4_K_M | 4,89 | — | Gut | … |
| Q5_K_M | 5,7 | — | Gut | … |
| Q6_K | 6,56 | — | Fast original | … |
| Q8_0 | 8,5 | — | Fast original | … |
| F16 | 16 | — | Original | … |
In Q4_K_M. Der Kontext-Cache wächst mit jedem Token, das das Modell im Blick behält.
| Kontext | Kontext-Cache | Gesamt |
|---|---|---|
| 4K | 0,1 GB | 21,1 GB |
| 8K | 0,2 GB | 21,2 GB |
| 32K | 0,6 GB | 21,7 GB |
| 128K | 2,5 GB | 23,6 GB |
| 256K | 5 GB | 26,1 GB |
Modelle, die weniger Speicher als Qwen3.6 35B A3B brauchen und etwa gleich gut oder besser abschneiden.
Bewertete Modelle ähnlicher Größe, nebeneinander auf deinem Gerät.
Desktop-Geräte mit dem wenigsten Speicher, die Qwen3.6 35B A3B bei Q4_K_M Note A oder S geben.
Ja, wenn deine GPU oder dein Mac in Q4_K_M etwa 21,2 GB frei hat. Öffne diese Seite auf dem Rechner, um die Note für deine Hardware zu sehen, und starte es mit llama.cpp, Ollama oder LM Studio.
Etwa 21,2 GB in Q4_K_M mit 8K Kontext und 34,8 GB in Q8_0. Niedrigere Quantisierungen passen auf kleinere Karten, mit etwas Qualitätsverlust; längerer Kontext kommt hinzu.