Zum Inhalt

Qwen3 30B A3B Thinking 2507

MoE

QwenQwen · 30,5B (3,3B aktiv) · Mixture of Experts

Qwen3 30B A3B Thinking 2507 ist ein 30,5B-Modell von Qwen mit 256K Token Kontext. In Q4_K_M mit 8K Kontext braucht es etwa 18,3 GB; mit 24 GB bleibt Luft für lange Chats.

Hugging Face GGUF

Mixture of Experts

Parameter: 30,5B · Aktiv: 3,3B

Alle 30,5B Parameter liegen im Speicher, aber nur 3,3B arbeiten pro Token – es läuft also so schnell wie ein viel kleineres Modell.

Quantisierungsoptionen

Quant.SpeicherAuf deiner Hardware
Q2_K—…
Q3_K_M—…
Q4_K_M—…
Q5_K_M—…
Q6_K—…
Q8_0—…
F16—…

Speicher nach Kontextlänge

In Q4_K_M. Der Kontext-Cache wächst mit jedem Token, das das Modell im Blick behält.

KontextKontext-CacheGesamt
4K0,4 GB18 GB
8K0,8 GB18,3 GB
32K3 GB20,6 GB
128K12 GB29,6 GB
256K24 GB41,6 GB

Gemessene Geschwindigkeit teilen

Führe einen dieser Befehle aus und füge die ganze Ausgabe unten ein (oder nur die Tokens pro Sekunde):

llama-bench -m model.gguf
ollama run model --verbose

Anonym veröffentlicht und aufbewahrt. Wir speichern kein Konto und keine Adresse, nur einen täglich wechselnden Hash für ein Limit von zehn Einsendungen pro Tag.

Nächste Schritte

Kann ich Qwen3 30B A3B Thinking 2507 lokal ausführen?

Kann ich Qwen3 30B A3B Thinking 2507 lokal ausführen?

Ja, wenn deine GPU oder dein Mac in Q4_K_M etwa 18,3 GB frei hat. Öffne diese Seite auf dem Rechner, um die Note für deine Hardware zu sehen, und starte es mit llama.cpp, Ollama oder LM Studio.

Wie viel Speicher braucht Qwen3 30B A3B Thinking 2507?

Etwa 18,3 GB in Q4_K_M mit 8K Kontext und 31,3 GB in Q8_0. Niedrigere Quantisierungen passen auf kleinere Karten, mit etwas Qualitätsverlust; längerer Kontext kommt hinzu.