Zum Inhalt

DeepSeek V4.1 Flash

MoEVision

DeepSeekDeepSeek · 763,2B (16B aktiv) · Mixture of Experts

DeepSeek V4.1 Flash ist ein 763,2B-Modell von DeepSeek mit 1M Token Kontext. In Q4_K_M mit 8K Kontext braucht es etwa 435,8 GB; mit 546 GB bleibt Luft für lange Chats.

Hugging Face

Mixture of Experts

Parameter: 763,2B · Aktiv: 16B

Alle 763,2B Parameter liegen im Speicher, aber nur 16B arbeiten pro Token – es läuft also so schnell wie ein viel kleineres Modell.

Quantisierungsoptionen

Quant.SpeicherAuf deiner Hardware
Q2_K—…
Q3_K_M—…
Q4_K_M—…
Q5_K_M—…
Q6_K—…
Q8_0—…
F16—…

Speicher nach Kontextlänge

In Q4_K_M. Der Kontext-Cache wächst mit jedem Token, das das Modell im Blick behält.

KontextKontext-CacheGesamt
4K0,3 GB435,5 GB
8K0,6 GB435,8 GB
32K2,5 GB437,7 GB
128K10 GB445,2 GB
256K20 GB455,2 GB

Gemessene Geschwindigkeit teilen

Führe einen dieser Befehle aus und füge die ganze Ausgabe unten ein (oder nur die Tokens pro Sekunde):

llama-bench -m model.gguf
ollama run model --verbose

Anonym veröffentlicht und aufbewahrt. Wir speichern kein Konto und keine Adresse, nur einen täglich wechselnden Hash für ein Limit von zehn Einsendungen pro Tag.

Nächste Schritte

Die kleinste Hardware, auf der es gut läuft

Desktop-Geräte mit dem wenigsten Speicher, die DeepSeek V4.1 Flash bei Q4_K_M Note A oder S geben.

Kein Desktop-Gerät in unserem Katalog erreicht damit Note A oder besser.

Kann ich DeepSeek V4.1 Flash lokal ausführen?

Kann ich DeepSeek V4.1 Flash lokal ausführen?

Ja, wenn deine GPU oder dein Mac in Q4_K_M etwa 435,8 GB frei hat. Öffne diese Seite auf dem Rechner, um die Note für deine Hardware zu sehen, und starte es mit llama.cpp, Ollama oder LM Studio.

Wie viel Speicher braucht DeepSeek V4.1 Flash?

Etwa 435,8 GB in Q4_K_M mit 8K Kontext und 756,2 GB in Q8_0. Niedrigere Quantisierungen passen auf kleinere Karten, mit etwas Qualitätsverlust; längerer Kontext kommt hinzu.