Aller au contenu

DeepSeek V4 Flash 0731

MoE

DeepSeekDeepSeek · 304,2B (13B actifs) · Mélange d'experts

DeepSeek V4 Flash 0731 est un modèle de 304,2B de DeepSeek avec un contexte de 1M tokens. En Q4_K_M avec 8K de contexte, il demande environ 161 Go ; 203 Go laissent de la marge pour les longues conversations.

Hugging Face GGUF

Mélange d'experts

Paramètres: 304,2B · Actifs: 13B

Les 304,2B paramètres sont chargés en mémoire, mais seuls 13B travaillent sur chaque token : il tourne à la vitesse d'un modèle bien plus petit.

Options de quantification

Quant.MémoireSur votre matériel
Q2_K—…
Q3_K_M—…
Q4_K_M—…
Q5_K_M—…
Q6_K—…
Q8_0—…
F16—…

Mémoire selon le contexte

En Q4_K_M. Le cache du contexte grandit à chaque token que le modèle garde en tête.

ContexteCache de contexteTotal
4K0,3 GB160,7 GB
8K0,7 GB161 GB
32K2,7 GB163 GB
128K10,8 GB171,1 GB
256K21,5 GB181,8 GB

Partager une vitesse mesurée

Lancez l’une de ces commandes et collez toute la sortie ci-dessous (ou seulement les tokens par seconde) :

llama-bench -m model.gguf
ollama run model --verbose

Publié anonymement et conservé. Aucun compte ni adresse stockés, seulement une empreinte qui change chaque jour pour limiter à dix envois par jour.

Pour aller plus loin

Alternatives plus légères

Des modèles qui demandent moins de mémoire que DeepSeek V4 Flash 0731 et obtiennent un score proche ou meilleur.

Aucun modèle noté n’est à la fois plus léger et presque aussi intelligent que DeepSeek V4 Flash 0731.

Le matériel minimal où il tourne bien

Les appareils de bureau avec le moins de mémoire qui donnent à DeepSeek V4 Flash 0731 la note A ou S en Q4_K_M.

Puis-je faire tourner DeepSeek V4 Flash 0731 en local ?

Puis-je faire tourner DeepSeek V4 Flash 0731 en local ?

Oui, si votre GPU ou votre Mac dispose d'environ 161 Go libres en Q4_K_M. Ouvrez cette page sur cet ordinateur pour voir la note de votre matériel, puis lancez-le avec llama.cpp, Ollama ou LM Studio.

De combien de mémoire DeepSeek V4 Flash 0731 a-t-il besoin ?

Environ 161 Go en Q4_K_M avec 8K de contexte et 282,4 Go en Q8_0. Les quantifications plus basses tiennent sur des cartes plus petites avec une perte de qualité ; les longs contextes s'ajoutent au total.