Saltar al contenido

DeepSeek V4 Flash 0731

MoE

DeepSeekDeepSeek · 304,2B (13B activos) · Mezcla de expertos

DeepSeek V4 Flash 0731 es un modelo de 304,2B de DeepSeek con un contexto de 1M tokens. En Q4_K_M con 8K de contexto necesita unos 161 GB; con 203 GB tienes margen para conversaciones largas.

Hugging Face GGUF

Mezcla de expertos

Parámetros: 304,2B · Activos: 13B

Los 304,2B parámetros se cargan en memoria, pero sólo 13B trabajan en cada token, así que va a la velocidad de un modelo mucho más pequeño.

Opciones de cuantización

Cuant.MemoriaEn tu hardware
Q2_K—…
Q3_K_M—…
Q4_K_M—…
Q5_K_M—…
Q6_K—…
Q8_0—…
F16—…

Memoria según el contexto

En Q4_K_M. La caché del contexto crece con cada token que el modelo recuerda.

ContextoCaché de contextoTotal
4K0,3 GB160,7 GB
8K0,7 GB161 GB
32K2,7 GB163 GB
128K10,8 GB171,1 GB
256K21,5 GB181,8 GB

Comparte una velocidad medida

Ejecuta uno de estos y pega abajo la salida completa (o sólo los tokens por segundo):

llama-bench -m model.gguf
ollama run model --verbose

Se publica de forma anónima y se conserva. No guardamos cuenta ni dirección, sólo un hash que cambia cada día para limitar a diez envíos diarios.

Siguiente paso

Alternativas más pequeñas

Modelos que necesitan menos memoria que DeepSeek V4 Flash 0731 y puntúan casi igual o mejor.

Ningún modelo puntuado es a la vez más pequeño y casi tan inteligente como DeepSeek V4 Flash 0731.

El hardware mínimo donde va bien

Equipos de escritorio con la menor memoria que dan a DeepSeek V4 Flash 0731 nota A o S en Q4_K_M.

¿Puedo ejecutar DeepSeek V4 Flash 0731 en local?

¿Puedo ejecutar DeepSeek V4 Flash 0731 en local?

Sí, si tu GPU o tu Mac tiene unos 161 GB libres para él en Q4_K_M. Abre esta página en ese ordenador para ver la nota de tu hardware exacto y arráncalo con llama.cpp, Ollama o LM Studio.

¿Cuánta memoria necesita DeepSeek V4 Flash 0731?

Unos 161 GB en Q4_K_M con 8K de contexto y 282,4 GB en Q8_0. Las cuantizaciones más bajas caben en tarjetas más pequeñas con algo de pérdida de calidad; los contextos largos suman al total.