Saltar al contenido

Qwen3 30B A3B Instruct 2507

MoE

QwenQwen · 30,5B (3,3B activos) · Mezcla de expertos

Qwen3 30B A3B Instruct 2507 es un modelo de 30,5B de Qwen con un contexto de 256K tokens. En Q4_K_M con 8K de contexto necesita unos 18,3 GB; con 24 GB tienes margen para conversaciones largas.

Hugging Face GGUF

Mezcla de expertos

Parámetros: 30,5B · Activos: 3,3B

Los 30,5B parámetros se cargan en memoria, pero sólo 3,3B trabajan en cada token, así que va a la velocidad de un modelo mucho más pequeño.

Opciones de cuantización

Cuant.MemoriaEn tu hardware
Q2_K—…
Q3_K_M—…
Q4_K_M—…
Q5_K_M—…
Q6_K—…
Q8_0—…
F16—…

Memoria según el contexto

En Q4_K_M. La caché del contexto crece con cada token que el modelo recuerda.

ContextoCaché de contextoTotal
4K0,4 GB18 GB
8K0,8 GB18,3 GB
32K3 GB20,6 GB
128K12 GB29,6 GB
256K24 GB41,6 GB

Comparte una velocidad medida

Ejecuta uno de estos y pega abajo la salida completa (o sólo los tokens por segundo):

llama-bench -m model.gguf
ollama run model --verbose

Se publica de forma anónima y se conserva. No guardamos cuenta ni dirección, sólo un hash que cambia cada día para limitar a diez envíos diarios.

Siguiente paso

¿Puedo ejecutar Qwen3 30B A3B Instruct 2507 en local?

¿Puedo ejecutar Qwen3 30B A3B Instruct 2507 en local?

Sí, si tu GPU o tu Mac tiene unos 18,3 GB libres para él en Q4_K_M. Abre esta página en ese ordenador para ver la nota de tu hardware exacto y arráncalo con llama.cpp, Ollama o LM Studio.

¿Cuánta memoria necesita Qwen3 30B A3B Instruct 2507?

Unos 18,3 GB en Q4_K_M con 8K de contexto y 31,3 GB en Q8_0. Las cuantizaciones más bajas caben en tarjetas más pequeñas con algo de pérdida de calidad; los contextos largos suman al total.