Saltar al contenido

Phi-4 14B

MicrosoftMicrosoft · 14,7B · Denso

Phi-4 14B es un modelo de 14,7B de Microsoft con un contexto de 16K tokens. En Q4_K_M con 8K de contexto necesita unos 10,1 GB; con 14 GB tienes margen para conversaciones largas.

Hugging Face GGUF

Opciones de cuantización

Cuant.MemoriaEn tu hardware
Q2_K—…
Q3_K_M—…
Q4_K_M—…
Q5_K_M—…
Q6_K—…
Q8_0—…
F16—…

Memoria según el contexto

En Q4_K_M. La caché del contexto crece con cada token que el modelo recuerda.

ContextoCaché de contextoTotal
4K0,8 GB9,4 GB
8K1,6 GB10,1 GB

Comparte una velocidad medida

Ejecuta uno de estos y pega abajo la salida completa (o sólo los tokens por segundo):

llama-bench -m model.gguf
ollama run model --verbose

Se publica de forma anónima y se conserva. No guardamos cuenta ni dirección, sólo un hash que cambia cada día para limitar a diez envíos diarios.

Siguiente paso

Alternativas más pequeñas

Modelos que necesitan menos memoria que Phi-4 14B y puntúan casi igual o mejor.

¿Puedo ejecutar Phi-4 14B en local?

¿Puedo ejecutar Phi-4 14B en local?

Sí, si tu GPU o tu Mac tiene unos 10,1 GB libres para él en Q4_K_M. Abre esta página en ese ordenador para ver la nota de tu hardware exacto y arráncalo con llama.cpp, Ollama o LM Studio.

¿Cuánta memoria necesita Phi-4 14B?

Unos 10,1 GB en Q4_K_M con 8K de contexto y 16,4 GB en Q8_0. Las cuantizaciones más bajas caben en tarjetas más pequeñas con algo de pérdida de calidad; los contextos largos suman al total.