Saltar al contenido

Kimi K2 Instruct

MoE

Moonshot AIMoonshot AI · 1T (32B activos) · Mezcla de expertos

Kimi K2 Instruct es un modelo de 1T de Moonshot AI con un contexto de 128K tokens. En Q4_K_M con 8K de contexto necesita unos 579 GB; con 725 GB tienes margen para conversaciones largas.

Hugging Face GGUF

Mezcla de expertos

Parámetros: 1T · Activos: 32B

Los 1T parámetros se cargan en memoria, pero sólo 32B trabajan en cada token, así que va a la velocidad de un modelo mucho más pequeño.

Opciones de cuantización

Cuant.MemoriaEn tu hardware
Q2_K—…
Q3_K_M—…
Q4_K_M—…
Q5_K_M—…
Q6_K—…
Q8_0—…
F16—…

Memoria según el contexto

En Q4_K_M. La caché del contexto crece con cada token que el modelo recuerda.

ContextoCaché de contextoTotal
4K0,3 GB578,7 GB
8K0,5 GB579 GB
32K2,1 GB580,6 GB
128K8,6 GB587 GB

Comparte una velocidad medida

Ejecuta uno de estos y pega abajo la salida completa (o sólo los tokens por segundo):

llama-bench -m model.gguf
ollama run model --verbose

Se publica de forma anónima y se conserva. No guardamos cuenta ni dirección, sólo un hash que cambia cada día para limitar a diez envíos diarios.

Siguiente paso

El hardware mínimo donde va bien

Equipos de escritorio con la menor memoria que dan a Kimi K2 nota A o S en Q4_K_M.

Ningún equipo de escritorio del catálogo lo ejecuta con nota A o mejor.

¿Puedo ejecutar Kimi K2 Instruct en local?

¿Puedo ejecutar Kimi K2 Instruct en local?

Sí, si tu GPU o tu Mac tiene unos 579 GB libres para él en Q4_K_M. Abre esta página en ese ordenador para ver la nota de tu hardware exacto y arráncalo con llama.cpp, Ollama o LM Studio.

¿Cuánta memoria necesita Kimi K2 Instruct?

Unos 579 GB en Q4_K_M con 8K de contexto y 1017 GB en Q8_0. Las cuantizaciones más bajas caben en tarjetas más pequeñas con algo de pérdida de calidad; los contextos largos suman al total.