Saltar al contenido

Mistral Medium 3.5 128B

Visión

Mistral AIMistral AI · 127,7B · Denso

Mistral Medium 3.5 128B es un modelo de 127,7B de Mistral AI con un contexto de 256K tokens. En Q4_K_M con 8K de contexto necesita unos 72,8 GB; con 93 GB tienes margen para conversaciones largas.

Hugging Face GGUF

Opciones de cuantización

Cuant.MemoriaEn tu hardware
Q2_K—…
Q3_K_M—…
Q4_K_M—…
Q5_K_M—…
Q6_K—…
Q8_0—…
F16—…

Memoria según el contexto

En Q4_K_M. La caché del contexto crece con cada token que el modelo recuerda.

ContextoCaché de contextoTotal
4K1,4 GB71,4 GB
8K2,8 GB72,8 GB
32K11 GB81,1 GB
128K44 GB114,1 GB
256K88 GB158,1 GB

Comparte una velocidad medida

Ejecuta uno de estos y pega abajo la salida completa (o sólo los tokens por segundo):

llama-bench -m model.gguf
ollama run model --verbose

Se publica de forma anónima y se conserva. No guardamos cuenta ni dirección, sólo un hash que cambia cada día para limitar a diez envíos diarios.

Siguiente paso

El hardware mínimo donde va bien

Equipos de escritorio con la menor memoria que dan a Mistral Medium 3.5 128B nota A o S en Q4_K_M.

Ningún equipo de escritorio del catálogo lo ejecuta con nota A o mejor.

¿Puedo ejecutar Mistral Medium 3.5 128B en local?

¿Puedo ejecutar Mistral Medium 3.5 128B en local?

Sí, si tu GPU o tu Mac tiene unos 72,8 GB libres para él en Q4_K_M. Abre esta página en ese ordenador para ver la nota de tu hardware exacto y arráncalo con llama.cpp, Ollama o LM Studio.

¿Cuánta memoria necesita Mistral Medium 3.5 128B?

Unos 72,8 GB en Q4_K_M con 8K de contexto y 126,8 GB en Q8_0. Las cuantizaciones más bajas caben en tarjetas más pequeñas con algo de pérdida de calidad; los contextos largos suman al total.