Aller au contenu

Mistral Medium 3.5 128B

Vision

Mistral AIMistral AI · 127,7B · Dense

Mistral Medium 3.5 128B est un modèle de 127,7B de Mistral AI avec un contexte de 256K tokens. En Q4_K_M avec 8K de contexte, il demande environ 72,8 Go ; 93 Go laissent de la marge pour les longues conversations.

Hugging Face GGUF

Options de quantification

Quant.MémoireSur votre matériel
Q2_K—…
Q3_K_M—…
Q4_K_M—…
Q5_K_M—…
Q6_K—…
Q8_0—…
F16—…

Mémoire selon le contexte

En Q4_K_M. Le cache du contexte grandit à chaque token que le modèle garde en tête.

ContexteCache de contexteTotal
4K1,4 GB71,4 GB
8K2,8 GB72,8 GB
32K11 GB81,1 GB
128K44 GB114,1 GB
256K88 GB158,1 GB

Partager une vitesse mesurée

Lancez l’une de ces commandes et collez toute la sortie ci-dessous (ou seulement les tokens par seconde) :

llama-bench -m model.gguf
ollama run model --verbose

Publié anonymement et conservé. Aucun compte ni adresse stockés, seulement une empreinte qui change chaque jour pour limiter à dix envois par jour.

Pour aller plus loin

Le matériel minimal où il tourne bien

Les appareils de bureau avec le moins de mémoire qui donnent à Mistral Medium 3.5 128B la note A ou S en Q4_K_M.

Aucun appareil de bureau du catalogue ne le fait tourner avec la note A ou mieux.

Puis-je faire tourner Mistral Medium 3.5 128B en local ?

Puis-je faire tourner Mistral Medium 3.5 128B en local ?

Oui, si votre GPU ou votre Mac dispose d'environ 72,8 Go libres en Q4_K_M. Ouvrez cette page sur cet ordinateur pour voir la note de votre matériel, puis lancez-le avec llama.cpp, Ollama ou LM Studio.

De combien de mémoire Mistral Medium 3.5 128B a-t-il besoin ?

Environ 72,8 Go en Q4_K_M avec 8K de contexte et 126,8 Go en Q8_0. Les quantifications plus basses tiennent sur des cartes plus petites avec une perte de qualité ; les longs contextes s'ajoutent au total.