Aller au contenu

Qwen3 30B A3B Thinking 2507

MoE

QwenQwen · 30,5B (3,3B actifs) · Mélange d'experts

Qwen3 30B A3B Thinking 2507 est un modèle de 30,5B de Qwen avec un contexte de 256K tokens. En Q4_K_M avec 8K de contexte, il demande environ 18,3 Go ; 24 Go laissent de la marge pour les longues conversations.

Hugging Face GGUF

Mélange d'experts

Paramètres: 30,5B · Actifs: 3,3B

Les 30,5B paramètres sont chargés en mémoire, mais seuls 3,3B travaillent sur chaque token : il tourne à la vitesse d'un modèle bien plus petit.

Options de quantification

Quant.MémoireSur votre matériel
Q2_K—…
Q3_K_M—…
Q4_K_M—…
Q5_K_M—…
Q6_K—…
Q8_0—…
F16—…

Mémoire selon le contexte

En Q4_K_M. Le cache du contexte grandit à chaque token que le modèle garde en tête.

ContexteCache de contexteTotal
4K0,4 GB18 GB
8K0,8 GB18,3 GB
32K3 GB20,6 GB
128K12 GB29,6 GB
256K24 GB41,6 GB

Partager une vitesse mesurée

Lancez l’une de ces commandes et collez toute la sortie ci-dessous (ou seulement les tokens par seconde) :

llama-bench -m model.gguf
ollama run model --verbose

Publié anonymement et conservé. Aucun compte ni adresse stockés, seulement une empreinte qui change chaque jour pour limiter à dix envois par jour.

Pour aller plus loin

Puis-je faire tourner Qwen3 30B A3B Thinking 2507 en local ?

Puis-je faire tourner Qwen3 30B A3B Thinking 2507 en local ?

Oui, si votre GPU ou votre Mac dispose d'environ 18,3 Go libres en Q4_K_M. Ouvrez cette page sur cet ordinateur pour voir la note de votre matériel, puis lancez-le avec llama.cpp, Ollama ou LM Studio.

De combien de mémoire Qwen3 30B A3B Thinking 2507 a-t-il besoin ?

Environ 18,3 Go en Q4_K_M avec 8K de contexte et 31,3 Go en Q8_0. Les quantifications plus basses tiennent sur des cartes plus petites avec une perte de qualité ; les longs contextes s'ajoutent au total.