Alternativas más pequeñas
Modelos que necesitan menos memoria que Qwen3.5 35B A3B y puntúan casi igual o mejor.
Qwen · 36B (3B activos) · Mezcla de expertos
Qwen3.5 35B A3B es un modelo de 36B de Qwen con un contexto de 256K tokens. En Q4_K_M con 8K de contexto necesita unos 21 GB; con 28 GB tienes margen para conversaciones largas.
Mezcla de expertos
Parámetros: 36B · Activos: 3B
Los 36B parámetros se cargan en memoria, pero sólo 3B trabajan en cada token, así que va a la velocidad de un modelo mucho más pequeño.
| Cuant. | Bits | Memoria | Calidad | En tu hardware |
|---|---|---|---|---|
| Q2_K | 3,16 | — | Peor, se nota | … |
| Q3_K_M | 4 | — | Algo de pérdida | … |
| Q4_K_M | 4,89 | — | Buena | … |
| Q5_K_M | 5,7 | — | Buena | … |
| Q6_K | 6,56 | — | Casi original | … |
| Q8_0 | 8,5 | — | Casi original | … |
| F16 | 16 | — | Original | … |
En Q4_K_M. La caché del contexto crece con cada token que el modelo recuerda.
| Contexto | Caché de contexto | Total |
|---|---|---|
| 4K | 0,1 GB | 20,9 GB |
| 8K | 0,2 GB | 21 GB |
| 32K | 0,6 GB | 21,4 GB |
| 128K | 2,5 GB | 23,3 GB |
| 256K | 5 GB | 25,8 GB |
Modelos que necesitan menos memoria que Qwen3.5 35B A3B y puntúan casi igual o mejor.
Modelos puntuados de tamaño parecido, lado a lado en tu dispositivo.
Equipos de escritorio con la menor memoria que dan a Qwen3.5 35B A3B nota A o S en Q4_K_M.
Sí, si tu GPU o tu Mac tiene unos 21 GB libres para él en Q4_K_M. Abre esta página en ese ordenador para ver la nota de tu hardware exacto y arráncalo con llama.cpp, Ollama o LM Studio.
Unos 21 GB en Q4_K_M con 8K de contexto y 34,8 GB en Q8_0. Las cuantizaciones más bajas caben en tarjetas más pequeñas con algo de pérdida de calidad; los contextos largos suman al total.
Tu privacidad
Usamos PostHog para entender cómo se usa la web y mejorarla. Si aceptas, guarda un identificador en tu navegador y graba tu sesión (los campos de texto quedan ocultos). Si rechazas, solo contamos la visita de forma anónima, sin cookies. Puedes cambiarlo cuando quieras desde el pie de página.