Método
Cómo puntuamos
Cada número de este sitio sale de 74 modelos, 194 dispositivos y 17 laboratorios, cada cifra con su fuente pública, y de un modelo de velocidad contrastado con 193 mediciones publicadas.
Detección
Tu navegador indica el nombre de su chip gráfico mediante WebGPU o WebGL. Lo buscamos en nuestra lista de dispositivos; si una tarjeta se vende con varias memorias o Safari oculta el chip, te pedimos que lo elijas. Nada de tu hardware se envía a ningún sitio: la puntuación se calcula en tu dispositivo.
Memoria
Un modelo necesita sitio para sus pesos, para la caché que guarda la conversación y para los búferes de trabajo del programa. Usamos tamaños reales de fichero GGUF cuando un repositorio público los tiene y, si no, los bits por peso de llama.cpp. La caché crece con el contexto, por eso el selector de contexto cambia las notas.
memory = weights + KV cache + runtime
weights = parameters × bits per weight / 8 (Q4_K_M ≈ 4,89 bits; real GGUF size when known)
KV cache = 2 × layers × KV heads × head size × 2 bytes × context
(windowed layers stop at their window)Dónde va la memoria
En una tarjeta gráfica, el driver y el escritorio se quedan con 1 GB aproximadamente. En un Mac, macOS deja a la GPU unos dos tercios de la memoria hasta 32 GB y tres cuartos por encima. Varias tarjetas se reparten el modelo según su memoria, y lo que no cabe pasa a la RAM del sistema, mucho más lenta. La velocidad de generación la limita la rapidez con que se lee la memoria, así que la estimamos a partir del ancho de banda más un coste fijo por token.
seconds per token = bytes read per token / (efficiency × bandwidth) + fixed cost bytes read = active weights + KV cache in use
Cuánto nos equivocamos
Ajustamos el modelo de velocidad con benchmarks publicados de llama.cpp y medimos el error prediciendo cada medición sin usarla. La cifra de abajo es la diferencia mediana entre nuestra estimación y la velocidad real.
| Backend | Mediciones | Ancho de banda usado | Error mediano |
|---|---|---|---|
| CUDA | 33 | 66% | 12% |
| Metal | 66 | 93% | 4,9% |
| ROCm | 24 | 79% | 21% |
| Vulkan | 34 | 85% | 18,3% |
Notas
Las notas siguen la velocidad, tomando como referencia la lectura: leemos unos 5 a 8 tokens por segundo, así que por debajo de eso el modelo va más lento de lo que lees. Un ajuste justo no pasa de B y usar la RAM del sistema no pasa de C, porque ambos fallan en conversaciones largas.
- SExcelente≥ 40 tok/s
- ABueno≥ 20 tok/s
- BUsable≥ 10 tok/s · tope si va justo
- CLento≥ 5 tok/s · tope si desborda
- DApenas funciona< 5 tok/s
- FNo cabeno cabe
Lo que no sabemos
Las velocidades son para una persona generando texto con programas tipo llama.cpp. La lectura del prompt, otros programas, los drivers y la temperatura cambian las cifras reales. Algunos chips de portátil varían según el fabricante, y los navegadores no informan de la RAM, así que revisa los valores de la barra de hardware.