Calibrado con 193 benchmarks publicados
¿Qué IA puede ejecutar tu ordenador?
Leemos tu GPU o tu Mac y puntuamos cada modelo abierto para él: la memoria que necesita, la velocidad que tendrás y el comando para ejecutarlo.
Tu hardware
- Memoria
- GB
- Ancho de banda
- GB/s
- Contexto
Los más inteligentes en tu …
Inteligencia (ECI) de los modelos más inteligentes que cargan · el color indica cómo funcionan
Velocidad esperada
Tokens por segundo en tu … de los modelos más inteligentes que funcionan bien
Modelos disponibles con más memoria
Modelos abiertos que funcionan bien (nota B o superior) con cada memoria
Puntuaciones de 8 oct 2026 · 0 modelos nuevos en los dos últimos meses
Para cualquier hardware
Todos los modelos abiertos y dispositivos que medimos, sin depender de tu equipo
Inteligencia
Los modelos abiertos más inteligentes, según el Epoch Capabilities Index (ECI)
Inteligencia
Epoch Capabilities Index (ECI) · Más es mejor
Inteligencia según memoria
Arriba a la izquierda es mejor. La línea une los modelos a los que ninguno más pequeño supera.
El mejor para su tamaño
Velocidad por dispositivo
Tokens de salida por segundo de un modelo en Q4_K_M en dispositivos populares · Más es mejor
en dispositivos populares
tok/s · Q4_K_M · 8K
Memoria y contexto
Memoria que necesitan los modelos más inteligentes en Q4_K_M; un contexto más largo necesita más
Memoria necesaria con un contexto de 8K
GB en Q4_K_M · Menos es mejor
Benchmarks por tarea
Evaluaciones propias de Epoch AI, con el mejor ajuste que ejecutó para cada modelo abierto
Razonamiento
GPQA Diamond · 0 modelos abiertos medidos · Más es mejor
Matemáticas
OTIS Mock AIME · 0 modelos abiertos medidos · Más es mejor
Conocimiento
SimpleQA Verified · 0 modelos abiertos medidos · Más es mejor
Programar
SWE-bench Verified · 0 modelos abiertos medidos · Más es mejor
Dispositivos
Modelos abiertos que funcionan bien (nota B o superior) en cada dispositivo, con su memoria estándar
Modelos que funcionan bien
De 0 modelos abiertos · Más es mejor
Abiertos frente a cerrados en el tiempo
Máxima inteligencia (ECI) alcanzada por modelos abiertos y cerrados, mes a mes
Modelos nuevos
Modelos abiertos publicados en los dos últimos meses, por inteligencia · 0 aún sin puntuar
Modelos nuevos
ECI · Más es mejor
Cuantización
Memoria que necesita en cada cuantización con contexto de 8K · el color indica la calidad que conserva
GB · 8K
Peor, se notaAlgo de pérdidaBuenaCasi originalOriginal
Metodología y datos abiertos
Cómo se estima cada nota, velocidad y memoria, y todos los datos para descargar
74 modelos · 194 dispositivos · 17 laboratorios
Modelos de IA abiertos en tu propio hardware
Ejecutar un modelo en casa mantiene tus datos en tu máquina y no cuesta nada por mensaje. Que funcione depende de dos números: cuánta memoria necesita el modelo y a qué velocidad puede alimentarlo tu memoria. Calculamos ambos para cada modelo y cada dispositivo, a partir de especificaciones públicas y calibrados con mediciones publicadas. Los detalles están en cómo puntuamos.
- 01_
Abre la página
En el ordenador que quieres usar. Sin cuenta, sin descargas, sin instalar nada.
- 02_
Revisa tu hardware
Leemos tu GPU o tu chip desde el navegador. Si no es correcto o está oculto, elígelo en la lista e indica tu memoria.
- 03_
Mira las notas
Cada modelo recibe de S a F para tu máquina, con la memoria que necesita y la velocidad que tendrás.
- 04_
Ejecútalo
Abre un modelo para ver la mejor cuantización para tu hardware y el comando para arrancarlo.
¿Cuánta memoria necesitas?
Calculado por nuestro motor para Q4_K_M con 8K de contexto en una GPU dedicada. Los modelos de mezcla de expertos cargan todos los expertos en memoria, aunque sólo unos pocos trabajen en cada palabra.
| Memoria | Qué cabe | Ejemplo |
|---|---|---|
| 8 GB | 15 modelos, hasta Qwen3.5 9B (9,7B) | RTX 4060 |
| 12 GB | 18 modelos, hasta Phi-4 14B (14,7B) | RTX 3060 12GB |
| 16 GB | 23 modelos, hasta Devstral Small 2 24B (24B) | RTX 4060 Ti 16GB |
| 24 GB | 35 modelos, hasta Qwen3.6 35B A3B (36B) | RTX 4090 |
| 32 GB | 37 modelos, hasta Kimi Linear 48B A3B (49,1B) | RTX 5090 |
| 48 GB | 39 modelos, hasta Qwen3 Coder Next (79,7B) | RTX A6000 |
Dispositivos populares
Laboratorios detrás de los modelos
Modelos para empezar
Una lista corta para empezar. Las notas de arriba siguen decidiendo qué cabe en tu máquina.
Qwen3.5 4B4,7BPequeño, rápido y multilingüe. Un buen primer modelo para tarjetas de 8 GB y portátiles.
gpt-oss 20b3,6B activosEl modelo de razonamiento con pesos abiertos de OpenAI. Rápido porque sólo una parte trabaja en cada palabra.
Qwen3.6 35B A3B3B activosUna mezcla de expertos grande que va como un modelo pequeño si cabe en memoria.
Gemma 4 12B12BEl modelo mediano de Google, con visión. Cómodo en tarjetas de 12–16 GB.
Devstral Small 2 24B24BPensado para agentes de programación. Necesita una tarjeta de 16–24 GB para ir holgado.
Llama 3.1 8B Instruct8BEl 8B clásico. Funciona casi en cualquier sitio y todas las herramientas lo soportan.
Preguntas frecuentes
Las fórmulas, las fuentes de datos y cuánto nos equivocamos. Cómo puntuamos
¿Cuánta VRAM necesito para ejecutar IA en local?
Con 8 GB funcionan buenos modelos pequeños (3–9B) en Q4. 16 GB abren la gama de 12–24B, y con 24 GB o más puedes usar modelos de 30B y mezclas de expertos medianas. Las conversaciones largas necesitan memoria extra para el contexto.
¿Puede un Mac ejecutar modelos de IA sin tarjeta gráfica?
Sí. Apple Silicon comparte una sola memoria entre CPU y GPU, así que un Mac con 32 GB o más puede cargar modelos que no caben en la mayoría de tarjetas gráficas. Por defecto macOS se reserva cerca de un tercio de esa memoria.
¿Qué es la cuantización?
Guardar los números del modelo con menos bits. Q4_K_M usa unos 4,9 bits por peso en vez de 16, así que el modelo ocupa más o menos un tercio con una pequeña pérdida de calidad. Por debajo de Q4 se ahorra más memoria, pero las respuestas empiezan a empeorar.
¿Cómo sabéis qué modelos caben en mi hardware?
Tu navegador nos dice el nombre de la GPU; nuestros datos dan su memoria y ancho de banda, con fuente para cada cifra. El motor suma los pesos, la caché del contexto y el margen del programa, y estima la velocidad a partir del ancho de banda, calibrada con mediciones publicadas de llama.cpp.
¿Cómo ejecuto un modelo una vez elegido?
Abre su página: verás la mejor cuantización para tu máquina y el comando para llama.cpp u Ollama, más un enlace para descargarlo en LM Studio.