Calibré sur 193 benchmarks publiés
Quelle IA votre ordinateur peut-il faire tourner ?
Nous lisons votre GPU ou votre Mac et notons chaque modèle ouvert pour lui : la mémoire requise, la vitesse attendue et la commande pour le lancer.
Votre matériel
- Mémoire
- GB
- Bande passante
- GB/s
- Contexte
Les plus intelligents sur votre …
Intelligence (ECI) des modèles les plus intelligents qui se chargent · la couleur indique leur fonctionnement
Vitesse attendue
Tokens par seconde sur votre … pour les modèles les plus intelligents qui tournent bien
Modèles accessibles avec plus de mémoire
Modèles ouverts qui tournent bien (B ou plus) pour chaque mémoire
Scores du 8 oct. 2026 · 0 nouveaux modèles ces deux derniers mois
Pour tout matériel
Tous les modèles ouverts et appareils que nous mesurons, indépendamment de votre machine
Intelligence
Les modèles ouverts les plus intelligents, classés par l'Epoch Capabilities Index (ECI)
Intelligence
Epoch Capabilities Index (ECI) · Plus haut est meilleur
Intelligence selon la mémoire
En haut à gauche, c’est mieux. La ligne relie les modèles qu’aucun modèle plus petit ne dépasse.
Le meilleur pour sa taille
Vitesse par appareil
Tokens générés par seconde pour un modèle en Q4_K_M sur des appareils courants · Plus haut est meilleur
sur des appareils courants
tok/s · Q4_K_M · 8K
Mémoire et contexte
Mémoire nécessaire aux modèles les plus intelligents en Q4_K_M ; un contexte plus long en demande davantage
Mémoire nécessaire avec un contexte de 8K
Go en Q4_K_M · Plus bas est meilleur
Benchmarks par tâche
Évaluations propres d'Epoch AI, avec le meilleur réglage testé pour chaque modèle ouvert
Raisonnement
GPQA Diamond · 0 modèles ouverts mesurés · Plus haut est meilleur
Mathématiques
OTIS Mock AIME · 0 modèles ouverts mesurés · Plus haut est meilleur
Connaissances
SimpleQA Verified · 0 modèles ouverts mesurés · Plus haut est meilleur
Code
SWE-bench Verified · 0 modèles ouverts mesurés · Plus haut est meilleur
Appareils
Modèles ouverts qui tournent bien (B ou plus) sur chaque appareil, avec sa mémoire standard
Modèles qui tournent bien
Sur 0 modèles ouverts · Plus haut est meilleur
Ouverts vs fermés dans le temps
Intelligence maximale (ECI) atteinte par les modèles ouverts et fermés, mois par mois
Nouveaux modèles
Modèles ouverts sortis ces deux derniers mois, par intelligence · 0 pas encore notés
Nouveaux modèles
ECI · Plus haut est meilleur
Quantification
Mémoire nécessaire à pour chaque quantification avec un contexte de 8K · la couleur indique la qualité conservée
GB · 8K
Nettement moins bonLégère perteBonneQuasi originaleOriginale
Méthodologie et données ouvertes
Comment chaque note, vitesse et mémoire est estimée, et toutes les données à télécharger
74 modèles · 194 appareils · 17 labos
Des modèles d'IA ouverts sur votre propre matériel
Faire tourner un modèle chez soi garde vos données sur votre machine et ne coûte rien par message. Tout tient à deux chiffres : la mémoire dont le modèle a besoin, et la vitesse à laquelle votre mémoire peut l'alimenter. Nous calculons les deux pour chaque modèle et chaque appareil, à partir de spécifications publiques et calibrés sur des mesures publiées. Les détails sont dans notre méthode.
- 01_
Ouvrez la page
Sur l'ordinateur que vous voulez utiliser. Sans compte, sans téléchargement, sans rien installer.
- 02_
Vérifiez votre matériel
Nous lisons votre GPU ou votre puce depuis le navigateur. S'il est faux ou masqué, choisissez-le et indiquez votre mémoire.
- 03_
Lisez les notes
Chaque modèle reçoit de S à F pour votre machine, avec la mémoire requise et la vitesse attendue.
- 04_
Lancez-le
Ouvrez un modèle pour voir la meilleure quantification pour votre matériel et la commande pour le lancer.
De combien de mémoire avez-vous besoin ?
Calculé par notre moteur pour Q4_K_M avec 8K de contexte sur un GPU dédié. Les modèles à mélange d'experts chargent tous les experts en mémoire, même si seuls quelques-uns travaillent sur chaque mot.
| Mémoire | Ce qui tient | Exemple |
|---|---|---|
| 8 GB | 15 modèles, jusqu'à Qwen3.5 9B (9,7B) | RTX 4060 |
| 12 GB | 18 modèles, jusqu'à Phi-4 14B (14,7B) | RTX 3060 12GB |
| 16 GB | 23 modèles, jusqu'à Devstral Small 2 24B (24B) | RTX 4060 Ti 16GB |
| 24 GB | 35 modèles, jusqu'à Qwen3.6 35B A3B (36B) | RTX 4090 |
| 32 GB | 37 modèles, jusqu'à Kimi Linear 48B A3B (49,1B) | RTX 5090 |
| 48 GB | 39 modèles, jusqu'à Qwen3 Coder Next (79,7B) | RTX A6000 |
Appareils populaires
Les labos derrière les modèles
Des modèles pour commencer
Une courte liste pour commencer. Les notes ci-dessus décident toujours de ce qui tient sur votre machine.
Qwen3.5 4B4,7BPetit, rapide et multilingue. Un bon premier modèle pour les cartes de 8 Go et les portables.
gpt-oss 20b3,6B actifsLe modèle de raisonnement à poids ouverts d'OpenAI. Rapide car seule une partie travaille sur chaque mot.
Qwen3.6 35B A3B3B actifsUn grand mélange d'experts qui tourne comme un petit modèle s'il tient en mémoire.
Gemma 4 12B12BLe modèle intermédiaire de Google, avec vision. À l'aise sur des cartes de 12–16 Go.
Devstral Small 2 24B24BPensé pour les agents de code. Demande une carte de 16–24 Go pour respirer.
Llama 3.1 8B Instruct8BLe 8B classique. Tourne presque partout et tous les outils le prennent en charge.
Questions fréquentes
Les formules, les sources et notre marge d'erreur. Comment nous notons
De combien de VRAM ai-je besoin pour faire tourner l'IA en local ?
8 Go font tourner de bons petits modèles (3–9B) en Q4. 16 Go ouvrent la gamme 12–24B, et 24 Go ou plus permettent les modèles de 30B et les mélanges d'experts moyens. Les longues conversations demandent de la mémoire en plus pour le contexte.
Un Mac peut-il faire tourner des modèles d'IA sans carte graphique ?
Oui. Apple Silicon partage une seule mémoire entre CPU et GPU, donc un Mac de 32 Go ou plus peut charger des modèles qui ne tiendraient pas sur la plupart des cartes graphiques. Par défaut, macOS garde environ un tiers de cette mémoire.
Qu'est-ce que la quantification ?
Stocker les nombres du modèle avec moins de bits. Q4_K_M utilise environ 4,9 bits par poids au lieu de 16 : le modèle prend environ un tiers de la mémoire, avec une petite perte de qualité. En dessous de Q4, on gagne encore de la place mais les réponses se dégradent.
Comment savez-vous quels modèles tiennent sur mon matériel ?
Votre navigateur nous donne le nom du GPU ; nos données donnent sa mémoire et sa bande passante, avec une source pour chaque chiffre. Le moteur additionne les poids, le cache du contexte et la marge du logiciel, et estime la vitesse à partir de la bande passante, calibrée sur des mesures llama.cpp publiées.
Comment lancer un modèle une fois choisi ?
Ouvrez sa page : elle indique la meilleure quantification pour votre machine et la commande pour llama.cpp ou Ollama, avec un lien pour le télécharger dans LM Studio.