Aller au contenu

Calibré sur 193 benchmarks publiés

Quelle IA votre ordinateur peut-il faire tourner ?

Nous lisons votre GPU ou votre Mac et notons chaque modèle ouvert pour lui : la mémoire requise, la vitesse attendue et la commande pour le lancer.

Votre matériel

Mémoire
GB
Bande passante
GB/s
Contexte

 

Les plus intelligents sur votre …

Intelligence (ECI) des modèles les plus intelligents qui se chargent · la couleur indique leur fonctionnement

Vitesse attendue

Tokens par seconde sur votre … pour les modèles les plus intelligents qui tournent bien

Modèles accessibles avec plus de mémoire

Modèles ouverts qui tournent bien (B ou plus) pour chaque mémoire

Scores du 8 oct. 2026 · 0 nouveaux modèles ces deux derniers mois

Pour tout matériel

Tous les modèles ouverts et appareils que nous mesurons, indépendamment de votre machine

Intelligence

Les modèles ouverts les plus intelligents, classés par l'Epoch Capabilities Index (ECI)

Voir plus

Intelligence

Epoch Capabilities Index (ECI) · Plus haut est meilleur

Intelligence selon la mémoire

En haut à gauche, c’est mieux. La ligne relie les modèles qu’aucun modèle plus petit ne dépasse.

Mémoire requise (Go, échelle log)ECI

Le meilleur pour sa taille

Vitesse par appareil

Tokens générés par seconde pour un modèle en Q4_K_M sur des appareils courants · Plus haut est meilleur

Voir plus

sur des appareils courants

tok/s · Q4_K_M · 8K

Mémoire et contexte

Mémoire nécessaire aux modèles les plus intelligents en Q4_K_M ; un contexte plus long en demande davantage

Voir plus

Mémoire nécessaire avec un contexte de 8K

Go en Q4_K_M · Plus bas est meilleur

Benchmarks par tâche

Évaluations propres d'Epoch AI, avec le meilleur réglage testé pour chaque modèle ouvert

Voir plus

Raisonnement

GPQA Diamond · 0 modèles ouverts mesurés · Plus haut est meilleur

Mathématiques

OTIS Mock AIME · 0 modèles ouverts mesurés · Plus haut est meilleur

Connaissances

SimpleQA Verified · 0 modèles ouverts mesurés · Plus haut est meilleur

Code

SWE-bench Verified · 0 modèles ouverts mesurés · Plus haut est meilleur

Appareils

Modèles ouverts qui tournent bien (B ou plus) sur chaque appareil, avec sa mémoire standard

Voir plus

Modèles qui tournent bien

Sur 0 modèles ouverts · Plus haut est meilleur

Ouverts vs fermés dans le temps

Intelligence maximale (ECI) atteinte par les modèles ouverts et fermés, mois par mois

Voir plus

Nouveaux modèles

Modèles ouverts sortis ces deux derniers mois, par intelligence · 0 pas encore notés

Voir plus

Nouveaux modèles

ECI · Plus haut est meilleur

Quantification

Mémoire nécessaire à pour chaque quantification avec un contexte de 8K · la couleur indique la qualité conservée

GB · 8K

Nettement moins bonLégère perteBonneQuasi originaleOriginale

Méthodologie et données ouvertes

Comment chaque note, vitesse et mémoire est estimée, et toutes les données à télécharger

74 modèles · 194 appareils · 17 labos

Des modèles d'IA ouverts sur votre propre matériel

Faire tourner un modèle chez soi garde vos données sur votre machine et ne coûte rien par message. Tout tient à deux chiffres : la mémoire dont le modèle a besoin, et la vitesse à laquelle votre mémoire peut l'alimenter. Nous calculons les deux pour chaque modèle et chaque appareil, à partir de spécifications publiques et calibrés sur des mesures publiées. Les détails sont dans notre méthode.

  1. 01_

    Ouvrez la page

    Sur l'ordinateur que vous voulez utiliser. Sans compte, sans téléchargement, sans rien installer.

  2. 02_

    Vérifiez votre matériel

    Nous lisons votre GPU ou votre puce depuis le navigateur. S'il est faux ou masqué, choisissez-le et indiquez votre mémoire.

  3. 03_

    Lisez les notes

    Chaque modèle reçoit de S à F pour votre machine, avec la mémoire requise et la vitesse attendue.

  4. 04_

    Lancez-le

    Ouvrez un modèle pour voir la meilleure quantification pour votre matériel et la commande pour le lancer.

De combien de mémoire avez-vous besoin ?

Calculé par notre moteur pour Q4_K_M avec 8K de contexte sur un GPU dédié. Les modèles à mélange d'experts chargent tous les experts en mémoire, même si seuls quelques-uns travaillent sur chaque mot.

MémoireCe qui tientExemple
8 GB15 modèles, jusqu'à Qwen3.5 9B (9,7B)RTX 4060
12 GB18 modèles, jusqu'à Phi-4 14B (14,7B)RTX 3060 12GB
16 GB23 modèles, jusqu'à Devstral Small 2 24B (24B)RTX 4060 Ti 16GB
24 GB35 modèles, jusqu'à Qwen3.6 35B A3B (36B)RTX 4090
32 GB37 modèles, jusqu'à Kimi Linear 48B A3B (49,1B)RTX 5090
48 GB39 modèles, jusqu'à Qwen3 Coder Next (79,7B)RTX A6000

Appareils populaires

Les 194 appareils →

Les labos derrière les modèles

Des modèles pour commencer

Une courte liste pour commencer. Les notes ci-dessus décident toujours de ce qui tient sur votre machine.

Questions fréquentes

Les formules, les sources et notre marge d'erreur. Comment nous notons

De combien de VRAM ai-je besoin pour faire tourner l'IA en local ?

8 Go font tourner de bons petits modèles (3–9B) en Q4. 16 Go ouvrent la gamme 12–24B, et 24 Go ou plus permettent les modèles de 30B et les mélanges d'experts moyens. Les longues conversations demandent de la mémoire en plus pour le contexte.

Un Mac peut-il faire tourner des modèles d'IA sans carte graphique ?

Oui. Apple Silicon partage une seule mémoire entre CPU et GPU, donc un Mac de 32 Go ou plus peut charger des modèles qui ne tiendraient pas sur la plupart des cartes graphiques. Par défaut, macOS garde environ un tiers de cette mémoire.

Qu'est-ce que la quantification ?

Stocker les nombres du modèle avec moins de bits. Q4_K_M utilise environ 4,9 bits par poids au lieu de 16 : le modèle prend environ un tiers de la mémoire, avec une petite perte de qualité. En dessous de Q4, on gagne encore de la place mais les réponses se dégradent.

Comment savez-vous quels modèles tiennent sur mon matériel ?

Votre navigateur nous donne le nom du GPU ; nos données donnent sa mémoire et sa bande passante, avec une source pour chaque chiffre. Le moteur additionne les poids, le cache du contexte et la marge du logiciel, et estime la vitesse à partir de la bande passante, calibrée sur des mesures llama.cpp publiées.

Comment lancer un modèle une fois choisi ?

Ouvrez sa page : elle indique la meilleure quantification pour votre machine et la commande pour llama.cpp ou Ollama, avec un lien pour le télécharger dans LM Studio.