Méthode
Comment nous notons
Chaque chiffre de ce site vient de 74 modèles, 194 appareils et 17 labos, chaque valeur avec sa source publique, et d'un modèle de vitesse vérifié sur 193 mesures publiées.
Détection
Votre navigateur indique le nom de sa puce graphique via WebGPU ou WebGL. Nous le cherchons dans notre liste d'appareils ; si une carte existe en plusieurs tailles de mémoire, ou si Safari masque la puce, nous vous demandons de choisir. Rien de votre matériel n'est envoyé : la note est calculée sur votre appareil.
Mémoire
Un modèle a besoin de place pour ses poids, pour le cache qui garde la conversation et pour les tampons de travail du logiciel. Nous utilisons les vraies tailles de fichiers GGUF quand un dépôt public les donne, sinon les bits par poids de llama.cpp. Le cache grandit avec le contexte : c'est pourquoi le sélecteur de contexte change les notes.
memory = weights + KV cache + runtime
weights = parameters × bits per weight / 8 (Q4_K_M ≈ 4,89 bits; real GGUF size when known)
KV cache = 2 × layers × KV heads × head size × 2 bytes × context
(windowed layers stop at their window)Où va la mémoire
Sur une carte graphique, environ 1 Go est gardé par le pilote et le bureau. Sur un Mac, macOS laisse au GPU environ deux tiers de la mémoire jusqu'à 32 Go, trois quarts au-delà. Plusieurs cartes se partagent le modèle selon leur mémoire, et ce qui ne tient pas déborde en RAM système, bien plus lente. La vitesse de génération est limitée par la vitesse de lecture de la mémoire : nous l'estimons à partir de la bande passante plus un coût fixe par token.
seconds per token = bytes read per token / (efficiency × bandwidth) + fixed cost bytes read = active weights + KV cache in use
Notre marge d'erreur
Nous ajustons le modèle de vitesse sur des benchmarks llama.cpp publiés et mesurons l'erreur en prédisant chaque mesure sans l'utiliser. Le chiffre ci-dessous est l'écart médian entre notre estimation et la vitesse réelle.
| Backend | Mesures | Bande passante utilisée | Erreur médiane |
|---|---|---|---|
| CUDA | 33 | 66% | 12% |
| Metal | 66 | 93% | 4,9% |
| ROCm | 24 | 79% | 21% |
| Vulkan | 34 | 85% | 18,3% |
Notes
Les notes suivent la vitesse, avec la lecture comme repère : on lit environ 5 à 8 tokens par seconde ; en dessous, le modèle va moins vite que vous ne lisez. Un modèle trop juste ne dépasse pas B, et un débordement en RAM système ne dépasse pas C, car les deux cèdent sur les longues conversations.
- SExcellent≥ 40 tok/s
- ABon≥ 20 tok/s
- BUtilisable≥ 10 tok/s · plafond si serré
- CLent≥ 5 tok/s · plafond si débordement
- DTourne à peine< 5 tok/s
- FNe tient pasne tient pas
Ce que nous ne savons pas
Les vitesses valent pour une personne générant du texte avec des logiciels de type llama.cpp. La lecture du prompt, d'autres logiciels, les pilotes et la chauffe changent les chiffres réels. Certaines puces de portable varient selon le fabricant, et les navigateurs ne donnent pas la RAM : vérifiez les valeurs de la barre matériel.