Alternatives plus légères
Des modèles qui demandent moins de mémoire que Olmo 3 7B et obtiennent un score proche ou meilleur.
Allen Institute for AI · 7,3B · Dense
Olmo 3 7B Instruct est un modèle de 7,3B de Allen Institute for AI avec un contexte de 64K tokens. En Q4_K_M avec 8K de contexte, il demande environ 7 Go ; 10 Go laissent de la marge pour les longues conversations.
| Quant. | Bits | Mémoire | Qualité | Sur votre matériel |
|---|---|---|---|---|
| Q2_K | 3,16 | — | Nettement moins bon | … |
| Q3_K_M | 4 | — | Légère perte | … |
| Q4_K_M | 4,89 | — | Bonne | … |
| Q5_K_M | 5,7 | — | Bonne | … |
| Q6_K | 6,56 | — | Quasi originale | … |
| Q8_0 | 8,5 | — | Quasi originale | … |
| F16 | 16 | — | Originale | … |
En Q4_K_M. Le cache du contexte grandit à chaque token que le modèle garde en tête.
| Contexte | Cache de contexte | Total |
|---|---|---|
| 4K | 2 GB | 6,5 GB |
| 8K | 2,5 GB | 7 GB |
| 32K | 5,5 GB | 10 GB |
Des modèles qui demandent moins de mémoire que Olmo 3 7B et obtiennent un score proche ou meilleur.
Des modèles notés de taille proche, côte à côte sur votre appareil.
Les appareils de bureau avec le moins de mémoire qui donnent à Olmo 3 7B la note A ou S en Q4_K_M.
Oui, si votre GPU ou votre Mac dispose d'environ 7 Go libres en Q4_K_M. Ouvrez cette page sur cet ordinateur pour voir la note de votre matériel, puis lancez-le avec llama.cpp, Ollama ou LM Studio.
Environ 7 Go en Q4_K_M avec 8K de contexte et 10 Go en Q8_0. Les quantifications plus basses tiennent sur des cartes plus petites avec une perte de qualité ; les longs contextes s'ajoutent au total.
Votre vie privée
Nous utilisons PostHog pour comprendre comment le site est utilisé et l’améliorer. Si vous acceptez, il enregistre un identifiant dans votre navigateur ainsi que votre session (les champs de texte restent masqués). Si vous refusez, nous comptons seulement la visite de façon anonyme, sans cookies. Vous pouvez changer d’avis à tout moment depuis le pied de page.