Kalibriert an 193 veröffentlichten Benchmarks
Welche KI kann dein Computer ausführen?
Wir lesen deine GPU oder deinen Mac aus und bewerten jedes offene Modell dafür: benötigter Speicher, zu erwartendes Tempo und der Startbefehl.
Deine Hardware
- Speicher
- GB
- Bandbreite
- GB/s
- Kontext
Die intelligentesten auf deinem …
Intelligenz (ECI) der intelligentesten Modelle, die laden · die Farbe zeigt, wie gut sie laufen
Erwartete Geschwindigkeit
Tokens pro Sekunde auf deinem … für die intelligentesten Modelle, die gut laufen
Modelle mit mehr Speicher
Offene Modelle, die gut laufen (Note B oder besser), je Speichergröße
Werte vom 8. Okt. 2026 · 0 neue Modelle in den letzten zwei Monaten
Für jede Hardware
Alle offenen Modelle und Geräte, die wir messen, unabhängig von deinem Rechner
Intelligenz
Die intelligentesten offenen Modelle nach dem Epoch Capabilities Index (ECI)
Intelligenz
Epoch Capabilities Index (ECI) · Höher ist besser
Intelligenz nach Speicher
Oben links ist besser. Die Linie verbindet die Modelle, die kein kleineres Modell schlägt.
Das beste für seine Größe
Geschwindigkeit nach Gerät
Ausgabe-Tokens pro Sekunde für ein Modell bei Q4_K_M auf verbreiteten Geräten · Höher ist besser
auf verbreiteten Geräten
tok/s · Q4_K_M · 8K
Speicher und Kontext
Speicher, den die intelligentesten Modelle bei Q4_K_M brauchen; längerer Kontext braucht mehr
Benötigter Speicher bei 8K Kontext
GB bei Q4_K_M · Niedriger ist besser
Benchmarks nach Aufgabe
Eigene Auswertungen von Epoch AI, jeweils die beste getestete Einstellung je offenem Modell
Reasoning
GPQA Diamond · 0 offene Modelle gemessen · Höher ist besser
Mathematik
OTIS Mock AIME · 0 offene Modelle gemessen · Höher ist besser
Wissen
SimpleQA Verified · 0 offene Modelle gemessen · Höher ist besser
Code
SWE-bench Verified · 0 offene Modelle gemessen · Höher ist besser
Geräte
Offene Modelle, die gut laufen (Note B oder besser), je Gerät mit Standardspeicher
Modelle, die gut laufen
Von 0 offenen Modellen · Höher ist besser
Offen vs geschlossen im Zeitverlauf
Höchste Intelligenz (ECI) offener und geschlossener Modelle, Monat für Monat
Neue Modelle
Offene Modelle der letzten zwei Monate nach Intelligenz · 0 noch ohne Wertung
Neue Modelle
ECI · Höher ist besser
Quantisierung
Speicher, den je Quantisierung bei 8K Kontext braucht · die Farbe zeigt die erhaltene Qualität
GB · 8K
Spürbar schlechterEtwas VerlustGutFast originalOriginal
Methodik und offene Daten
Wie jede Note, Geschwindigkeit und Speicherangabe geschätzt wird, und alle Daten zum Herunterladen
74 Modelle · 194 Geräte · 17 Labore
Offene KI-Modelle auf deiner eigenen Hardware
Ein Modell zu Hause laufen zu lassen hält deine Daten auf deinem Rechner und kostet nichts pro Nachricht. Ob es klappt, hängt an zwei Zahlen: wie viel Speicher das Modell braucht und wie schnell dein Speicher es versorgen kann. Wir berechnen beides für jedes Modell und jedes Gerät, aus öffentlichen Datenblättern und kalibriert an veröffentlichten Messungen. Details stehen in So bewerten wir.
- 01_
Seite öffnen
Auf dem Computer, den du nutzen willst. Kein Konto, kein Download, nichts zu installieren.
- 02_
Hardware prüfen
Wir lesen GPU oder Chip über den Browser aus. Stimmt es nicht oder ist es verborgen, wähle es aus und gib deinen Speicher an.
- 03_
Noten ansehen
Jedes Modell bekommt S bis F für deinen Rechner, mit benötigtem Speicher und zu erwartendem Tempo.
- 04_
Starten
Öffne ein Modell, um die beste Quantisierung für deine Hardware und den Startbefehl zu sehen.
Wie viel Speicher brauchst du?
Von unserer Engine berechnet für Q4_K_M mit 8K Kontext auf einer dedizierten GPU. Mixture-of-Experts-Modelle laden alle Experten in den Speicher, auch wenn pro Wort nur wenige arbeiten.
| Speicher | Was passt | Beispiel |
|---|---|---|
| 8 GB | 15 Modelle, bis Qwen3.5 9B (9,7B) | RTX 4060 |
| 12 GB | 18 Modelle, bis Phi-4 14B (14,7B) | RTX 3060 12GB |
| 16 GB | 23 Modelle, bis Devstral Small 2 24B (24B) | RTX 4060 Ti 16GB |
| 24 GB | 35 Modelle, bis Qwen3.6 35B A3B (36B) | RTX 4090 |
| 32 GB | 37 Modelle, bis Kimi Linear 48B A3B (49,1B) | RTX 5090 |
| 48 GB | 39 Modelle, bis Qwen3 Coder Next (79,7B) | RTX A6000 |
Beliebte Geräte
Die Labore hinter den Modellen
Modelle für den Einstieg
Eine kurze Liste zum Start. Was auf deinen Rechner passt, entscheiden weiterhin die Noten oben.
Qwen3.5 4B4,7BKlein, schnell und mehrsprachig. Ein gutes erstes Modell für 8-GB-Karten und Laptops.
gpt-oss 20b3,6B aktivOpenAIs Reasoning-Modell mit offenen Gewichten. Schnell, weil pro Wort nur ein Teil arbeitet.
Qwen3.6 35B A3B3B aktivEin großes Mixture-of-Experts, das wie ein kleines läuft, wenn es in den Speicher passt.
Gemma 4 12B12BGoogles mittelgroßes Modell mit Bildverständnis. Läuft bequem auf 12–16-GB-Karten.
Devstral Small 2 24B24BFür Coding-Agenten gebaut. Braucht eine 16–24-GB-Karte, um Luft zu haben.
Llama 3.1 8B Instruct8BDas klassische 8B. Läuft fast überall, jedes Tool unterstützt es.
Häufige Fragen
Die Formeln, die Datenquellen und wie weit wir danebenliegen. Wie wir bewerten
Wie viel VRAM brauche ich, um KI lokal zu nutzen?
Mit 8 GB laufen gute kleine Modelle (3–9B) in Q4. 16 GB öffnen den Bereich 12–24B, ab 24 GB gehen 30B-Modelle und mittlere Mixture-of-Experts. Lange Unterhaltungen brauchen zusätzlich Speicher für den Kontext.
Kann ein Mac KI-Modelle ohne Grafikkarte ausführen?
Ja. Apple Silicon teilt einen Speicher zwischen CPU und GPU, daher kann ein Mac mit 32 GB oder mehr Modelle laden, die auf die meisten Grafikkarten nicht passen. macOS behält standardmäßig etwa ein Drittel davon für sich.
Was ist Quantisierung?
Die Zahlen eines Modells mit weniger Bits speichern. Q4_K_M nutzt etwa 4,9 Bit pro Gewicht statt 16, das Modell braucht also rund ein Drittel des Speichers bei kleinem Qualitätsverlust. Unter Q4 spart man mehr, aber die Antworten leiden.
Woher wisst ihr, welche Modelle auf meine Hardware passen?
Dein Browser nennt uns den GPU-Namen; unsere Daten liefern Speicher und Bandbreite, mit Quelle für jede Zahl. Die Engine addiert Gewichte, Kontext-Cache und Laufzeit-Overhead und schätzt das Tempo aus der Bandbreite, kalibriert an veröffentlichten llama.cpp-Messungen.
Wie starte ich ein Modell, sobald ich es ausgewählt habe?
Öffne seine Seite: Dort stehen die beste Quantisierung für deinen Rechner und der Befehl für llama.cpp oder Ollama, plus ein Link zum Download in LM Studio.