Zum Inhalt

Kalibriert an 193 veröffentlichten Benchmarks

Welche KI kann dein Computer ausführen?

Wir lesen deine GPU oder deinen Mac aus und bewerten jedes offene Modell dafür: benötigter Speicher, zu erwartendes Tempo und der Startbefehl.

Deine Hardware

Speicher
GB
Bandbreite
GB/s
Kontext

 

Die intelligentesten auf deinem …

Intelligenz (ECI) der intelligentesten Modelle, die laden · die Farbe zeigt, wie gut sie laufen

Erwartete Geschwindigkeit

Tokens pro Sekunde auf deinem … für die intelligentesten Modelle, die gut laufen

Modelle mit mehr Speicher

Offene Modelle, die gut laufen (Note B oder besser), je Speichergröße

Werte vom 8. Okt. 2026 · 0 neue Modelle in den letzten zwei Monaten

Für jede Hardware

Alle offenen Modelle und Geräte, die wir messen, unabhängig von deinem Rechner

Intelligenz

Die intelligentesten offenen Modelle nach dem Epoch Capabilities Index (ECI)

Mehr anzeigen

Intelligenz

Epoch Capabilities Index (ECI) · Höher ist besser

Intelligenz nach Speicher

Oben links ist besser. Die Linie verbindet die Modelle, die kein kleineres Modell schlägt.

Nötiger Speicher (GB, log. Skala)ECI

Das beste für seine Größe

Geschwindigkeit nach Gerät

Ausgabe-Tokens pro Sekunde für ein Modell bei Q4_K_M auf verbreiteten Geräten · Höher ist besser

Mehr anzeigen

auf verbreiteten Geräten

tok/s · Q4_K_M · 8K

Speicher und Kontext

Speicher, den die intelligentesten Modelle bei Q4_K_M brauchen; längerer Kontext braucht mehr

Mehr anzeigen

Benötigter Speicher bei 8K Kontext

GB bei Q4_K_M · Niedriger ist besser

Benchmarks nach Aufgabe

Eigene Auswertungen von Epoch AI, jeweils die beste getestete Einstellung je offenem Modell

Mehr anzeigen

Reasoning

GPQA Diamond · 0 offene Modelle gemessen · Höher ist besser

Mathematik

OTIS Mock AIME · 0 offene Modelle gemessen · Höher ist besser

Wissen

SimpleQA Verified · 0 offene Modelle gemessen · Höher ist besser

Code

SWE-bench Verified · 0 offene Modelle gemessen · Höher ist besser

Geräte

Offene Modelle, die gut laufen (Note B oder besser), je Gerät mit Standardspeicher

Mehr anzeigen

Modelle, die gut laufen

Von 0 offenen Modellen · Höher ist besser

Offen vs geschlossen im Zeitverlauf

Höchste Intelligenz (ECI) offener und geschlossener Modelle, Monat für Monat

Mehr anzeigen

Neue Modelle

Offene Modelle der letzten zwei Monate nach Intelligenz · 0 noch ohne Wertung

Mehr anzeigen

Neue Modelle

ECI · Höher ist besser

Quantisierung

Speicher, den je Quantisierung bei 8K Kontext braucht · die Farbe zeigt die erhaltene Qualität

GB · 8K

Spürbar schlechterEtwas VerlustGutFast originalOriginal

Methodik und offene Daten

Wie jede Note, Geschwindigkeit und Speicherangabe geschätzt wird, und alle Daten zum Herunterladen

74 Modelle · 194 Geräte · 17 Labore

Offene KI-Modelle auf deiner eigenen Hardware

Ein Modell zu Hause laufen zu lassen hält deine Daten auf deinem Rechner und kostet nichts pro Nachricht. Ob es klappt, hängt an zwei Zahlen: wie viel Speicher das Modell braucht und wie schnell dein Speicher es versorgen kann. Wir berechnen beides für jedes Modell und jedes Gerät, aus öffentlichen Datenblättern und kalibriert an veröffentlichten Messungen. Details stehen in So bewerten wir.

  1. 01_

    Seite öffnen

    Auf dem Computer, den du nutzen willst. Kein Konto, kein Download, nichts zu installieren.

  2. 02_

    Hardware prüfen

    Wir lesen GPU oder Chip über den Browser aus. Stimmt es nicht oder ist es verborgen, wähle es aus und gib deinen Speicher an.

  3. 03_

    Noten ansehen

    Jedes Modell bekommt S bis F für deinen Rechner, mit benötigtem Speicher und zu erwartendem Tempo.

  4. 04_

    Starten

    Öffne ein Modell, um die beste Quantisierung für deine Hardware und den Startbefehl zu sehen.

Wie viel Speicher brauchst du?

Von unserer Engine berechnet für Q4_K_M mit 8K Kontext auf einer dedizierten GPU. Mixture-of-Experts-Modelle laden alle Experten in den Speicher, auch wenn pro Wort nur wenige arbeiten.

SpeicherWas passtBeispiel
8 GB15 Modelle, bis Qwen3.5 9B (9,7B)RTX 4060
12 GB18 Modelle, bis Phi-4 14B (14,7B)RTX 3060 12GB
16 GB23 Modelle, bis Devstral Small 2 24B (24B)RTX 4060 Ti 16GB
24 GB35 Modelle, bis Qwen3.6 35B A3B (36B)RTX 4090
32 GB37 Modelle, bis Kimi Linear 48B A3B (49,1B)RTX 5090
48 GB39 Modelle, bis Qwen3 Coder Next (79,7B)RTX A6000

Beliebte Geräte

Alle 194 Geräte →

Die Labore hinter den Modellen

Modelle für den Einstieg

Eine kurze Liste zum Start. Was auf deinen Rechner passt, entscheiden weiterhin die Noten oben.

Häufige Fragen

Die Formeln, die Datenquellen und wie weit wir danebenliegen. Wie wir bewerten

Wie viel VRAM brauche ich, um KI lokal zu nutzen?

Mit 8 GB laufen gute kleine Modelle (3–9B) in Q4. 16 GB öffnen den Bereich 12–24B, ab 24 GB gehen 30B-Modelle und mittlere Mixture-of-Experts. Lange Unterhaltungen brauchen zusätzlich Speicher für den Kontext.

Kann ein Mac KI-Modelle ohne Grafikkarte ausführen?

Ja. Apple Silicon teilt einen Speicher zwischen CPU und GPU, daher kann ein Mac mit 32 GB oder mehr Modelle laden, die auf die meisten Grafikkarten nicht passen. macOS behält standardmäßig etwa ein Drittel davon für sich.

Was ist Quantisierung?

Die Zahlen eines Modells mit weniger Bits speichern. Q4_K_M nutzt etwa 4,9 Bit pro Gewicht statt 16, das Modell braucht also rund ein Drittel des Speichers bei kleinem Qualitätsverlust. Unter Q4 spart man mehr, aber die Antworten leiden.

Woher wisst ihr, welche Modelle auf meine Hardware passen?

Dein Browser nennt uns den GPU-Namen; unsere Daten liefern Speicher und Bandbreite, mit Quelle für jede Zahl. Die Engine addiert Gewichte, Kontext-Cache und Laufzeit-Overhead und schätzt das Tempo aus der Bandbreite, kalibriert an veröffentlichten llama.cpp-Messungen.

Wie starte ich ein Modell, sobald ich es ausgewählt habe?

Öffne seine Seite: Dort stehen die beste Quantisierung für deinen Rechner und der Befehl für llama.cpp oder Ollama, plus ein Link zum Download in LM Studio.