Zum Inhalt

Methode

Wie wir bewerten

Jede Zahl hier stammt aus 74 Modellen, 194 Geräten und 17 Laboren, jeder Wert mit öffentlicher Quelle, und aus einem Tempo-Modell, geprüft an 193 veröffentlichten Messungen.

Erkennung

Dein Browser nennt über WebGPU oder WebGL den Namen seines Grafikchips. Wir suchen ihn in unserer Geräteliste; gibt es eine Karte mit mehreren Speichergrößen oder verbirgt Safari den Chip, fragen wir nach. Nichts über deine Hardware wird verschickt: Die Bewertung läuft auf deinem Gerät.

Speicher

Ein Modell braucht Platz für seine Gewichte, für den Cache, der das Gespräch hält, und für die Arbeitspuffer der Software. Wir nutzen echte GGUF-Dateigrößen, wenn ein öffentliches Repository sie hat, sonst die Bits pro Gewicht aus llama.cpp. Der Cache wächst mit dem Kontext – deshalb ändert der Kontext-Regler die Noten.

memory = weights + KV cache + runtime
weights  = parameters × bits per weight / 8      (Q4_K_M ≈ 4,89 bits; real GGUF size when known)
KV cache = 2 × layers × KV heads × head size × 2 bytes × context
           (windowed layers stop at their window)

Wo der Speicher liegt

Auf einer Grafikkarte behalten Treiber und Desktop etwa 1 GB. Auf einem Mac lässt macOS der GPU bis 32 GB etwa zwei Drittel des Speichers, darüber drei Viertel. Mehrere Karten teilen sich das Modell nach ihrem Speicher; was nicht passt, wandert in den deutlich langsameren Arbeitsspeicher. Das Tempo begrenzt, wie schnell Speicher gelesen wird – wir schätzen es aus der Bandbreite plus festen Kosten pro Token.

seconds per token = bytes read per token / (efficiency × bandwidth) + fixed cost
bytes read        = active weights + KV cache in use

Wie weit wir danebenliegen

Wir passen das Tempo-Modell an veröffentlichte llama.cpp-Benchmarks an und messen den Fehler, indem wir jede Messung vorhersagen, ohne sie zu verwenden. Unten steht die mittlere Abweichung zwischen Schätzung und echtem Tempo.

BackendMessungenGenutzte BandbreiteMedianer Fehler
CUDA3366%12%
Metal6693%4,9%
ROCm2479%21%
Vulkan3485%18,3%

Noten

Die Noten folgen dem Tempo, gemessen am Lesen: Wir lesen etwa 5 bis 8 Token pro Sekunde, darunter ist das Modell langsamer als du liest. Knapper Speicher bekommt höchstens B, Auslagern in den Arbeitsspeicher höchstens C – beides bricht bei langen Gesprächen ein.

  • SHervorragend≥ 40 tok/s
  • AGut≥ 20 tok/s
  • BBrauchbar≥ 10 tok/s · Obergrenze wenn knapp
  • CLangsam≥ 5 tok/s · Obergrenze bei Auslagerung
  • DLäuft kaum< 5 tok/s
  • FPasst nichtpasst nicht

Was wir nicht wissen

Die Werte gelten für eine Person, die mit llama.cpp-artiger Software Text erzeugt. Prompt-Verarbeitung, andere Software, Treiber und Wärme ändern echte Zahlen. Manche Laptopchips variieren je Hersteller, und Browser melden den Arbeitsspeicher nicht – prüfe die Werte in der Hardware-Leiste.