RAM und GPU eingeben und sehen, welche lokalen Modelle Ihr Rechner wirklich stemmt — von 3B bis 70B, von Q4 bis FP16.
Auf Apple Silicon teilt sich die GPU den Systemspeicher, VRAM entfällt daher. Am PC zählt der VRAM Ihrer Grafikkarte (z. B. RTX 4060 = 8 GB, RTX 4090 = 24 GB).
Läuft gut — Passt in GPU- bzw. Unified Memory — interaktive Geschwindigkeit mit Runtimes wie Ollama oder LM Studio.
Langsam (CPU) — Passt nur ins System-RAM — läuft auf der CPU mit wenigen Token pro Sekunde. Zum Testen okay, im Alltag mühsam.
Passt nicht — Braucht mehr Speicher, als dieser Rechner hat — selbst mit Q4-Quantisierung.
Planungswerte für lokale Inferenz im Stil von llama.cpp, inklusive Runtime-Overhead. Der tatsächliche Verbrauch hängt von Kontextlänge und Runtime ab. Q4/Q8/FP16 = Quantisierungsstufen: kleinere Zahlen bedeuten kleinere, etwas ungenauere Modelle.
Prüfen, ob Ihr Rechner lokale KI stemmt — so geht's
Finden Sie heraus, welche lokalen Modelle Ihre Hardware ausführen kann — von 3B bis 70B Parametern.
1
RAM eintragenGesamter Arbeitsspeicher in GB. Unter Windows: Task-Manager → Leistung. Unter macOS: Über diesen Mac.
2
GPU-VRAM eintragenDedizierter Grafikspeicher in GB (z. B. RTX 4060 = 8 GB, RTX 4090 = 24 GB). Auf Apple Silicon überspringen Sie das Feld und setzen stattdessen den Haken bei Unified Memory.
3
Matrix ablesenJede Modellgröße (3B–70B) erhält pro Quantisierungsstufe ein Urteil: läuft gut auf der GPU, langsam auf der CPU oder passt nicht — samt ungefährem Speicherbedarf.
4
Runtime installierenBei grünen Zellen installieren Sie Ollama oder LM Studio, laden ein passendes Modell — und schon läuft KI lokal, ohne einen Cent API-Kosten.
Häufig gestellte Fragen
Quantisierungsstufen — also wie viele Bits jedes Modellgewicht belegt. Q4 schrumpft ein Modell auf etwa ein Viertel der vollen Größe bei geringem Qualitätsverlust; FP16 ist volle Qualität bei voller Größe. Die meisten lokalen Nutzer fahren wegen der Speicherersparnis Q4 oder Q8.
Apple-Silicon-Macs teilen sich einen Pool Unified Memory zwischen CPU und GPU. Ein MacBook mit 32 GB kann daher Modelle GPU-beschleunigt ausführen, die am PC eine dedizierte Grafikkarte mit 24 GB bräuchten.
Nein — gehostete Frontier-Modelle sind klar stärker. Aber ein lokales 7B–13B-Modell erledigt Zusammenfassungen, Textentwürfe und Coding-Hilfe ordentlich, kostet nichts pro Token, läuft offline und behält sensible Daten auf Ihrem Rechner.
Es sind Planungswerte für Runtimes im Stil von llama.cpp, inklusive typischem Runtime-Overhead. Lange Kontexte, große Batches und die konkrete Runtime verschieben den realen Verbrauch — werten Sie ein knappes grünes Urteil als Vielleicht.