Dimensionierung ohne Rätselraten

Rechne dein lokales KI-Setup.

Vier kleine Werkzeuge trennen Speicherkapazität, Kontext, Strom und Fine-Tuning. Ergebnisse sind Dimensionierungen, keine Benchmarks.

01 · VRAM

Modell passt es?

Gewichte + KV-Cache + Runtime-Reserve.

02 · KV-Cache

Wie teuer ist Kontext?

GQA reduziert den Cache; Batch vervielfacht ihn.

03 · Stromversorgung

Wie groß muss das Netzteil sein?

Last plus Reserve statt Schönrechnen.

04 · Betriebskosten

Was kostet 24/7?

Passe Leistung, Auslastung und Tarif an.

Fine-Tuning

Warum Training mehr Speicher braucht

Inferenz

Gewichte + KV-Cache + Runtime.

LoRA / QLoRA

Zusätzlich Adapter, Aktivierungen und Gradienten. Das Basismodell kann quantisiert bleiben.

Volltraining

Gewichte, Gradienten, Aktivierungen und Optimizer-State. Der Speicherbedarf steigt massiv.