01 · VRAM
Modell passt es?
Gewichte + KV-Cache + Runtime-Reserve.
Vier kleine Werkzeuge trennen Speicherkapazität, Kontext, Strom und Fine-Tuning. Ergebnisse sind Dimensionierungen, keine Benchmarks.
Gewichte + KV-Cache + Runtime-Reserve.
GQA reduziert den Cache; Batch vervielfacht ihn.
Last plus Reserve statt Schönrechnen.
Passe Leistung, Auslastung und Tarif an.
Gewichte + KV-Cache + Runtime.
Zusätzlich Adapter, Aktivierungen und Gradienten. Das Basismodell kann quantisiert bleiben.
Gewichte, Gradienten, Aktivierungen und Optimizer-State. Der Speicherbedarf steigt massiv.