7–8B
Q4: 6–8 GB
Q8: 10–12 GB
FP16: 18–20 GB
12 GB GPU oder 16 GB Unified Memory
Aufgabe, Quantisierung, Kontext, Lizenz, Modalität und Hardware gehören zusammen.
Q4: 6–8 GB
Q8: 10–12 GB
FP16: 18–20 GB
12 GB GPU oder 16 GB Unified Memory
Q4: 10–13 GB
Q8: 18–21 GB
FP16: 32–36 GB
16–24 GB GPU oder 32 GB Unified Memory
Q4: 22–27 GB
Q8: 37–43 GB
FP16: 68–75 GB
32–48 GB Speicher
Q4: 43–52 GB
Q8: 78–90 GB
FP16: 145–155 GB
64–96 GB für Q4; 160 GB+ für FP16
Kontext, Tool Use und stabile Ausgabe sind wichtiger als reine Parameterzahl.
Retriever, Embeddings, Chunking und Berechtigungen gehören zur Modellwahl.
Modalität erhöht Speicherbedarf und verändert die Latenzmessung.