Modelle

Parameterzahl ist nur der Anfang.

Aufgabe, Quantisierung, Kontext, Lizenz, Modalität und Hardware gehören zusammen.

7–8B

Q4: 6–8 GB
Q8: 10–12 GB
FP16: 18–20 GB

12 GB GPU oder 16 GB Unified Memory

14B

Q4: 10–13 GB
Q8: 18–21 GB
FP16: 32–36 GB

16–24 GB GPU oder 32 GB Unified Memory

32B

Q4: 22–27 GB
Q8: 37–43 GB
FP16: 68–75 GB

32–48 GB Speicher

70B

Q4: 43–52 GB
Q8: 78–90 GB
FP16: 145–155 GB

64–96 GB für Q4; 160 GB+ für FP16

Nach Aufgabe auswählen

Coding

Kontext, Tool Use und stabile Ausgabe sind wichtiger als reine Parameterzahl.

RAG

Retriever, Embeddings, Chunking und Berechtigungen gehören zur Modellwahl.

Vision & Audio

Modalität erhöht Speicherbedarf und verändert die Latenzmessung.