01
Wie viel VRAM brauche ich mindestens, um LLMs lokal auszuführen?
Kurzantwort
Für 7–8B Q4 sind meist 8–12 GB nutzbarer Beschleunigerspeicher ausreichend; 14B braucht typischerweise 12–16 GB, 32B eher 24–32 GB und 70B etwa 48–64 GB für Q4.
Praxisregel: Plane zusätzlich mindestens 10–20 % Reserve für Runtime und KV-Cache ein.
Technisch: Die Modellgewichte sind nur der erste Block. Kontextfenster, Batch-Größe, Parallelität und Backend-Overhead kommen hinzu.
Grenze: Die Werte sind Größenordnungen für Batch 1 und etwa 8k Kontext, keine Garantie für jedes Modell.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
02
Warum ist VRAM wichtiger als normaler RAM?
Kurzantwort
VRAM beziehungsweise Unified Memory bringt Modellgewichte näher an die Recheneinheiten und bietet deutlich mehr Bandbreite als typischer System-RAM.
Praxisregel: Wenn das Modell nicht vollständig im schnellen Speicher liegt, sinkt die Decode-Geschwindigkeit oft stark.
Technisch: System-RAM bleibt wichtig für CPU-Inferenz, Offload, Betriebssystem und Daten. VRAM ist aber bei GPU-Inferenz meist die harte Kapazitäts- und Bandbreitengrenze.
Grenze: Bei Apple Silicon teilen sich CPU und GPU Unified Memory; die Abgrenzung ist dort anders.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
03
Kann ich AMD-Grafikkarten mit ROCm genauso einfach nutzen wie NVIDIA-GPUs mit CUDA?
Kurzantwort
Nein. AMD ist unter Linux für viele Inferenzpfade brauchbar, aber CUDA hat weiterhin das breitere und reibungsärmere Ökosystem.
Praxisregel: AMD ist interessant, wenn viel VRAM pro Franken wichtiger ist als maximale Softwarekompatibilität.
Technisch: ROCm, HIP, llama.cpp und bestimmte vLLM-Stacks funktionieren; Betriebssystem, GPU-Generation, Container und Backend müssen aber zusammenpassen.
Grenze: Windows und seltene Frameworks können deutlich mehr Handarbeit erfordern.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
04
Welche NVIDIA-Grafikkarten bieten das beste Preis-Leistungs-Verhältnis?
Kurzantwort
Für lokale Modelle ist VRAM oft wichtiger als Gaming-Leistung: 24-GB-Karten sind häufig der praktische Sweet Spot, während 16-GB-Karten günstiger, aber schneller begrenzt sind.
Praxisregel: Vergleiche CHF pro GB, Bandbreite, Stromverbrauch, Gebrauchtzustand und CUDA-Kompatibilität statt nur TFLOPS.
Technisch: Ein aktuelles Ranking muss Preis und Messdatum nennen. Ohne Marktpreis und identische Benchmarks gibt es keine dauerhafte Siegerkarte.
Grenze: Preise ändern sich; die Seite behandelt Preisangaben als Momentaufnahme.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
05
Lohnen sich mehrere kleinere GPUs statt einer großen?
Kurzantwort
Nur wenn zusätzliche Kapazität oder der Gebrauchtpreis den Mehraufwand rechtfertigt. Eine große GPU ist einfacher, leiser und meist leichter zu betreiben.
Praxisregel: Multi-GPU lohnt sich vor allem für Modelle, die sonst nicht in eine Karte passen.
Technisch: Prüfe Slots, PCIe-Lanes, Netzteil, Kühlung, P2P und ob das Backend Pipeline- oder Tensor-Parallelismus nutzt.
Grenze: Die VRAM-Kapazitäten addieren sich nicht automatisch zu einer einfach nutzbaren Einzelkarte.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
06
Was bedeutet Speicherbandbreite für die Inferenzgeschwindigkeit?
Kurzantwort
Bei Einzel-Token-Decode muss das System große Teile der Modellgewichte wiederholt lesen. Mehr effektive Bandbreite erhöht daher meist die Tokens/s.
Praxisregel: Als grobe Obergrenze gilt effektive Bandbreite geteilt durch Modellgröße; reale Werte liegen darunter.
Technisch: Prefill ist stärker rechengebunden, Decode bei Batch 1 häufig speichergebunden. KV-Cache, Kernel und Parallelität verändern die Rechnung.
Grenze: Die lineare Faustformel ist keine exakte Messgleichung.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
07
Laufen Modelle auf Intel Arc GPUs?
Kurzantwort
Ja, besonders kleinere Modelle über llama.cpp mit SYCL/oneAPI oder passende Intel-Stacks.
Praxisregel: Für 7–14B und Experimentierbetrieb interessant; für produktives Serving vorab das konkrete Backend testen.
Technisch: Kapazität allein reicht nicht. Treiber, SYCL-Build, Quantisierung und Framework-Unterstützung bestimmen die Alltagstauglichkeit.
Grenze: Nicht jede CUDA-Anleitung lässt sich übertragen.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
08
Warum sind Macs mit Apple Silicon für lokale LLMs beliebt?
Kurzantwort
Sie kombinieren Unified Memory, geringe Lautstärke, kompakte Bauform und eine einfache lokale Laufzeitumgebung.
Praxisregel: Apple ist stark für Einzelanwender, die große Modelle ruhig und ohne Multi-GPU-Bau betreiben wollen.
Technisch: CPU und GPU teilen einen großen Speicherpool; dadurch sind Modelle möglich, die nicht in eine einzelne Consumer-GPU passen.
Grenze: CUDA-Serving, hohe Parallelität und maximale Tokens/s sprechen eher für NVIDIA.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
09
Wie viel Unified Memory brauche ich für 70B-Modelle?
Kurzantwort
Für 70B Q4 sind 64 GB meist die sinnvolle Untergrenze; 96–128 GB geben Reserven für Kontext, Desktop und mehrere Prozesse.
Praxisregel: Für Q8 oder lange Kontexte sind 128 GB oder mehr realistischer.
Technisch: Rechne Gewichte, KV-Cache, Betriebssystemreserve und parallele Anfragen getrennt.
Grenze: Die nutzbare Größe hängt von macOS, MLX/llama.cpp, Modellformat und Kontext ab.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
10
Ist ein Mac Studio schneller oder langsamer als ein NVIDIA-PC?
Kurzantwort
Für maximale Einzelstream- und Serving-Geschwindigkeit ist NVIDIA meist schneller; für Speicherkapazität, Lautstärke und Einfachheit kann Apple attraktiver sein.
Praxisregel: Vergleiche dasselbe Modell, dieselbe Quantisierung, denselben Kontext und dasselbe Messverfahren.
Technisch: Apple gewinnt häufig bei großem Unified Memory pro kompakter Box; NVIDIA gewinnt häufig bei CUDA-Kernels und hoher Parallelität.
Grenze: Pauschale Tokens/s-Vergleiche ohne Messprotokoll sind nicht belastbar.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
11
Kann man mit 16 GB Mac sinnvoll lokale Modelle betreiben?
Kurzantwort
Ja für kleine 3–8B-Q4-Modelle und kurze Kontexte; nicht komfortabel für 14B+ oder lange Kontexte.
Praxisregel: Lass 3–4 GB für macOS und Anwendungen frei und erwarte keine 70B-Nutzung.
Technisch: Unified Memory ist geteilt. Ein Modell, das rechnerisch passt, kann durch Desktop, KV-Cache und Runtime trotzdem an die Grenze kommen.
Grenze: Das konkrete Modell und Backend entscheiden.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
12
Kann ich LLMs rein auf der CPU betreiben?
Kurzantwort
Ja. llama.cpp und ähnliche Backends können Modelle aus System-RAM ausführen, meist mit deutlich niedrigerem Decode-Durchsatz.
Praxisregel: CPU eignet sich für kleine Modelle, Batch-Aufgaben und Systeme ohne GPU; für interaktives 32B/70B wird es schnell langsam.
Technisch: Mehr Speicherkanäle und hohe RAM-Bandbreite helfen stärker als minimale Latenzunterschiede.
Grenze: Tokens/s hängen stark von CPU, Threads, Quantisierung und Modellarchitektur ab.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
13
Welche Rolle spielt DDR4/DDR5 sowie Dual- und Quad-Channel?
Kurzantwort
Bei CPU-Inferenz zählt die Speicherbandbreite deutlich. Mehr Kanäle und höhere Datenrate können den Decode-Durchsatz erhöhen.
Praxisregel: Für CPU-LLMs zuerst genügend Kapazität und alle Speicherkanäle bestücken; Timing ist nachrangig.
Technisch: DDR5 bietet pro Kanal mehr Bandbreite, Quad-/Octa-Channel-Plattformen skalieren die Speicherbreite weiter.
Grenze: Nicht jede CPU nutzt die theoretische Bandbreite vollständig.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
14
Wie viel schneller ist ein LLM auf NVMe gegenüber SATA-SSD oder HDD?
Kurzantwort
Vor allem das Laden und Starten des Modells wird schneller. Die laufenden Tokens/s steigen kaum, wenn das Modell vollständig im schnellen Speicher liegt.
Praxisregel: NVMe lohnt sich für große Modelle, häufige Modellwechsel und Serverstart; sie ersetzt keinen VRAM.
Technisch: HDD/SATA werden beim Kaltstart zum I/O-Flaschenhals, während Decode primär durch Speicherbandbreite und Compute bestimmt wird.
Grenze: Bei Offload, Paging oder knapper RAM-Kapazität kann Storage indirekt stärker bremsen.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
15
Wie viel freier Festplattenspeicher wird pro Modell benötigt?
Kurzantwort
Plane neben der Modell-Datei mindestens 20–30 % Reserve für alternative Quantisierungen, Downloads, Caches und temporäre Dateien ein.
Praxisregel: Für 7–8B reichen oft 10–20 GB frei, für 32B eher 35–50 GB und für 70B eher 60–100 GB, je nach Format.
Technisch: Gewichtsgröße ist nicht gleich Installationsbedarf. Mehrere Versionen, Container und Konvertierungen wachsen schnell.
Grenze: Die Angaben sind Planungswerte, keine festen Dateigrößen.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
16
Welche CPU-Befehlssatzerweiterungen sind wichtig?
Kurzantwort
AVX2 ist ein verbreiteter Mindestnutzen; AVX-512 und AMX können passende CPU-Kernels beschleunigen, sind aber nicht universell verfügbar.
Praxisregel: Beim CPU-Kauf zählen zusätzlich Speicherkanäle, Bandbreite, Kerne, Kühlung und Backend-Unterstützung.
Technisch: Die Erweiterung muss vom Modell-Backend tatsächlich genutzt werden. Ein Datenblatt allein garantiert keinen Durchsatz.
Grenze: Unterstützung unterscheidet sich nach CPU, Betriebssystem und Build.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
17
Wie berechne ich den VRAM-Bedarf aus Parameterzahl und Quantisierung?
Kurzantwort
Gewichtsspeicher ist ungefähr Parameterzahl mal Bits pro Parameter geteilt durch acht; danach kommen KV-Cache und Runtime-Reserve hinzu.
Praxisregel: Nutze den Rechner und plane nicht exakt bis zur Kartenkapazität.
Technisch: Quantisierungsmetadaten und Tensor-Strukturen machen die Datei etwas größer als die reine Bitrechnung.
Grenze: „Genau“ ist nur mit konkretem Modellformat, Backend und Kontext möglich.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
18
Was bedeuten GGUF, AWQ, EXL2, 4-bit und 8-bit?
Kurzantwort
Bits beschreiben die numerische Präzision; GGUF, AWQ und EXL2 beschreiben zusätzlich konkrete Speicher- und Backendformate.
Praxisregel: Wähle zuerst das Backend, dann ein kompatibles Format.
Technisch: GGUF ist besonders flexibel für llama.cpp; AWQ und EXL2 sind stark an GPU-Backends gebunden. Niedrigere Bitbreite spart Speicher, kann aber Qualität und Kompatibilität beeinflussen.
Grenze: Formatnamen allein sagen nichts über tatsächliche Qualität oder Geschwindigkeit.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
19
Welche Hardware lässt 70B-Modelle flüssig in Echtzeit laufen?
Kurzantwort
Für 70B Q4 brauchst du typischerweise 48–64 GB schnellen Speicher; für komfortable Parallelität deutlich mehr.
Praxisregel: Definiere flüssig als Zielwert, zum Beispiel mindestens 15–20 Decode-Tokens/s bei deinem Kontext.
Technisch: Ein Dual-GPU-System oder ein Mac mit 64–128 GB kann passen, aber Geschwindigkeit, Software und Strom unterscheiden sich stark.
Grenze: Ohne identisches Benchmark-Protokoll sind konkrete Tokens/s nur Orientierung.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
20
Wie stark erhöht ein langes Kontextfenster den VRAM-Bedarf?
Kurzantwort
Der KV-Cache wächst ungefähr linear mit Kontextlänge und Batch-Größe. 32k benötigt etwa viermal so viel KV-Cache wie 8k.
Praxisregel: Rechne Kontextbudget und parallele Nutzer früh ein; sie können die Gewichte übertreffen.
Technisch: Layerzahl, KV-Heads, Head-Dimension und KV-Datentyp bestimmen die konkrete Größe.
Grenze: MLA, GQA und Backend-Implementierung verändern den Wert.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
21
Was bringt eine NPU gegenüber einer GPU?
Kurzantwort
Eine NPU kann kleine, dauerhafte INT8/INT4-Aufgaben energieeffizient ausführen; sie ersetzt keine große GPU für 32B/70B-LLMs.
Praxisregel: NPU ist interessant für Whisper, Embeddings, Vision-Preprocessing und kleine SLMs.
Technisch: TOPS-Angaben sind keine direkte Tokens/s-Angabe. Speicherbandbreite, Kapazität und Runtime entscheiden.
Grenze: Toolchain und Modellunterstützung prüfen.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
22
Lohnen sich gebrauchte Server-GPUs?
Kurzantwort
Manchmal: viel VRAM kann günstig sein, aber Kühlung, Alter, Strom, Anschlüsse und Softwarerisiko sind real.
Praxisregel: P40 und V100 sind Spezialfälle; eine gebrauchte RTX 3090 ist für viele lokale Nutzer einfacher.
Technisch: Passive Serverkarten brauchen kontrollierte Luftführung. Vor dem Kauf Speicherfehler, Temperatur, Firmware und Rückgaberecht klären.
Grenze: Gebrauchtpreise und Verfügbarkeit schwanken.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
23
Können Raspberry Pi 5 oder NVIDIA Jetson lokale Sprachmodelle ausführen?
Kurzantwort
Ja, vor allem kleine quantisierte Modelle, Embeddings und Audio; große interaktive LLMs sind wegen Speicher und Bandbreite stark begrenzt.
Praxisregel: Jetson ist wegen CUDA/Edge-Stack meist geeigneter für GPU-Workloads; Raspberry Pi eignet sich für leichte Automatisierung.
Technisch: Realistische Ziele sind 1–7B je nach Speicher, Quantisierung und gewünschter Latenz.
Grenze: Nicht mit Desktop-GPU-Tokens/s vergleichen.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
24
Welche Beschleuniger gibt es abseits von GPUs?
Kurzantwort
Neben CPUs, NPUs und Apple UMA gibt es unter anderem Tenstorrent-, Coral-, TPU- und Gaudi-Systeme mit jeweils eigener Software.
Praxisregel: Für ein lokales Einzelgerät zählen Ökosystem und Modellunterstützung meist stärker als theoretische TOPS.
Technisch: Coral ist eher für Edge-Inferenz kleiner Modelle; Tenstorrent und Gaudi zielen auf spezifische ML- und Serving-Workloads.
Grenze: Die praktische Eignung hängt stark von Treiber, Compiler und Modellformat ab.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
25
Wie viel Watt muss das Netzteil liefern?
Kurzantwort
Addiere GPU-, CPU- und Systemlast und plane Reserve für Lastspitzen; zwei High-End-GPUs brauchen häufig 1.200–1.600 W, vier entsprechend mehr.
Praxisregel: ATX-3.x-Netzteil, passende Kabel, Steckplätze und Stromkreis prüfen.
Technisch: Dauerlast und kurzzeitige Transienten sind verschieden. Ein Netzteil knapp an der Nennlast ist für 24/7-Betrieb keine gute Planung.
Grenze: Herstellerempfehlungen und konkrete GPU-TGP beachten.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
26
Welche Kühlung braucht ein Multi-GPU-Setup?
Kurzantwort
Je enger und höher die Dauerlast, desto wichtiger sind definierter Airflow, Kartenabstand und gegebenenfalls Blower- oder Wasserkühlung.
Praxisregel: Axialkarten brauchen Platz; passive Serverkarten brauchen eine eigene Luftführung; offene Rigs gehören nicht ins Wohnumfeld.
Technisch: Kühlung ist nicht nur Temperatur, sondern auch Lautstärke, Staub, Hotspot und Raumabwärme.
Grenze: Gehäuse und Kartenlayout entscheiden.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
27
Wie hoch sind die laufenden Stromkosten?
Kurzantwort
Kosten = Leistung in kW mal Betriebsstunden mal Strompreis. Durchschnittliche Auslastung ist wichtiger als die maximale TDP allein.
Praxisregel: Rechne Netzteilverluste und optional Klimatisierung separat ein.
Technisch: Ein 600-W-System bei 40 % Durchschnittslast verbraucht deutlich weniger als 600 W dauerhaft, aber Serverbetrieb bleibt ein TCO-Faktor.
Grenze: Messung an der Steckdose ist genauer als TDP-Schätzung.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
28
Reicht Inferenz-Hardware für LoRA oder QLoRA?
Kurzantwort
Oft ja für kleine Modelle; Fine-Tuning braucht aber zusätzliche Speicherblöcke und weniger Reserve als reine Inferenz.
Praxisregel: 24 GB können für manche 7–14B-QLoRA-Setups reichen; Kontext und Batch entscheiden.
Technisch: LoRA trainiert Adapter, QLoRA hält Gewichte quantisiert; Volltraining benötigt deutlich mehr für Gradienten und Optimizer.
Grenze: Konkrete VRAM-Werte hängen von Framework, Rank, Sequenzlänge und Batch ab.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
29
Welche PCIe-Anbindung ist minimal erforderlich?
Kurzantwort
Für Pipeline-Parallelismus reichen oft weniger Lanes; Tensor-Parallelismus und All-Reduce profitieren deutlich von schnellen, direkten Links.
Praxisregel: Bei zwei GPUs ist x8/x8 oft brauchbar; bei drei oder vier GPUs werden Workstation-Lanes und Topologie wichtig.
Technisch: PCIe 4/5, x8/x16 und P2P müssen zusammen mit dem Parallelismus betrachtet werden.
Grenze: Kein universeller Mindestwert für jedes Backend.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.
30
Warum benötigt Fine-Tuning mehr VRAM als reine Inferenz?
Kurzantwort
Beim Training müssen zusätzlich Gradienten, Aktivierungen und meist Optimizer-Zustände gespeichert werden.
Praxisregel: LoRA und QLoRA senken den Bedarf, beseitigen ihn aber nicht.
Technisch: Inferenz hält primär Gewichte und KV-Cache; Training braucht Zwischenwerte für den Rückwärtslauf und Zustände für die Gewichtsaktualisierung.
Grenze: Checkpointing, Gradient Accumulation und Optimizer ändern die Größe.
PlanungswertPlanungswert; konkrete Hardware, Modellversion und Backend können abweichen.