Antworten

30 Fragen. Direkte Antworten.

Suche nach Modell, VRAM, GPU, Mac, Strom, PCIe oder Fine-Tuning.

01

Wie viel VRAM brauche ich mindestens, um LLMs lokal auszuführen?

Kurzantwort

Für 7–8B Q4 sind meist 8–12 GB nutzbarer Beschleunigerspeicher ausreichend; 14B braucht typischerweise 12–16 GB, 32B eher 24–32 GB und 70B etwa 48–64 GB für Q4.

Praxisregel: Plane zusätzlich mindestens 10–20 % Reserve für Runtime und KV-Cache ein.

Technisch: Die Modellgewichte sind nur der erste Block. Kontextfenster, Batch-Größe, Parallelität und Backend-Overhead kommen hinzu.

Grenze: Die Werte sind Größenordnungen für Batch 1 und etwa 8k Kontext, keine Garantie für jedes Modell.

Weiterlesen →Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

02

Warum ist VRAM wichtiger als normaler RAM?

Kurzantwort

VRAM beziehungsweise Unified Memory bringt Modellgewichte näher an die Recheneinheiten und bietet deutlich mehr Bandbreite als typischer System-RAM.

Praxisregel: Wenn das Modell nicht vollständig im schnellen Speicher liegt, sinkt die Decode-Geschwindigkeit oft stark.

Technisch: System-RAM bleibt wichtig für CPU-Inferenz, Offload, Betriebssystem und Daten. VRAM ist aber bei GPU-Inferenz meist die harte Kapazitäts- und Bandbreitengrenze.

Grenze: Bei Apple Silicon teilen sich CPU und GPU Unified Memory; die Abgrenzung ist dort anders.

Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

03

Kann ich AMD-Grafikkarten mit ROCm genauso einfach nutzen wie NVIDIA-GPUs mit CUDA?

Kurzantwort

Nein. AMD ist unter Linux für viele Inferenzpfade brauchbar, aber CUDA hat weiterhin das breitere und reibungsärmere Ökosystem.

Praxisregel: AMD ist interessant, wenn viel VRAM pro Franken wichtiger ist als maximale Softwarekompatibilität.

Technisch: ROCm, HIP, llama.cpp und bestimmte vLLM-Stacks funktionieren; Betriebssystem, GPU-Generation, Container und Backend müssen aber zusammenpassen.

Grenze: Windows und seltene Frameworks können deutlich mehr Handarbeit erfordern.

Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

04

Welche NVIDIA-Grafikkarten bieten das beste Preis-Leistungs-Verhältnis?

Kurzantwort

Für lokale Modelle ist VRAM oft wichtiger als Gaming-Leistung: 24-GB-Karten sind häufig der praktische Sweet Spot, während 16-GB-Karten günstiger, aber schneller begrenzt sind.

Praxisregel: Vergleiche CHF pro GB, Bandbreite, Stromverbrauch, Gebrauchtzustand und CUDA-Kompatibilität statt nur TFLOPS.

Technisch: Ein aktuelles Ranking muss Preis und Messdatum nennen. Ohne Marktpreis und identische Benchmarks gibt es keine dauerhafte Siegerkarte.

Grenze: Preise ändern sich; die Seite behandelt Preisangaben als Momentaufnahme.

Weiterlesen →Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

05

Lohnen sich mehrere kleinere GPUs statt einer großen?

Kurzantwort

Nur wenn zusätzliche Kapazität oder der Gebrauchtpreis den Mehraufwand rechtfertigt. Eine große GPU ist einfacher, leiser und meist leichter zu betreiben.

Praxisregel: Multi-GPU lohnt sich vor allem für Modelle, die sonst nicht in eine Karte passen.

Technisch: Prüfe Slots, PCIe-Lanes, Netzteil, Kühlung, P2P und ob das Backend Pipeline- oder Tensor-Parallelismus nutzt.

Grenze: Die VRAM-Kapazitäten addieren sich nicht automatisch zu einer einfach nutzbaren Einzelkarte.

Weiterlesen →Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

06

Was bedeutet Speicherbandbreite für die Inferenzgeschwindigkeit?

Kurzantwort

Bei Einzel-Token-Decode muss das System große Teile der Modellgewichte wiederholt lesen. Mehr effektive Bandbreite erhöht daher meist die Tokens/s.

Praxisregel: Als grobe Obergrenze gilt effektive Bandbreite geteilt durch Modellgröße; reale Werte liegen darunter.

Technisch: Prefill ist stärker rechengebunden, Decode bei Batch 1 häufig speichergebunden. KV-Cache, Kernel und Parallelität verändern die Rechnung.

Grenze: Die lineare Faustformel ist keine exakte Messgleichung.

Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

07

Laufen Modelle auf Intel Arc GPUs?

Kurzantwort

Ja, besonders kleinere Modelle über llama.cpp mit SYCL/oneAPI oder passende Intel-Stacks.

Praxisregel: Für 7–14B und Experimentierbetrieb interessant; für produktives Serving vorab das konkrete Backend testen.

Technisch: Kapazität allein reicht nicht. Treiber, SYCL-Build, Quantisierung und Framework-Unterstützung bestimmen die Alltagstauglichkeit.

Grenze: Nicht jede CUDA-Anleitung lässt sich übertragen.

Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

08

Warum sind Macs mit Apple Silicon für lokale LLMs beliebt?

Kurzantwort

Sie kombinieren Unified Memory, geringe Lautstärke, kompakte Bauform und eine einfache lokale Laufzeitumgebung.

Praxisregel: Apple ist stark für Einzelanwender, die große Modelle ruhig und ohne Multi-GPU-Bau betreiben wollen.

Technisch: CPU und GPU teilen einen großen Speicherpool; dadurch sind Modelle möglich, die nicht in eine einzelne Consumer-GPU passen.

Grenze: CUDA-Serving, hohe Parallelität und maximale Tokens/s sprechen eher für NVIDIA.

Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

09

Wie viel Unified Memory brauche ich für 70B-Modelle?

Kurzantwort

Für 70B Q4 sind 64 GB meist die sinnvolle Untergrenze; 96–128 GB geben Reserven für Kontext, Desktop und mehrere Prozesse.

Praxisregel: Für Q8 oder lange Kontexte sind 128 GB oder mehr realistischer.

Technisch: Rechne Gewichte, KV-Cache, Betriebssystemreserve und parallele Anfragen getrennt.

Grenze: Die nutzbare Größe hängt von macOS, MLX/llama.cpp, Modellformat und Kontext ab.

Weiterlesen →Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

10

Ist ein Mac Studio schneller oder langsamer als ein NVIDIA-PC?

Kurzantwort

Für maximale Einzelstream- und Serving-Geschwindigkeit ist NVIDIA meist schneller; für Speicherkapazität, Lautstärke und Einfachheit kann Apple attraktiver sein.

Praxisregel: Vergleiche dasselbe Modell, dieselbe Quantisierung, denselben Kontext und dasselbe Messverfahren.

Technisch: Apple gewinnt häufig bei großem Unified Memory pro kompakter Box; NVIDIA gewinnt häufig bei CUDA-Kernels und hoher Parallelität.

Grenze: Pauschale Tokens/s-Vergleiche ohne Messprotokoll sind nicht belastbar.

Weiterlesen →Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

11

Kann man mit 16 GB Mac sinnvoll lokale Modelle betreiben?

Kurzantwort

Ja für kleine 3–8B-Q4-Modelle und kurze Kontexte; nicht komfortabel für 14B+ oder lange Kontexte.

Praxisregel: Lass 3–4 GB für macOS und Anwendungen frei und erwarte keine 70B-Nutzung.

Technisch: Unified Memory ist geteilt. Ein Modell, das rechnerisch passt, kann durch Desktop, KV-Cache und Runtime trotzdem an die Grenze kommen.

Grenze: Das konkrete Modell und Backend entscheiden.

Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

12

Kann ich LLMs rein auf der CPU betreiben?

Kurzantwort

Ja. llama.cpp und ähnliche Backends können Modelle aus System-RAM ausführen, meist mit deutlich niedrigerem Decode-Durchsatz.

Praxisregel: CPU eignet sich für kleine Modelle, Batch-Aufgaben und Systeme ohne GPU; für interaktives 32B/70B wird es schnell langsam.

Technisch: Mehr Speicherkanäle und hohe RAM-Bandbreite helfen stärker als minimale Latenzunterschiede.

Grenze: Tokens/s hängen stark von CPU, Threads, Quantisierung und Modellarchitektur ab.

Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

13

Welche Rolle spielt DDR4/DDR5 sowie Dual- und Quad-Channel?

Kurzantwort

Bei CPU-Inferenz zählt die Speicherbandbreite deutlich. Mehr Kanäle und höhere Datenrate können den Decode-Durchsatz erhöhen.

Praxisregel: Für CPU-LLMs zuerst genügend Kapazität und alle Speicherkanäle bestücken; Timing ist nachrangig.

Technisch: DDR5 bietet pro Kanal mehr Bandbreite, Quad-/Octa-Channel-Plattformen skalieren die Speicherbreite weiter.

Grenze: Nicht jede CPU nutzt die theoretische Bandbreite vollständig.

Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

14

Wie viel schneller ist ein LLM auf NVMe gegenüber SATA-SSD oder HDD?

Kurzantwort

Vor allem das Laden und Starten des Modells wird schneller. Die laufenden Tokens/s steigen kaum, wenn das Modell vollständig im schnellen Speicher liegt.

Praxisregel: NVMe lohnt sich für große Modelle, häufige Modellwechsel und Serverstart; sie ersetzt keinen VRAM.

Technisch: HDD/SATA werden beim Kaltstart zum I/O-Flaschenhals, während Decode primär durch Speicherbandbreite und Compute bestimmt wird.

Grenze: Bei Offload, Paging oder knapper RAM-Kapazität kann Storage indirekt stärker bremsen.

Weiterlesen →Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

15

Wie viel freier Festplattenspeicher wird pro Modell benötigt?

Kurzantwort

Plane neben der Modell-Datei mindestens 20–30 % Reserve für alternative Quantisierungen, Downloads, Caches und temporäre Dateien ein.

Praxisregel: Für 7–8B reichen oft 10–20 GB frei, für 32B eher 35–50 GB und für 70B eher 60–100 GB, je nach Format.

Technisch: Gewichtsgröße ist nicht gleich Installationsbedarf. Mehrere Versionen, Container und Konvertierungen wachsen schnell.

Grenze: Die Angaben sind Planungswerte, keine festen Dateigrößen.

Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

16

Welche CPU-Befehlssatzerweiterungen sind wichtig?

Kurzantwort

AVX2 ist ein verbreiteter Mindestnutzen; AVX-512 und AMX können passende CPU-Kernels beschleunigen, sind aber nicht universell verfügbar.

Praxisregel: Beim CPU-Kauf zählen zusätzlich Speicherkanäle, Bandbreite, Kerne, Kühlung und Backend-Unterstützung.

Technisch: Die Erweiterung muss vom Modell-Backend tatsächlich genutzt werden. Ein Datenblatt allein garantiert keinen Durchsatz.

Grenze: Unterstützung unterscheidet sich nach CPU, Betriebssystem und Build.

Weiterlesen →Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

17

Wie berechne ich den VRAM-Bedarf aus Parameterzahl und Quantisierung?

Kurzantwort

Gewichtsspeicher ist ungefähr Parameterzahl mal Bits pro Parameter geteilt durch acht; danach kommen KV-Cache und Runtime-Reserve hinzu.

Praxisregel: Nutze den Rechner und plane nicht exakt bis zur Kartenkapazität.

Technisch: Quantisierungsmetadaten und Tensor-Strukturen machen die Datei etwas größer als die reine Bitrechnung.

Grenze: „Genau“ ist nur mit konkretem Modellformat, Backend und Kontext möglich.

Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

18

Was bedeuten GGUF, AWQ, EXL2, 4-bit und 8-bit?

Kurzantwort

Bits beschreiben die numerische Präzision; GGUF, AWQ und EXL2 beschreiben zusätzlich konkrete Speicher- und Backendformate.

Praxisregel: Wähle zuerst das Backend, dann ein kompatibles Format.

Technisch: GGUF ist besonders flexibel für llama.cpp; AWQ und EXL2 sind stark an GPU-Backends gebunden. Niedrigere Bitbreite spart Speicher, kann aber Qualität und Kompatibilität beeinflussen.

Grenze: Formatnamen allein sagen nichts über tatsächliche Qualität oder Geschwindigkeit.

Weiterlesen →Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

19

Welche Hardware lässt 70B-Modelle flüssig in Echtzeit laufen?

Kurzantwort

Für 70B Q4 brauchst du typischerweise 48–64 GB schnellen Speicher; für komfortable Parallelität deutlich mehr.

Praxisregel: Definiere flüssig als Zielwert, zum Beispiel mindestens 15–20 Decode-Tokens/s bei deinem Kontext.

Technisch: Ein Dual-GPU-System oder ein Mac mit 64–128 GB kann passen, aber Geschwindigkeit, Software und Strom unterscheiden sich stark.

Grenze: Ohne identisches Benchmark-Protokoll sind konkrete Tokens/s nur Orientierung.

Weiterlesen →Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

20

Wie stark erhöht ein langes Kontextfenster den VRAM-Bedarf?

Kurzantwort

Der KV-Cache wächst ungefähr linear mit Kontextlänge und Batch-Größe. 32k benötigt etwa viermal so viel KV-Cache wie 8k.

Praxisregel: Rechne Kontextbudget und parallele Nutzer früh ein; sie können die Gewichte übertreffen.

Technisch: Layerzahl, KV-Heads, Head-Dimension und KV-Datentyp bestimmen die konkrete Größe.

Grenze: MLA, GQA und Backend-Implementierung verändern den Wert.

Weiterlesen →Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

21

Was bringt eine NPU gegenüber einer GPU?

Kurzantwort

Eine NPU kann kleine, dauerhafte INT8/INT4-Aufgaben energieeffizient ausführen; sie ersetzt keine große GPU für 32B/70B-LLMs.

Praxisregel: NPU ist interessant für Whisper, Embeddings, Vision-Preprocessing und kleine SLMs.

Technisch: TOPS-Angaben sind keine direkte Tokens/s-Angabe. Speicherbandbreite, Kapazität und Runtime entscheiden.

Grenze: Toolchain und Modellunterstützung prüfen.

Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

22

Lohnen sich gebrauchte Server-GPUs?

Kurzantwort

Manchmal: viel VRAM kann günstig sein, aber Kühlung, Alter, Strom, Anschlüsse und Softwarerisiko sind real.

Praxisregel: P40 und V100 sind Spezialfälle; eine gebrauchte RTX 3090 ist für viele lokale Nutzer einfacher.

Technisch: Passive Serverkarten brauchen kontrollierte Luftführung. Vor dem Kauf Speicherfehler, Temperatur, Firmware und Rückgaberecht klären.

Grenze: Gebrauchtpreise und Verfügbarkeit schwanken.

Weiterlesen →Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

23

Können Raspberry Pi 5 oder NVIDIA Jetson lokale Sprachmodelle ausführen?

Kurzantwort

Ja, vor allem kleine quantisierte Modelle, Embeddings und Audio; große interaktive LLMs sind wegen Speicher und Bandbreite stark begrenzt.

Praxisregel: Jetson ist wegen CUDA/Edge-Stack meist geeigneter für GPU-Workloads; Raspberry Pi eignet sich für leichte Automatisierung.

Technisch: Realistische Ziele sind 1–7B je nach Speicher, Quantisierung und gewünschter Latenz.

Grenze: Nicht mit Desktop-GPU-Tokens/s vergleichen.

Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

24

Welche Beschleuniger gibt es abseits von GPUs?

Kurzantwort

Neben CPUs, NPUs und Apple UMA gibt es unter anderem Tenstorrent-, Coral-, TPU- und Gaudi-Systeme mit jeweils eigener Software.

Praxisregel: Für ein lokales Einzelgerät zählen Ökosystem und Modellunterstützung meist stärker als theoretische TOPS.

Technisch: Coral ist eher für Edge-Inferenz kleiner Modelle; Tenstorrent und Gaudi zielen auf spezifische ML- und Serving-Workloads.

Grenze: Die praktische Eignung hängt stark von Treiber, Compiler und Modellformat ab.

Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

25

Wie viel Watt muss das Netzteil liefern?

Kurzantwort

Addiere GPU-, CPU- und Systemlast und plane Reserve für Lastspitzen; zwei High-End-GPUs brauchen häufig 1.200–1.600 W, vier entsprechend mehr.

Praxisregel: ATX-3.x-Netzteil, passende Kabel, Steckplätze und Stromkreis prüfen.

Technisch: Dauerlast und kurzzeitige Transienten sind verschieden. Ein Netzteil knapp an der Nennlast ist für 24/7-Betrieb keine gute Planung.

Grenze: Herstellerempfehlungen und konkrete GPU-TGP beachten.

Weiterlesen →Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

26

Welche Kühlung braucht ein Multi-GPU-Setup?

Kurzantwort

Je enger und höher die Dauerlast, desto wichtiger sind definierter Airflow, Kartenabstand und gegebenenfalls Blower- oder Wasserkühlung.

Praxisregel: Axialkarten brauchen Platz; passive Serverkarten brauchen eine eigene Luftführung; offene Rigs gehören nicht ins Wohnumfeld.

Technisch: Kühlung ist nicht nur Temperatur, sondern auch Lautstärke, Staub, Hotspot und Raumabwärme.

Grenze: Gehäuse und Kartenlayout entscheiden.

Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

27

Wie hoch sind die laufenden Stromkosten?

Kurzantwort

Kosten = Leistung in kW mal Betriebsstunden mal Strompreis. Durchschnittliche Auslastung ist wichtiger als die maximale TDP allein.

Praxisregel: Rechne Netzteilverluste und optional Klimatisierung separat ein.

Technisch: Ein 600-W-System bei 40 % Durchschnittslast verbraucht deutlich weniger als 600 W dauerhaft, aber Serverbetrieb bleibt ein TCO-Faktor.

Grenze: Messung an der Steckdose ist genauer als TDP-Schätzung.

Weiterlesen →Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

28

Reicht Inferenz-Hardware für LoRA oder QLoRA?

Kurzantwort

Oft ja für kleine Modelle; Fine-Tuning braucht aber zusätzliche Speicherblöcke und weniger Reserve als reine Inferenz.

Praxisregel: 24 GB können für manche 7–14B-QLoRA-Setups reichen; Kontext und Batch entscheiden.

Technisch: LoRA trainiert Adapter, QLoRA hält Gewichte quantisiert; Volltraining benötigt deutlich mehr für Gradienten und Optimizer.

Grenze: Konkrete VRAM-Werte hängen von Framework, Rank, Sequenzlänge und Batch ab.

Weiterlesen →Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

29

Welche PCIe-Anbindung ist minimal erforderlich?

Kurzantwort

Für Pipeline-Parallelismus reichen oft weniger Lanes; Tensor-Parallelismus und All-Reduce profitieren deutlich von schnellen, direkten Links.

Praxisregel: Bei zwei GPUs ist x8/x8 oft brauchbar; bei drei oder vier GPUs werden Workstation-Lanes und Topologie wichtig.

Technisch: PCIe 4/5, x8/x16 und P2P müssen zusammen mit dem Parallelismus betrachtet werden.

Grenze: Kein universeller Mindestwert für jedes Backend.

Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.

30

Warum benötigt Fine-Tuning mehr VRAM als reine Inferenz?

Kurzantwort

Beim Training müssen zusätzlich Gradienten, Aktivierungen und meist Optimizer-Zustände gespeichert werden.

Praxisregel: LoRA und QLoRA senken den Bedarf, beseitigen ihn aber nicht.

Technisch: Inferenz hält primär Gewichte und KV-Cache; Training braucht Zwischenwerte für den Rückwärtslauf und Zustände für die Gewichtsaktualisierung.

Grenze: Checkpointing, Gradient Accumulation und Optimizer ändern die Größe.

Weiterlesen →Weiterlesen →
Planungswert

Planungswert; konkrete Hardware, Modellversion und Backend können abweichen.