Kapitel 05 · geprüft August 2026

Hardware-Kategorien

Apple UMA, Consumer-GPUs und Enterprise-Hardware.

Kurzantwort

Apple UMA, Consumer-GPUs und Enterprise-Hardware. Lies zuerst die Kurzantwort und springe danach in die technische Herleitung.

Hardware-Kategorien: technische Übersicht
Hardware-Kategorien · redaktionelle Kapitelübersicht

Kapitel 5: Hardware-Kategorien – NVIDIA, Apple Silicon, Enterprise & Alternativen

Die Auswahl der Hardware für lokale Sprachmodelle entscheidet über Durchsatz, maximale Modellgröße, Energieeffizienz und die Kompatibilität mit bestehenden Software-Stacks. Stand 2026 ist das Marktsegment durch vier distinkte Ökosysteme geprägt: das dominierende NVIDIA-Consumer- und Workstation-Segment mit CUDA-Monopol, Apple Silicon mit seiner Unified Memory Architecture (UMA) im High-RAM-Bereich, klassische Enterprise- und Gebraucht-Server-Hardware sowie aufstrebende alternative Beschleuniger von AMD, Intel und NPU-Herstellern.


5.1 NVIDIA Consumer GPUs: Das CUDA-Ökosystem

NVIDIA-Consumer-Grafikkarten (GeForce-Serie) stellen die am weitesten verbreitete Plattform für lokale Inferenz und Feintuning dar. Der primäre Vorteil liegt in der lückenlosen Softwareunterstützung: Nahezu jedes Open-Source-Framework (vLLM, TensorRT-LLM, SGLang, Ollama, llama.cpp, ExLlamaV2) ist primär für NVIDIA-Architekturen optimiert.

+-----------------------------------------------------------------------------+
|                      NVIDIA TENSOR CORE GENERATIONEN                        |
+-----------------------------------------------------------------------------+
|                                                                             |
|  Ampere (RTX 30xx)        Ada Lovelace (RTX 40xx)    Blackwell (RTX 50xx)   |
|  +---------------------+  +---------------------+    +---------------------+|
|  | FP16 Tensor Cores   |  | FP8 (E4M3 / E5M2)   |    | Native FP4 / INT4   | |
|  | INT8, INT4 Support  |  | Transformer Engine  |    | 2nd Gen Transformer | |
|  | GDDR6 / GDDR6X      |  | GDDR6X (bis 1 TB/s) |    | GDDR7 (bis 1.8 TB/s)| |
|  +---------------------+  +---------------------+    +---------------------+|
|                                                                             |
+-----------------------------------------------------------------------------+

Detaillierte Spezifikationen und Inferenz-Metriken

GPU-Modell VRAM & Bus Speicher-Bandbreite FP16 Compute (Dense) FP8 Compute Leistungsaufnahme (TDP) Sweet-Spot / Anwendungsbereich
RTX 3060 12GB 12 GB GDDR6 (192-Bit) 360 GB/s 26 TFLOPs Nicht nativ 170 W Budget-Einstieg für 8B Modelle (Q8/Q4)
RTX 4060 Ti 16GB 16 GB GDDR6 (128-Bit) 288 GB/s 44 TFLOPs 88 TFLOPs 165 W Günstigste 16GB Karte, aber bandbreitenlimitiert
RTX 4070 Ti Super 16 GB GDDR6X (256-Bit) 672 GB/s 88 TFLOPs 176 TFLOPs 285 W 16GB VRAM mit hoher Bandbreite
RTX 4080 / Super 16 GB GDDR6X (256-Bit) 717 / 736 GB/s 97 / 104 TFLOPs 194 / 208 TFLOPs 320 W Hohe Prefill-Leistung für 8B-14B
RTX 3090 24GB 24 GB GDDR6X (384-Bit) 936 GB/s 71 TFLOPs Nicht nativ 350 W Gebrauchtmarkt-König für 24GB (Multi-GPU Rigs)
RTX 4090 24GB 24 GB GDDR6X (384-Bit) 1008 GB/s 330 TFLOPs 660 TFLOPs 450 W Maximale Single-GPU Consumer-Leistung
RTX 5090 32GB 32 GB GDDR7 (512-Bit) 1792 GB/s ~340 TFLOPs ~680 TFLOPs 600 W 32GB VRAM: 32B FP8 oder 70B Q3 nativ auf 1 Karte

Relevanz der Tensor-Core-Generationen

  1. Ampere (RTX 30xx): Bietet hervorragendes Preis-Leistungs-Verhältnis auf dem Gebrauchtmarkt (insbesondere RTX 3090 24GB). Unterstützt native FP16- und INT8/INT4-Operationen. Limitierung: Keine native Unterstützung für FP8-Formate (E4M3 / E5M2). FP8-quantisierte Modelle (z. B. vLLM FP8) müssen per Software emuliert oder als AWQ/GPTQ (INT4/INT8) geladen werden.
  2. Ada Lovelace (RTX 40xx): Einführung der FP8 Transformer Engine. Ermöglicht die Ausführung von Modellen in nativer FP8-Präzision mit nahezu doppelter TFLOP-Leistung gegenüber FP16 und halbiertem VRAM-Bedarf ohne merklichen Perplexity-Verlust.
  3. Blackwell (RTX 50xx): Erste Consumer-Architektur mit nativem Microscaling FP4 / INT4 Support und GDDR7-Speicherinterface (1792 GB/s). Erlaubt extrem hohe Token-Generierungsraten bei 32B- und 70B-Modellen.
[Praxis-Tipp] Der 24GB-VRAM-Schwellenwert
24 GB VRAM markieren die wichtigste Grenze im Consumer-Segment. Erst mit 24 GB VRAM lassen sich:
- Qwen 2.5 32B in Q4_K_M (ca. 20 GB) mit 16k Kontext betreiben
- Llama 3.3 70B in Q2_K (Notlösung) betreiben
- 8B-Modelle in unquantisiertem FP16 mit 128k vollem Kontext betreiben
- LoRA-Feintuning für 8B-Modelle lokal mit Batch-Size > 1 durchführen
Karten mit 16 GB VRAM sind auf 14B-Modelle (Q8/FP16) oder 32B-Modelle in aggressiver Quantisierung (Q3) limitiert.

5.2 Apple Silicon: Unified Memory Architecture (UMA)

Apples M-Serie verfolgt einen radikal anderen Architekturansatz: CPU, GPU und Neural Engine teilen sich einen gemeinsamen physischen Speicherpool (Unified Memory). Es gibt keinen PCIe-Bus zwischen CPU und GPU-Speicher.

+-----------------------------------------------------------------------------+
|                     APPLE UNIFIED MEMORY ARCHITECTURE (UMA)                 |
+-----------------------------------------------------------------------------+
|                                                                             |
|  +-------------------+  +--------------------+  +----------------------+   |
|  | CPU Cores (P + E) |  | GPU Cores (Metal)  |  | Neural Engine (ANE)  |   |
|  +---------+---------+  +---------+----------+  +----------+-----------+   |
|            |                      |                        |                |
|            +----------------------+------------------------+                |
|                                   |                                         |
|                   +---------------+---------------+                         |
|                   | High-Speed On-Die Interconnect|                         |
|                   +---------------+---------------+                         |
|                                   |                                         |
|             +---------------------+---------------------+                   |
|             | UNIFIED MEMORY (LPDDR5 / LPDDR5X Speichers)|                   |
|             | Bis zu 192 GB (M2 Ultra) / 128 GB (M4 Max)|                   |
|             | Bandbreite: 273 GB/s bis 800 GB/s         |                   |
|             +-------------------------------------------+                   |
|                                                                             |
+-----------------------------------------------------------------------------+

Apple Silicon Varianten im Inferenz-Vergleich

Prozessor / Plattform Maximaler RAM Speicher-Schnittstelle Bandbreite Metal GPU Cores Typischer Durchsatz Llama 3.3 70B (Q4_K_M) Typischer Durchsatz Qwen 2.5 32B (Q4_K_M)
M4 Pro (Mac mini) 64 GB 256-Bit LPDDR5X 273 GB/s bis zu 20 $\approx 5{,}5 \text{ t/s}$ $\approx 12{,}0 \text{ t/s}$
M3 / M4 Max (MacBook / Studio) 128 GB 512-Bit LPDDR5X 410 / 546 GB/s bis zu 40 $\approx 9{,}5 \text{ t/s}$ / $\approx 12{,}5 \text{ t/s}$ $\approx 21{,}0 \text{ t/s}$ / $\approx 27{,}0 \text{ t/s}$
M2 Ultra (Mac Studio / Pro) 192 GB 1024-Bit LPDDR5 800 GB/s bis zu 76 $\approx 16{,}5 \text{ t/s}$ $\approx 36{,}0 \text{ t/s}$

Speicher-Allokation unter macOS

macOS behandelt Unified Memory gemeinsam für CPU, GPU und Systemdienste. Es gibt daher kein allgemein gültiges, öffentlich dokumentiertes „75-%-GPU-Limit“, das sich mit einem universellen sysctl-Befehl auf 95 % anheben lässt. Die nutzbare Modellgröße hängt von Gerät, Betriebssystem, Framework, Kontext und gleichzeitig laufenden Anwendungen ab. Für reproduzierbare Dimensionierung muss der konkrete MLX- oder llama.cpp-Backend-Build gemessen werden.

Vor- und Nachteile von Apple Silicon für lokale KI

Vorteile:

  1. Unübertroffenes VRAM-zu-Preis-Verhältnis bei Großmodellen: Ein Mac Studio M2 Ultra mit 192 GB RAM (ca. 4.500–5.500 €) stellt 180 GB nutzbaren GPU-VRAM bereit. Ein vergleichbares NVIDIA-Setup erfordert mindestens $4 \times \text{RTX 3090/4090}$ oder $4 \times \text{RTX 6000 Ada}$ (Kosten: 6.000 € bis 35.000 €).
  2. Gigantische Modellgrößen lokal: DeepSeek-V3/R1 Quants (Q3/Q4 MoE), Command R+ 104B oder Llama 3.3 70B in unquantisiertem FP16/Q8_0 laufen vollständig im Grafikspeicher.
  3. Energieeffizienz: Bei Volllast zieht ein Mac Studio M2 Ultra / M4 Max lediglich 100 bis 180 Watt aus der Steckdose (gegenüber 800–1600 Watt bei einem Multi-GPU PC-Rig).

Nachteile:

  1. Limitiertes Prompt-Processing (TTFT): Metal Performance Shaders (MPS) und llama.cpp Metal erreichen bei der Prefill-Phase (GEMM) nur einen Bruchteil der TFLOP-Leistung von NVIDIA Tensor Cores. Bei 32k-Prompt-Längen kann das Prefilling auf einem Mac 10–30 Sekunden dauern.
  2. Keine Enterprise-Inferenz-Engines: vLLM, TensorRT-LLM und SGLang unterstützen macOS nicht nativ für High-Throughput-Serving. Apple Silicon ist primär auf llama.cpp, Ollama und MLX beschränkt.
  3. Geringe Multi-User/Batch-Skalierung: Wenn mehrere Anfragen parallel eintreffen, bricht die Generierungsgeschwindigkeit pro User massiv ein.
[Architektur-Hinweis] MLX vs. llama.cpp auf Apple Silicon
Das von Apple entwickelte Open-Source-Framework MLX und llama.cpp mit Metal-Backend nutzen Unified Memory. Welche Variante schneller ist, hängt unter anderem von Modellformat, Quantisierung, Kontext, Batchgröße und Version ab; pauschale 15–25-%-Vorteile sind kein belastbarer allgemeiner Wert.

5.3 Workstation & Enterprise GPUs: NVIDIA Ada Lovelace & Hopper

Im professionellen und Enterprise-Umfeld dominieren dedizierte Workstation- und Datacenter-Karten. Diese bieten ECC-Speicher (Error-Correcting Code), standardisierte PCIe-Blower- oder SXM-Kühlkonzepte und unlimitierte Treiber-Features.

+-----------------------------------------------------------------------------+
|                     ENTERPRISE INTERCONNECT: PCIE VS NVLINK                 |
+-----------------------------------------------------------------------------+
|                                                                             |
|  PCIe 4.0/5.0 Topologie:               NVLink 4 Topologie (z.B. HGX H100):  |
|  +--------+     +--------+             +--------+         +--------+        |
|  | GPU 0  |     | GPU 1  |             | GPU 0  | <=====> | GPU 1  |        |
|  +----+---+     +---+----+             +----+---+ NVLink  +---+----+        |
|       |             |                       ||   900 GB/s     ||            |
|  +----+-------------+----+             +----+-----------------+----+        |
|  |  PCIe Root Complex    |             |       NVSwitch Fabric     |        |
|  |  (31.5 - 63 GB/s P2P) |             |     (Bi-Dir: 900 GB/s)    |        |
|  +-----------------------+             +---------------------------+        |
|                                                                             |
+-----------------------------------------------------------------------------+

Spezifikations- und Benchmark-Übersicht

GPU-Modell Formfaktor / Bus VRAM-Kapazität Speicher-Typ & Bandbreite TDP FP8 Tensor TFLOPs Typischer Einsatzzweck
RTX A4000 Single-Slot PCIe 4.0 16 GB GDDR6 ECC 448 GB/s 140 W Nicht nativ Kompakte Edge-Server, 8B/14B Modelle
RTX A5000 Dual-Slot PCIe 4.0 24 GB GDDR6 ECC 768 GB/s 230 W Nicht nativ Stabile 24GB Alternative zur RTX 3090
RTX 5000 Ada Dual-Slot PCIe 4.0 32 GB GDDR6 ECC 576 GB/s 250 W 400 TFLOPs 32B FP8 Modelle auf Workstations
RTX 6000 Ada Dual-Slot PCIe 4.0 48 GB GDDR6 ECC 960 GB/s 300 W 730 TFLOPs 70B Modelle in FP8/Q4 auf einer Karte
A100 80GB Dual-Slot PCIe / SXM4 80 GB HBM2e 1935 / 2039 GB/s 300 / 400 W Nicht nativ (INT8: 624) High-Concurrency vLLM Serving, RAG
H100 80GB Dual-Slot PCIe / SXM5 80 GB HBM3 2000 / 3350 GB/s 350 / 700 W 1979 TFLOPs Maximale Prefill- & Serving-Performance

Gebrauchte Datacenter-Beschleuniger auf dem Prüfstand

Aufgrund hoher Neupreise greifen viele Systemintegratoren zu gebrauchten Enterprise-Karten aus vergangenen Generationen:

1. NVIDIA Tesla P40 (24 GB GDDR5, Pascal-Architektur – 2016)

  • Vorteil: Extrem günstiger Einstieg in 24 GB VRAM (ca. 150–250 € auf dem Gebrauchtmarkt).
  • Nachteile & Restriktionen:
    • Katastrophale FP16-Leistung: Pascal besitzt keine FP16-Tensor-Cores. FP16 wird mit $1/64$ der FP32-Rate berechnet.
    • Software-Zwang: In llama.cpp muss die Ausführung zwingend über INT4- oder INT8-Quantisierungen mit nativem INT8-Dot-Product (dp4a) erzwungen werden (-ngl auf P40 funktioniert nur performant mit Q4_0 / Q8_0, nicht mit FP16).
    • Keine vLLM/FlashAttention-2 Unterstützung: Moderne PagedAttention-Kernel erfordern Mindest-Compute-Capability 8.0 (Ampere) oder 7.5 (Turing). Die P40 (Compute Capability 6.1) wird von modernen Serving-Frameworks nicht mehr unterstützt.

2. NVIDIA Tesla V100 (16 GB / 32 GB HBM2, Volta-Architektur – 2017)

  • Vorteil: HBM2-Speicherbandbreite von 900 GB/s zu moderaten Gebrauchtpreisen.
  • Nachteile: Compute Capability 7.0. Keine native INT4-Hardwareunterstützung, keine native FP8-Unterstützung. FlashAttention-2 wird offiziell nicht unterstützt (nur FlashAttention-1 Patches).
[Warnung] Kühlung von Server-Karten im Desktop-Gehäuse
Karten wie Tesla P40, V100, A100 PCIe besitzen KEINE eigenen Lüfter (passives Blower-Design).
Werden sie in normale Desktop-Gehäuse verbaut, überhitzen die GPUs innerhalb von 60 Sekunden und schalten wegen thermischer Notabschaltung (Thermal Throttling / TJMax) ab.
Der Betrieb erfordert 3D-gedruckte Luftführungs-Adapter (Fan Shrouds) mit hochdrehenden 12V-Serverlüftern (z.B. Delta-Fans mit >5000 RPM und hohem statischem Druck).

5.4 Multi-GPU-Konfigurationen: Dual- und Quad-GPU Rigs

Um Modelle ab 70 Milliarden Parametern mit hohen Quantisierungsstufen (Q8_0 / FP8 / FP16) oder mit 128k Kontextfenster lokal zu betreiben, sind Multi-GPU-Systeme der wirtschaftlichste Pfad.

+-----------------------------------------------------------------------------+
|                 QUAD-GPU INFERENZ-SETUP (4x RTX 3090 / 4090)                |
+-----------------------------------------------------------------------------+
|                                                                             |
|  +---------------+  +---------------+  +---------------+  +---------------+ |
|  | GPU 0 (24 GB) |  | GPU 1 (24 GB) |  | GPU 2 (24 GB) |  | GPU 3 (24 GB) | |
|  | Layers 0..19  |  | Layers 20..39 |  | Layers 40..59 |  | Layers 60..79 | |
|  +-------+-------+  +-------+-------+  +-------+-------+  +-------+-------+ |
|          |                  |                  |                  |         |
|      PCIe x8            PCIe x8            PCIe x8            PCIe x8       |
|          |                  |                  |                  |         |
|  +-------+------------------+------------------+------------------+-------+ |
|  |             AMD Threadripper / EPYC Workstation-Mainboard              | |
|  |                 (128 PCIe 4.0 / 5.0 Lanes, Octa-Channel DDR5)          | |
|  +------------------------------------------------------------------------+ |
|  Gesamt-VRAM: 96 GB | Max. Modellgröße: Llama 3.3 70B FP16 oder DeepSeek MoE |
|                                                                             |
+-----------------------------------------------------------------------------+

Technische Voraussetzungen für Multi-GPU Rigs

  1. PCIe-Lanes & Bifurcation:
    • Desktop-CPUs (Intel Core i9-14900K, AMD Ryzen 9 9950X) stellen nur 16 PCIe-Lanes für Grafikkarten bereit. Bei 2 GPUs laufen diese als $x8 / x8$. Bei 3 oder 4 GPUs müssen die Lanes über den Chipsatz geroutet werden ($x4$ über DMI/PCH), was die Latenzen massiv erhöht.
    • Empfohlene Plattform für $\ge 3$ GPUs: AMD Threadripper 7000 (64-128 Lanes) oder AMD EPYC 7002/7003/9004 (128 Lanes).
  2. Stromversorgung (Netzteile):
    • $2 \times \text{RTX 3090/4090}$ erfordern ein Netzteil mit mindestens 1200–1600 Watt (Titanium/Platinum-Zertifizierung wegen Lastspitzen / Transient Spikes).
    • $4 \times \text{RTX 3090/4090}$ erfordern 2 getrennte Netzteile (z. B. $2 \times 1200\text{ W}$) oder ein 2500W-Servernetzteil an einer dedizierten 16A-Sicherung (230V $\times$ 16A = 3680 Watt maximal pro Stromkreis).
  3. NVLink vs. PCIe Peer-to-Peer (P2P):
    • Bei der RTX 3090 ist NVLink noch vorhanden ($112{,}5 \text{ GB/s}$ bidirektional). Zwei RTX 3090 mit NVLink-Bridge erreichen in vLLM (Tensor Parallelism = 2) nahezu perfekte Skalierung ohne PCIe-Bus-Belastung.
    • Ab der RTX 4090 hat NVIDIA NVLink für Consumer-Karten gestrichen. Die Kommunikation erfolgt zwingend über PCIe P2P.

5.5 Alternative Beschleuniger: AMD ROCm, Intel Arc & NPUs

Obwohl NVIDIA den Markt dominiert, existieren Alternativen mit spezifischen Stärken und Software-Einschränkungen.

AMD ROCm 6.x & Radeon-GPUs

Die AMD Radeon RX 7900 XTX bietet mit 24 GB GDDR6 (960 GB/s Bandbreite) für ca. 950–1.050 € eine attraktive Hardwarebasis.

  • Software-Status (Stand 2026):
    • ROCm 6.x unter Linux: Exzellente Stabilität in llama.cpp (via HIP-Backend), Ollama und vLLM (ROCm-Docker-Images). FlashAttention-2 und vLLM PagedAttention laufen nativ auf RDNA3.
    • ROCm unter Windows: Weiterhin experimentell. Primär wird Windows über DirectML oder Vulkan angesprochen, was ca. 20–35% Performance gegenüber nativem Linux-ROCm einbüßt.
  • Instinct Enterprise (MI300X): Mit 192 GB HBM3 ($5{,}3 \text{ TB/s}$ Bandbreite) die derzeit stärkste Single-GPU für Großmodell-Serving im Datacenter.

Intel Arc & IPEX-LLM

Intel Arc Grafikkarten (z. B. Arc A770 16GB) bieten 16 GB VRAM für unter 300 €.

  • Software-Status:
    • Betrieb über IPEX-LLM (Intel Extension for PyTorch) und llama.cpp mit SYCL/oneAPI Backend.
    • Gut geeignet für 8B- und 14B-Modelle im Low-Budget-Bereich.
    • Einschränkung: Geringe Prefill-Leistung und fehlende Unterstützung in etablierten Serving-Frameworks wie vLLM oder TensorRT-LLM.

On-Device NPUs (Neural Processing Units)

Mit der Ära der "AI PCs" (Snapdragon X Elite, Intel Lunar Lake, AMD Strix Point) werden dedizierte NPUs in Consumer-Laptops verbaut.

NPU-Plattform Angegebene INT8 TOPS Reale Speicheranbindung Limitierung für LLMs Geeigneter Einsatzzweck
Qualcomm Snapdragon X Elite 45 TOPS LPDDR5X (135 GB/s) Kleiner Unified Memory, proprietärer Qualcomm AI Stack On-Device 3B-7B INT4 Inferenz
Intel Lunar Lake (Core Ultra 200V) 48 TOPS LPDDR5X (137 GB/s) Fest verlöteter RAM (max 32 GB) Whisper, Background Denoising, 3B SLMs
AMD Ryzen AI 9 (Strix Point) 50 TOPS LPDDR5X (135 GB/s) LPDDR-Bandbreiten-Limitierung Embeddings, Vision-Preprocessing, 3B SLMs
[Deep Dive] Warum NPUs dedizierten GPUs bei LLMs unterlegen sind
NPUs werben mit beeindruckenden TOPS-Zahlen (Tera-Operations per Second), die jedoch fast ausschließlich für INT8- oder INT4-Matrizen unter Laborbedingungen gemessen werden.
Für LLMs gilt jedoch das Bandbreiten-Gesetz: Da NPUs denselben LPDDR5X-Bus wie die CPU teilen (135 GB/s), kann selbst eine 50-TOPS-NPU ein 14B-Modell nicht schneller dekodieren als:
Durchsatz = 135 GB/s / 8 GB = max. 16 t/s.
Die eigentliche Stärke von NPUs liegt nicht im maximalen Durchsatz, sondern in der Energieeffizienz (TOPS/Watt) für kontinuierliche Hintergrundaufgaben (z. B. lokale Sprach-Transkription mit Whisper-Small bei < 5 Watt).
Redaktionelle Einschätzung

Kapitelinhalt: technische Herleitung und redaktionelle Einordnung; zeitabhängige Werte vor Einsatz prüfen.