Das Handbuch, jetzt mit Kurzantwort.
Vierzehn Kapitel führen von Cloud-vs.-lokal über Speicher und Hardware bis zu RAG, Sicherheit und Audit.
Cloud vs. lokal
Entscheidungskriterien für Datenhoheit, Kosten und Latenz.
Modell-Landschaft
Open Weights, Reasoning, Vision und Spezialmodelle.
Vokabular & Mathematik
Tokens, Quantisierung, Attention und KV-Cache.
Der Bandbreiten-Flaschenhals
Warum Speicherzugriff die Decode-Rate bestimmt.
Hardware-Kategorien
Apple UMA, Consumer-GPUs und Enterprise-Hardware.
Modell-Hardware-Matrix
Modelle, Quantisierung, VRAM und realistische Setups.
Inference Engines
llama.cpp, Ollama, vLLM und PagedAttention.
Frontends, RAG & MCP
Open WebUI, Retrieval und Tool-Anbindung.
Homelab & Privat-Setups
Vom Refurbished-Rechner zur Dual-GPU-Workstation.
KMU-Einsatzszenarien
Inhouse-Architekturen für kleine Teams.
Betrieb & Sicherheit
RBAC, Monitoring, Backups und Rollouts.
Evolution 2020–2026
Die wichtigsten Sprünge bei Open Weights.
Ausblick
BitNet, Mamba, effiziente Inferenz und nächste Grenzen.
Glossar & Audit
Begriffe, Checklisten und Readiness-Fragen.