Lokale KI, die du verstehst und dimensionieren kannst.
Von der konkreten Hardwarefrage bis zur belastbaren Architektur: Modelle, VRAM, Bandbreite, RAG, MCP, Sicherheit und Betrieb.
Entscheiden
Was passt zu Modell, Budget, Lautstärke und Nutzerzahl?
02Hardware
VRAM, Bandbreite, CPU, Apple, AMD, NVIDIA und Edge.
03Rechnen
VRAM, KV-Cache, Netzteil, Strom und Fine-Tuning.
Von der Entscheidung bis zum Betrieb.
Die 14 Kapitel bleiben als tiefer technischer Lernpfad erhalten.
Cloud vs. lokal
Entscheidungskriterien für Datenhoheit, Kosten und Latenz.
Modell-Landschaft
Open Weights, Reasoning, Vision und Spezialmodelle.
Vokabular & Mathematik
Tokens, Quantisierung, Attention und KV-Cache.
Der Bandbreiten-Flaschenhals
Warum Speicherzugriff die Decode-Rate bestimmt.
Hardware-Kategorien
Apple UMA, Consumer-GPUs und Enterprise-Hardware.
Modell-Hardware-Matrix
Modelle, Quantisierung, VRAM und realistische Setups.
Inference Engines
llama.cpp, Ollama, vLLM und PagedAttention.
Frontends, RAG & MCP
Open WebUI, Retrieval und Tool-Anbindung.
Homelab & Privat-Setups
Vom Refurbished-Rechner zur Dual-GPU-Workstation.
KMU-Einsatzszenarien
Inhouse-Architekturen für kleine Teams.
Betrieb & Sicherheit
RBAC, Monitoring, Backups und Rollouts.
Evolution 2020–2026
Die wichtigsten Sprünge bei Open Weights.
Ausblick
BitNet, Mamba, effiziente Inferenz und nächste Grenzen.
Glossar & Audit
Begriffe, Checklisten und Readiness-Fragen.
Eine Referenz, die zuerst antwortet.
Hardware-, Modell- und Betriebsfragen sind direkt durchsuchbar und mit Rechnern verknüpft.
Alle Fragen öffnen →