Nachschlagewerk

Glossar mit Praxisbezug.

Jeder Begriff erklärt kurz, warum er bei einer lokalen KI-Entscheidung zählt.

KV-Cache

Speicher für bereits berechnete Key-/Value-Vektoren im Kontext.

MoE

Mixture of Experts: Nur ein Teil der Experten wird pro Token aktiviert.

Quantisierung

Reduzierte numerische Präzision zur Verringerung von Speicherbedarf und Bandbreite.

RAG

Retrieval-Augmented Generation: Antworten werden mit abgerufenen Dokumenten ergänzt.

MCP

Standardisierte Anbindung von Modellen an Werkzeuge und Datenquellen.

TTFT

Time to First Token: Zeit bis zum ersten Ausgabetoken.

AVX2 / AVX-512 / AMX

CPU-Befehlssatzerweiterungen, die passende Inferenz-Kernels beschleunigen können.