KV-Cache
Speicher für bereits berechnete Key-/Value-Vektoren im Kontext.
Jeder Begriff erklärt kurz, warum er bei einer lokalen KI-Entscheidung zählt.
Speicher für bereits berechnete Key-/Value-Vektoren im Kontext.
Mixture of Experts: Nur ein Teil der Experten wird pro Token aktiviert.
Reduzierte numerische Präzision zur Verringerung von Speicherbedarf und Bandbreite.
Retrieval-Augmented Generation: Antworten werden mit abgerufenen Dokumenten ergänzt.
Standardisierte Anbindung von Modellen an Werkzeuge und Datenquellen.
Time to First Token: Zeit bis zum ersten Ausgabetoken.
CPU-Befehlssatzerweiterungen, die passende Inferenz-Kernels beschleunigen können.