Kapitel 02 · geprüft August 2026

Modell-Landschaft

Open Weights, Reasoning, Vision und Spezialmodelle.

Kurzantwort

Open Weights, Reasoning, Vision und Spezialmodelle. Lies zuerst die Kurzantwort und springe danach in die technische Herleitung.

Modell-Landschaft: technische Übersicht
Modell-Landschaft · redaktionelle Kapitelübersicht

Kapitel 2: Die Modell-Landschaft 2026 – Open Weights von Text bis Multimodal

Die Open-Weights-Landschaft des Jahres 2026 zeichnet sich durch hochspezialisierte Architekturen aus, die proprietären Frontier-Modellen in spezifischen Domänen ebenbürtig oder überlegen sind. Während frühere Generationen auf monolithischen dichten Transformern basierten, dominieren moderne Architekturen mit Sparse Mixture-of-Experts (MoE), Multi-Head Latent Attention (MLA), DeepSeek Reasoning R1-Modellen und hybriden Vision-Sprach-Systemen.

+-----------------------------------------------------------------------------------------------+
|                       OPEN WEIGHTS TAXONOMIE & ÖKOSYSTEM 2026                                 |
+-----------------------------------------------------------------------------------------------+
|                                                                                               |
|  [TEXT & REASONING]           [MULTIMODAL & VISION]              [SPEZIALISTEN]               |
|  +-------------------------+  +-------------------------------+  +--------------------------+ |
|  | - DeepSeek-R1 / V3      |  | - Qwen2-VL / Qwen2.5-VL       |  | - Embeddings:            | |
|  |   (671B MoE / 37B act.) |  |   (Dynamic Resolution VLM)    |  |   BGE-M3, Nomic-Embed    | |
|  | - Llama 3.3 (70B Dense) |  | - Pixtral 12B (Mistral Vision)|  | - Reranker:              | |
|  | - Qwen 2.5 (0.5B - 72B) |  | - Llama 3.2 Vision (11B, 90B) |  |   bge-reranker-large     | |
|  | - Mistral Large 2 (123B)|  | - Diffusion:                  |  | - Code:                  | |
|  | - Gemma 2 (9B, 27B)     |  |   Flux.1 (Dev/Schnell), SDXL  |  |   Qwen 2.5-Coder 32B/72B | |
|  | - Small/Edge:           |  | - Audio:                      |  |   DeepSeek-Coder-V2      | |
|  |   Llama 3.2 1B/3B       |  |   Whisper-v3-turbo, Kokoro    |  |                          | |
|  +-------------------------+  +-------------------------------+  +--------------------------+ |
+-----------------------------------------------------------------------------------------------+

2.1 Text-Modelle (LLMs): Foundation, Instruct und Reasoning

Moderne Textmodelle werden in drei primären Ausprägungsstufen trainiert und ausgeliefert:

  1. Foundation / Base Models: Reine Next-Token-Prediction auf Terabytes von Web- und Fachkorpora. Ungeeignet für direkte Chat-Interaktion, primär genutzt für weiteres Domain-Pretraining.
  2. Instruct / Chat Models: Mittels Supervised Fine-Tuning (SFT) und Direct Preference Optimization (DPO) / RLHF auf Befolgung von System-Prompts, Formatvorgaben und Konversationslogik ausgerichtet.
  3. Reasoning Models (Chain-of-Thought / RL): Modelle wie DeepSeek-R1, die vor der finalen Antwort explizite, unzensierte Denkketten (<think>...</think>) generieren. Trainiert über Reinforcement Learning (RL) mit Verifizierern (Rule-Based Verifiers) auf mathematische, logische und algorithmische Korrektheit.

DeepSeek-V3 und DeepSeek-R1: Architektur-Durchbruch

DeepSeek-V3 und dessen reasoning-optimierte Variante R1 stellen mit 671 Milliarden Gesamtparametern, von denen pro Token lediglich 37 Milliarden Parameter aktiviert werden (MoE), einen fundamentalen Effizienzsprung dar.

+-------------------------------------------------------------------------------+
|                 DEEPSEEK-V3 / R1 ARCHITEKTUR-MERKMALE                         |
+-------------------------------------------------------------------------------+

1. Multi-Head Latent Attention (MLA):
   Traditioneller KV-Cache pro Token:  [Key 1, Key 2 ... Key H] [Val 1 ... Val H]
   DeepSeek MLA komprimierter Vektor:  [Latent KV Vector c_KV] (Kompressionsfaktor ~6x)
   --> Dramatische Reduktion des VRAM-Bedarfs für lange Kontexte (bis 128k).

2. DeepSeek Sparse MoE:
   Gesamt: 256 geroutete Experten + 1 Shared Experte (konstant aktiv).
   Aktivierung: Top-8 Experten pro Token via Sigmoid-Gating + Normalisierung.
   Aktive Parameter: ~37B von 671B -> Durchsatz einer 37B-Dense-Engine!

DeepSeek-R1 Distillationsserie

Für lokale Umgebungen mit begrenztem VRAM existieren offizielle Distillationen auf dichte Architekturen:

  • DeepSeek-R1-Distill-Qwen-1.5B / 7B / 14B / 32B
  • DeepSeek-R1-Distill-Llama-8B / 70B

Diese destillierten Modelle kombinieren die Reasoning-Muster der 671B-Originalmodelle mit dem kompakten Footprint etablierter Transformer.

Llama-Familie (Llama 3.1 & Llama 3.3)

Die von Meta veröffentlichten Gewichte der Llama-3-Serie setzen den Standard für dichte Architekturen:

  • Llama 3.3 70B: Bietet die Leistungsfähigkeit des früheren Llama 3.1 405B bei einem Bruchteil des Rechenaufwands. Standardmäßig mit Grouped-Query Attention (GQA, 8 KV-Heads) und nativem 128k-Kontextfenster ausgestattet.
  • Llama 3.1 8B: Das Standard-Edge-Modell für ressourcenbeschränkte Systeme (Workstations, Embedded-Systeme, On-Device).
  • Llama 3.2 1B / 3B: Extrem leichtgewichtige Modelle für lokale Vorfilterung, Classification und Function Calling auf Mobil-CPUs.

Qwen 2.5 Serie: Maximale Sprachenvielfalt und Kontextskalierung

Die von Alibaba entwickelte Qwen-2.5-Serie reicht von 0.5B bis 72B Parametern:

  • Qwen 2.5 72B Instruct: Führendes Open-Weights-Modell in mehrsprachigen Benchmarks (inklusive exzellenter deutscher Grammatik- und Fachterminologie-Beherrschung), stark in strukturierter Datenextraktion und Tool-Use.
  • Qwen 2.5 14B & 32B: Die idealen "Sweet-Spot"-Modelle für Single-GPU-Workstations (RTX 4090 / RTX 5090 mit 24–32 GB VRAM).
  • Unterstützt nativer Kontext bis zu 128k Token mit YARN-Rotary-Embedding-Erweiterungen.

Mistral AI Portfolio

  • Mistral Large 2 (123B): Entwickelt für komplexe Enterprise-Reasoning-Workloads mit nativer Code- und Mehrsprachenunterstützung (128k Kontext).
  • Mistral NeMo (12B): In Kooperation mit NVIDIA trainiert; zeichnet sich durch den neuen Tekken-Tokenizer (optimiert für Coder und europäische Sprachen) aus.
  • Mistral Small 3 (24B): Kompaktes Dense-Modell für Low-Latency Agentensysteme.

2.2 Multimodal & Vision: Sehen, Hören und Generieren

+-------------------------------------------------------------------------------+
|                       MULTIMODALE INFERENZ-PIPELINE                           |
+-------------------------------------------------------------------------------+

[Dokument / Bild] ----> [Vision Encoder / Patch Extraction]
                                  |
                                  v (Projizierte Image Embeddings)
[System / User Prompt] -> [LLM Backbone (Qwen2-VL / Pixtral)] -> [Strukturierter Output]
                                                                    (JSON / Markdown)

[Audio Stream] ---------> [Mel-Spektrogramm] -> [Whisper-v3-turbo] -> [Text Transkript]
                                                                            |
[Text Output] ----------> [Kokoro-82M / StyleTTS2] ------------------> [Audio Stream (WAV)]

Vision-Language Models (VLMs)

Die direkte Extraktion strukturierter Daten aus unstrukturierten visuellen Quellen (gescannte Rechnungen, technische Zeichnungen, Dashboards, GUI-Screenshots) wird von spezialisierten Vision-LLMs übernommen:

  1. Qwen2-VL / Qwen2.5-VL (7B, 72B):
    • Dynamic Resolution: Bilder werden nicht auf fixe 224x224 oder 448x448 Kacheln herunterskaliert, sondern dynamisch in variable Patch-Tokens konvertiert. Dies erhält kleinste Details in Schaltplänen und PDF-Tabellen.
    • Video-Verarbeitung: Unterstützt native Video-Streams über zeitlich indizierte Vision-Tokens.
  2. Pixtral 12B (Mistral AI):
    • Nativer 12B-Vision-Transformer mit 128k Kontextfenster. Exzellente Balance aus Bildverarbeitungsgeschwindigkeit und Text-Reasoning.
  3. Llama 3.2 Vision (11B & 90B):
    • Integrierter Vision-Adapter auf Basis vortrainierter Llama-3.1-Gewichte für Document-QA und Image-Captioning.

Bildgenerierung: Diffusion & Flow Matching

Für die lokale Bild- und Grafikgenerierung im Enterprise-Bereich (Marketing-Assets, synthetische Trainingsdaten, Produkt-Mockups):

  • Flux.1 (Black Forest Labs):
    • Flux.1 Dev: 12B Parameter Flow-Matching Transformer für High-End-Generierung mit fotorealistischer Typografie und Detailtreue.
    • Flux.1 Schnell: Destillierte 4-Step-Inferenz für Sub-Sekunden-Generierung auf Consumer-GPUs.
  • Stable Diffusion XL (SDXL) / SD 3.5:
    • Weiterhin relevant für hochgradig anpassbare Pipelines via ControlNet, IP-Adapter und LoRA-Ökosysteme.

Audio: Transkription und Sprachsynthese

  • Spracherkennung (ASR):
    • Whisper large-v3-turbo: Von OpenAI optimierte Version mit 4 Decoder-Layern (statt 32 in Large-V3). Bietet ca. 4x schnellere Inferenz bei vernachlässigbarem Word Error Rate (WER) Anstieg.
    • Faster-Whisper (CTranslate2): Bis zu 8x schneller als Standard-PyTorch-Implementierungen durch optimierte INT8/FP16 CUDA-Kernel.
  • Sprachsynthese (TTS):
    • Kokoro-82M: Extrem leichtgewichtiges TTS-Modell (82M Parameter), liefert hochqualitative Sprachausgabe mit 20–30x Echtzeit-Geschwindigkeit auf Standard-CPUs.

2.3 Spezialisten: Embeddings, Reranker und Code-Modelle

Für Enterprise RAG (Retrieval-Augmented Generation) und Software-Engineering-Automatisierung sind General-Purpose-LLMs ineffizient und teuer. Spezialisierte Modelle übernehmen Teilaufgaben mit maximaler Präzision.

+-------------------------------------------------------------------------------+
|                      ENTERPRISE RAG PIPELINE TOPOLOGIE                        |
+-------------------------------------------------------------------------------+

Dokument-Korpus (PDF, Confluence, SQL)
      |
      v
[Embedding-Modell: BGE-M3 / Nomic] ----> Dense/Sparse Vektoren ----> [Vektordatenbank]
                                                                            |
Suchanfrage (User Query)                                                    |
      |                                                                     v
[Query Embedding] ----------------------------------------------> Top-100 Matches (Bi-Encoder)
                                                                            |
                                                                            v
[Cross-Encoder Reranker: BGE-Reranker-Large] -------------------> Top-5 Relevante Chunks
                                                                            |
                                                                            v
[LLM Context: Qwen 2.5-Coder / Llama 3.3] ----------------------> Faktenbasierte Antwort

Embedding-Modelle (Bi-Encoder)

Bi-Encoder transformieren Textsegmente in hochdimensionale dichte Vektoren ($d \in [768, 1024, 4096]$).

  • BGE-M3 (BAAI):
    • Unterstützt Multi-Lingualität (>100 Sprachen), Multi-Functionality (Dense Retrieval, Sparse Lexical Matching wie BM25 und Multi-Vector ColBERT) und lange Kontexte bis 8.192 Token.
  • Nomic-Embed-Text-v1.5:
    • Open-Weights Embedding-Modell mit Matryoshka-Representation Learning (Dimensionsanpassung von 64 bis 768 Dimensionen ohne massiven Qualitätsverlust zur Speicheroptimierung).
  • E5-Mistral-7B-Instruct:
    • LLM-basiertes Embedding-Modell für komplexe semantische Retrieval-Szenarien.

Cross-Encoder Reranker

Während Bi-Encoder Dokumente isoliert einbetten, berechnen Cross-Encoder die volle Self-Attention zwischen Query $q$ und Dokument $d$ ($[q; d]$) gemeinsam:

$$\text{Score} = \sigma\left(W \cdot \text{Transformer}([q; d])\right)$$

  • BGE-Reranker-Large / BGE-Reranker-v2-M3:
    • Unverzichtbar für Enterprise RAG. Filtert die Top-100 Ergebnisse des initialen Vektor-Retrievals auf die Top-3 bis Top-5 Chunks herunter und eliminiert False Positives drastisch.

Code-Spezialisten (Coder LLMs)

  1. Qwen 2.5-Coder (32B & 72B):
    • Weltweit führendes Open-Weights-Modell für Softwareentwicklung. Übertrifft in Standard-Benchmarks (HumanEval, EvalPlus, MBPP) proprietäre Modelle wie GPT-4o im Generieren syntaktisch korrekten Codes, Debugging, Repository-Level Reasoning und FIM (Fill-in-the-Middle).
  2. DeepSeek-Coder-V2 (16B / 236B MoE):
    • Unterstützt über 300 Programmiersprachen, Git-Diff-Verarbeitung und 128k Kontextfenster für vollständige Repository-Analysen.

2.4 Modell-Vergleichsmatrix (Stand 2026)

Modell Architektur Parameter (Total / Aktiv) Kontext Min. VRAM (FP16) Min. VRAM (Q4_K_M) Primärer Einsatzzweck
DeepSeek-R1 MoE + MLA 671B / 37B 128k 1.340 GB ~380 GB (Q4) Komplexe Logik, Math, Reasoning
DeepSeek-R1-Distill-Qwen-32B Dense 32.5B / 32.5B 128k 65 GB 20 GB Single-GPU Reasoning Workstation
Llama 3.3 70B Instruct Dense (GQA) 70.6B / 70.6B 128k 141 GB 42 GB Enterprise General Assistant
Qwen 2.5 72B Instruct Dense (GQA) 72.7B / 72.7B 128k 145 GB 44 GB Mehrsprachig, Tool-Calling, RAG
Qwen 2.5-Coder 32B Dense (GQA) 32.5B / 32.5B 128k 65 GB 20 GB Code Completion, Refactoring
Mistral Large 2 Dense 123B / 123B 128k 246 GB 74 GB Enterprise Reasoning, Multilingual
Pixtral 12B VLM 12B / 12B 128k 24 GB 8 GB OCR, Dokument-QA, Multimodal
BGE-M3 Bi-Encoder 560M / 560M 8k 1.2 GB 0.6 GB Semantische Suche, Dense/Sparse RAG
BGE-Reranker-Large Cross-Encoder 560M / 560M 512 1.2 GB 0.6 GB RAG Re-Ranking Stage
Whisper-v3-turbo Audio ASR 809M / 809M 30s Seg. 1.6 GB 0.8 GB Speech-to-Text Transkription

Die Wahl des Zielmodells richtet sich somit exakt nach den verfügbaren VRAM-Budgets und dem spezifischen Anwendungsprofil – von 800-MB-Embeddings bis zum Multi-GPU MoE-Cluster.

Redaktionelle Einschätzung

Kapitelinhalt: technische Herleitung und redaktionelle Einordnung; zeitabhängige Werte vor Einsatz prüfen.