Zum Hauptinhalt springen

Gradually LLM Index

LLM-Vergleich 2026: 28 KI-Modelle im direkten Duell

Dieser LLM-Vergleich stellt 28 aktuelle Sprachmodelle in 378 direkten Duellen gegenüber. Du bekommst gemeinsame Benchmark-Messreihen, aktuelle API-Preise, Kontextfenster, Parameter, Verfügbarkeit und die jeweilige Quelle.

Modelle
28
direkte Vergleiche
378
aktive Benchmarks
80
aktive Messwerte
14.155

Aktuelle Spitzenreiter

Welche LLMs führen in den wichtigsten Benchmarks?

Die fünf Charts halten die Benchmarks bewusst getrennt. Jede Rangliste nutzt genau eine veröffentlichte Kohorte, eine Aufgabe und eine Metrik. Die Balken zeigen die acht bestplatzierten aktuellen Modelle. Die Modellzahl nennt die vollständige Kohortengröße.

Gesamtpräferenz

LMArena Text, Style Control

Stilbereinigte Bewertung aus anonymen Paarvergleichen.

1.Claude Fable 51.507,8 Punkte, Platz 1
2.Claude Opus 51.492,6 Punkte
3.Kimi K31.489,1 Punkte
4.Gemini 3.1 Pro Preview1.486,3 Punkte
5.GPT-5.6 Sol1.482,3 Punkte
6.GPT-5.51.481,9 Punkte
7.Gemini 3.6 Flash1.480,8 Punkte
8.Gemini 3.5 Flash1.478,2 Punkte
LMArenaAktualisiert 21.08.2026 · 26 Modelle

Das veröffentlichte Leaderboard enthält modellabhängige dokumentierte Testeinstellungen. Der Chart nutzt pro Modell die stärkste gelistete Variante.

Reasoning

GPQA Diamond

Schwierige, wissenschaftliche Fragen aus dem GPQA-Diamond-Datensatz.

1.Gemini 3.1 Pro Preview95,5 %, Platz 1
2.GPT-5.6 Sol95,2 %
3.Grok 4.694,7 %
4.Gemini 3.7 Flash93,9 %
5.Claude Opus 593,4 %
5.Gemini 3.6 Flash93,4 %
7.Claude Fable 593,2 %
7.GPT-5.593,2 %
Vals AIAktualisiert 19.08.2026 · 24 Modelle

Coding

Vibe Code Bench v1.1

Praktische Programmieraufgaben aus Vibe Code Bench v1.1.

1.Claude Fable 590,4 %, Platz 1
2.Claude Opus 588,4 %
3.Kimi K385 %
4.Claude Sonnet 581,3 %
5.GPT-5.6 Sol80,5 %
6.GPT-5.6 Luna77,1 %
7.Grok 4.676,2 %
8.GPT-5.6 Terra74,6 %
Vals AIAktualisiert 19.08.2026 · 24 Modelle

Agenten

Terminal-Bench 2.1

Mehrstufige Aufgaben in einer realen Terminal-Umgebung.

1.GPT-5.6 Sol85,8 %, Platz 1
2.Claude Opus 584,6 %
3.Kimi K380,9 %
4.Claude Fable 580,5 %
5.GPT-5.6 Luna79 %
6.Grok 4.678,3 %
7.Gemini 3.7 Flash77,5 %
7.GPT-5.6 Terra77,5 %
Vals AIAktualisiert 19.08.2026 · 23 Modelle

Finanzen

Finance Agent (v2)

Recherche- und Analyseaufgaben aus Finance Agent v2.

1.Gemini 3.7 Flash59 %, Platz 1
2.Claude Opus 558,6 %
3.Gemini 3.5 Flash57,9 %
4.Claude Fable 556,3 %
5.Gemini 3.6 Flash56,3 %
6.GPT-5.6 Luna55 %
7.GPT-5.6 Terra54,4 %
8.Kimi K354,4 %
Vals AIAktualisiert 19.08.2026 · 23 Modelle

Ein erster Platz gilt nur für den genannten Benchmark. Er ist kein Gesamtscore und sagt allein nichts über Preis, Geschwindigkeit, Kontextlänge oder deinen eigenen Einsatzzweck aus.

Entscheidungskriterien

Was du im LLM-Vergleich prüfen kannst

Benchmarks
Gemeinsame Aufgaben und Versionen für Reasoning, Coding, Agenten, Recherche und weitere Fähigkeiten.
API-Preise
Input, Output, Cache-Lesen und Cache-Schreiben, sofern der Anbieter diese Preise veröffentlicht.
Kontext
Veröffentlichte Kontextfenster und maximale Ausgabelängen ohne ungenaue Rundung.
Architektur
Bekannte Parameter, aktive Parameter, Dense oder MoE sowie der Open-Weight-Status.
Verfügbarkeit
API-Zugriff, Modellstatus, Erscheinungsdatum und dokumentierte Websuche.
Quellen
Ein Abruf- oder Prüfdatum und eine direkte Quelle für jeden volatilen Messwert.

Du suchst ein breiteres Verzeichnis? Dann sieh dir die Open-Source-LLMs im Vergleich an. Für konkrete Kosten pro Anwendung hilft der API-Kostenrechner.

Auswahl

Die wichtigsten 28 Modelle

Die Auswahl konzentriert sich auf aktuelle Spitzenmodelle und relevante günstigere Varianten. Veraltete Modellgenerationen bleiben außen vor.

Anthropic

Claude Opus 5Claude Fable 5Claude Sonnet 5Claude Mythos 5

OpenAI

GPT-5.6 SolGPT-5.6 TerraGPT-5.6 LunaGPT-5.5GPT-5.4GPT-5.4 mini

Google

Gemini 3.7 FlashGemini 3.6 FlashGemini 3.5 FlashGemini 3.1 Pro PreviewGemini 3.5 Flash-Lite

xAI

Grok 4.6Grok 4.5Grok 4.3

DeepSeek

DeepSeek-V4-ProDeepSeek-V4-Flash

Moonshot AI

Kimi K3Kimi K2.6

Z.ai

GLM-5.2GLM-5.1

Mistral AI

Mistral Large 3Mistral Medium 3.5

Xiaomi

MiMo-V2.5MiMo-V2.5-Pro

Methodik

Ein Vergleich ist nur so gut wie seine Kohorte

Zentrale Datenbank

28 Quellen, 14.155 aktive Messwerte und ein einheitliches Modell-Schema.

Gleicher Testaufbau

Wir vergleichen nur Ergebnisse derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte.

Fehlende Werte bleiben leer

Wenn zwei Modelle keine gemeinsame Messreihe haben, zeigen wir das offen. Es gibt keine Schätzwerte.

Daten statt Siegerliste

Benchmarks, Preise und technische Daten stehen nebeneinander. Der beste Kandidat hängt von deinem Einsatz ab.

Datenbank zuletzt abgerufen am 26.08.2026. Preise haben je Modell einen eigenen Prüfstand und eine verlinkte Primärquelle.

Häufige Fragen zum LLM-Vergleich

So funktionieren Benchmark-Zuordnung, Gewinner und Datenstand.

Changelog

Die neuesten Updates und Verbesserungen unseres LLM-Vergleichs
v1.324. August 2026

Ähnliche Duelle, Anbieter-Icons und erweiterte FAQ

  • Jede LLM-Duellseite auf 14 ähnliche Duelle erweitert und den Hub-Button unter der Liste platziert
  • Lokale Anbieter-Icons ohne Platzhalter in alle 28 Modell-Badges aufgenommen
  • FAQ um Details zu Benchmarks, Preisen, Parametern und der Radar-Methodik erweitert
v1.221. August 2026

Benchmark-Ranglisten und Fähigkeitsprofile

  • Fünf getrennte Ranglisten für Gesamtpräferenz, Reasoning, Coding, Agenten und Finanzen ergänzt
  • Datengestützte Fähigkeitsprofile auf den direkten Duellseiten ergänzt
  • Jede Rangliste auf eine veröffentlichte Kohorte, Aufgabe, Metrik und einen Quellenstand begrenzt
v1.118. August 2026

FAQ, Changelog und interne Links

  • FAQ zu Benchmark-Abdeckung, Methodik und Datenstand ergänzt
  • Changelog für nachvollziehbare inhaltliche Updates ergänzt
  • Hub und Duellseiten in die Navigation, die Sitemap und die Rubrik „Ähnliche Vergleiche“ aufgenommen
v1.017. August 2026

Erstveröffentlichung

  • 28 aktuelle Modelle und 378 direkte Duelle veröffentlicht
  • Gemeinsame Benchmarks, API-Preise, technische Daten und Primärquellen zusammengeführt
  • Auswahlwerkzeug und zehn priorisierte Duelle ergänzt