Zum Hauptinhalt springen

Direktvergleich

GPT-5.6 Sol vs. Mistral Medium 3.5

Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.

gemeinsame Messreihen
28
verschiedene Benchmarks
1
jüngster Abruf
26.08.2026

Modellauswahl ändern

Steckbrief

Allgemeine Daten

Erscheinungsdatum, Verfügbarkeit, Kontextfenster, Architektur und veröffentlichte Parameterzahlen auf einen Blick. Nicht veröffentlichte Angaben bleiben als solche markiert.

Allgemeine Daten von GPT-5.6 Sol und Mistral Medium 3.5
MerkmalGPT-5.6 SolMistral Medium 3.5
AnbieterOpenAIMistral AI
Erschienen26. Juni 202628. Apr. 2026
VerfügbarkeitAktivAktiv
ModelltypProprietärOpen Weights
ParameterNicht veröffentlichtNicht veröffentlicht
ArchitekturNicht veröffentlichtNicht veröffentlicht
Kontextfenster1.050.000 Token256.000 Token
Wissensstand16. Februar 2026Nicht veröffentlicht
Technische QuellenModell, Kontext, WissensstandModell

Kosten

API-Preise im Vergleich

Die Tabelle vergleicht die offiziellen Standard-API-Tarife pro 1 Mio. Token einschließlich veröffentlichter Cache-Preise. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.

API-Preise von GPT-5.6 Sol und Mistral Medium 3.5
PreisartGPT-5.6 SolMistral Medium 3.5
API-Eingabe4 $ ≤272K / 8 $ >272K1,5 $
API-Ausgabe20 $ ≤272K / 30 $ >272K7,5 $
Cache lesen0,4 $ ≤272K / 0,8 $ >272KNicht ausgewiesen
Cache schreiben (5 Min.)5 $ ≤272K / 10 $ >272KNicht ausgewiesen
Cache schreiben (1 Std.)Nicht ausgewiesenNicht ausgewiesen
Preis geprüft24.08.2026 Quelle30.07.2026 Quelle
GPT-5.6 SolMistral Medium 3.5
API-EingabeUSD pro 1 Mio. Token, Basistarif
GPT-5.6 Sol4 $
Mistral Medium 3.5Günstiger1,5 $
API-AusgabeUSD pro 1 Mio. Token, Basistarif
GPT-5.6 Sol20 $
Mistral Medium 3.5Günstiger7,5 $

Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand

Preise nach Anbieter

Direkte Entwicklertarife und über OpenRouter geroutete Anbieterpreise sind getrennt gekennzeichnet. Alle Preise gelten in USD pro 1 Mio. Token. Kontextabhängige Direktpreise sowie regionale, Flex-, Priority- und weitere OpenRouter-Tarife bleiben einzeln erkennbar.

Anbieterpreise von GPT-5.6 Sol und Mistral Medium 3.5
ModellAnbieterBezugsweg und TarifEingabe pro 1 Mio. TokenAusgabe pro 1 Mio. TokenQuelle
GPT-5.6 SolOpenAIDirekt beim EntwicklerBis 272.000 Kontext-Token4 $20 $Quelle24.08.2026
OpenAIDirekt beim EntwicklerÜber 272.000 Kontext-Token8 $30 $Quelle24.08.2026
Amazon BedrockÜber OpenRouteramazon-bedrock/us-east-15,5 $33 $Quelle25.08.2026
AzureÜber OpenRouterazure5 $30 $Quelle25.08.2026
AzureÜber OpenRouterazure/eu5,5 $33 $Quelle25.08.2026
AzureÜber OpenRouterazure/us5,5 $33 $Quelle25.08.2026
OpenAIÜber OpenRouteropenai2 $10 $Quelle25.08.2026
OpenAIÜber OpenRouteropenai/flexGünstigster erfasster Preis: 1 $Günstigster erfasster Preis: 5 $Quelle25.08.2026
OpenAIÜber OpenRouteropenai/priority4 $20 $Quelle25.08.2026
Mistral Medium 3.5Mistral AIDirekt beim EntwicklerStandard-APIGünstigster erfasster Preis: 1,5 $Günstigster erfasster Preis: 7,5 $Quelle30.07.2026
MistralÜber OpenRoutermistralGünstigster erfasster Preis: 1,5 $Günstigster erfasster Preis: 7,5 $Quelle25.08.2026
MistralÜber OpenRoutermistral/eu1,65 $8,25 $Quelle25.08.2026
MistralÜber OpenRoutermistral/zdrGünstigster erfasster Preis: 1,5 $Günstigster erfasster Preis: 7,5 $Quelle25.08.2026

Leistung

Gemeinsame Benchmarks

Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.

Fähigkeitsprofil aus vergleichbaren Benchmarks

Jede Achse mittelt direkt vergleichbare Benchmarkfamilien. Ein Wert von 100 bedeutet den stärkeren Wert innerhalb dieses Duells, keinen universellen Qualitätswert.

Nicht genug direkt vergleichbare Kategorien für ein belastbares Radar

Nur 0 von mindestens 5 Kategorien enthalten direkt vergleichbare Modellmessungen. Die Benchmarktabellen darunter zeigen die vorhandenen Belege, ohne fehlende Achsen aufzufüllen.

GPT-5.6 SolMistral Medium 3.5
LMArena Text, Style ControlOverall. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 SolHöherer Messwert1.482,26
Mistral Medium 3.51.426,754
LMArena Text, Style ControlBusiness, management and finance. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 SolHöherer Messwert1.487,572
Mistral Medium 3.51.430,13
LMArena Text, Style ControlChinese. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 SolHöherer Messwert1.546,638
Mistral Medium 3.51.448,994
LMArena Text, Style ControlCoding. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 SolHöherer Messwert1.529,974
Mistral Medium 3.51.479,012
LMArena Text, Style ControlCreative writing. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 SolHöherer Messwert1.477,093
Mistral Medium 3.51.395,917
LMArena Text, Style ControlEnglish. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 SolHöherer Messwert1.487,454
Mistral Medium 3.51.444,949
LMArena Text, Style ControlEntertainment, sports and media. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 SolHöherer Messwert1.474,303
Mistral Medium 3.51.396,39
LMArena Text, Style ControlExcluding ties. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 SolHöherer Messwert1.495,782
Mistral Medium 3.51.420,808
LMArena Text, Style ControlExpert prompts. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 SolHöherer Messwert1.527,339
Mistral Medium 3.51.438,409
LMArena Text, Style ControlFrench. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 SolHöherer Messwert1.512,688
Mistral Medium 3.51.436,172
LMArena Text, Style ControlGerman. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 SolHöherer Messwert1.494,472
Mistral Medium 3.51.441,328
LMArena Text, Style ControlHard prompts. Mehr ist besser. Testaufbau nicht identisch dokumentiert
GPT-5.6 SolHöherer Messwert1.505,824
Mistral Medium 3.51.445,331

Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand

Benchmarkwerte von GPT-5.6 Sol und Mistral Medium 3.5
Benchmark und AufgabeGPT-5.6 SolMistral Medium 3.5Quelle
LMArena Text, Style ControlOverall
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 19.541 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 11.009 anonymen Paarvergleichen.
Höherer Messwert1.482,26
95-%-Konfidenzintervall: ±5,4Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.426,754
95-%-Konfidenzintervall: ±6,567Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlBusiness, management and finance
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 3.815 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.146 anonymen Paarvergleichen.
Höherer Messwert1.487,572
95-%-Konfidenzintervall: ±10,213Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.430,13
95-%-Konfidenzintervall: ±13,186Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlChinese
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 1.320 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 501 anonymen Paarvergleichen.
Höherer Messwert1.546,638
95-%-Konfidenzintervall: ±17,222Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.448,994
95-%-Konfidenzintervall: ±26,733Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlCoding
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 5.490 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.077 anonymen Paarvergleichen.
Höherer Messwert1.529,974
95-%-Konfidenzintervall: ±8,641Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.479,012
95-%-Konfidenzintervall: ±11,159Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlCreative writing
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 3.838 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.858 anonymen Paarvergleichen.
Höherer Messwert1.477,093
95-%-Konfidenzintervall: ±10,495Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.395,917
95-%-Konfidenzintervall: ±14,431Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlEnglish
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 8.101 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 5.302 anonymen Paarvergleichen.
Höherer Messwert1.487,454
95-%-Konfidenzintervall: ±7,266Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.444,949
95-%-Konfidenzintervall: ±8,676Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlEntertainment, sports and media
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 4.823 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.443 anonymen Paarvergleichen.
Höherer Messwert1.474,303
95-%-Konfidenzintervall: ±9,401Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.396,39
95-%-Konfidenzintervall: ±12,509Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlExcluding ties
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 14.776 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 8.292 anonymen Paarvergleichen.
Höherer Messwert1.495,782
95-%-Konfidenzintervall: ±6,947Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.420,808
95-%-Konfidenzintervall: ±8,694Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlExpert prompts
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 2.121 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.110 anonymen Paarvergleichen.
Höherer Messwert1.527,339
95-%-Konfidenzintervall: ±13,189Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.438,409
95-%-Konfidenzintervall: ±17,847Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlFrench
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 683 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 439 anonymen Paarvergleichen.
Höherer Messwert1.512,688
95-%-Konfidenzintervall: ±24,179Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.436,172
95-%-Konfidenzintervall: ±30,641Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlGerman
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 294 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 171 anonymen Paarvergleichen.
Höherer Messwert1.494,472
95-%-Konfidenzintervall: ±33,522Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.441,328
95-%-Konfidenzintervall: ±44,181Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlHard prompts
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 12.850 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 7.151 anonymen Paarvergleichen.
Höherer Messwert1.505,824
95-%-Konfidenzintervall: ±6,322Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.445,331
95-%-Konfidenzintervall: ±7,87Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlHard prompts, English
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 5.325 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.633 anonymen Paarvergleichen.
Höherer Messwert1.505,518
95-%-Konfidenzintervall: ±8,681Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.458,125
95-%-Konfidenzintervall: ±10,37Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlInstruction following
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 6.679 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 3.552 anonymen Paarvergleichen.
Höherer Messwert1.484,179
95-%-Konfidenzintervall: ±7,999Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.422,079
95-%-Konfidenzintervall: ±10,349Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlKorean
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 433 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 178 anonymen Paarvergleichen.
Höherer Messwert1.442,739
95-%-Konfidenzintervall: ±29,372Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.393,188
95-%-Konfidenzintervall: ±44,609Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlLegal and government
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 1.616 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 839 anonymen Paarvergleichen.
Höherer Messwert1.492,222
95-%-Konfidenzintervall: ±15,145Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.437,938
95-%-Konfidenzintervall: ±21,308Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlLife, physical and social science
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 3.144 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.821 anonymen Paarvergleichen.
Höherer Messwert1.486,852
95-%-Konfidenzintervall: ±11,005Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.433,249
95-%-Konfidenzintervall: ±14,385Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlLonger queries
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 8.976 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 4.649 anonymen Paarvergleichen.
Höherer Messwert1.494,462
95-%-Konfidenzintervall: ±7,349Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.430,567
95-%-Konfidenzintervall: ±9,45Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlMath
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 861 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 538 anonymen Paarvergleichen.
Höherer Messwert1.485,703
95-%-Konfidenzintervall: ±19,824Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.428,509
95-%-Konfidenzintervall: ±24,905Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlMathematical professions
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 1.088 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 589 anonymen Paarvergleichen.
Höherer Messwert1.511,423
95-%-Konfidenzintervall: ±18,192Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.438,818
95-%-Konfidenzintervall: ±24,056Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlMedicine and healthcare
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 1.445 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 803 anonymen Paarvergleichen.
Höherer Messwert1.483,322
95-%-Konfidenzintervall: ±16,236Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.422,5
95-%-Konfidenzintervall: ±21,811Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlMulti-turn
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 3.254 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.804 anonymen Paarvergleichen.
Höherer Messwert1.490,68
95-%-Konfidenzintervall: ±11,019Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.431,13
95-%-Konfidenzintervall: ±14,427Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlNon-English
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 11.436 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 5.707 anonymen Paarvergleichen.
Höherer Messwert1.473,4
95-%-Konfidenzintervall: ±6,493Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.405,968
95-%-Konfidenzintervall: ±8,379Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlPolish
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 312 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 226 anonymen Paarvergleichen.
Höherer Messwert1.500,809
95-%-Konfidenzintervall: ±33,285Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.407,842
95-%-Konfidenzintervall: ±38,9Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlRussian
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 2.048 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 1.136 anonymen Paarvergleichen.
Höherer Messwert1.493,615
95-%-Konfidenzintervall: ±13,551Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.415,537
95-%-Konfidenzintervall: ±17,92Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlSoftware and IT services
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 7.844 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 4.321 anonymen Paarvergleichen.
Höherer Messwert1.519,459
95-%-Konfidenzintervall: ±7,479Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.470,331
95-%-Konfidenzintervall: ±9,542Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlSpanish
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 566 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 377 anonymen Paarvergleichen.
Höherer Messwert1.455,319
95-%-Konfidenzintervall: ±26,229Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.387,273
95-%-Konfidenzintervall: ±32,551Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026
LMArena Text, Style ControlWriting, literature and language
Testdetails
Testaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGPT-5.6 Sol: Snapshot: gpt-5.6-sol-xhigh, Reasoning: xhigh, Harness: Arena text, style control
Mistral Medium 3.5: Snapshot: mistral-medium-3.5, Harness: Arena text, style control
GPT-5.6 Sol: Stilbereinigte Arena-Bewertung aus 5.064 anonymen Paarvergleichen.Mistral Medium 3.5: Stilbereinigte Arena-Bewertung aus 2.726 anonymen Paarvergleichen.
Höherer Messwert1.483,075
95-%-Konfidenzintervall: ±9,123Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
1.405,242
95-%-Konfidenzintervall: ±11,761Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis.
LMArena
Quellendetails
Datenstand: 21.08.2026

Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand

So liest du den Vergleich

Ein Benchmark-Sieg ist kein Gesamturteil

Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.

Die Standardpreistabelle nutzt direkte Entwicklertarife. Der Anbieter-Vergleich kennzeichnet OpenRouter-Endpoints, Regionen und Sondertarife separat.

Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.

Weitere Duelle

Vergleiche GPT-5.6 Sol und Mistral Medium 3.5 mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.

Zum vollständigen LLM-Vergleich