Direktvergleich
GLM-5.1 vs. Mistral Large 3
Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.
- gemeinsame Messreihen
- 29
- verschiedene Benchmarks
- 1
- jüngster Abruf
- 26.08.2026
Modellauswahl ändern
Steckbrief
Allgemeine Daten
Erscheinungsdatum, Verfügbarkeit, Kontextfenster, Architektur und veröffentlichte Parameterzahlen auf einen Blick. Nicht veröffentlichte Angaben bleiben als solche markiert.
| Merkmal | GLM-5.1 | Mistral Large 3 |
|---|---|---|
| Anbieter | Z.ai | Mistral AI |
| Erschienen | 7. Apr. 2026 | 2. Dez. 2025 |
| Verfügbarkeit | Open Source | Aktiv |
| Modelltyp | Open Weights | Open Weights |
| Parameter | 744 Mrd., 40 Mrd. aktiv | 675 Mrd., 41 Mrd. aktiv |
| Architektur | Mixture of Experts | Mixture of Experts |
| Kontextfenster | 200.000 Token | 256.000 Token |
| Wissensstand | Nicht veröffentlicht | Nicht veröffentlicht |
| Technische Quellen | Modell, Kontext | Modell |
Kosten
API-Preise im Vergleich
Die Tabelle vergleicht die offiziellen Standard-API-Tarife pro 1 Mio. Token einschließlich veröffentlichter Cache-Preise. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.
| Preisart | GLM-5.1 | Mistral Large 3 |
|---|---|---|
| API-Eingabe | 1,4 $ | 0,5 $ |
| API-Ausgabe | 4,4 $ | 1,5 $ |
| Cache lesen | 0,26 $ | Nicht ausgewiesen |
| Cache schreiben (5 Min.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Cache schreiben (1 Std.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Preis geprüft | 30.07.2026 Quelle | 30.07.2026 Quelle |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
Preise nach Anbieter
Direkte Entwicklertarife und über OpenRouter geroutete Anbieterpreise sind getrennt gekennzeichnet. Alle Preise gelten in USD pro 1 Mio. Token. Kontextabhängige Direktpreise sowie regionale, Flex-, Priority- und weitere OpenRouter-Tarife bleiben einzeln erkennbar.
| Modell | Anbieter | Bezugsweg und Tarif | Eingabe pro 1 Mio. Token | Ausgabe pro 1 Mio. Token | Quelle |
|---|---|---|---|---|---|
| GLM-5.1 | Z.ai | Direkt beim EntwicklerStandard-API | 1,4 $ | 4,4 $ | Quelle30.07.2026 |
| Alibaba | Über OpenRouteralibaba/fp8 | 1,33 $ | 4,18 $ | Quelle25.08.2026 | |
| AtlasCloud | Über OpenRouteratlas-cloud/fp8 | 1,26 $ | 3,96 $ | Quelle25.08.2026 | |
| Baidu | Über OpenRouterbaidu/fp8 | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| Chutes | Über OpenRouterchutes/fp8 | 0,98 $ | 3,08 $ | Quelle25.08.2026 | |
| Crusoe | Über OpenRoutercrusoe/fp8 | 1,2 $ | 4,4 $ | Quelle25.08.2026 | |
| DeepInfra | Über OpenRouterdeepinfra/fp4 | 1,05 $ | 3,5 $ | Quelle25.08.2026 | |
| DigitalOcean | Über OpenRouterdigitalocean | 1,3 $ | 4,3 $ | Quelle25.08.2026 | |
| Friendli | Über OpenRouterfriendli | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| GMICloud | Über OpenRoutergmicloud/fp8 | Günstigster erfasster Preis: 0,91 $ | Günstigster erfasster Preis: 2,86 $ | Quelle25.08.2026 | |
| Nebius | Über OpenRouternebius/fp8 | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| Novita | Über OpenRouternovita/fp8 | 1,38 $ | 4,4 $ | Quelle25.08.2026 | |
| Parasail | Über OpenRouterparasail/fp8 | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| Phala | Über OpenRouterphala | 1,21 $ | 4,2 $ | Quelle25.08.2026 | |
| SiliconFlow | Über OpenRoutersiliconflow/fp8 | 1,19 $ | 3,74 $ | Quelle25.08.2026 | |
| StreamLake | Über OpenRouterstreamlake/fp8 | 0,966 $ | 3,036 $ | Quelle25.08.2026 | |
| Venice | Über OpenRoutervenice/fp8 | 1,54 $ | 4,84 $ | Quelle25.08.2026 | |
| Z.AI | Über OpenRouterz-ai/fp8 | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| Mistral Large 3 | Mistral AI | Direkt beim EntwicklerStandard-API | Günstigster erfasster Preis: 0,5 $ | Günstigster erfasster Preis: 1,5 $ | Quelle30.07.2026 |
| Mistral | Über OpenRoutermistral | Günstigster erfasster Preis: 0,5 $ | Günstigster erfasster Preis: 1,5 $ | Quelle25.08.2026 | |
| Mistral | Über OpenRoutermistral/eu | 0,55 $ | 1,65 $ | Quelle25.08.2026 | |
| Mistral | Über OpenRoutermistral/zdr | Günstigster erfasster Preis: 0,5 $ | Günstigster erfasster Preis: 1,5 $ | Quelle25.08.2026 |
Leistung
Gemeinsame Benchmarks
Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.
Fähigkeitsprofil aus vergleichbaren Benchmarks
Jede Achse mittelt direkt vergleichbare Benchmarkfamilien. Ein Wert von 100 bedeutet den stärkeren Wert innerhalb dieses Duells, keinen universellen Qualitätswert.
29 passende Messreihen aus 1 Benchmarkfamilien wurden berücksichtigt. Das Radar zeigt 8 von 8 vergleichbaren Kategorien.
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
| Benchmark und Aufgabe | GLM-5.1 | Mistral Large 3 | Quelle |
|---|---|---|---|
LMArena Text, Style ControlOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 42.267 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 62.644 anonymen Paarvergleichen. | Gewinner1.467,757 95-%-Konfidenzintervall: ±4,079Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.414,148 95-%-Konfidenzintervall: ±3,124Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlBusiness, management and financeTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 8.473 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 11.895 anonymen Paarvergleichen. | Gewinner1.465,984 95-%-Konfidenzintervall: ±7,262Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.413,419 95-%-Konfidenzintervall: ±6,034Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlChineseTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 2.556 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 3.385 anonymen Paarvergleichen. | Gewinner1.519,694 95-%-Konfidenzintervall: ±12,722Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.430,005 95-%-Konfidenzintervall: ±10,86Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlCodingTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 11.848 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 15.520 anonymen Paarvergleichen. | Gewinner1.515,26 95-%-Konfidenzintervall: ±6,441Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.468,701 95-%-Konfidenzintervall: ±5,352Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlCreative writingTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 7.719 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 10.357 anonymen Paarvergleichen. | Gewinner1.449,165 95-%-Konfidenzintervall: ±7,729Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.374,861 95-%-Konfidenzintervall: ±6,475Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlEnglishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 19.039 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 28.538 anonymen Paarvergleichen. | Gewinner1.481,535 95-%-Konfidenzintervall: ±5,272Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.428,085 95-%-Konfidenzintervall: ±4,227Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlEntertainment, sports and mediaTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 9.479 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 12.993 anonymen Paarvergleichen. | Gewinner1.443,65 95-%-Konfidenzintervall: ±7,083Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.372,945 95-%-Konfidenzintervall: ±5,837Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlExcluding tiesTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 31.733 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 45.394 anonymen Paarvergleichen. | Gewinner1.474,652 95-%-Konfidenzintervall: ±5,341Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.401,505 95-%-Konfidenzintervall: ±4,363Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlExpert promptsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 4.384 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.398 anonymen Paarvergleichen. | Gewinner1.499,018 95-%-Konfidenzintervall: ±9,564Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.423,702 95-%-Konfidenzintervall: ±8,53Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlFrenchTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 1.511 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.670 anonymen Paarvergleichen. | Gewinner1.484,761 95-%-Konfidenzintervall: ±17,161Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.437,964 95-%-Konfidenzintervall: ±16,349Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlGermanTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 672 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 998 anonymen Paarvergleichen. | Gewinner1.467,92 95-%-Konfidenzintervall: ±23,523Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.402,917 95-%-Konfidenzintervall: ±19,739Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlHard promptsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 27.921 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 37.379 anonymen Paarvergleichen. | Gewinner1.490,674 95-%-Konfidenzintervall: ±4,778Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.431,17 95-%-Konfidenzintervall: ±3,917Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlHard prompts, EnglishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 12.858 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 17.481 anonymen Paarvergleichen. | Gewinner1.498,435 95-%-Konfidenzintervall: ±6,201Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.439,438 95-%-Konfidenzintervall: ±5,127Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlInstruction followingTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 14.620 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 19.190 anonymen Paarvergleichen. | Gewinner1.461,682 95-%-Konfidenzintervall: ±5,849Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.400,463 95-%-Konfidenzintervall: ±4,921Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlJapaneseTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 468 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 572 anonymen Paarvergleichen. | Gewinner1.429,379 95-%-Konfidenzintervall: ±28,839Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.371,242 95-%-Konfidenzintervall: ±26,241Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlKoreanTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 864 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.058 anonymen Paarvergleichen. | Gewinner1.418,687 95-%-Konfidenzintervall: ±21,395Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.352,743 95-%-Konfidenzintervall: ±19,619Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlLegal and governmentTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 3.356 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.653 anonymen Paarvergleichen. | Gewinner1.477,196 95-%-Konfidenzintervall: ±10,734Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.422,025 95-%-Konfidenzintervall: ±9,12Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlLife, physical and social scienceTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 6.979 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 10.106 anonymen Paarvergleichen. | Gewinner1.487,767 95-%-Konfidenzintervall: ±7,741Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.427,678 95-%-Konfidenzintervall: ±6,312Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlLonger queriesTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 18.980 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 21.776 anonymen Paarvergleichen. | Gewinner1.483,373 95-%-Konfidenzintervall: ±5,596Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.417,899 95-%-Konfidenzintervall: ±4,85Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMathTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 2.097 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 3.663 anonymen Paarvergleichen. | Gewinner1.478,309 95-%-Konfidenzintervall: ±13,348Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.403,343 95-%-Konfidenzintervall: ±10,013Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMathematical professionsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 2.266 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 3.023 anonymen Paarvergleichen. | Gewinner1.477,24 95-%-Konfidenzintervall: ±13,062Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.417,125 95-%-Konfidenzintervall: ±11,203Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMedicine and healthcareTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 3.090 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.327 anonymen Paarvergleichen. | Gewinner1.484,81 95-%-Konfidenzintervall: ±11,356Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.432,504 95-%-Konfidenzintervall: ±9,539Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMulti-turnTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 6.947 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 10.813 anonymen Paarvergleichen. | Gewinner1.479,462 95-%-Konfidenzintervall: ±7,86Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.422,621 95-%-Konfidenzintervall: ±6,251Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlNon-EnglishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 23.226 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 34.098 anonymen Paarvergleichen. | Gewinner1.452,368 95-%-Konfidenzintervall: ±4,946Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.397,753 95-%-Konfidenzintervall: ±3,961Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlPolishTestdetailsKein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 830 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.479 anonymen Paarvergleichen. | Kein klarer Vorsprung1.449,029 95-%-Konfidenzintervall: ±20,25Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.415,621 95-%-Konfidenzintervall: ±15,589Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlRussianTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 4.527 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 6.371 anonymen Paarvergleichen. | Gewinner1.462,449 95-%-Konfidenzintervall: ±9,316Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.408,634 95-%-Konfidenzintervall: ±7,661Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlSoftware and IT servicesTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 16.977 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 23.384 anonymen Paarvergleichen. | Gewinner1.503,199 95-%-Konfidenzintervall: ±5,534Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.456,677 95-%-Konfidenzintervall: ±4,573Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlSpanishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 1.468 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.735 anonymen Paarvergleichen. | Gewinner1.462,334 95-%-Konfidenzintervall: ±16,723Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.410,69 95-%-Konfidenzintervall: ±15,599Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlWriting, literature and languageTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.1: Snapshot: glm-5.1, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.1: Stilbereinigte Arena-Bewertung aus 10.728 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 14.925 anonymen Paarvergleichen. | Gewinner1.455,092 95-%-Konfidenzintervall: ±6,667Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.389,813 95-%-Konfidenzintervall: ±5,474Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand | |||
So liest du den Vergleich
Ein Benchmark-Sieg ist kein Gesamturteil
Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.
Die Standardpreistabelle nutzt direkte Entwicklertarife. Der Anbieter-Vergleich kennzeichnet OpenRouter-Endpoints, Regionen und Sondertarife separat.
Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.
Weitere Duelle
Ähnliche LLM-Vergleiche
Vergleiche GLM-5.1 und Mistral Large 3 mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.