Direktvergleich
GLM-5.2 vs. Mistral Large 3
Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.
- gemeinsame Messreihen
- 29
- verschiedene Benchmarks
- 1
- jüngster Abruf
- 26.08.2026
Modellauswahl ändern
Steckbrief
Allgemeine Daten
Erscheinungsdatum, Verfügbarkeit, Kontextfenster, Architektur und veröffentlichte Parameterzahlen auf einen Blick. Nicht veröffentlichte Angaben bleiben als solche markiert.
| Merkmal | GLM-5.2 | Mistral Large 3 |
|---|---|---|
| Anbieter | Z.ai | Mistral AI |
| Erschienen | 16. Juni 2026 | 2. Dez. 2025 |
| Verfügbarkeit | Open Source | Aktiv |
| Modelltyp | Open Weights | Open Weights |
| Parameter | 744 Mrd., 40 Mrd. aktiv | 675 Mrd., 41 Mrd. aktiv |
| Architektur | Mixture of Experts | Mixture of Experts |
| Kontextfenster | 1.000.000 Token | 256.000 Token |
| Wissensstand | Nicht veröffentlicht | Nicht veröffentlicht |
| Technische Quellen | Modell, Kontext | Modell |
Kosten
API-Preise im Vergleich
Die Tabelle vergleicht die offiziellen Standard-API-Tarife pro 1 Mio. Token einschließlich veröffentlichter Cache-Preise. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.
| Preisart | GLM-5.2 | Mistral Large 3 |
|---|---|---|
| API-Eingabe | 1,4 $ | 0,5 $ |
| API-Ausgabe | 4,4 $ | 1,5 $ |
| Cache lesen | 0,26 $ | Nicht ausgewiesen |
| Cache schreiben (5 Min.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Cache schreiben (1 Std.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Preis geprüft | 30.07.2026 Quelle | 30.07.2026 Quelle |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
Preise nach Anbieter
Direkte Entwicklertarife und über OpenRouter geroutete Anbieterpreise sind getrennt gekennzeichnet. Alle Preise gelten in USD pro 1 Mio. Token. Kontextabhängige Direktpreise sowie regionale, Flex-, Priority- und weitere OpenRouter-Tarife bleiben einzeln erkennbar.
| Modell | Anbieter | Bezugsweg und Tarif | Eingabe pro 1 Mio. Token | Ausgabe pro 1 Mio. Token | Quelle |
|---|---|---|---|---|---|
| GLM-5.2 | Z.ai | Direkt beim EntwicklerStandard-API | 1,4 $ | 4,4 $ | Quelle30.07.2026 |
| Alibaba | Über OpenRouteralibaba/fast | 2,31 $ | 7,26 $ | Quelle25.08.2026 | |
| Alibaba | Über OpenRouteralibaba/fp8 | 0,966 $ | 3,036 $ | Quelle25.08.2026 | |
| Ambient | Über OpenRouterambient/fp8 | 0,6 $ | Günstigster erfasster Preis: 2 $ | Quelle25.08.2026 | |
| AtlasCloud | Über OpenRouteratlas-cloud/fp8 | 1,26 $ | 3,96 $ | Quelle25.08.2026 | |
| Baidu | Über OpenRouterbaidu/fp8 | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| BaseTen | Über OpenRouterbaseten/fast | 2,1 $ | 6,6 $ | Quelle25.08.2026 | |
| BaseTen | Über OpenRouterbaseten/fp8 | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| Cloudflare | Über OpenRoutercloudflare | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| Cloudflare | Über OpenRoutercloudflare/fast | 2,1 $ | 6,6 $ | Quelle25.08.2026 | |
| CoreWeave | Über OpenRoutercoreweave/fp4 | 0,76 $ | 2,42 $ | Quelle25.08.2026 | |
| Crusoe | Über OpenRoutercrusoe/fp8 | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| Decart | Über OpenRouterdecart/fp4 | 0,684 $ | 2,28 $ | Quelle25.08.2026 | |
| DeepInfra | Über OpenRouterdeepinfra/fp4 | 0,75 $ | 2,4 $ | Quelle25.08.2026 | |
| DigitalOcean | Über OpenRouterdigitalocean | 0,7 $ | 2,2 $ | Quelle25.08.2026 | |
| Fireworks | Über OpenRouterfireworks | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| Fireworks | Über OpenRouterfireworks/fast | 2,1 $ | 6,6 $ | Quelle25.08.2026 | |
| Fireworks | Über OpenRouterfireworks/fast-us | 2,1 $ | 6,6 $ | Quelle25.08.2026 | |
| Friendli | Über OpenRouterfriendli | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| GMICloud | Über OpenRoutergmicloud/fp8 | 1,05 $ | 3,3 $ | Quelle25.08.2026 | |
| Inceptron | Über OpenRouterinceptron/fp4 | 0,75 $ | 2,9 $ | Quelle25.08.2026 | |
| Io Net | Über OpenRouterio-net/fp4 | 1,26 $ | 4,4 $ | Quelle25.08.2026 | |
| Mistral | Über OpenRoutermistral | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| Mistral | Über OpenRoutermistral/eu | 1,54 $ | 4,84 $ | Quelle25.08.2026 | |
| Mistral | Über OpenRoutermistral/zdr | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| Morph | Über OpenRoutermorph/fp4 | 0,8415 $ | 3,1365 $ | Quelle25.08.2026 | |
| Novita | Über OpenRouternovita/fp8 | 0,7 $ | 2,2 $ | Quelle25.08.2026 | |
| Parasail | Über OpenRouterparasail/fp4 | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| Phala | Über OpenRouterphala/fp8 | 1,26 $ | 3 $ | Quelle25.08.2026 | |
| Reka | Über OpenRouterreka/fp8 | 1,1 $ | 3,75 $ | Quelle25.08.2026 | |
| Sail Research | Über OpenRoutersail-research/fp8 | Günstigster erfasster Preis: 0,5 $ | 3,15 $ | Quelle25.08.2026 | |
| SiliconFlow | Über OpenRoutersiliconflow/fp8 | 1,19 $ | 3,74 $ | Quelle25.08.2026 | |
| StreamLake | Über OpenRouterstreamlake/fp8 | 0,693 $ | 2,178 $ | Quelle25.08.2026 | |
| Together | Über OpenRoutertogether | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| Venice | Über OpenRoutervenice/fp8 | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| Wafer | Über OpenRouterwafer | 1,26 $ | 3,96 $ | Quelle25.08.2026 | |
| Z.AI | Über OpenRouterz-ai/fp8 | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| Mistral Large 3 | Mistral AI | Direkt beim EntwicklerStandard-API | Günstigster erfasster Preis: 0,5 $ | Günstigster erfasster Preis: 1,5 $ | Quelle30.07.2026 |
| Mistral | Über OpenRoutermistral | Günstigster erfasster Preis: 0,5 $ | Günstigster erfasster Preis: 1,5 $ | Quelle25.08.2026 | |
| Mistral | Über OpenRoutermistral/eu | 0,55 $ | 1,65 $ | Quelle25.08.2026 | |
| Mistral | Über OpenRoutermistral/zdr | Günstigster erfasster Preis: 0,5 $ | Günstigster erfasster Preis: 1,5 $ | Quelle25.08.2026 |
Leistung
Gemeinsame Benchmarks
Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.
Fähigkeitsprofil aus vergleichbaren Benchmarks
Jede Achse mittelt direkt vergleichbare Benchmarkfamilien. Ein Wert von 100 bedeutet den stärkeren Wert innerhalb dieses Duells, keinen universellen Qualitätswert.
Nicht genug direkt vergleichbare Kategorien für ein belastbares Radar
Nur 0 von mindestens 5 Kategorien enthalten direkt vergleichbare Modellmessungen. Die Benchmarktabellen darunter zeigen die vorhandenen Belege, ohne fehlende Achsen aufzufüllen.
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
| Benchmark und Aufgabe | GLM-5.2 | Mistral Large 3 | Quelle |
|---|---|---|---|
LMArena Text, Style ControlOverallTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 30.637 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 62.644 anonymen Paarvergleichen. | Höherer Messwert1.470,441 95-%-Konfidenzintervall: ±4,872Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.414,148 95-%-Konfidenzintervall: ±3,124Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlBusiness, management and financeTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 6.060 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 11.895 anonymen Paarvergleichen. | Höherer Messwert1.460,256 95-%-Konfidenzintervall: ±8,333Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.413,419 95-%-Konfidenzintervall: ±6,034Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlChineseTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 1.886 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 3.385 anonymen Paarvergleichen. | Höherer Messwert1.516,365 95-%-Konfidenzintervall: ±14,315Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.430,005 95-%-Konfidenzintervall: ±10,86Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlCodingTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 8.722 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 15.520 anonymen Paarvergleichen. | Höherer Messwert1.505,457 95-%-Konfidenzintervall: ±7,353Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.468,701 95-%-Konfidenzintervall: ±5,352Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlCreative writingTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 5.788 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 10.357 anonymen Paarvergleichen. | Höherer Messwert1.449,852 95-%-Konfidenzintervall: ±8,796Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.374,861 95-%-Konfidenzintervall: ±6,475Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlEnglishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 13.314 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 28.538 anonymen Paarvergleichen. | Höherer Messwert1.476,731 95-%-Konfidenzintervall: ±6,19Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.428,085 95-%-Konfidenzintervall: ±4,227Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlEntertainment, sports and mediaTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 7.407 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 12.993 anonymen Paarvergleichen. | Höherer Messwert1.439,987 95-%-Konfidenzintervall: ±7,914Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.372,945 95-%-Konfidenzintervall: ±5,837Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlExcluding tiesTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 22.741 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 45.394 anonymen Paarvergleichen. | Höherer Messwert1.477,78 95-%-Konfidenzintervall: ±6,358Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.401,505 95-%-Konfidenzintervall: ±4,363Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlExpert promptsTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 3.304 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 5.398 anonymen Paarvergleichen. | Höherer Messwert1.486,319 95-%-Konfidenzintervall: ±10,772Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.423,702 95-%-Konfidenzintervall: ±8,53Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlFrenchTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 1.085 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.670 anonymen Paarvergleichen. | Höherer Messwert1.486,679 95-%-Konfidenzintervall: ±19,504Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.437,964 95-%-Konfidenzintervall: ±16,349Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlGermanTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 547 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 998 anonymen Paarvergleichen. | Höherer Messwert1.476,351 95-%-Konfidenzintervall: ±25,887Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.402,917 95-%-Konfidenzintervall: ±19,739Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlHard promptsTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 20.300 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 37.379 anonymen Paarvergleichen. | Höherer Messwert1.488,351 95-%-Konfidenzintervall: ±5,61Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.431,17 95-%-Konfidenzintervall: ±3,917Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlHard prompts, EnglishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 8.990 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 17.481 anonymen Paarvergleichen. | Höherer Messwert1.490,933 95-%-Konfidenzintervall: ±7,183Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.439,438 95-%-Konfidenzintervall: ±5,127Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlInstruction followingTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 10.713 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 19.190 anonymen Paarvergleichen. | Höherer Messwert1.461,669 95-%-Konfidenzintervall: ±6,755Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.400,463 95-%-Konfidenzintervall: ±4,921Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlJapaneseTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 427 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 572 anonymen Paarvergleichen. | Höherer Messwert1.458,198 95-%-Konfidenzintervall: ±30,433Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.371,242 95-%-Konfidenzintervall: ±26,241Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlKoreanTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 630 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.058 anonymen Paarvergleichen. | Höherer Messwert1.434,769 95-%-Konfidenzintervall: ±24,318Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.352,743 95-%-Konfidenzintervall: ±19,619Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlLegal and governmentTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 2.500 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.653 anonymen Paarvergleichen. | Höherer Messwert1.479,818 95-%-Konfidenzintervall: ±12,362Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.422,025 95-%-Konfidenzintervall: ±9,12Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlLife, physical and social scienceTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 5.014 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 10.106 anonymen Paarvergleichen. | Höherer Messwert1.493,214 95-%-Konfidenzintervall: ±8,85Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.427,678 95-%-Konfidenzintervall: ±6,312Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlLonger queriesTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 14.115 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 21.776 anonymen Paarvergleichen. | Höherer Messwert1.478,84 95-%-Konfidenzintervall: ±6,381Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.417,899 95-%-Konfidenzintervall: ±4,85Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMathTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 1.436 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 3.663 anonymen Paarvergleichen. | Höherer Messwert1.475,051 95-%-Konfidenzintervall: ±15,541Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.403,343 95-%-Konfidenzintervall: ±10,013Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMathematical professionsTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 1.679 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 3.023 anonymen Paarvergleichen. | Höherer Messwert1.484,896 95-%-Konfidenzintervall: ±14,752Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.417,125 95-%-Konfidenzintervall: ±11,203Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMedicine and healthcareTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 2.211 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 4.327 anonymen Paarvergleichen. | Höherer Messwert1.487,508 95-%-Konfidenzintervall: ±13,318Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.432,504 95-%-Konfidenzintervall: ±9,539Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMulti-turnTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 5.065 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 10.813 anonymen Paarvergleichen. | Höherer Messwert1.470,164 95-%-Konfidenzintervall: ±9Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.422,621 95-%-Konfidenzintervall: ±6,251Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlNon-EnglishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 17.318 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 34.098 anonymen Paarvergleichen. | Höherer Messwert1.457,315 95-%-Konfidenzintervall: ±5,746Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.397,753 95-%-Konfidenzintervall: ±3,961Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlPolishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 536 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.479 anonymen Paarvergleichen. | Höherer Messwert1.453,565 95-%-Konfidenzintervall: ±25,326Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.415,621 95-%-Konfidenzintervall: ±15,589Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlRussianTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 3.158 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 6.371 anonymen Paarvergleichen. | Höherer Messwert1.468,653 95-%-Konfidenzintervall: ±10,943Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.408,634 95-%-Konfidenzintervall: ±7,661Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlSoftware and IT servicesTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 12.340 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 23.384 anonymen Paarvergleichen. | Höherer Messwert1.496,99 95-%-Konfidenzintervall: ±6,446Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.456,677 95-%-Konfidenzintervall: ±4,573Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlSpanishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 919 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 1.735 anonymen Paarvergleichen. | Höherer Messwert1.481,209 95-%-Konfidenzintervall: ±20,555Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.410,69 95-%-Konfidenzintervall: ±15,599Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlWriting, literature and languageTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style control Mistral Large 3: Snapshot: mistral-large-3, Harness: Arena text, style controlGLM-5.2: Stilbereinigte Arena-Bewertung aus 7.896 anonymen Paarvergleichen.Mistral Large 3: Stilbereinigte Arena-Bewertung aus 14.925 anonymen Paarvergleichen. | Höherer Messwert1.454,07 95-%-Konfidenzintervall: ±7,616Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.389,813 95-%-Konfidenzintervall: ±5,474Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand | |||
So liest du den Vergleich
Ein Benchmark-Sieg ist kein Gesamturteil
Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.
Die Standardpreistabelle nutzt direkte Entwicklertarife. Der Anbieter-Vergleich kennzeichnet OpenRouter-Endpoints, Regionen und Sondertarife separat.
Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.
Weitere Duelle
Ähnliche LLM-Vergleiche
Vergleiche GLM-5.2 und Mistral Large 3 mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.