Direktvergleich
DeepSeek-V4-Flash vs. GLM-5.2
Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.
- gemeinsame Messreihen
- 61
- verschiedene Benchmarks
- 2
- jüngster Abruf
- 26.08.2026
Modellauswahl ändern
Steckbrief
Allgemeine Daten
Erscheinungsdatum, Verfügbarkeit, Kontextfenster, Architektur und veröffentlichte Parameterzahlen auf einen Blick. Nicht veröffentlichte Angaben bleiben als solche markiert.
| Merkmal | DeepSeek-V4-Flash | GLM-5.2 |
|---|---|---|
| Anbieter | DeepSeek | Z.ai |
| Erschienen | 24. Apr. 2026 | 16. Juni 2026 |
| Verfügbarkeit | Preview | Open Source |
| Modelltyp | Open Weights | Open Weights |
| Parameter | 284 Mrd., 13 Mrd. aktiv | 744 Mrd., 40 Mrd. aktiv |
| Architektur | Mixture of Experts | Mixture of Experts |
| Kontextfenster | 1.000.000 Token | 1.000.000 Token |
| Wissensstand | Nicht veröffentlicht | Nicht veröffentlicht |
| Technische Quellen | Modell | Modell, Kontext |
Kosten
API-Preise im Vergleich
Die Tabelle vergleicht die offiziellen Standard-API-Tarife pro 1 Mio. Token einschließlich veröffentlichter Cache-Preise. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.
| Preisart | DeepSeek-V4-Flash | GLM-5.2 |
|---|---|---|
| API-Eingabe | 0,14 $ | 1,4 $ |
| API-Ausgabe | 0,28 $ | 4,4 $ |
| Cache lesen | 0, $ | 0,26 $ |
| Cache schreiben (5 Min.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Cache schreiben (1 Std.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Preis geprüft | 30.07.2026 Quelle | 30.07.2026 Quelle |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
Preise nach Anbieter
Direkte Entwicklertarife und über OpenRouter geroutete Anbieterpreise sind getrennt gekennzeichnet. Alle Preise gelten in USD pro 1 Mio. Token. Kontextabhängige Direktpreise sowie regionale, Flex-, Priority- und weitere OpenRouter-Tarife bleiben einzeln erkennbar.
| Modell | Anbieter | Bezugsweg und Tarif | Eingabe pro 1 Mio. Token | Ausgabe pro 1 Mio. Token | Quelle |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash | DeepSeek | Direkt beim EntwicklerStandard-API | 0,14 $ | 0,28 $ | Quelle30.07.2026 |
| AkashML | Über OpenRouterakashml/fp8 | 0,14 $ | 0,28 $ | Quelle25.08.2026 | |
| Alibaba | Über OpenRouteralibaba | 0,352 $ | 1,056 $ | Quelle25.08.2026 | |
| Ambient | Über OpenRouterambient/fp4 | 0,08 $ | 0,18 $ | Quelle25.08.2026 | |
| AtlasCloud | Über OpenRouteratlas-cloud/fp4 | 0,44 $ | 1,32 $ | Quelle25.08.2026 | |
| Baidu | Über OpenRouterbaidu/fp8 | 0,14 $ | 0,28 $ | Quelle25.08.2026 | |
| BaseTen | Über OpenRouterbaseten/fp8 | 0,13 $ | 0,26 $ | Quelle25.08.2026 | |
| Cloudflare | Über OpenRoutercloudflare | 0,44 $ | 1,32 $ | Quelle25.08.2026 | |
| CoreWeave | Über OpenRoutercoreweave/fp8 | 0,13 $ | 0,28 $ | Quelle25.08.2026 | |
| DeepInfra | Über OpenRouterdeepinfra/fp8 | 0,08 $ | 0,18 $ | Quelle25.08.2026 | |
| DeepSeek | Über OpenRouterdeepseek | 0,22 $ | 0,66 $ | Quelle25.08.2026 | |
| DigitalOcean | Über OpenRouterdigitalocean | 0,08 $ | 0,252 $ | Quelle25.08.2026 | |
| Fireworks | Über OpenRouterfireworks | 0,22 $ | 0,66 $ | Quelle25.08.2026 | |
| GMICloud | Über OpenRoutergmicloud/fp4 | 0,063 $ | 0,126 $ | Quelle25.08.2026 | |
| Inceptron | Über OpenRouterinceptron/fp4 | 0,13 $ | 0,28 $ | Quelle25.08.2026 | |
| Io Net | Über OpenRouterio-net/fp8 | 0,219 $ | 0,49 $ | Quelle25.08.2026 | |
| Mancer 2 | Über OpenRoutermancer/fp8 | 0,15 $ | 0,45 $ | Quelle25.08.2026 | |
| Morph | Über OpenRoutermorph/bf16 | 0,079 $ | 0,278 $ | Quelle25.08.2026 | |
| Novita | Über OpenRouternovita/fp8 | 0,44 $ | 1,32 $ | Quelle25.08.2026 | |
| OpenInference | Über OpenRouteropen-inference/fp4 | Günstigster erfasster Preis: 0,035 $ | 0,1 $ | Quelle25.08.2026 | |
| Parasail | Über OpenRouterparasail/fp8 | 0,14 $ | 0,28 $ | Quelle25.08.2026 | |
| Phala | Über OpenRouterphala | 0,2 $ | 0,4 $ | Quelle25.08.2026 | |
| Reka | Über OpenRouterreka/fp4 | 0,22 $ | 0,66 $ | Quelle25.08.2026 | |
| Relace | Über OpenRouterrelace/fp4 | 0,04 $ | Günstigster erfasster Preis: 0,08 $ | Quelle25.08.2026 | |
| SiliconFlow | Über OpenRoutersiliconflow/fp8 | 0,14 $ | 0,28 $ | Quelle25.08.2026 | |
| StreamLake | Über OpenRouterstreamlake/fp8 | 0,1936 $ | 0,5808 $ | Quelle25.08.2026 | |
| Together | Über OpenRoutertogether | 0,14 $ | 0,28 $ | Quelle25.08.2026 | |
| Venice | Über OpenRoutervenice | 0,175 $ | 0,35 $ | Quelle25.08.2026 | |
| Wafer | Über OpenRouterwafer/fast | 0,28 $ | 0,56 $ | Quelle25.08.2026 | |
| GLM-5.2 | Z.ai | Direkt beim EntwicklerStandard-API | 1,4 $ | 4,4 $ | Quelle30.07.2026 |
| Alibaba | Über OpenRouteralibaba/fast | 2,31 $ | 7,26 $ | Quelle25.08.2026 | |
| Alibaba | Über OpenRouteralibaba/fp8 | 0,966 $ | 3,036 $ | Quelle25.08.2026 | |
| Ambient | Über OpenRouterambient/fp8 | 0,6 $ | Günstigster erfasster Preis: 2 $ | Quelle25.08.2026 | |
| AtlasCloud | Über OpenRouteratlas-cloud/fp8 | 1,26 $ | 3,96 $ | Quelle25.08.2026 | |
| Baidu | Über OpenRouterbaidu/fp8 | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| BaseTen | Über OpenRouterbaseten/fast | 2,1 $ | 6,6 $ | Quelle25.08.2026 | |
| BaseTen | Über OpenRouterbaseten/fp8 | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| Cloudflare | Über OpenRoutercloudflare | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| Cloudflare | Über OpenRoutercloudflare/fast | 2,1 $ | 6,6 $ | Quelle25.08.2026 | |
| CoreWeave | Über OpenRoutercoreweave/fp4 | 0,76 $ | 2,42 $ | Quelle25.08.2026 | |
| Crusoe | Über OpenRoutercrusoe/fp8 | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| Decart | Über OpenRouterdecart/fp4 | 0,684 $ | 2,28 $ | Quelle25.08.2026 | |
| DeepInfra | Über OpenRouterdeepinfra/fp4 | 0,75 $ | 2,4 $ | Quelle25.08.2026 | |
| DigitalOcean | Über OpenRouterdigitalocean | 0,7 $ | 2,2 $ | Quelle25.08.2026 | |
| Fireworks | Über OpenRouterfireworks | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| Fireworks | Über OpenRouterfireworks/fast | 2,1 $ | 6,6 $ | Quelle25.08.2026 | |
| Fireworks | Über OpenRouterfireworks/fast-us | 2,1 $ | 6,6 $ | Quelle25.08.2026 | |
| Friendli | Über OpenRouterfriendli | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| GMICloud | Über OpenRoutergmicloud/fp8 | 1,05 $ | 3,3 $ | Quelle25.08.2026 | |
| Inceptron | Über OpenRouterinceptron/fp4 | 0,75 $ | 2,9 $ | Quelle25.08.2026 | |
| Io Net | Über OpenRouterio-net/fp4 | 1,26 $ | 4,4 $ | Quelle25.08.2026 | |
| Mistral | Über OpenRoutermistral | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| Mistral | Über OpenRoutermistral/eu | 1,54 $ | 4,84 $ | Quelle25.08.2026 | |
| Mistral | Über OpenRoutermistral/zdr | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| Morph | Über OpenRoutermorph/fp4 | 0,8415 $ | 3,1365 $ | Quelle25.08.2026 | |
| Novita | Über OpenRouternovita/fp8 | 0,7 $ | 2,2 $ | Quelle25.08.2026 | |
| Parasail | Über OpenRouterparasail/fp4 | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| Phala | Über OpenRouterphala/fp8 | 1,26 $ | 3 $ | Quelle25.08.2026 | |
| Reka | Über OpenRouterreka/fp8 | 1,1 $ | 3,75 $ | Quelle25.08.2026 | |
| Sail Research | Über OpenRoutersail-research/fp8 | Günstigster erfasster Preis: 0,5 $ | 3,15 $ | Quelle25.08.2026 | |
| SiliconFlow | Über OpenRoutersiliconflow/fp8 | 1,19 $ | 3,74 $ | Quelle25.08.2026 | |
| StreamLake | Über OpenRouterstreamlake/fp8 | 0,693 $ | 2,178 $ | Quelle25.08.2026 | |
| Together | Über OpenRoutertogether | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| Venice | Über OpenRoutervenice/fp8 | 1,4 $ | 4,4 $ | Quelle25.08.2026 | |
| Wafer | Über OpenRouterwafer | 1,26 $ | 3,96 $ | Quelle25.08.2026 | |
| Z.AI | Über OpenRouterz-ai/fp8 | 1,4 $ | 4,4 $ | Quelle25.08.2026 |
Leistung
Gemeinsame Benchmarks
Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.
Fähigkeitsprofil aus vergleichbaren Benchmarks
Jede Achse mittelt direkt vergleichbare Benchmarkfamilien. Ein Wert von 100 bedeutet den stärkeren Wert innerhalb dieses Duells, keinen universellen Qualitätswert.
Nicht genug direkt vergleichbare Kategorien für ein belastbares Radar
Nur 1 von mindestens 5 Kategorien enthalten direkt vergleichbare Modellmessungen. Die Benchmarktabellen darunter zeigen die vorhandenen Belege, ohne fehlende Achsen aufzufüllen.
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
| Benchmark und Aufgabe | DeepSeek-V4-Flash | GLM-5.2 | Quelle |
|---|---|---|---|
CyberBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 66,716 % | Gewinner77,359 % | Vals AIQuellendetailsDatenstand: 03.08.2026 |
LMArena Text, Style ControlOverallTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 49.001 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 30.637 anonymen Paarvergleichen. | 1.435,524 95-%-Konfidenzintervall: ±4,153Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.470,441 95-%-Konfidenzintervall: ±4,872Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
CyberBenchPatchTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 72,414 % | Gewinner81,034 % | Vals AIQuellendetailsDatenstand: 03.08.2026 |
LMArena Text, Style ControlOverallTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 48.679 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 30.637 anonymen Paarvergleichen. | 1.438,259 95-%-Konfidenzintervall: ±4,218Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.470,441 95-%-Konfidenzintervall: ±4,872Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
CyberBenchPoCTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 61,017 % | Gewinner73,684 % | Vals AIQuellendetailsDatenstand: 03.08.2026 |
LMArena Text, Style ControlBusiness, management and financeTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 9.915 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 6.060 anonymen Paarvergleichen. | 1.437,377 95-%-Konfidenzintervall: ±7,141Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.460,256 95-%-Konfidenzintervall: ±8,333Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlBusiness, management and financeTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 10.057 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 6.060 anonymen Paarvergleichen. | 1.435,239 95-%-Konfidenzintervall: ±7,16Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.460,256 95-%-Konfidenzintervall: ±8,333Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlChineseTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.529 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 1.886 anonymen Paarvergleichen. | 1.474,636 95-%-Konfidenzintervall: ±12,715Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.516,365 95-%-Konfidenzintervall: ±14,315Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlChineseTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.504 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 1.886 anonymen Paarvergleichen. | 1.481,76 95-%-Konfidenzintervall: ±12,702Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.516,365 95-%-Konfidenzintervall: ±14,315Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlCodingTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 14.374 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 8.722 anonymen Paarvergleichen. | 1.482,591 95-%-Konfidenzintervall: ±6,385Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.505,457 95-%-Konfidenzintervall: ±7,353Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlCodingTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 14.320 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 8.722 anonymen Paarvergleichen. | 1.479,354 95-%-Konfidenzintervall: ±6,423Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.505,457 95-%-Konfidenzintervall: ±7,353Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlCreative writingTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 7.948 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 5.788 anonymen Paarvergleichen. | 1.408,019 95-%-Konfidenzintervall: ±7,77Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.449,852 95-%-Konfidenzintervall: ±8,796Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlCreative writingTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 7.992 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 5.788 anonymen Paarvergleichen. | 1.409,215 95-%-Konfidenzintervall: ±7,802Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.449,852 95-%-Konfidenzintervall: ±8,796Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlEnglishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.970 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 13.314 anonymen Paarvergleichen. | 1.445,237 95-%-Konfidenzintervall: ±5,376Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.476,731 95-%-Konfidenzintervall: ±6,19Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlEnglishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.745 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 13.314 anonymen Paarvergleichen. | 1.449,979 95-%-Konfidenzintervall: ±5,418Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.476,731 95-%-Konfidenzintervall: ±6,19Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlEntertainment, sports and mediaTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 10.428 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 7.407 anonymen Paarvergleichen. | 1.405,468 95-%-Konfidenzintervall: ±7,138Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.439,987 95-%-Konfidenzintervall: ±7,914Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlEntertainment, sports and mediaTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 10.633 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 7.407 anonymen Paarvergleichen. | 1.406,075 95-%-Konfidenzintervall: ±7,077Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.439,987 95-%-Konfidenzintervall: ±7,914Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlExcluding tiesTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 37.009 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 22.741 anonymen Paarvergleichen. | 1.430,911 95-%-Konfidenzintervall: ±5,425Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.477,78 95-%-Konfidenzintervall: ±6,358Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlExcluding tiesTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 37.019 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 22.741 anonymen Paarvergleichen. | 1.435,438 95-%-Konfidenzintervall: ±5,471Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.477,78 95-%-Konfidenzintervall: ±6,358Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlExpert promptsTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 4.925 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 3.304 anonymen Paarvergleichen. | 1.458,281 95-%-Konfidenzintervall: ±9,155Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.486,319 95-%-Konfidenzintervall: ±10,772Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlExpert promptsTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 4.914 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 3.304 anonymen Paarvergleichen. | 1.467,751 95-%-Konfidenzintervall: ±9,229Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.486,319 95-%-Konfidenzintervall: ±10,772Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlFrenchTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.906 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 1.085 anonymen Paarvergleichen. | 1.444,081 95-%-Konfidenzintervall: ±15,745Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.486,679 95-%-Konfidenzintervall: ±19,504Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlFrenchTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.867 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 1.085 anonymen Paarvergleichen. | 1.458,299 95-%-Konfidenzintervall: ±15,946Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.486,679 95-%-Konfidenzintervall: ±19,504Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlGermanTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 835 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 547 anonymen Paarvergleichen. | 1.423,579 95-%-Konfidenzintervall: ±21,512Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.476,351 95-%-Konfidenzintervall: ±25,887Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlGermanTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 878 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 547 anonymen Paarvergleichen. | 1.434,11 95-%-Konfidenzintervall: ±21,114Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.476,351 95-%-Konfidenzintervall: ±25,887Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlHard promptsTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 32.624 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 20.300 anonymen Paarvergleichen. | 1.459,012 95-%-Konfidenzintervall: ±4,887Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.488,351 95-%-Konfidenzintervall: ±5,61Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlHard promptsTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 32.476 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 20.300 anonymen Paarvergleichen. | 1.458,203 95-%-Konfidenzintervall: ±4,946Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.488,351 95-%-Konfidenzintervall: ±5,61Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlHard prompts, EnglishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 15.364 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 8.990 anonymen Paarvergleichen. | 1.463,915 95-%-Konfidenzintervall: ±6,171Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.490,933 95-%-Konfidenzintervall: ±7,183Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlHard prompts, EnglishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 15.133 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 8.990 anonymen Paarvergleichen. | 1.464,862 95-%-Konfidenzintervall: ±6,249Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.490,933 95-%-Konfidenzintervall: ±7,183Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlInstruction followingTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 16.792 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 10.713 anonymen Paarvergleichen. | 1.427,924 95-%-Konfidenzintervall: ±5,965Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.461,669 95-%-Konfidenzintervall: ±6,755Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlInstruction followingTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 16.800 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 10.713 anonymen Paarvergleichen. | 1.434,055 95-%-Konfidenzintervall: ±6,038Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.461,669 95-%-Konfidenzintervall: ±6,755Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlJapaneseTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 631 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 427 anonymen Paarvergleichen. | 1.396,076 95-%-Konfidenzintervall: ±25,697Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.458,198 95-%-Konfidenzintervall: ±30,433Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlJapaneseTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 597 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 427 anonymen Paarvergleichen. | 1.419,885 95-%-Konfidenzintervall: ±26,347Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.458,198 95-%-Konfidenzintervall: ±30,433Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlKoreanTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 872 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 630 anonymen Paarvergleichen. | 1.393,099 95-%-Konfidenzintervall: ±21,429Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.434,769 95-%-Konfidenzintervall: ±24,318Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlKoreanTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 916 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 630 anonymen Paarvergleichen. | 1.375,815 95-%-Konfidenzintervall: ±21,49Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.434,769 95-%-Konfidenzintervall: ±24,318Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlLegal and governmentTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.894 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 2.500 anonymen Paarvergleichen. | 1.449,229 95-%-Konfidenzintervall: ±10,198Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.479,818 95-%-Konfidenzintervall: ±12,362Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlLegal and governmentTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.878 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 2.500 anonymen Paarvergleichen. | 1.458,405 95-%-Konfidenzintervall: ±10,257Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.479,818 95-%-Konfidenzintervall: ±12,362Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlLife, physical and social scienceTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 7.789 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 5.014 anonymen Paarvergleichen. | 1.458,819 95-%-Konfidenzintervall: ±7,624Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.493,214 95-%-Konfidenzintervall: ±8,85Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlLife, physical and social scienceTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 7.975 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 5.014 anonymen Paarvergleichen. | 1.460,991 95-%-Konfidenzintervall: ±7,604Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.493,214 95-%-Konfidenzintervall: ±8,85Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlLonger queriesTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.575 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 14.115 anonymen Paarvergleichen. | 1.448,286 95-%-Konfidenzintervall: ±5,743Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.478,84 95-%-Konfidenzintervall: ±6,381Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlLonger queriesTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.626 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 14.115 anonymen Paarvergleichen. | 1.449,2 95-%-Konfidenzintervall: ±5,75Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.478,84 95-%-Konfidenzintervall: ±6,381Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMathTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.515 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 1.436 anonymen Paarvergleichen. | 1.425,392 95-%-Konfidenzintervall: ±12,231Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.475,051 95-%-Konfidenzintervall: ±15,541Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMathTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.453 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 1.436 anonymen Paarvergleichen. | 1.440,516 95-%-Konfidenzintervall: ±12,345Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.475,051 95-%-Konfidenzintervall: ±15,541Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMathematical professionsTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.743 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 1.679 anonymen Paarvergleichen. | 1.431,192 95-%-Konfidenzintervall: ±11,962Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.484,896 95-%-Konfidenzintervall: ±14,752Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMathematical professionsTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.592 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 1.679 anonymen Paarvergleichen. | 1.441,773 95-%-Konfidenzintervall: ±12,373Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.484,896 95-%-Konfidenzintervall: ±14,752Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMedicine and healthcareTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.426 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 2.211 anonymen Paarvergleichen. | 1.459,889 95-%-Konfidenzintervall: ±10,972Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.487,508 95-%-Konfidenzintervall: ±13,318Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMedicine and healthcareTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.495 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 2.211 anonymen Paarvergleichen. | 1.463,024 95-%-Konfidenzintervall: ±10,885Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.487,508 95-%-Konfidenzintervall: ±13,318Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMulti-turnTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 8.842 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 5.065 anonymen Paarvergleichen. | 1.452,556 95-%-Konfidenzintervall: ±7,468Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.470,164 95-%-Konfidenzintervall: ±9Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMulti-turnTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 8.685 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 5.065 anonymen Paarvergleichen. | 1.445,883 95-%-Konfidenzintervall: ±7,52Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.470,164 95-%-Konfidenzintervall: ±9Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlNon-EnglishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 27.029 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 17.318 anonymen Paarvergleichen. | 1.422,867 95-%-Konfidenzintervall: ±5,074Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.457,315 95-%-Konfidenzintervall: ±5,746Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlNon-EnglishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 26.932 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 17.318 anonymen Paarvergleichen. | 1.422,545 95-%-Konfidenzintervall: ±5,143Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.457,315 95-%-Konfidenzintervall: ±5,746Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlPolishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.005 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 536 anonymen Paarvergleichen. | 1.439,224 95-%-Konfidenzintervall: ±19,002Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.453,565 95-%-Konfidenzintervall: ±25,326Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlPolishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.014 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 536 anonymen Paarvergleichen. | 1.430,677 95-%-Konfidenzintervall: ±18,897Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.453,565 95-%-Konfidenzintervall: ±25,326Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlRussianTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 5.241 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 3.158 anonymen Paarvergleichen. | 1.433,172 95-%-Konfidenzintervall: ±8,927Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.468,653 95-%-Konfidenzintervall: ±10,943Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlRussianTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 5.209 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 3.158 anonymen Paarvergleichen. | 1.436,972 95-%-Konfidenzintervall: ±9,052Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.468,653 95-%-Konfidenzintervall: ±10,943Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlSoftware and IT servicesTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 20.148 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 12.340 anonymen Paarvergleichen. | 1.470,467 95-%-Konfidenzintervall: ±5,636Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.496,99 95-%-Konfidenzintervall: ±6,446Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlSoftware and IT servicesTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 20.048 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 12.340 anonymen Paarvergleichen. | 1.473,082 95-%-Konfidenzintervall: ±5,674Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.496,99 95-%-Konfidenzintervall: ±6,446Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlSpanishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.552 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 919 anonymen Paarvergleichen. | 1.433,199 95-%-Konfidenzintervall: ±16,572Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.481,209 95-%-Konfidenzintervall: ±20,555Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlSpanishTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.448 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 919 anonymen Paarvergleichen. | 1.432,164 95-%-Konfidenzintervall: ±17,071Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.481,209 95-%-Konfidenzintervall: ±20,555Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlWriting, literature and languageTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 11.736 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 7.896 anonymen Paarvergleichen. | 1.417,766 95-%-Konfidenzintervall: ±6,723Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.454,07 95-%-Konfidenzintervall: ±7,616Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlWriting, literature and languageTestdetailsTestaufbau nicht identisch dokumentiertKein direkter SiegerVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style control GLM-5.2: Snapshot: glm-5.2-max, Reasoning: max, Harness: Arena text, style controlDeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 11.832 anonymen Paarvergleichen.GLM-5.2: Stilbereinigte Arena-Bewertung aus 7.896 anonymen Paarvergleichen. | 1.421,428 95-%-Konfidenzintervall: ±6,73Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | Höherer Messwert1.454,07 95-%-Konfidenzintervall: ±7,616Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand | |||
So liest du den Vergleich
Ein Benchmark-Sieg ist kein Gesamturteil
Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.
Die Standardpreistabelle nutzt direkte Entwicklertarife. Der Anbieter-Vergleich kennzeichnet OpenRouter-Endpoints, Regionen und Sondertarife separat.
Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.
Weitere Duelle
Ähnliche LLM-Vergleiche
Vergleiche DeepSeek-V4-Flash und GLM-5.2 mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.