Direktvergleich
DeepSeek-V4-Pro vs. DeepSeek-V4-Flash
Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.
- gemeinsame Messreihen
- 61
- verschiedene Benchmarks
- 2
- jüngster Abruf
- 26.08.2026
Modellauswahl ändern
Steckbrief
Allgemeine Daten
Erscheinungsdatum, Verfügbarkeit, Kontextfenster, Architektur und veröffentlichte Parameterzahlen auf einen Blick. Nicht veröffentlichte Angaben bleiben als solche markiert.
| Merkmal | DeepSeek-V4-Pro | DeepSeek-V4-Flash |
|---|---|---|
| Anbieter | DeepSeek | DeepSeek |
| Erschienen | 24. Apr. 2026 | 24. Apr. 2026 |
| Verfügbarkeit | Preview | Preview |
| Modelltyp | Open Weights | Open Weights |
| Parameter | 1,6 Billionen, 49 Mrd. aktiv | 284 Mrd., 13 Mrd. aktiv |
| Architektur | Mixture of Experts | Mixture of Experts |
| Kontextfenster | 1.000.000 Token | 1.000.000 Token |
| Wissensstand | Nicht veröffentlicht | Nicht veröffentlicht |
| Technische Quellen | Modell, Kontext | Modell |
Kosten
API-Preise im Vergleich
Die Tabelle vergleicht die offiziellen Standard-API-Tarife pro 1 Mio. Token einschließlich veröffentlichter Cache-Preise. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.
| Preisart | DeepSeek-V4-Pro | DeepSeek-V4-Flash |
|---|---|---|
| API-Eingabe | 0,43 $ | 0,14 $ |
| API-Ausgabe | 0,87 $ | 0,28 $ |
| Cache lesen | 0, $ | 0, $ |
| Cache schreiben (5 Min.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Cache schreiben (1 Std.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Preis geprüft | 30.07.2026 Quelle | 30.07.2026 Quelle |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
Preise nach Anbieter
Direkte Entwicklertarife und über OpenRouter geroutete Anbieterpreise sind getrennt gekennzeichnet. Alle Preise gelten in USD pro 1 Mio. Token. Kontextabhängige Direktpreise sowie regionale, Flex-, Priority- und weitere OpenRouter-Tarife bleiben einzeln erkennbar.
| Modell | Anbieter | Bezugsweg und Tarif | Eingabe pro 1 Mio. Token | Ausgabe pro 1 Mio. Token | Quelle |
|---|---|---|---|---|---|
| DeepSeek-V4-Pro | DeepSeek | Direkt beim EntwicklerStandard-API | Günstigster erfasster Preis: 0,435 $ | Günstigster erfasster Preis: 0,87 $ | Quelle30.07.2026 |
| Alibaba | Über OpenRouteralibaba | 1,122 $ | 3,366 $ | Quelle25.08.2026 | |
| BaseTen | Über OpenRouterbaseten/fp4 | 1,32 $ | 3,96 $ | Quelle25.08.2026 | |
| Cloudflare | Über OpenRoutercloudflare | 1,32 $ | 3,96 $ | Quelle25.08.2026 | |
| DeepInfra | Über OpenRouterdeepinfra/fp8 | 1,3 $ | 2,6 $ | Quelle25.08.2026 | |
| DeepSeek | Über OpenRouterdeepseek | 0,66 $ | 1,98 $ | Quelle25.08.2026 | |
| DigitalOcean | Über OpenRouterdigitalocean | 1,32 $ | 3,96 $ | Quelle25.08.2026 | |
| Fireworks | Über OpenRouterfireworks | 1,32 $ | 3,96 $ | Quelle25.08.2026 | |
| GMICloud | Über OpenRoutergmicloud/fp8 | 1,122 $ | 3,366 $ | Quelle25.08.2026 | |
| Novita | Über OpenRouternovita/fp8 | 1,32 $ | 3,96 $ | Quelle25.08.2026 | |
| Parasail | Über OpenRouterparasail/fp8 | 1,32 $ | 3,96 $ | Quelle25.08.2026 | |
| Phala | Über OpenRouterphala | 1,45 $ | 4,36 $ | Quelle25.08.2026 | |
| Sail Research | Über OpenRoutersail-research/fp4 | 1,32 $ | 3,96 $ | Quelle25.08.2026 | |
| SiliconFlow | Über OpenRoutersiliconflow/fp8 | 1,32 $ | 3,96 $ | Quelle25.08.2026 | |
| StreamLake | Über OpenRouterstreamlake | 1,32 $ | 3,96 $ | Quelle25.08.2026 | |
| Together | Über OpenRoutertogether | 1,32 $ | 3,96 $ | Quelle25.08.2026 | |
| DeepSeek-V4-Flash | DeepSeek | Direkt beim EntwicklerStandard-API | 0,14 $ | 0,28 $ | Quelle30.07.2026 |
| AkashML | Über OpenRouterakashml/fp8 | 0,14 $ | 0,28 $ | Quelle25.08.2026 | |
| Alibaba | Über OpenRouteralibaba | 0,352 $ | 1,056 $ | Quelle25.08.2026 | |
| Ambient | Über OpenRouterambient/fp4 | 0,08 $ | 0,18 $ | Quelle25.08.2026 | |
| AtlasCloud | Über OpenRouteratlas-cloud/fp4 | 0,44 $ | 1,32 $ | Quelle25.08.2026 | |
| Baidu | Über OpenRouterbaidu/fp8 | 0,14 $ | 0,28 $ | Quelle25.08.2026 | |
| BaseTen | Über OpenRouterbaseten/fp8 | 0,13 $ | 0,26 $ | Quelle25.08.2026 | |
| Cloudflare | Über OpenRoutercloudflare | 0,44 $ | 1,32 $ | Quelle25.08.2026 | |
| CoreWeave | Über OpenRoutercoreweave/fp8 | 0,13 $ | 0,28 $ | Quelle25.08.2026 | |
| DeepInfra | Über OpenRouterdeepinfra/fp8 | 0,08 $ | 0,18 $ | Quelle25.08.2026 | |
| DeepSeek | Über OpenRouterdeepseek | 0,22 $ | 0,66 $ | Quelle25.08.2026 | |
| DigitalOcean | Über OpenRouterdigitalocean | 0,08 $ | 0,252 $ | Quelle25.08.2026 | |
| Fireworks | Über OpenRouterfireworks | 0,22 $ | 0,66 $ | Quelle25.08.2026 | |
| GMICloud | Über OpenRoutergmicloud/fp4 | 0,063 $ | 0,126 $ | Quelle25.08.2026 | |
| Inceptron | Über OpenRouterinceptron/fp4 | 0,13 $ | 0,28 $ | Quelle25.08.2026 | |
| Io Net | Über OpenRouterio-net/fp8 | 0,219 $ | 0,49 $ | Quelle25.08.2026 | |
| Mancer 2 | Über OpenRoutermancer/fp8 | 0,15 $ | 0,45 $ | Quelle25.08.2026 | |
| Morph | Über OpenRoutermorph/bf16 | 0,079 $ | 0,278 $ | Quelle25.08.2026 | |
| Novita | Über OpenRouternovita/fp8 | 0,44 $ | 1,32 $ | Quelle25.08.2026 | |
| OpenInference | Über OpenRouteropen-inference/fp4 | Günstigster erfasster Preis: 0,035 $ | 0,1 $ | Quelle25.08.2026 | |
| Parasail | Über OpenRouterparasail/fp8 | 0,14 $ | 0,28 $ | Quelle25.08.2026 | |
| Phala | Über OpenRouterphala | 0,2 $ | 0,4 $ | Quelle25.08.2026 | |
| Reka | Über OpenRouterreka/fp4 | 0,22 $ | 0,66 $ | Quelle25.08.2026 | |
| Relace | Über OpenRouterrelace/fp4 | 0,04 $ | Günstigster erfasster Preis: 0,08 $ | Quelle25.08.2026 | |
| SiliconFlow | Über OpenRoutersiliconflow/fp8 | 0,14 $ | 0,28 $ | Quelle25.08.2026 | |
| StreamLake | Über OpenRouterstreamlake/fp8 | 0,1936 $ | 0,5808 $ | Quelle25.08.2026 | |
| Together | Über OpenRoutertogether | 0,14 $ | 0,28 $ | Quelle25.08.2026 | |
| Venice | Über OpenRoutervenice | 0,175 $ | 0,35 $ | Quelle25.08.2026 | |
| Wafer | Über OpenRouterwafer/fast | 0,28 $ | 0,56 $ | Quelle25.08.2026 |
Leistung
Gemeinsame Benchmarks
Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.
Fähigkeitsprofil aus vergleichbaren Benchmarks
Jede Achse mittelt direkt vergleichbare Benchmarkfamilien. Ein Wert von 100 bedeutet den stärkeren Wert innerhalb dieses Duells, keinen universellen Qualitätswert.
61 passende Messreihen aus 2 Benchmarkfamilien wurden berücksichtigt. Das Radar zeigt 8 von 9 vergleichbaren Kategorien.
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
| Benchmark und Aufgabe | DeepSeek-V4-Pro | DeepSeek-V4-Flash | Quelle |
|---|---|---|---|
CyberBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | Gewinner68,644 % | 66,716 % | Vals AIQuellendetailsDatenstand: 03.08.2026 |
LMArena Text, Style ControlOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 54.263 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 49.001 anonymen Paarvergleichen. | Gewinner1.457,7 95-%-Konfidenzintervall: ±4,017Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.435,524 95-%-Konfidenzintervall: ±4,153Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
CyberBenchPatchTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | Gewinner79,661 % | 72,414 % | Vals AIQuellendetailsDatenstand: 03.08.2026 |
LMArena Text, Style ControlOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 51.642 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 48.679 anonymen Paarvergleichen. | Gewinner1.455,038 95-%-Konfidenzintervall: ±4,085Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.438,259 95-%-Konfidenzintervall: ±4,218Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
CyberBenchPoCTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 57,627 % | Gewinner61,017 % | Vals AIQuellendetailsDatenstand: 03.08.2026 |
LMArena Text, Style ControlBusiness, management and financeTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 10.743 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 9.915 anonymen Paarvergleichen. | Gewinner1.460,843 95-%-Konfidenzintervall: ±6,925Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.437,377 95-%-Konfidenzintervall: ±7,141Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlBusiness, management and financeTestdetailsKein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 10.412 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 10.057 anonymen Paarvergleichen. | Kein klarer Vorsprung1.448,356 95-%-Konfidenzintervall: ±7,004Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.435,239 95-%-Konfidenzintervall: ±7,16Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlChineseTestdetailsKein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 2.857 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.529 anonymen Paarvergleichen. | Kein klarer Vorsprung1.495,376 95-%-Konfidenzintervall: ±12,11Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.474,636 95-%-Konfidenzintervall: ±12,715Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlChineseTestdetailsKein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 2.760 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.504 anonymen Paarvergleichen. | Kein klarer Vorsprung1.499,875 95-%-Konfidenzintervall: ±12,373Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.481,76 95-%-Konfidenzintervall: ±12,702Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlCodingTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 16.202 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 14.374 anonymen Paarvergleichen. | Gewinner1.501,604 95-%-Konfidenzintervall: ±6,087Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.482,591 95-%-Konfidenzintervall: ±6,385Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlCodingTestdetailsKein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 15.128 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 14.320 anonymen Paarvergleichen. | Kein klarer Vorsprung1.488,275 95-%-Konfidenzintervall: ±6,238Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.479,354 95-%-Konfidenzintervall: ±6,423Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlCreative writingTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 9.015 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 7.948 anonymen Paarvergleichen. | Gewinner1.444,726 95-%-Konfidenzintervall: ±7,519Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.408,019 95-%-Konfidenzintervall: ±7,77Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlCreative writingTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 8.654 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 7.992 anonymen Paarvergleichen. | Gewinner1.440,08 95-%-Konfidenzintervall: ±7,604Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.409,215 95-%-Konfidenzintervall: ±7,802Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlEnglishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 23.965 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.970 anonymen Paarvergleichen. | Gewinner1.467,54 95-%-Konfidenzintervall: ±5,224Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.445,237 95-%-Konfidenzintervall: ±5,376Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlEnglishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 22.736 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.745 anonymen Paarvergleichen. | Gewinner1.465,705 95-%-Konfidenzintervall: ±5,276Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.449,979 95-%-Konfidenzintervall: ±5,418Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlEntertainment, sports and mediaTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 11.885 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 10.428 anonymen Paarvergleichen. | Gewinner1.434,172 95-%-Konfidenzintervall: ±6,815Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.405,468 95-%-Konfidenzintervall: ±7,138Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlEntertainment, sports and mediaTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 11.430 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 10.633 anonymen Paarvergleichen. | Gewinner1.429,886 95-%-Konfidenzintervall: ±6,898Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.406,075 95-%-Konfidenzintervall: ±7,077Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlExcluding tiesTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 41.107 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 37.009 anonymen Paarvergleichen. | Gewinner1.461,299 95-%-Konfidenzintervall: ±5,257Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.430,911 95-%-Konfidenzintervall: ±5,425Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlExcluding tiesTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 39.223 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 37.019 anonymen Paarvergleichen. | Gewinner1.456,964 95-%-Konfidenzintervall: ±5,271Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.435,438 95-%-Konfidenzintervall: ±5,471Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlExpert promptsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 5.447 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 4.925 anonymen Paarvergleichen. | Gewinner1.482,141 95-%-Konfidenzintervall: ±8,836Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.458,281 95-%-Konfidenzintervall: ±9,155Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlExpert promptsTestdetailsKein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 5.079 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 4.914 anonymen Paarvergleichen. | Kein klarer Vorsprung1.475,437 95-%-Konfidenzintervall: ±8,986Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.467,751 95-%-Konfidenzintervall: ±9,229Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlFrenchTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 2.109 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.906 anonymen Paarvergleichen. | Gewinner1.483,368 95-%-Konfidenzintervall: ±15,313Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.444,081 95-%-Konfidenzintervall: ±15,745Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlFrenchTestdetailsKein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 1.982 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.867 anonymen Paarvergleichen. | Kein klarer Vorsprung1.470,361 95-%-Konfidenzintervall: ±15,414Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.458,299 95-%-Konfidenzintervall: ±15,946Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlGermanTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 964 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 835 anonymen Paarvergleichen. | Gewinner1.467,762 95-%-Konfidenzintervall: ±20,084Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.423,579 95-%-Konfidenzintervall: ±21,512Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlGermanTestdetailsKein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 888 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 878 anonymen Paarvergleichen. | Kein klarer Vorsprung1.457,77 95-%-Konfidenzintervall: ±20,761Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.434,11 95-%-Konfidenzintervall: ±21,114Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlHard promptsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 36.142 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 32.624 anonymen Paarvergleichen. | Gewinner1.480,326 95-%-Konfidenzintervall: ±4,704Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.459,012 95-%-Konfidenzintervall: ±4,887Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlHard promptsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 34.595 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 32.476 anonymen Paarvergleichen. | Gewinner1.473,959 95-%-Konfidenzintervall: ±4,764Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.458,203 95-%-Konfidenzintervall: ±4,946Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlHard prompts, EnglishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 16.850 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 15.364 anonymen Paarvergleichen. | Gewinner1.484,379 95-%-Konfidenzintervall: ±5,987Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.463,915 95-%-Konfidenzintervall: ±6,171Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlHard prompts, EnglishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 15.941 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 15.133 anonymen Paarvergleichen. | Gewinner1.481,888 95-%-Konfidenzintervall: ±6,077Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.464,862 95-%-Konfidenzintervall: ±6,249Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlInstruction followingTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 18.700 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 16.792 anonymen Paarvergleichen. | Gewinner1.453,347 95-%-Konfidenzintervall: ±5,739Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.427,924 95-%-Konfidenzintervall: ±5,965Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlInstruction followingTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 17.759 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 16.800 anonymen Paarvergleichen. | Gewinner1.449,032 95-%-Konfidenzintervall: ±5,829Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.434,055 95-%-Konfidenzintervall: ±6,038Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlJapaneseTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 689 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 631 anonymen Paarvergleichen. | Gewinner1.461,549 95-%-Konfidenzintervall: ±24,781Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.396,076 95-%-Konfidenzintervall: ±25,697Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlJapaneseTestdetailsKein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 635 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 597 anonymen Paarvergleichen. | Kein klarer Vorsprung1.427,788 95-%-Konfidenzintervall: ±25,259Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.419,885 95-%-Konfidenzintervall: ±26,347Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlKoreanTestdetailsKein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 1.080 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 872 anonymen Paarvergleichen. | Kein klarer Vorsprung1.417,139 95-%-Konfidenzintervall: ±19,425Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.393,099 95-%-Konfidenzintervall: ±21,429Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlKoreanTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 966 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 916 anonymen Paarvergleichen. | Gewinner1.431,69 95-%-Konfidenzintervall: ±20,252Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.375,815 95-%-Konfidenzintervall: ±21,49Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlLegal and governmentTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 4.244 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.894 anonymen Paarvergleichen. | Gewinner1.473,741 95-%-Konfidenzintervall: ±9,874Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.449,229 95-%-Konfidenzintervall: ±10,198Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlLegal and governmentTestdetailsKein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 4.070 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.878 anonymen Paarvergleichen. | Kein klarer Vorsprung1.472,138 95-%-Konfidenzintervall: ±10,029Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.458,405 95-%-Konfidenzintervall: ±10,257Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlLife, physical and social scienceTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 8.611 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 7.789 anonymen Paarvergleichen. | Gewinner1.480,933 95-%-Konfidenzintervall: ±7,35Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.458,819 95-%-Konfidenzintervall: ±7,624Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlLife, physical and social scienceTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 8.171 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 7.975 anonymen Paarvergleichen. | Gewinner1.478,847 95-%-Konfidenzintervall: ±7,442Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.460,991 95-%-Konfidenzintervall: ±7,604Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlLonger queriesTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 23.980 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.575 anonymen Paarvergleichen. | Gewinner1.472,553 95-%-Konfidenzintervall: ±5,513Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.448,286 95-%-Konfidenzintervall: ±5,743Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlLonger queriesTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 22.846 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.626 anonymen Paarvergleichen. | Gewinner1.466,174 95-%-Konfidenzintervall: ±5,588Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.449,2 95-%-Konfidenzintervall: ±5,75Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMathTestdetailsKein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 2.868 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.515 anonymen Paarvergleichen. | Kein klarer Vorsprung1.444,75 95-%-Konfidenzintervall: ±11,543Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.425,392 95-%-Konfidenzintervall: ±12,231Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMathTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 2.505 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.453 anonymen Paarvergleichen. | Gewinner1.468,143 95-%-Konfidenzintervall: ±12,279Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.440,516 95-%-Konfidenzintervall: ±12,345Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMathematical professionsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 3.009 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.743 anonymen Paarvergleichen. | Gewinner1.459,987 95-%-Konfidenzintervall: ±11,533Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.431,192 95-%-Konfidenzintervall: ±11,962Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMathematical professionsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 2.685 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.592 anonymen Paarvergleichen. | Gewinner1.468,563 95-%-Konfidenzintervall: ±12,137Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.441,773 95-%-Konfidenzintervall: ±12,373Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMedicine and healthcareTestdetailsKein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 3.761 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.426 anonymen Paarvergleichen. | Kein klarer Vorsprung1.476,837 95-%-Konfidenzintervall: ±10,569Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.459,889 95-%-Konfidenzintervall: ±10,972Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMedicine and healthcareTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 3.575 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.495 anonymen Paarvergleichen. | Gewinner1.485,157 95-%-Konfidenzintervall: ±10,739Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.463,024 95-%-Konfidenzintervall: ±10,885Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMulti-turnTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 9.825 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 8.842 anonymen Paarvergleichen. | Gewinner1.476,329 95-%-Konfidenzintervall: ±7,209Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.452,556 95-%-Konfidenzintervall: ±7,468Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMulti-turnTestdetailsKein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 9.157 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 8.685 anonymen Paarvergleichen. | Kein klarer Vorsprung1.455,775 95-%-Konfidenzintervall: ±7,34Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.445,883 95-%-Konfidenzintervall: ±7,52Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlNon-EnglishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 30.298 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 27.029 anonymen Paarvergleichen. | Gewinner1.444,915 95-%-Konfidenzintervall: ±4,847Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.422,867 95-%-Konfidenzintervall: ±5,074Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlNon-EnglishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 28.902 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 26.932 anonymen Paarvergleichen. | Gewinner1.440,961 95-%-Konfidenzintervall: ±4,919Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.422,545 95-%-Konfidenzintervall: ±5,143Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlPolishTestdetailsKein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 1.081 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.005 anonymen Paarvergleichen. | Kein klarer Vorsprung1.466,281 95-%-Konfidenzintervall: ±18,48Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.439,224 95-%-Konfidenzintervall: ±19,002Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlPolishTestdetailsKein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 1.054 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.014 anonymen Paarvergleichen. | Kein klarer Vorsprung1.461,4 95-%-Konfidenzintervall: ±18,605Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.430,677 95-%-Konfidenzintervall: ±18,897Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlRussianTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 5.700 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 5.241 anonymen Paarvergleichen. | Gewinner1.458,06 95-%-Konfidenzintervall: ±8,69Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.433,172 95-%-Konfidenzintervall: ±8,927Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlRussianTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 5.550 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 5.209 anonymen Paarvergleichen. | Gewinner1.458,961 95-%-Konfidenzintervall: ±8,763Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.436,972 95-%-Konfidenzintervall: ±9,052Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlSoftware and IT servicesTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 22.329 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 20.148 anonymen Paarvergleichen. | Gewinner1.491,809 95-%-Konfidenzintervall: ±5,402Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.470,467 95-%-Konfidenzintervall: ±5,636Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlSoftware and IT servicesTestdetailsKein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 21.195 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 20.048 anonymen Paarvergleichen. | Kein klarer Vorsprung1.482,935 95-%-Konfidenzintervall: ±5,488Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.473,082 95-%-Konfidenzintervall: ±5,674Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlSpanishTestdetailsKein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 1.694 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.552 anonymen Paarvergleichen. | Kein klarer Vorsprung1.453,824 95-%-Konfidenzintervall: ±15,925Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.433,199 95-%-Konfidenzintervall: ±16,572Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlSpanishTestdetailsKein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 1.659 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.448 anonymen Paarvergleichen. | Kein klarer Vorsprung1.452,371 95-%-Konfidenzintervall: ±16,057Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.432,164 95-%-Konfidenzintervall: ±17,071Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlWriting, literature and languageTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 13.157 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 11.736 anonymen Paarvergleichen. | Gewinner1.451,126 95-%-Konfidenzintervall: ±6,506Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.417,766 95-%-Konfidenzintervall: ±6,723Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlWriting, literature and languageTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserDeepSeek-V4-Pro: Snapshot: deepseek-v4-pro-high-preview, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlDeepSeek-V4-Pro: Stilbereinigte Arena-Bewertung aus 12.746 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 11.832 anonymen Paarvergleichen. | Gewinner1.442,738 95-%-Konfidenzintervall: ±6,585Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.421,428 95-%-Konfidenzintervall: ±6,73Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand | |||
So liest du den Vergleich
Ein Benchmark-Sieg ist kein Gesamturteil
Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.
Die Standardpreistabelle nutzt direkte Entwicklertarife. Der Anbieter-Vergleich kennzeichnet OpenRouter-Endpoints, Regionen und Sondertarife separat.
Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.
Weitere Duelle
Ähnliche LLM-Vergleiche
Vergleiche DeepSeek-V4-Pro und DeepSeek-V4-Flash mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.