Direktvergleich
Gemini 3.5 Flash vs. DeepSeek-V4-Flash
Veröffentlichte Benchmarkwerte aus derselben Version und Vergleichskohorte, API-Preise und technische Eckdaten. Unterschiedliche Testeinstellungen werden sichtbar ausgewiesen.
- gemeinsame Messreihen
- 32
- verschiedene Benchmarks
- 2
- jüngster Abruf
- 26.08.2026
Modellauswahl ändern
Steckbrief
Allgemeine Daten
Erscheinungsdatum, Verfügbarkeit, Kontextfenster, Architektur und veröffentlichte Parameterzahlen auf einen Blick. Nicht veröffentlichte Angaben bleiben als solche markiert.
| Merkmal | Gemini 3.5 Flash | DeepSeek-V4-Flash |
|---|---|---|
| Anbieter | DeepSeek | |
| Erschienen | 19. Mai 2026 | 24. Apr. 2026 |
| Verfügbarkeit | Aktiv | Preview |
| Modelltyp | Proprietär | Open Weights |
| Parameter | Nicht veröffentlicht | 284 Mrd., 13 Mrd. aktiv |
| Architektur | Nicht veröffentlicht | Mixture of Experts |
| Kontextfenster | 1.048.576 Token | 1.000.000 Token |
| Wissensstand | Nicht veröffentlicht | Nicht veröffentlicht |
| Technische Quellen | Modell | Modell |
Kosten
API-Preise im Vergleich
Die Tabelle vergleicht die offiziellen Standard-API-Tarife pro 1 Mio. Token einschließlich veröffentlichter Cache-Preise. Batch, Fast, Priority, regionale Aufschläge, Toolaufrufe und Cloudpreise sind nicht eingerechnet.
| Preisart | Gemini 3.5 Flash | DeepSeek-V4-Flash |
|---|---|---|
| API-Eingabe | 1,5 $ | 0,14 $ |
| API-Ausgabe | 9 $ | 0,28 $ |
| Cache lesen | 0,15 $ | 0, $ |
| Cache schreiben (5 Min.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Cache schreiben (1 Std.) | Nicht ausgewiesen | Nicht ausgewiesen |
| Preis geprüft | 30.07.2026 Quelle | 30.07.2026 Quelle |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
Preise nach Anbieter
Direkte Entwicklertarife und über OpenRouter geroutete Anbieterpreise sind getrennt gekennzeichnet. Alle Preise gelten in USD pro 1 Mio. Token. Kontextabhängige Direktpreise sowie regionale, Flex-, Priority- und weitere OpenRouter-Tarife bleiben einzeln erkennbar.
| Modell | Anbieter | Bezugsweg und Tarif | Eingabe pro 1 Mio. Token | Ausgabe pro 1 Mio. Token | Quelle |
|---|---|---|---|---|---|
| Gemini 3.5 Flash | Direkt beim EntwicklerStandard-API | 1,5 $ | 9 $ | Quelle30.07.2026 | |
| Über OpenRoutergoogle-vertex/global | 1,5 $ | 9 $ | Quelle25.08.2026 | ||
| Über OpenRoutergoogle-vertex/global/flex | Günstigster erfasster Preis: 0,75 $ | Günstigster erfasster Preis: 4,5 $ | Quelle25.08.2026 | ||
| Über OpenRoutergoogle-vertex/global/priority | 2,7 $ | 16,2 $ | Quelle25.08.2026 | ||
| Über OpenRoutergoogle-vertex/us | 1,65 $ | 9,9 $ | Quelle25.08.2026 | ||
| Google AI Studio | Über OpenRoutergoogle-ai-studio | 1,5 $ | 9 $ | Quelle25.08.2026 | |
| Google AI Studio | Über OpenRoutergoogle-ai-studio/flex | Günstigster erfasster Preis: 0,75 $ | Günstigster erfasster Preis: 4,5 $ | Quelle25.08.2026 | |
| Google AI Studio | Über OpenRoutergoogle-ai-studio/priority | 2,7 $ | 16,2 $ | Quelle25.08.2026 | |
| DeepSeek-V4-Flash | DeepSeek | Direkt beim EntwicklerStandard-API | 0,14 $ | 0,28 $ | Quelle30.07.2026 |
| AkashML | Über OpenRouterakashml/fp8 | 0,14 $ | 0,28 $ | Quelle25.08.2026 | |
| Alibaba | Über OpenRouteralibaba | 0,352 $ | 1,056 $ | Quelle25.08.2026 | |
| Ambient | Über OpenRouterambient/fp4 | 0,08 $ | 0,18 $ | Quelle25.08.2026 | |
| AtlasCloud | Über OpenRouteratlas-cloud/fp4 | 0,44 $ | 1,32 $ | Quelle25.08.2026 | |
| Baidu | Über OpenRouterbaidu/fp8 | 0,14 $ | 0,28 $ | Quelle25.08.2026 | |
| BaseTen | Über OpenRouterbaseten/fp8 | 0,13 $ | 0,26 $ | Quelle25.08.2026 | |
| Cloudflare | Über OpenRoutercloudflare | 0,44 $ | 1,32 $ | Quelle25.08.2026 | |
| CoreWeave | Über OpenRoutercoreweave/fp8 | 0,13 $ | 0,28 $ | Quelle25.08.2026 | |
| DeepInfra | Über OpenRouterdeepinfra/fp8 | 0,08 $ | 0,18 $ | Quelle25.08.2026 | |
| DeepSeek | Über OpenRouterdeepseek | 0,22 $ | 0,66 $ | Quelle25.08.2026 | |
| DigitalOcean | Über OpenRouterdigitalocean | 0,08 $ | 0,252 $ | Quelle25.08.2026 | |
| Fireworks | Über OpenRouterfireworks | 0,22 $ | 0,66 $ | Quelle25.08.2026 | |
| GMICloud | Über OpenRoutergmicloud/fp4 | 0,063 $ | 0,126 $ | Quelle25.08.2026 | |
| Inceptron | Über OpenRouterinceptron/fp4 | 0,13 $ | 0,28 $ | Quelle25.08.2026 | |
| Io Net | Über OpenRouterio-net/fp8 | 0,219 $ | 0,49 $ | Quelle25.08.2026 | |
| Mancer 2 | Über OpenRoutermancer/fp8 | 0,15 $ | 0,45 $ | Quelle25.08.2026 | |
| Morph | Über OpenRoutermorph/bf16 | 0,079 $ | 0,278 $ | Quelle25.08.2026 | |
| Novita | Über OpenRouternovita/fp8 | 0,44 $ | 1,32 $ | Quelle25.08.2026 | |
| OpenInference | Über OpenRouteropen-inference/fp4 | Günstigster erfasster Preis: 0,035 $ | 0,1 $ | Quelle25.08.2026 | |
| Parasail | Über OpenRouterparasail/fp8 | 0,14 $ | 0,28 $ | Quelle25.08.2026 | |
| Phala | Über OpenRouterphala | 0,2 $ | 0,4 $ | Quelle25.08.2026 | |
| Reka | Über OpenRouterreka/fp4 | 0,22 $ | 0,66 $ | Quelle25.08.2026 | |
| Relace | Über OpenRouterrelace/fp4 | 0,04 $ | Günstigster erfasster Preis: 0,08 $ | Quelle25.08.2026 | |
| SiliconFlow | Über OpenRoutersiliconflow/fp8 | 0,14 $ | 0,28 $ | Quelle25.08.2026 | |
| StreamLake | Über OpenRouterstreamlake/fp8 | 0,1936 $ | 0,5808 $ | Quelle25.08.2026 | |
| Together | Über OpenRoutertogether | 0,14 $ | 0,28 $ | Quelle25.08.2026 | |
| Venice | Über OpenRoutervenice | 0,175 $ | 0,35 $ | Quelle25.08.2026 | |
| Wafer | Über OpenRouterwafer/fast | 0,28 $ | 0,56 $ | Quelle25.08.2026 |
Leistung
Gemeinsame Benchmarks
Nur veröffentlichte Ergebnisse mit derselben Benchmark-Version, Aufgabe, Metrik und Vergleichskohorte werden gegenübergestellt. Wenn Anbieter unterschiedliche Reasoning-Stufen, Agenten oder Ausgabegrenzen verwendet haben, steht das direkt in der Tabelle.
Fähigkeitsprofil aus vergleichbaren Benchmarks
Jede Achse mittelt direkt vergleichbare Benchmarkfamilien. Ein Wert von 100 bedeutet den stärkeren Wert innerhalb dieses Duells, keinen universellen Qualitätswert.
32 passende Messreihen aus 2 Benchmarkfamilien wurden berücksichtigt. Das Radar zeigt 8 von 9 vergleichbaren Kategorien.
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand
| Benchmark und Aufgabe | Gemini 3.5 Flash | DeepSeek-V4-Flash | Quelle |
|---|---|---|---|
CyberBenchOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | Gewinner69,331 % | 66,716 % | Vals AIQuellendetailsDatenstand: 03.08.2026 |
LMArena Text, Style ControlOverallTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 30.004 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 48.679 anonymen Paarvergleichen. | Gewinner1.478,186 95-%-Konfidenzintervall: ±4,512Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.438,259 95-%-Konfidenzintervall: ±4,218Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
CyberBenchPatchTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | Gewinner81,034 % | 72,414 % | Vals AIQuellendetailsDatenstand: 03.08.2026 |
LMArena Text, Style ControlBusiness, management and financeTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 5.980 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 10.057 anonymen Paarvergleichen. | Gewinner1.462,48 95-%-Konfidenzintervall: ±8,36Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.435,239 95-%-Konfidenzintervall: ±7,16Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
CyberBenchPoCTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: 1Messgröße: accuracyBewertung: Mehr ist besser | 57,627 % | Gewinner61,017 % | Vals AIQuellendetailsDatenstand: 03.08.2026 |
LMArena Text, Style ControlChineseTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 1.910 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.504 anonymen Paarvergleichen. | Gewinner1.527,374 95-%-Konfidenzintervall: ±14,718Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.481,76 95-%-Konfidenzintervall: ±12,702Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlCodingTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 8.771 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 14.320 anonymen Paarvergleichen. | Gewinner1.506,689 95-%-Konfidenzintervall: ±7,222Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.479,354 95-%-Konfidenzintervall: ±6,423Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlCreative writingTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 5.445 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 7.992 anonymen Paarvergleichen. | Gewinner1.465,846 95-%-Konfidenzintervall: ±8,938Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.409,215 95-%-Konfidenzintervall: ±7,802Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlEnglishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 13.155 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.745 anonymen Paarvergleichen. | Gewinner1.476,148 95-%-Konfidenzintervall: ±6,021Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.449,979 95-%-Konfidenzintervall: ±5,418Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlEntertainment, sports and mediaTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 6.972 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 10.633 anonymen Paarvergleichen. | Gewinner1.453,796 95-%-Konfidenzintervall: ±8,002Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.406,075 95-%-Konfidenzintervall: ±7,077Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlExcluding tiesTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 22.742 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 37.019 anonymen Paarvergleichen. | Gewinner1.487,968 95-%-Konfidenzintervall: ±5,927Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.435,438 95-%-Konfidenzintervall: ±5,471Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlExpert promptsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 3.349 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 4.914 anonymen Paarvergleichen. | Gewinner1.491,6 95-%-Konfidenzintervall: ±10,806Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.467,751 95-%-Konfidenzintervall: ±9,229Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlFrenchTestdetailsKein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 997 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.867 anonymen Paarvergleichen. | Kein klarer Vorsprung1.482,409 95-%-Konfidenzintervall: ±20,415Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.458,299 95-%-Konfidenzintervall: ±15,946Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlGermanTestdetailsKein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 513 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 878 anonymen Paarvergleichen. | Kein klarer Vorsprung1.472,255 95-%-Konfidenzintervall: ±26,682Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.434,11 95-%-Konfidenzintervall: ±21,114Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlHard promptsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 20.131 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 32.476 anonymen Paarvergleichen. | Gewinner1.495,937 95-%-Konfidenzintervall: ±5,331Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.458,203 95-%-Konfidenzintervall: ±4,946Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlHard prompts, EnglishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 8.917 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 15.133 anonymen Paarvergleichen. | Gewinner1.488,556 95-%-Konfidenzintervall: ±7,114Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.464,862 95-%-Konfidenzintervall: ±6,249Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlInstruction followingTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 10.572 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 16.800 anonymen Paarvergleichen. | Gewinner1.466,327 95-%-Konfidenzintervall: ±6,653Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.434,055 95-%-Konfidenzintervall: ±6,038Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlJapaneseTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 358 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 597 anonymen Paarvergleichen. | Gewinner1.483,577 95-%-Konfidenzintervall: ±32,203Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.419,885 95-%-Konfidenzintervall: ±26,347Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlKoreanTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 663 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 916 anonymen Paarvergleichen. | Gewinner1.440,323 95-%-Konfidenzintervall: ±23,173Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.375,815 95-%-Konfidenzintervall: ±21,49Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlLegal and governmentTestdetailsKein dokumentierter Unterschied im TestaufbauKein klarer VorsprungVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 2.505 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.878 anonymen Paarvergleichen. | Kein klarer Vorsprung1.475,251 95-%-Konfidenzintervall: ±12,6Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.458,405 95-%-Konfidenzintervall: ±10,257Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlLife, physical and social scienceTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 4.894 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 7.975 anonymen Paarvergleichen. | Gewinner1.488,224 95-%-Konfidenzintervall: ±8,971Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.460,991 95-%-Konfidenzintervall: ±7,604Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlLonger queriesTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 13.857 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 21.626 anonymen Paarvergleichen. | Gewinner1.482,422 95-%-Konfidenzintervall: ±6,316Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.449,2 95-%-Konfidenzintervall: ±5,75Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMathTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 1.475 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.453 anonymen Paarvergleichen. | Gewinner1.502,939 95-%-Konfidenzintervall: ±15,646Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.440,516 95-%-Konfidenzintervall: ±12,345Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMathematical professionsTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 1.709 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 2.592 anonymen Paarvergleichen. | Gewinner1.486,502 95-%-Konfidenzintervall: ±14,893Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.441,773 95-%-Konfidenzintervall: ±12,373Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMedicine and healthcareTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 2.186 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 3.495 anonymen Paarvergleichen. | Gewinner1.490,981 95-%-Konfidenzintervall: ±13,521Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.463,024 95-%-Konfidenzintervall: ±10,885Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlMulti-turnTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 5.128 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 8.685 anonymen Paarvergleichen. | Gewinner1.484,617 95-%-Konfidenzintervall: ±8,983Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.445,883 95-%-Konfidenzintervall: ±7,52Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlNon-EnglishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 16.845 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 26.932 anonymen Paarvergleichen. | Gewinner1.472,458 95-%-Konfidenzintervall: ±5,583Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.422,545 95-%-Konfidenzintervall: ±5,143Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlPolishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 564 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.014 anonymen Paarvergleichen. | Gewinner1.510,936 95-%-Konfidenzintervall: ±25,282Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.430,677 95-%-Konfidenzintervall: ±18,897Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlRussianTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 3.099 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 5.209 anonymen Paarvergleichen. | Gewinner1.491,327 95-%-Konfidenzintervall: ±11,256Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.436,972 95-%-Konfidenzintervall: ±9,052Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlSoftware and IT servicesTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 12.180 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 20.048 anonymen Paarvergleichen. | Gewinner1.500,882 95-%-Konfidenzintervall: ±6,331Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.473,082 95-%-Konfidenzintervall: ±5,674Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlSpanishTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 945 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 1.448 anonymen Paarvergleichen. | Gewinner1.470,285 95-%-Konfidenzintervall: ±20,396Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.432,164 95-%-Konfidenzintervall: ±17,071Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
LMArena Text, Style ControlWriting, literature and languageTestdetailsKein dokumentierter Unterschied im TestaufbauVersion: style-control-v1Messgröße: style-controlled Bradley-Terry ratingBewertung: Mehr ist besserGemini 3.5 Flash: Snapshot: gemini-3.5-flash-high, Reasoning: high, Harness: Arena text, style control DeepSeek-V4-Flash: Snapshot: deepseek-v4-flash-high-preview, Reasoning: high, Harness: Arena text, style controlGemini 3.5 Flash: Stilbereinigte Arena-Bewertung aus 7.521 anonymen Paarvergleichen.DeepSeek-V4-Flash: Stilbereinigte Arena-Bewertung aus 11.832 anonymen Paarvergleichen. | Gewinner1.473,503 95-%-Konfidenzintervall: ±7,655Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | 1.421,428 95-%-Konfidenzintervall: ±6,73Der Arena-Score misst menschliche Präferenzen und ist kein fester Fähigkeitstest. Konfidenzintervall und Modellkonfiguration gehören zum Ergebnis. | LMArenaQuellendetailsDatenstand: 21.08.2026 |
Zeichenerklärung:besserer Wertbesser, aber nicht eindeutigGleichstand | |||
So liest du den Vergleich
Ein Benchmark-Sieg ist kein Gesamturteil
Entscheidend sind deine Aufgaben, dein Budget und die benötigte Kontextlänge. Ein Coding-Benchmark sagt wenig über Bildverständnis oder Agentenarbeit aus.
Die Standardpreistabelle nutzt direkte Entwicklertarife. Der Anbieter-Vergleich kennzeichnet OpenRouter-Endpoints, Regionen und Sondertarife separat.
Jeder Messwert verlinkt seine Messstelle und zeigt den Abrufstand. Je nach Kennzeichnung handelt es sich um eine Anbieterangabe, ein offizielles Benchmark-Leaderboard oder eine unabhängige Evaluation. Strittige oder archivierte Ergebnisse werden nicht verwendet.
Weitere Duelle
Ähnliche LLM-Vergleiche
Vergleiche Gemini 3.5 Flash und DeepSeek-V4-Flash mit weiteren wichtigen Modellen. Alle Duelle nutzen dieselbe Daten- und Benchmarklogik.