Gemini 2.5 Flash, Gemini 3.1 Pro, Gemini 3.5 Flash, 3.6 Flash und jetzt 3.7 Flash, dazu Flash-Lite und Nano. Google bringt gefühlt jede Woche ein neues Modell raus.
Da kann man schnell den Überblick verlieren. Welches Gemini-Modell brauchst du wirklich? Was unterscheidet Pro von Flash? Und ist 3.7 Flash tatsächlich günstiger als 3.6 Flash?
Ich habe alle aktuellen Gemini-Modelle für dich verglichen, von den Features über die Preise bis zu den Benchmarks. In diesem Artikel findest du alles, was du wissen musst, um das richtige Modell für deine Anwendung auszuwählen.
- Gemini 3.7 Flash (August 2026) ist Googles aktuelle Flash-Generation mit rund 1 Million Token Kontext und einem Einführungspreis von 0,75 $ / 3,75 $ pro Million Token bis Ende 2026, alle Details stehen in der Tabelle weiter unten
- Gemini 3.5 Flash bleibt parallel verfügbar und gewinnt weiterhin die meisten Agent- und Coding-Benchmarks gegen 3.1 Pro, etwa auf Terminal-Bench 2.1 und MCP Atlas
- Gemini 3.1 Pro (Februar 2026) bleibt das stärkste Reasoning-Modell mit 94,3 % auf GPQA Diamond, weitere Benchmark-Werte zeigt der Vergleich weiter unten im Artikel
- Gemini 2.5 Flash-Lite bleibt das günstigste leistungsstarke LLM am Markt, das neue Gemini 3.5 Flash-Lite bietet mehr Qualität für High-Throughput-Aufgaben, kostet dafür aber auch etwas mehr; alle Preise stehen in der Tabelle weiter unten
- Alle modernen Gemini-Modelle (ab 1.5) sind nativ multimodal und verarbeiten Text, Bilder, Audio und Video gleichzeitig mit bis zu 1 Million Token Kontext
Was sind Gemini-Modelle?
Gemini-Modelle sind Googles fortschrittliche Large Language Models, die von DeepMind und Google Research entwickelt wurden.
Was macht Gemini anders? Ein paar Dinge fallen sofort auf:
Zum einen: Native Multimodalität von Anfang an. Google hat Gemini mit Text, Bildern, Audio und Video trainiert. Nicht wie andere Anbieter, die das nachträglich reingepatcht haben. Das gibt Gemini ein viel tieferes Verständnis für alle diese Modalitäten zusammen.
Dann das Kontextfenster: Gemini 2.5 Pro verarbeitet bis zu 1 Million Token (experimentell auch 2 Millionen). Das sind ungefähr 700.000 Wörter oder über 1.400 Buchseiten. In einem einzigen Request. Das ist... sehr groß.
Google hat auch keine Ein-Modell-Strategie. Stattdessen: Nano für Smartphones, Flash für die meisten Standard-Aufgaben, Pro für anspruchsvolle Sachen. Jedes hat seinen Platz. Und weil Gemini tief in Google Search, Workspace und Android integriert ist, funktioniert es da besonders gut.
Google hat mit Gemini einen anderen Ansatz als OpenAI gewählt: Statt auf maximale Benchmark-Performance zu setzen, liegt der Fokus auf praktischer Vielseitigkeit, Multimodalität und Integration in das Google-Ökosystem.
Bevor wir uns die einzelnen Modelle anschauen, hier die wichtigsten Meilensteine der Gemini-Entwicklung von 2023 bis heute im Überblick.
Vergleich aller Gemini-Modelle
Hier ist eine detaillierte Übersicht aller Gemini-Modelle mit ihren wichtigsten Eigenschaften:
Modell | Veröffentlichung | Status | Input | Output | Cache Input |
|---|---|---|---|---|---|
| Gemini 2.0 Flash | 12/2024 | Eingestellt | 0,1 $ | 0,4 $ | 0,03 $ |
| Gemini 2.5 Flash-Lite | 06/2025 | Aktiv | 0,1 $ | 0,4 $ | 0,01 $ |
| Gemini 2.5 Flash | 04/2025 | Aktiv | 0,3 $ | 2,5 $ | 0,03 $ |
| Gemini 2.5 Pro | 03/2025 | Aktiv | 1,25 $ ≤200K / 2,5 $ >200K | 10 $ ≤200K / 15 $ >200K | 0,13 $ ≤200K / 0,25 $ >200K |
| Gemini 3 Flash | 12/2025 | Aktiv | 0,5 $ | 3 $ | 0,05 $ |
| Gemini 3 Pro | 11/2025 | Eingestellt | 2 $ ≤200K / 4 $ >200K | 12 $ ≤200K / 18 $ >200K | 0,2 $ ≤200K / 0,4 $ >200K |
| Gemini 3.1 Pro | 02/2026 | Preview | 2 $ ≤200K / 4 $ >200K | 12 $ ≤200K / 18 $ >200K | 0,2 $ ≤200K / 0,4 $ >200K |
| Gemini 3.5 Flash | 05/2026 | Aktiv | 1,5 $ | 9 $ | 0,15 $ |
| Gemini 3.6 Flash | 07/2026 | Aktiv | 0,75 $ | 3,75 $ | 0,07 $ |
| Gemini 3.7 Flash | 08/2026 | Aktiv | 0,75 $ | 3,75 $ | 0,07 $ |
| Gemini 3.5 Flash-Lite | 07/2026 | Aktiv | 0,3 $ | 2,5 $ | 0,03 $ |
| Gemini Nano-1 | 12/2023 | Aktiv | — | — | — |
| Gemini Nano-2 | 05/2024 | Aktiv | — | — | — |
Gemini-Modelle im einheitlichen Vals-AI-Testaufbau
Noch aufschlussreicher wird es, wenn man die Coding-Leistung ins Verhältnis zum API-Preis setzt und mit Claude vergleicht.
Gemini 3.7 Flash
Veröffentlicht: August 2026Gemini 3.7 Flash ist seit dem 13. August 2026 als stabiles API-Modell verfügbar. Google positioniert es für schnelle agentische Workflows, Coding und komplexe mehrstufige Aufgaben. Es verarbeitet Text, Bilder, Video, Audio und PDF-Dateien und gibt Text aus.
Das Modell bietet 1.048.576 Token Kontext und bis zu 65.536 Token Ausgabe. Beim Reasoning kannst du zwischen Low, Medium und High wählen. Dazu kommen Function Calling, strukturierte Ausgaben, Code Execution, Google-Suche, URL Context und Computer Use als Preview.
Hauptmerkmale
- Kontextfenster: 1.048.576 Token
- Maximale Ausgabe: 65.536 Token
- Wissensstand: März 2026
- Preis bis 31. Dezember 2026: 0,75 $ Input / 3,75 $ Output pro Million Token
- Context Caching: 0,075 $ pro Million gecachter Input-Token
- API-String: gemini-3.7-flash
Wichtig für die Kostenplanung:
Google weist den Preis als zeitlich begrenzten Einführungspreis aus. Ab dem 1. Januar 2027 steigen die Standardpreise laut aktueller Preistabelle auf 1,50 $ für Input und 7,50 $ für Output. Der Rechner und der Preisindex zeigen immer den aktuell gültigen Preis.
Gemini 3.6 Flash
Veröffentlicht: Juli 2026Gemini 3.6 Flash erschien am 21. Juli 2026. Es löste Gemini 3.5 Flash nicht ab, sondern wurde auf mehr Token-Effizienz getrimmt: 17 % weniger Output-Token laut Artificial Analysis Index, dazu weniger Reasoning-Schritte und Tool-Calls bei mehrstufigen Workflows. Seit August 2026 steht mit 3.7 Flash eine neuere Flash-Generation darüber.
Google hat den Preis inzwischen reduziert. Bis Ende 2026 kostet Gemini 3.6 Flash 0,75 $ für Input und 3,75 $ für Output pro Million Token. Ab dem 1. Januar 2027 nennt Google 1,50 $ / 7,50 $. Gleichzeitig wanderte der Wissensstand gegenüber 3.5 Flash deutlich nach vorn, von Januar 2025 auf März 2026.
Hauptmerkmale
- Token-effizienter: 17 % weniger Output-Token als 3.5 Flash, weniger Reasoning-Schritte und Tool-Calls
- Agentisches Coding: 58,7 % auf SWE-Bench Pro (3.5 Flash 55,1 %, 3.1 Pro 54,2 %)
- Computer Use: 83 % auf OSWorld-Verified (vorher 78,4 %)
- DeepSWE: 49 % (vorher 37 %), MLE-Bench: 63,9 %
- 1 Million Token Kontext, Wissensstand März 2026 (vorher Januar 2025)
- Preis bis Ende 2026: 0,75 $ Input / 3,75 $ Output pro Million Token
- Context Caching: 0,075 $ für gecachte Inputs
- API-String: gemini-3.6-flash
Was macht Gemini 3.6 Flash besonders?
Gemini 3.6 Flash ist kein reiner Benchmark-Sprung, sondern eine Effizienz-Generation: Bei vergleichbarer oder leicht besserer Qualität braucht das Modell spürbar weniger Output-Token und Tool-Calls, um zum Ergebnis zu kommen. Bei agentischen Workflows mit vielen Zwischenschritten macht sich das direkt im Preis bemerkbar.
Verfügbar ist Gemini 3.6 Flash seit dem 21. Juli 2026 in der Gemini-App, für Entwickler über Google Antigravity, AI Studio, Android Studio sowie über die Gemini API und Vertex AI.
Gemini 3.5 Flash-Lite
Veröffentlicht: Juli 2026Gemini 3.5 Flash-Lite ist Googles neuestes Lite-Modell, angekündigt am 21. Juli 2026 und damit dem Vorgänger 3.1 Flash-Lite (Februar 2026) sowie dem älteren 2.5 Flash-Lite überlegen. Es ist auf High-Throughput- und Low-Latency-Aufgaben zugeschnitten, etwa agentische Suche und Dokumentenverarbeitung.
Die Qualität liegt deutlich über 3.1 Flash-Lite: Auf Terminal-Bench 2.1 erreicht das Modell 54 % statt 31 %, ein Sprung um 23 Prozentpunkte. Auch bei Coding- und Computer-Use-Aufgaben zieht es an vielen größeren Vorgängermodellen vorbei.
Hauptmerkmale
- Terminal-Bench 2.1: 54 % (3.1 Flash-Lite 31 %)
- Agentisches Coding: 54,2 % auf SWE-Bench Pro (Gemini 3 Flash 49,6 %)
- Computer Use: 74,0 % auf OSWorld-Verified (vorher 65,1 %)
- Long Context: 72,2 % auf GDM-MRCR v2
- 1 Million Token Kontext
- Preis: 0,30 $ Input / 2,50 $ Output pro Million Token
- Context Caching: 0,03 $ für gecachte Inputs
- API-String: gemini-3.5-flash-lite
Was macht Gemini 3.5 Flash-Lite besonders?
Gemini 3.5 Flash-Lite zeigt, wie schnell sich die Lite-Reihe weiterentwickelt: Für High-Throughput-Anwendungen wie Massen-Klassifizierung oder Agenten mit vielen kleinen Zwischenschritten bietet es spürbar mehr Qualität als 3.1 Flash-Lite, bei ähnlich niedrigem Preis. Für die absolut günstigste Option bleibt trotzdem Gemini 2.5 Flash-Lite die richtige Wahl.
Verfügbarkeit: Gemini 3.5 Flash-Lite ist seit dem 21. Juli 2026 in der Gemini-App und über die Gemini API verfügbar. Die Integration in Google Search ist angekündigt, aber noch nicht ausgerollt.
Gemini 3.5 Flash
Veröffentlicht: Mai 2026Gemini 3.5 Flash ist Googles agentische Flash-Generation, vorgestellt auf der Google I/O 2026 (19. Mai 2026). Mittlerweile ist mit Gemini 3.6 Flash ein noch token-effizienteres Flash-Modell dazugekommen, 3.5 Flash bleibt aber unverändert verfügbar. Es bringt Spitzenperformance in agentischen Aufgaben und schlägt Gemini 3.1 Pro auf mehreren Coding- und Agent-Benchmarks, kostet aber nur einen Bruchteil.
Hauptmerkmale
- Agentisches Coding: 76,2 % auf Terminal-Bench 2.1 (schlägt 3.1 Pro mit 70,3 %)
- Tool Use: 83,6 % auf MCP Atlas
- Multimodal-Reasoning: 84,2 % auf CharXiv Reasoning
- ~4x schneller bei Output-Tokens als vergleichbare Spitzenmodelle
- 1 Million Token Input, bis zu 64.000 Token Output
- Multimodal: Text, Bilder, Audio, Video und PDF
- Preis: 1,50 $ Input / 9 $ Output pro Million Token
- Context Caching: 0,15 $ für gecachte Inputs (90 % Rabatt)
- API-String: gemini-3.5-flash
Was macht Gemini 3.5 Flash besonders?
Gemini 3.5 Flash ist das erste Flash-Modell, das in agentischen Workflows mit Pro-Tier-Modellen konkurriert. Es gewinnt 11 von 15 publizierten Benchmarks gegen Gemini 3.1 Pro, gerade dort, wo Tool-Calls, Long-Running-Tasks oder Browser-Agents gefragt sind. Bei reinem Reasoning bleibt 3.1 Pro vorne (Humanity's Last Exam, ARC-AGI-2), aber für die meisten Coding- und Agent-Anwendungen ist 3.5 Flash die bessere und deutlich günstigere Wahl.
Auch die API-Schnittstelle hat sich geändert: Statt eines numerischen `thinking_budget` gibt es jetzt ein String-Enum `thinking_level` mit den Werten minimal, low, medium (neuer Standardwert) und high. Wer aus 3 Flash migriert, sollte explizit auf high stellen, sonst denkt das Modell weniger als gewohnt.
Verfügbarkeit: Gemini 3.5 Flash ist seit dem 19. Mai 2026 allgemein verfügbar über die Gemini API, Google AI Studio, Vertex AI, Google Antigravity, AI Mode in Google Search und die Gemini-App. Computer Use wird auf 3.5 Flash noch nicht unterstützt, dafür bleibt gemini-3-flash-preview die Option. Gemini 3.5 Pro wurde angekündigt, ein konkretes Erscheinungsdatum hat Google bislang nicht bestätigt.
Gemini 3.1 Pro
Veröffentlicht: Februar 2026Gemini 3.1 Pro ist Googles leistungsstärkstes Reasoning-Modell und markiert einen massiven Sprung gegenüber allen Vorgängern. Seit Februar 2026 ist es allgemein verfügbar über die Gemini API, Google AI Studio und Vertex AI.
Hauptmerkmale
- 2x Reasoning-Sprung gegenüber Gemini 3 Pro in komplexen Aufgaben
- 94,3 % auf GPQA Diamond (PhD-Level Reasoning), neuer Bestwert
- 80,6 % auf SWE-bench Verified (agentic Coding)
- 1 Million Token Input, bis zu 64.000 Token Output
- Multimodal: Text, Bilder, Audio, Video und PDF
- Gestaffelte API-Preise: 2,00 $ / 12,00 $ pro Million Tokens unter 200.000 Token Kontext, 4,00 $ / 18,00 $ darüber
- Context Caching: 90 % Rabatt auf gecachte Input-Tokens (0,20 $ / 0,40 $)
- API-String: gemini-3.1-pro
Was macht Gemini 3.1 Pro besonders?
Gemini 3.1 Pro setzt neue Maßstäbe im Reasoning: Mit 94,3 % auf GPQA Diamond übertrifft es alle bisherigen Gemini-Modelle deutlich. Der 2x Reasoning-Sprung gegenüber Gemini 3 Pro zeigt sich besonders bei komplexen wissenschaftlichen Fragestellungen, mehrstufigen Programmieraufgaben und analytischen Herausforderungen.
Auch beim agentic Coding liefert Gemini 3.1 Pro mit 80,6 % auf SWE-bench Verified eine neue Bestmarke. Es kann eigenständig komplexe Software-Probleme lösen, Code umbauen und Multi-File-Änderungen durchführen.
Verfügbarkeit: Gemini 3.1 Pro ist seit Februar 2026 allgemein über die Gemini API in Google AI Studio, Vertex AI und Gemini Enterprise verfügbar. Es wird als Premium-Modell für anspruchsvolle Research-, Code- und Analyse-Aufgaben positioniert.
Gemini 3 Flash
Veröffentlicht: Dezember 2025Gemini 3 Flash ist Googles ausgewogenes Modell, das Spitzenintelligenz mit hoher Geschwindigkeit und niedrigen Kosten kombiniert. Seit Dezember 2025 allgemein verfügbar, ist es das Standard-Modell in der Gemini-App.
Hauptmerkmale
- Spitzenperformance: 90,4 % auf GPQA Diamond (PhD-Level Reasoning), 81,2 % auf MMMU Pro
- Agentic Coding: 78 % auf SWE-bench Verified
- 3x schneller als Gemini 2.5 Pro bei vergleichbarer Qualität
- 15 % besser als Gemini 2.5 Flash in der Gesamtgenauigkeit
- 1 Million Token Input, bis zu 64.000 Token Output
- Multimodal: Text, Bilder, Audio, Video und PDF
- Preis: 0,50 $ Input / 3,00 $ Output pro Million Token
- Context Caching: 90 % Kostenreduktion auf gecachte Tokens (0,05 $ Input)
- API-String: gemini-3-flash
Was macht Gemini 3 Flash besonders?
Gemini 3 Flash bringt Spitzenintelligenz in ein schnelles, kosteneffizientes Paket. In Benchmarks erreicht es PhD-Level-Reasoning (90,4 % GPQA Diamond) und rivalisiert damit deutlich teurere Modelle.
Google hat Gemini 3 Flash mit neuen Features ausgestattet: Ein „Thinking Level“-Parameter steuert, wie viel internes Reasoning das Modell verwendet. Der „Media Resolution“-Parameter (low bis ultra-high) optimiert die Verarbeitung von Bildern und Videos für verschiedene Anwendungsfälle.
Verfügbarkeit: Gemini 3 Flash ist allgemein über die Gemini API in Google AI Studio, Vertex AI und Gemini Enterprise verfügbar. Es ist das Standard-Modell in der Gemini-App und AI Mode in Google Search. Unternehmen wie JetBrains, Bridgewater Associates und Figma setzen es produktiv ein.
Gemini 3 Pro
Veröffentlicht: November 2025Gemini 3 Pro war die dritte Generation von Googles Premium-KI-Modell mit Spitzenintelligenz, Deep Research und Premium-Performance. Von November 2025 bis März 2026 allgemein verfügbar.
Hauptmerkmale
- Spitzenintelligenz von Google DeepMind
- Verbesserte Reasoning-Fähigkeiten gegenüber Gemini 2.5 Pro
- Deep Research für komplexe, mehrstufige Analysen
- Multimodale Verbesserungen besonders bei Video-Verständnis
- 1 Million Token Kontextfenster (Input), bis zu 64.000 Token Output
- Gestaffelte API-Preise: 2,00 $ / 12,00 $ pro Million Tokens unter 200.000 Token Kontext, 4,00 $ / 18,00 $ darüber
- API-String: gemini-3-pro
Verfügbarkeit: Gemini 3 Pro wurde von Gemini 3.1 Pro abgelöst und im März 2026 eingestellt. Wer heute Premium-Performance braucht, greift direkt zu Gemini 3.1 Pro.
Gemini 2.5 Pro
Veröffentlicht: März 2025Gemini 2.5 Pro war bis Ende 2025 Googles Premium-Variante und bleibt eine solide Wahl für anspruchsvolle Aufgaben. (Mehr zur Gemini API findest du in unserem separaten Guide.)
Was bietet Pro konkret?
- Performance auf dem aktuellen Stand der Technik bei komplizierten Reasoning- und Code-Aufgaben
- 1 Million Token Kontextfenster (experimentell auch 2 Millionen)
- Gestaffelte Preise: 1,25 $ / 10 $ für Standard-Prompts (≤ 200K Token), 2,50 $ / 15 $ für längere
- Native Multimodalität: Text, Bilder, Audio, Video zusammen verarbeiten
- Prompt Caching mit 90 % Rabatt auf gecachte Inputs (0,125 $ / 0,25 $ statt 1,25 bis 2,50 $)
- API-Model-String: gemini-2.5-pro
Was macht Gemini 2.5 Pro besonders?
Gemini 2.5 Pro ist Googles Antwort auf die damaligen Claude 4 Opus und GPT-4o. Es bietet vergleichbare Performance bei komplexen Reasoning-Aufgaben und übertrifft beide Konkurrenten bei der Verarbeitung sehr langer Kontexte. Das 1-Million-Token-Fenster ermöglicht die Analyse kompletter Bücher, großer Codebasen oder stundenlanger Video-Transkripte in einem einzigen API-Call.
Die gestaffelte Preisstruktur ist konkurrenzfähig: Für die meisten Standard-Prompts bis 200.000 Token zahlst du nur 1,25 $ / 10 $. Damit liegt Gemini 2.5 Pro beim Input-Preis wie beim Output-Preis deutlich unter Claude Opus 5, das 5 $ / 25 $ verlangt.
Wo bekommst du es? Die Google AI API, Google AI Studio, Vertex AI oder Google Cloud.
Wann brauchst du Pro? Wenn du ganze Codebases analysieren, lange Research-Paper durchforsten, dickwandige Verträge zusammenfassen oder Stunden-Videos in einem Shot verarbeiten willst. Das ist nicht für Chatbots gedacht. Dafür ist Flash da und günstiger.
Gemini 2.5 Flash
Veröffentlicht: April 2025Gemini 2.5 Flash ist die ausgewogene Variante, der Modell-Evergreen der 2.5-Serie. Es liefert 90 % der Pro-Leistung, kostet aber einen Bruchteil und ist deutlich schneller.
Die Eckdaten:
- 90 % der Pro-Performance bei einem Bruchteil der Kosten
- 2 bis 3x schneller als Pro (Inferenz-Speed)
- 1 Million Token Kontext
- 0,30 $ Input / 2,50 $ Output pro Million Token
- Prompt Caching: 0,03 $ für gecachte Inputs
- Multimodal: Text, Bilder, Audio, Video
- API-String: gemini-2.5-flash
Was macht Gemini 2.5 Flash besonders?
Gemini 2.5 Flash ist das ideale Produktionsmodell für 90 % aller Anwendungsfälle. Es bietet nahezu dieselbe Qualität wie Pro, aber bei 80 % niedrigeren Kosten und 2-3x schnellerer Response-Zeit. Dies macht es perfekt für Chatbots, Content-Generierung und Automatisierungs-Workflows, wo schnelle Antworten wichtiger sind als die absolut höchste Präzision.
Im Vergleich zu ChatGPT GPT-4o (2,50 $ / 10 $ pro Million Token) bietet Gemini 2.5 Flash bei ähnlicher Qualität 75 bis 88 % Kostenersparnis, ein starkes Preis-Leistungs-Verhältnis.
Du findest Flash über Google AI API, Google AI Studio, Vertex AI und Google Cloud. Es ist das Backend-Modell für viele Google-Produkte.
Konkrete Nutzung: Chatbots, die schnell antworten müssen. Content-Generierung (Artikel, Marketing-Texte, Social Posts). Datenextraktion aus ungeordneten Quellen. E-Mail-Klassifizierung, Sentiment-Analysen, Zusammenfassungen. Screenshot-Verständnis und OCR. Für all das brauchst du nicht Pro, Flash reicht aus und spart Geld.
Gemini 2.5 Flash-Lite
Veröffentlicht: Juni 2025Gemini 2.5 Flash-Lite ist was Sache: Das billigste brauchbare LLM am Markt. Und gleichzeitig extrem schnell.
Die wichtigsten Zahlen:
- 0,10 $ Input / 0,40 $ Output pro Million Token (billigste am Markt)
- 5x schneller als Pro-Modelle
- Trotzdem 70 bis 80 % der Flash-Performance
- 1 Million Token Kontext
- Prompt Caching: 0,01 $ für gecachte Inputs
- Multimodal: Text, Bilder, Audio, Video
- API-String: gemini-2.5-flash-lite
Warum ist das so interessant? Es ist rund ein Drittel billiger als GPT-4o-mini, das 0,15 $ / 0,60 $ kostet, und nur ein Bruchteil des Preises von Claude 4.5 Haiku mit 1 $ / 5 $. Und es ist nicht langsam, eher das Gegenteil.
Die Qualität? 70 bis 80 % der Flash-Performance für Chatbot-Responses, einfache Textgenerierung und Klassifizierung. Wenn du Millionen von API-Calls täglich brauchst, sind die Kostenersparnisse enorm.
Wo findest du es? Google AI API, Google AI Studio, Vertex AI.
Einsatzszenarien: Chatbots mit Millionen täglich. Content-Moderation im großen Stil. Sentiment-Analysen, Kategorisierung, Tags. Echtzeitanwendungen, wo low Latency wichtig ist. Massive Batch-Processing mit kleinem Budget.
Gemini 2.0 Flash
Veröffentlicht: Dezember 2024Gemini 2.0 Flash ist die ältere Version von Flash und wurde im Juni 2026 eingestellt. Ihr großer Vorteil war der kostenlose API-Tier mit Rate Limits.
Kurzinfo (Stand bis zur Einstellung):
- Kostenloser Tier (Rate Limits: 15 req./min, 1.500 /Tag, 1 Mio /Monat) oder bezahlter Tier: 0,10 $ / 0,40 $ pro Million Token
- ~80 % der 2.5-Flash-Performance
- 1 Million Token Kontext
- Multimodal: Text, Bilder, Audio
- API-String: gemini-2.0-flash
Wer 2.0 Flash noch in Alt-Projekten nutzt, migriert auf 2.5 Flash. Für kostenloses Prototyping bleibt der Free-Tier in Google AI Studio.
Gemini 1.5 Pro
Veröffentlicht: Februar 2024Gemini 1.5 Pro war 2024 ein großes Ding: Erstes Modell mit 2 Millionen Token Kontext. Das war damals Weltrekord.
Heute: Es wird am 30. April 2025 abgeschaltet. Wenn du noch 1.5 Pro nutzt, migriere auf 2.5 Pro. Bessere Performance, weniger Ärger.
Was 1.5 hatte: 2 Millionen Token (beeindruckend damals). Native Multimodalität. Starke Video- und Dokumentanalyse. Aber das war 2024.
Gemini 1.5 Flash
Veröffentlicht: Mai 2024Gemini 1.5 Flash war quasi die günstigere, schnellere Version von 1.5 Pro. Auch deprecated.
Die Facts: 1 Million Token Kontext. Schnell, niedrige Kosten. Multimodal. Aber auch am 30. April 2025 offline. Nutzer sollten auf 2.5 Flash wechseln.
Gemini 1.0 Pro und Ultra
Veröffentlicht: Dezember 2023Gemini 1.0 war der erste Versuch. Heute: Nicht mehr relevant.
Was war's? 32.000 Token Kontext. Text-only, keine Bilder/Videos. Pro war Standard, Ultra war Premium. Beide sind längst weg. Google hat sie schnell durch 1.5 und 2.x ersetzt. Viel bessere Modelle.
Gemini Nano
Veröffentlicht: Dezember 2023 / Mai 2024Gemini Nano ist anders: On-Device KI für Smartphones. Läuft lokal, keine Cloud.
Was wichtig ist:
- On-Device: Direkt auf Smartphones, kein Cloud-Call
- Zwei Varianten: Nano-1 (text-only) und Nano-2 (multimodal)
- 4.000 Token Kontext (klein, aber reicht für Smartphone-Aufgaben)
- Datenschutz: Alles bleibt lokal
- Hardware: Pixel Smartphones, Samsung Galaxy S24+, weitere Android-Devices
- Einsatz: Smart Reply, Live-Transkription, Offline-Übersetzung, Foto-Bearbeitung
Verfügbar: Bereits in verschiedenen Android-Phones integriert. Google rollt es per System-Update aus. Entwickler können AICore API nutzen.






