Gemini 3.6 Flash: Benchmarks, Preise, Verfügbarkeit und was sich geändert hat
Google hat Gemini 3.6 Flash am 21. Juli 2026 als neuen Allzweck-Arbeitspferd seiner Flash-Reihe veröffentlicht. Das Modell zielt auf Coding, multimodale Analyse, Computer-Nutzungsagenten und mehrstufige Tool-Workflows ab, während der Verbrauch der Ausgabetokens reduziert und der Preis der Ausgabetokens im Vergleich zu Gemini 3.5 Flash gesenkt wird.
Die Spitzenwerte sind beachtlich: Google meldet 49 % bei DeepSWE, 63,9 % bei MLE-Bench und 83,0 % bei OSWorld-Verified. Standard-API-Preise betragen 1,50 $ pro Million Eingabetokens und 7,50 $ pro Million Ausgabetokens. Dieser Leitfaden erklärt die Benchmarks, Preisstufen, Verfügbarkeit, API-Änderungen, unterstützten Tools und die praktischen Gründe für eine Migration.
Wichtigste Erkenntnisse
- Veröffentlichung: Gemini 3.6 Flash ist seit dem 21. Juli 2026 allgemein verfügbar.
- Modell-ID: Der stabile API-Modellcode für Gemini lautet
gemini-3.6-flash. - Preise: Der Standardpreis beträgt 1,50 $ pro Million Eingabetokens und 7,50 $ pro Million Ausgabetokens.
- Effizienz: Google meldet 17 % weniger Ausgabetokens im Artificial Analysis Index und bis zu 65 % weniger bei DeepSWE als Gemini 3.5 Flash.
- Kontext: Das Modell akzeptiert bis zu 1.048.576 Eingabetokens und erzeugt bis zu 65.536 Ausgabetokens.
- Verfügbarkeit: Es ist über die Gemini API, Google AI Studio, Android Studio, Google Antigravity, Gemini Enterprise und die Gemini App verfügbar.
Gemini 3.6 Flash im Überblick
| Kategorie | Gemini 3.6 Flash |
|---|---|
| Hauptrolle | Schnelles Allzweck-Reasoning-Modell für Agenten- und multimodale Workloads |
| Stabile API-Kennung | gemini-3.6-flash |
| Standarddenkniveau | Mittel |
| Eingabemodalitäten | Text, Bild, Video, Audio und PDF |
| Ausgabemodalität | Text |
| Produktionsstatus | Allgemein verfügbar |
Was ist Gemini 3.6 Flash?
Gemini 3.6 Flash ist ein proprietäres multimodales Reasoning-Modell aus Googles auf Geschwindigkeit und Effizienz ausgerichteter Flash-Familie. Google positioniert es für reale Agenten-Workloads: Code-Generierung, Funktionsaufrufe, Computernutzung, räumliches Reasoning, Dokumentenanalyse und Workflows, die mehrere Schritte erfordern, bevor eine endgültige Antwort bereitsteht.
Das Modell ist nicht einfach nur eine umbenannte 3.5-Version. Google gibt an, dass es auf der Grundlage von Entwicklerfeedback hinsichtlich Wortreichtum, unerwünschten Codeänderungen und Ausführungsschleifen, die zusätzliche Reasoning-Tokens und Tool-Aufrufe verbrauchten, abgestimmt wurde. Die beabsichtigte Verbesserung ist daher zweifach: bessere Aufgabenqualität und geringerer Aufwand zur Erzielung des Ergebnisses.
For developers starting with Google’s platform, Zerlo’s Leitfaden zum Erhalt eines Gemini API-Schlüssels erklärt die Einrichtung des Kontos und von Google AI Studio. Der auszuwählende Modellname in einer API-Anfrage lautet gemini-3.6-flash.
Was hat sich gegenüber Gemini 3.5 Flash geändert?
| Bereich | Änderung Gemini 3.6 Flash | Praktische Auswirkung |
|---|---|---|
| Coding | Höhere Präzision, weniger unbeabsichtigte Dateianpassungen und weniger Debugging-Schleifen | Besser geeignet für Migrationen und iterative Agenten-Entwicklung |
| Token-Effizienz | Weniger Ausgabetokens, Reasoning-Schritte, Turns und Tool-Aufrufe | Potenziell geringere Kosten pro abgeschlossener Aufgabe, nicht nur pro Token |
| Multimodales Reasoning | Verbesserte Diagramminterpretation, Blaupausenkonvertierung und Verständnis von Mehrelement-Layouts | Stärkere Dokumentations-, visuelle und räumliche Workflows |
| Computernutzung | Native Tool-Unterstützung, derzeit in der Modell-Dokumentation als Vorschau markiert | Kann unterstützte Browser- und Schnittstellen-Automatisierungs-Workflows antreiben |
| Ausgabepreise | 7,50 $ pro Million Tokens statt 9,00 $ für Gemini 3.5 Flash | Eine Reduzierung des Standard-Ausgabetoken-Preises um 16,7 % |
| API-Konfiguration | Sampling-Parameter wie temperature, top_p und top_k sind veraltet |
Bestehende Integrationen erfordern eine Konfigurationsprüfung, nicht nur eine Änderung der Modell-ID |
Es gibt eine Nuance für die Frontend-Arbeit. Die Migrationsdokumentation von Google besagt, dass Gemini 3.6 Flash dazu neigt, ein Projekt programmatisch zu analysieren, bevor Änderungen vorgenommen werden. Das kann die Korrektheit bei komplexen Aufgaben verbessern, kann aber bei einer einfachen visuellen Bearbeitung explorative Schritte hinzufügen. Google merkt auch an, dass menschliche Bewerter früher Modelle für das Styling manchmal bevorzugten, sodass explizite Designanweisungen weiterhin wertvoll sind.
Gemini 3.6 Flash Benchmarks
Die Launch-Daten von Google zeigen Fortschritte gegenüber Gemini 3.5 Flash bei Coding-, Machine-Learning-Engineering-, Wissensarbeit- und Computer-Nutzungsaufgaben. Diese Benchmarks verwenden unterschiedliche Bewertungsmethoden, sodass ihre Werte nicht zu einem Gesamtdurchschnittsprozentsatz gemittelt werden sollten. Jedes Ergebnis ist ein Beleg für einen bestimmten Aufgabentyp.
| Benchmark | Was er testet | Gemini 3.5 Flash | Gemini 3.6 Flash |
|---|---|---|---|
| DeepSWE v1.1 | Langfristige Software-Engineering-Agenten | 37% | 49% |
| MLE-Bench | Aufgaben im Bereich Machine-Learning-Engineering und -Forschung | 49.7% | 63.9% |
| OSWorld-Verified | Computernutzung in realen Desktop-Umgebungen | 78.4% | 83.0% |
| GDPval-AA v2 | Qualität bei Wissensarbeitsaufgaben | 1349 | 1421 |

Quelle: blog.google
Die stärksten veröffentlichten Gewinne zeigen sich im langfristigen Software-Engineering und im Machine-Learning-Engineering, während sich auch die Leistung bei der Computernutzung verbessert.
Wie diese Benchmark-Ergebnisse zu lesen sind
- DeepSWE ist wichtig für autonomes Coding: es ist relevanter für Repository-weite Arbeiten als eine kurze, eigenständige Coding-Frage.
- MLE-Bench misst einen Spezialisten-Workflow: das Ergebnis ist nützlich für Data-Science- und Machine-Learning-Agenten, aber keine allgemeine Chatbot-Bewertung.
- OSWorld-Verified testet Aktionen: eine höhere Punktzahl unterstützt die Geschichte der Computernutzung, obwohl die zugehörige API-Funktion immer noch als Vorschau markiert ist.
- GDPval-AA ist keine Prozentzahl: es handelt sich um eine vergleichende Bewertung von Wissensarbeitsaufgaben und sollte im Rahmen der Methodik dieses Benchmarks interpretiert werden.
Token-Effizienz ist Teil der Benchmark-Story
Rohe Aufgabenergebnisse zeigen nicht, wie viele Tokens oder Tool-Aufrufe zur Erreichung des Ergebnisses benötigt wurden. Google gibt an, dass Gemini 3.6 Flash auf dem Artificial Analysis Intelligence Index 17 % weniger Ausgabetokens erzeugt hat als Gemini 3.5 Flash. Bei DeepSWE meldet das Unternehmen eine größere Reduzierung: Die durchschnittlichen Ausgabetokens pro Aufgabe fielen von etwa 276.000 auf 97.000, was einer Verringerung von etwa 65 % entspricht.
Artificial Analysis listet unabhängig voneinander die High-Thinking-Konfiguration von Gemini 3.6 Flash mit einer Intelligence Index-Bewertung von 50 und einem Kontextfenster von einer Million Tokens auf. Die Benchmark-Ergebnisse können sich ändern, wenn Bewerter Prompts, Harnesses und Modellversionen aktualisieren. Daher ist das Testen in der Produktion mit repräsentativen Aufgaben wichtiger als eine Spitzenposition auf einer Rangliste.

Quelle: blog.google
Reduzierte Ausgabetoken-Nutzung kann die Kosten für lange Agentenschleifen senken, insbesondere wenn das Modell wiederholt denkt, Dateien bearbeitet und Tools aufruft, bevor es fertig ist.
Gemini 3.6 Flash Preise
Der Standardpreis von Google beträgt 1,50 $ pro Million Eingabetokens und 7,50 $ pro Million Ausgabetokens. Der Eingabepreis ist gegenüber Gemini 3.5 Flash unverändert, während der Ausgabepreis von 9,00 $ auf 7,50 $ sinkt. Cache-Eingaben werden auf der Preisgestaltungsseite der Google Cloud Agent Platform mit 0,15 $ pro Million Tokens aufgeführt.
| Verbrauchsoption | Eingabe pro 1 Mio. Tokens | Ausgabe pro 1 Mio. Tokens | Typische Nutzung |
|---|---|---|---|
| Standard | $1.50 | $7.50 | Normaler interaktiver und produktiver API-Verkehr |
| Priorität | $2.70 | $13.50 | Workloads, die für priorisierte Inferenzkapazität mehr bezahlen |
| Flex oder Batch | $0.75 | $3.75 | Verzögerungstolerante oder asynchrone Verarbeitung |
Beispielhafte Berechnungen für Standardpreise
| Monatliches Nutzungsbeispiel | Eingabekosten | Ausgabekosten | Geschätzte Gesamtkosten |
|---|---|---|---|
| 10 Mio. Eingabe- und 1 Mio. Ausgabetokens | $15.00 | $7.50 | $22.50 |
| 50 Mio. Eingabe- und 5 Mio. Ausgabetokens | $75.00 | $37.50 | $112.50 |
| 100 Mio. Eingabe- und 20 Mio. Ausgabetokens | $150.00 | $150.00 | $300.00 |
Diese Beispiele beziehen sich nur auf Modell-Tokens. Suchanfragen, Computernutzung, Codeausführung, externe Dienste und andere Plattformkomponenten können Kosten oder Latenz hinzufügen. Die nützlichste interne Metrik ist daher der Kosten pro erfolgreich abgeschlossener Aufgabe, einschließlich Wiederholungsversuchen und Tool-Aufrufen, und nicht allein der angegebene Token-Preis.
Verfügbarkeit: Wo kann man Gemini 3.6 Flash nutzen?
Gemini 3.6 Flash war ab dem Starttag über Googles Consumer-, Entwickler- und Enterprise-Oberflächen verfügbar. Genaue Nutzungslimits, regionale Zugriffsrechte und Modellwahlkontrollen können je nach Produkt, Abonnement und Konto variieren.
| Benutzergruppe | Verfügbar über | Wichtige Details |
|---|---|---|
| Entwickler | Gemini API, Google AI Studio und Android Studio | Verwenden Sie die stabile Modell-ID gemini-3.6-flash |
| Agentenentwickler | Google Antigravity und Gemini Managed Agents | Google hat 3.6 Flash zum Standardmodell für den Antigravity Managed Agent gemacht |
| Unternehmen | Gemini Enterprise Agent Platform und die Gemini Enterprise App | Es gelten Rechnungsstellung, Governance und Regionaleinstellungen für Unternehmen |
| Allgemeine Benutzer | Gemini App | Zugriff und Nutzungslimits können vom Konto und der Abonnementstufe abhängen |

Quelle: blog.google
AI Studio-Logs und Datensätze können Teams helfen, das Modellverhalten zu vergleichen, fehlgeschlagene Anfragen zu prüfen und wiederholbare Auswertungsdatensätze zu erstellen, bevor eine Produktionsbereitstellung geändert wird.
Gemini 3.6 Flash sollte nicht mit Gemini 3.5 Flash-Lite oder Gemini 3.5 Flash Cyber verwechselt werden. Flash-Lite ist die kostengünstigere Option mit hohem Durchsatz. Flash Cyber ist ein spezialisiertes Sicherheitsmodell, das für Regierungen und vertrauenswürdige Partner über ein Pilotprojekt mit eingeschränktem Zugang namens CodeMender geplant ist, kein allgemein verfügbarer Ersatz für 3.6 Flash.
Kontextfenster, Eingaben und unterstützte Tools
| Spezifikation | Gemini 3.6 Flash |
|---|---|
| Eingabetypen | Text, Bild, Video, Audio und PDF |
| Ausgabetyp | Text |
| Eingabetoken-Limit | 1.048.576 Tokens |
| Ausgabetoken-Limit | 65.536 Tokens |
| Unterstützte Funktionen | Caching, Codeausführung, Dateisuche, Funktionsaufrufe, Suchanbindung, Maps-Anbindung, strukturierte Ausgabe, Denken und URL-Kontext |
| Computernutzung | Unterstützt in der Vorschau |
| Verbrauchsoptionen | Standard, Batch-API, Flex-Inferenz und Priority-Inferenz |
| Nicht unterstützt | Bildgenerierung, Audiogenerierung und die Live-API |
Das Kontextfenster mit einer Million Tokens ist nützlich für große Dokumentensätze, Code-Repositorys, Transkripte und multimodale Aufzeichnungen. Es garantiert keine perfekte Wiedergabe über jede Position in einem langen Prompt hinaus, und das Senden des maximalen Kontexts kann die Kosten und Latenz erhöhen. Abruf, Dateisuche und Prompt-Segmentierung können dennoch ein zuverlässigeres Produktionssystem ergeben.

Quelle: blog.google
Die Dateisuche ist eines der integrierten Tools, die von Gemini 3.6 Flash unterstützt werden und Antworten auf der Grundlage indexierter Projektdokumente verankern können, anstatt jede Datei direkt in jeden Prompt zu legen.
Welche integrierten Tools sind am wichtigsten?
- Dateisuche: nützlich für den Abruf interner Dokumente, Handbücher und Wissensdatenbanken.
- Codeausführung: ermöglicht dem Modell, Daten zu berechnen, zu transformieren und Teile einer Antwort programmatisch zu überprüfen.
- Funktionsaufruf: verbindet das Modell mit anwendungsspezifischen Aktionen und Datenquellen.
- Google Suche und Maps Anbindung: fügt, wo unterstützt, aktuelle oder standortbezogene Informationen hinzu.
- Computernutzung: ermöglicht die Automatisierung von Benutzeroberflächen, bleibt aber eine Vorschaufunktion und erfordert sorgfältige Berechtigungen und Validierungen.
Checkliste für die Migration zu Gemini 3.6 Flash
- Ändern Sie die Zielmodell-ID in
gemini-3.6-flashin einer Testumgebung. - Entfernen Sie veraltete Sampling-Felder wie
temperature,top_pundtop_k. - Ersetzen Sie ältere Einstellungen für das Denkbudget durch eine geeignete
thinking_level. - Entfernen Sie vorab ausgefüllte Modell-Turns und überprüfen Sie die Handhabung des Multi-Turn-Zustands.
- Testen Sie Funktionsaufrufe, Tool-Antworten und strukturierte Ausgabeschemata erneut.
- Vergleichen Sie Aufgabenerfolg, Latenz, Eingabetokens, Ausgabetokens, Turns und Tool-Aufrufe mit dem aktuellen Produktionsmodell.
- Verwenden Sie eine gestaffelte Einführung und behalten Sie einen Rollback-Pfad bei, bis repräsentative Workloads stabil sind.
Sollten Sie von Gemini 3.5 Flash migrieren?
Gemini 3.6 Flash ist das logische Migrationsziel, wenn eine Anwendung von Coding-Agenten, mehrstufigen Tool-Nutzungen, Computerinteraktion, Dokumentenanalyse oder visuellen und räumlichen Analysen abhängt. Der niedrigere Ausgabepreis und die geringere Neigung zu Schleifen sind besonders relevant für Agenten, die das Modell wiederholt aufrufen können, bevor eine Benutzeranfrage abgeschlossen ist.
| Workload | Beste aktuelle Richtung | Grund |
|---|---|---|
| Repository-ebenen Coding-Agent | Testen Sie Gemini 3.6 Flash | Verbesserte Coding-Präzision und weniger Ausführungsschleifen |
| Multimodale Dokumenten- und Diagrammanalyse | Testen Sie Gemini 3.6 Flash | Stärkere veröffentlichte multimodale Ergebnisse und Ergebnisse bei Wissensarbeit |
| Hochvolumige Klassifizierung oder Extraktion | Vergleichen Sie mit Gemini 3.5 Flash-Lite | Flash-Lite ist für kostengünstigen Durchsatz konzipiert |
| Bildgenerierung | Wählen Sie ein anderes Gemini-Modell | Gemini 3.6 Flash erzeugt nur Textausgaben |
| Echtzeit-Sprachanwendung | Verwenden Sie ein mit der Live-API kompatibles Modell | Die Live-API wird von Gemini 3.6 Flash nicht unterstützt |
| Stabile Legacy-Pipeline ohne Qualitätsprobleme | Benchmark vor der Migration | Eine Änderung ist nur nützlich, wenn Qualität, Latenz oder Kosten sich für den tatsächlichen Workload verbessern |
Für eine breitere Modell-Auswahlperspektive, Zerlos Technischer Vergleich Gemini vs. Claude erklärt die unterschiedlichen Kompromisse zwischen Googles Ökosystem und Anthropic-Modellen. Benutzer, die sich auf wiederverwendbare Assistenten anstelle von API-Bereitstellungen konzentrieren, finden möglicherweise auch den Gemini Gems Leitfaden nützlich.
FAQ
Wann wurde Gemini 3.6 Flash veröffentlicht?
Google kündigte und veröffentlichte Gemini 3.6 Flash am 21. Juli 2026. Es wurde allgemein über Gemini-Produkte für Entwickler, Unternehmen und Verbraucher verfügbar.
Wie lautet der API-Modellname für Gemini 3.6 Flash?
Die stabile Modell-ID lautet gemini-3.6-flash. Die Modell-Dokumentation von Google listet sie als stabile Version und nicht als Vorschau-Alias.
Wie viel kostet Gemini 3.6 Flash?
Der Standardpreis beträgt 1,50 $ pro Million Eingabetokens und 7,50 $ pro Million Ausgabetokens. Google Cloud listet auch günstigere Flex- oder Batch-Preise und höhere Priority-Preise auf. Tools und andere Plattformdienste können separate Gebühren hinzufügen.
Ist Gemini 3.6 Flash günstiger als Gemini 3.5 Flash?
Ja, für Standard-Ausgabetokens. Der Eingabepreis bleibt 1,50 $ pro Million Tokens, während der Ausgabepreis von 9,00 $ auf 7,50 $ pro Million Tokens sinkt. Google meldet auch eine reduzierte Ausgabetoken-Nutzung in seinen Auswertungen.
Unterstützt Gemini 3.6 Flash Bilder, Audio und Video?
Es akzeptiert Text, Bilder, Video, Audio und PDF-Dokumente als Eingabe. Seine Ausgabe ist Text. Es unterstützt keine Bildgenerierung, Audiogenerierung oder die Live-API.
Ist Gemini 3.6 Flash in der Gemini App verfügbar?
Ja. Google listete die Gemini App unter den Startoberflächen auf. Konto-spezifische Limits, Details zur regionalen Einführung und Modellwahlkontrollen können immer noch variieren.
Unterstützt Gemini 3.6 Flash die Computernutzung?
Ja, aber Google kennzeichnet die Computernutzung in der Modell-Dokumentation als Vorschaufunktion. Produktionssysteme sollten Berechtigungen einschränken, Aktionen validieren und menschliche Bestätigung für folgenschwere Operationen beibehalten.
Ist Gemini 3.6 Flash besser als Gemini 3.5 Flash?
Die von Google veröffentlichten Auswertungen zeigen höhere Punktzahlen in Coding, Machine-Learning-Engineering, Wissensarbeit und Computernutzung sowie eine geringere Ausgabetoken-Nutzung. Der praktische Vorteil hängt vom Workload ab, daher sollten Teams repräsentative Tests durchführen, bevor sie den Produktionsverkehr ändern.
Fazit
Gemini 3.6 Flash ist ein bedeutendes Effizienz-Upgrade und keine kosmetische Versionsänderung. Es verbessert die von Google veröffentlichten Ergebnisse in Agenten-Coding, Machine-Learning-Engineering, Wissensarbeit und Computernutzung und senkt gleichzeitig den Standardpreis für Ausgabetokens von 9,00 $ auf 7,50 $ pro Million Tokens. Sein stärkstes Argument ist nicht nur, dass jeder Token billiger ist, sondern dass viele mehrstufige Aufgaben weniger Tokens, Turns und Tool-Aufrufe erfordern könnten.
Entwickler sollten es als den primären Migrationskandidaten für Gemini 3.5 Flash-Workloads betrachten, die auf Code, Tools oder multimodales Reasoning angewiesen sind. Flash-Lite eignet sich weiterhin besser für die kostengünstigste Hochdurchsatzverarbeitung, und Gemini 3.6 Flash ist nicht das richtige Modell für Bildgenerierung, native Audioausgabe oder Live-API-Nutzung. Benchmark-Gewinne sind vielversprechend, aber Produktionsentscheidungen sollten weiterhin aufgabenspezifischer Genauigkeit, Latenz, Sicherheit und Gesamtkosten basieren.