Am 13. August 2026 hat Google Gemini 3.7 Flash veröffentlicht — nur drei Wochen nach 3.6 Flash — und bezeichnet es als „unser bisher intelligentestes Workhorse-Modell für Coding und Agents“. Wenn Sie die Gemini API bereits für strukturiertes JSON oder Tool Calling nutzen, erklärt dieser Leitfaden Positionierung, Intro-Preise, API-Aufruf, JSON-Ausgabe und Function Calling und verknüpft das mit der JSON-/Agent-Serie in diesem Blog.
Der vorherige Artikel, Strukturiertes JSON mit der Gemini API erzeugen, erläutert responseMimeType und Schema. Früher behandelte Tool Calling → MCP-Datenfluss Tool-Parameter-JSON. 3.7 Flash verbessert beides: zuverlässigere mehrstufige Planung, präzisere Tool Calls und einen niedrigeren Intro-Preis.
Was ist Gemini 3.7 Flash
Gemini 3.7 Flash gehört zur Flash-Reihe von Google — hoher Durchsatz, geringe Latenz, ausgelegt für Produktions-Agents und Coding. Es ist kein Pro/Ultra-Flaggschiff für „Deep Thinking“, aber Google gibt an, dass es 3.6 Flash bei Softwareentwicklung, Wissensarbeit und Webentwicklung übertrifft.
Drei Schwerpunkte beim Launch:
- Coding: Debugging, Issue-Behebung, höhere Erstpass-Genauigkeit (FrontierCode 1.1 Main 43,6 % vs. 34,4 % bei 3.6).
- Agents: sorgfältigere mehrstufige Planung und Tool-Nutzung — DeepSWE v1.1 65,3 % vs. 49,0 %, AutomationBench 30,4 % vs. 17,0 %.
- Wissensarbeit: Finanzen, Recht, Biowissenschaften bei langen Dokumenten (GDP.pdf 34,0 % vs. 22,0 %).
Für Endnutzer läuft Spark in Google AI Pro/Ultra jetzt mit 3.7 Flash. Für Unternehmen ist dasselbe Modell auf Gemini Enterprise Agent Platform und Vertex AI verfügbar. Die meisten Entwickler starten weiterhin mit der Gemini API (AI Studio Key).
Spezifikationen und multimodale Eingabe
| Eintrag | Gemini 3.7 Flash |
|---|---|
| Modell-ID (API) | gemini-3.7-flash |
| Eingabe-Modalitäten | Text, Bild, Video, Audio, PDF |
| Kontextfenster | Bis zu ~1 Mio. Input-Token |
| Maximale Ausgabe | ~64k Token (Reasoning-Ausgabe wird als Output abgerechnet) |
| Structured Output | responseMimeType + Schema unterstützt |
| Function Calling | Unterstützt; gleiches Tool-Deklarationsformat wie 3.x |
| Context Caching | Unterstützt; Intro-Cache-Lesen ~$0.075 / 1M Token |
Multimodale Eingabe plus langer Kontext eignen sich für Aufgaben wie „gesamter Jahresbericht als PDF → strukturiertes JSON“ oder „UI-Screenshot → Code“. Das Schema legt die Ausgabe fest, nicht das, was Sie in contents übergeben.
Aktuelle Preise
3.7 Flash startete mit einem Intro-Tarif — etwa die Hälfte des Standardpreises von 3.6 Flash. Google hat Standardpreise ab 2027 veröffentlicht; kalkulieren Sie beide Stufen.
| Tarif | Zeitraum | Input / 1M Token | Output / 1M Token |
|---|---|---|---|
| Intro | 2026-08-13 – 2026-12-31 | $0.75 | $3.75 |
| Standard | Ab 2027-01-01 | $1.50 | $7.50 |
Details (Gemini API / AI Studio; Vertex AI hat eigene SKUs — vor der Budgetplanung prüfen):
- Reasoning in der Ausgabe: Thinking-Token und finale Antwort-Token zählen beide zur Output-Abrechnung.
- Context Caching: Intro-Cache-Lesen ~$0.075 / 1M; ab 2027 ~$0.15 / 1M. Gut für feste System-Prompts + Tool-Schemas in Agents.
- Batch: Offline-Massenjobs haben oft separate ermäßigte Tarife.
- Free Tier: AI Studio bietet möglicherweise noch ratenbegrenzte kostenlose Nutzung — prüfen Sie die Konsole.
Agent-Rechnungen fallen oft schwer auf Output-Token. Beim Intro-Preis von $3.75 / 1M Output kostet 3.7 Flash halb so viel wie der Standard von 3.6 Flash ($7.50) — nützlich für Agent-Lasttests in Q4 2026.
API-Zugang und Modell-ID
Nutzen Sie das offizielle google-genai SDK (pip install google-genai) mit GEMINI_API_KEY aus AI Studio. Modellname: gemini-3.7-flash.
from google import genai
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="Explain MCP vs Function Calling in three sentences.",
)
print(response.text)
REST entspricht 2.5 / 3.6, mit dem Modell im Pfad:
POST https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContent
Header: x-goog-api-key: YOUR_KEY
{
"contents": [{ "role": "user", "parts": [{ "text": "Hello" }] }]
}
Auf Vertex AI stimmen Structured Output und Tool-Konfiguration überein; nur Endpoint und GCP-Authentifizierung unterscheiden sich. API-Keys nur auf dem Server — niemals in statischen Frontends oder MCP-Logs.
Strukturierte JSON-Ausgabe
3.7 Flash unterstützt Gemini Structured Outputs vollständig: setzen Sie response_mime_type: application/json plus response_schema (Pydantic) oder response_json_schema (JSON-Schema-Dictionary). Gleiches constrained decoding wie bei 2.5 / 3.6.
from google import genai
from pydantic import BaseModel, Field
class Task(BaseModel):
title: str
priority: str = Field(description="low | medium | high")
due_date: str | None = None
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="Extract a todo: finish budget review by next Friday, high priority.",
config={
"response_mime_type": "application/json",
"response_schema": Task,
},
)
task = response.parsed
print(task.priority)
Structured Output vs. Function Calling: Ersteres liefert finales Benutzer-/Downstream-JSON; Letzteres liefert Tool-Argument-JSON. Siehe Vom Prompt zu Structured Output und Gemini-JSON-Tutorial. 3.7 Flash wird oft wegen stabiler komplexer Schemas gewählt.
Validieren Sie weiterhin zweifach: json.loads + JSON Schema; Geschäftsregeln (z. B. Summen) im eigenen Code. Diffen Sie Beispiele lokal in der JSON-Toolbox — nichts wird hochgeladen.
Function Calling / Tool Calling
Deklarieren Sie tools mit JSON-Schema-Parametern; das Modell liefert Function Calls; Ihr Host führt aus und führt Ergebnisse zurück. 3.7 Flash legt Wert auf sorgfältigere mehrstufige Tool-Planung — weniger fehlgeschlagene Retries, manchmal weniger Gesamt-Token.
from google import genai
from google.genai import types
get_weather = types.FunctionDeclaration(
name="get_weather",
description="Current weather for a city",
parameters={
"type": "object",
"properties": {
"city": {"type": "string", "description": "e.g. Shanghai"}
},
"required": ["city"],
},
)
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="Is it good for a run in Shanghai now?",
config=types.GenerateContentConfig(
tools=[types.Tool(function_declarations=[get_weather])],
),
)
for part in response.candidates[0].content.parts:
if part.function_call:
print(part.function_call.name, part.function_call.args)
Typischer Agent-Loop: Tool Calling für Fakten → Structured Output für festes JSON → MCP für Cursor / Claude Desktop. Tool-Schema an MCP inputSchema angleichen. Siehe JSON Schema, Function Calling und MCP-Evolution.
| Structured Output | Function Calling | |
|---|---|---|
| JSON-Rolle | Finale Antwort / Extraktion | Tool-Argumente |
| Ausführung | Nur parsen, keine Nebenwirkungen | Ihr Code / MCP-Server |
| Vorteil von 3.7 Flash | Längere Schemas, verschachtelte Felder | Kohärente mehrstufige Tool-Pläne |
vs. 3.6 Flash und wann welches Modell
| Szenario | Empfehlung |
|---|---|
| Neuer Agent / Coding (Q3–Q4 2026) | Standard gemini-3.7-flash, Intro-Preise nutzen |
| Stabil auf 3.6, keine JSON/Tool-Probleme | Migration optional; Standardpreise gleichen sich 2027 an |
| Lange Reasoning-Ketten, geringste Halluzination | Gemini Pro / Thinking-Modelle erwägen |
| Überwiegend Structured Output | 3.7 Flash + lokale Schema-Validierung |
| Viele MCP-Tool-Loops | 3.7 Flash + Context Caching für Tool-Schemas |
Neben dem Listenpreis messen Sie Structured-Output-Erfolgsrate und Tool-Retries auf Ihren Tasks — dort soll 3.7 Flash punkten.
Tipps für den Produktionseinsatz
- Modell global tauschen: Standard auf
gemini-3.7-flashsetzen; 3.6 eine Woche als Fallback behalten. - JSON-Pfade getrennt testen: gleiche Prompts für Structured Output vs. Tool Calling; mit JSON Schema validieren.
- System + tools cachen: festen System-Prompt und
toolsüber Context Caching. - Budget nach Standardtarifen 2027 kalkulieren: Intro-Output-Preise verdoppeln sich nach dem 31. Dez. 2026.
- Keys und Schemas trennen: Schemas können öffentlich sein; Keys nur auf dem Server.
FAQ
Wie lautet die API-Modell-ID für Gemini 3.7 Flash?
Verwenden Sie gemini-3.7-flash in der Gemini API und im google-genai SDK. REST-Pfad: models/gemini-3.7-flash:generateContent. Vertex AI kann Regions- oder Versionssuffixe anzeigen — folgen Sie der Dokumentation Ihres Projekts.
Wann endet der Intro-Preis?
Intro-Preise: $0.75 Input / $3.75 Output pro Million Token bis zum 31. Dezember 2026. Ab dem 1. Januar 2027 gelten Standardpreise von $1.50 / $7.50; Context-Caching-Lesetarife verdoppeln sich ebenfalls.
Unterstützt 3.7 Flash JSON-Schema-Structured Output?
Ja. Wie bei 2.5 / 3.6: response_mime_type=application/json mit response_schema oder response_json_schema. Für Produktions-Extraktion und Agent-Payloads immer Schema verwenden — nicht nur Prompt-JSON.
Kann ich nur Function Calling oder nur Structured Output nutzen?
Ja, aber die Rollen unterscheiden sich. Structured Output für Klassifikation, Formulare, Extraktion; Function Calling für Datenbanken, E-Mail, MCP. Produktions-Agents nutzen oft beides in einer Konversation.
Brauche ich Code-Änderungen bei der Migration von gemini-3.6-flash?
Meist nur den Modell-String plus Regressionstests. tools, responseJsonSchema und multimodale parts bleiben kompatibel. JSON-Beispiele in Staging vergleichen, bevor Sie vollständig umschalten.
Wie validiere ich Modell-JSON lokal?
responseJsonSchema und Ausgaben als JSON-Dateien speichern; JSON-Toolbox im Browser für Syntax- und Struktur-Diff nutzen — nichts wird hochgeladen.
Zusammenfassung
Gemini 3.7 Flash ist Googles 2026-Workhorse für Coding und Agents: Modell-ID gemini-3.7-flash, Intro-Preise bis Ende 2026 bei $0.75 / $3.75 pro Million Input-/Output-Token, ab 2027 verdoppelt. Die API-Oberfläche entspricht früheren Flash-Modellen; der Gewinn liegt in stabileren mehrstufigen Tools und Structured Output in Produktion.
Testen Sie 3.7 Flash in Staging mit JSON- + Tool-Regression und diffen Sie Ausgaben lokal gegen das Schema. Für Konfigurationstiefe weiter die Serienartikel nutzen — Structured Output und Function Calling sind nicht dieselbe API.