Gemini 3.7 Flash : prix, API, sortie JSON et Function Calling

Gemini 3.7 Flash de Google (août 2026) : positionnement, tarifs intro vs 2027, API gemini-3.7-flash, Structured Output, Function Calling et comparaison avec 3.6 Flash.

Le 13 août 2026, Google a publié Gemini 3.7 Flash — seulement trois semaines après 3.6 Flash — en le présentant comme « notre modèle workhorse le plus intelligent à ce jour pour le codage et les agents ». Si vous utilisez déjà l’API Gemini pour du JSON structuré ou du Tool Calling, ce guide couvre le positionnement, les tarifs introductifs, l’appel à l’API, la sortie JSON et Function Calling, et s’inscrit dans la série JSON / Agent de ce blog.

L’article précédent, Comment générer du JSON structuré avec l’API Gemini, explique responseMimeType et Schema. Plus tôt, Tool Calling → flux de données MCP a traité le JSON des paramètres d’outils. 3.7 Flash améliore les deux : planification multi-étapes plus fiable, appels d’outils plus précis et tarif introductif plus bas.

Qu’est-ce que Gemini 3.7 Flash

Gemini 3.7 Flash appartient à la gamme Flash de Google — fort débit, faible latence, conçu pour les agents de production et le codage. Ce n’est pas un flagship Pro/Ultra de « réflexion profonde », mais Google affirme qu’il surpasse 3.6 Flash en ingénierie logicielle, travail de connaissance et développement web.

Trois thèmes au lancement :

  • Codage : débogage, résolution de problèmes, meilleure précision au premier passage (FrontierCode 1.1 Main 43,6 % vs 34,4 % pour 3.6).
  • Agents : planification multi-étapes et utilisation d’outils plus rigoureuses — DeepSWE v1.1 65,3 % vs 49,0 %, AutomationBench 30,4 % vs 17,0 %.
  • Travail de connaissance : finance, droit, biosciences sur de longs documents (GDP.pdf 34,0 % vs 22,0 %).

Pour les particuliers, Spark sur Google AI Pro/Ultra utilise désormais 3.7 Flash. Pour les entreprises, le même modèle est disponible sur Gemini Enterprise Agent Platform et Vertex AI. La plupart des développeurs commencent toujours par l’API Gemini (clé AI Studio).

Spécifications et entrée multimodale

ÉlémentGemini 3.7 Flash
ID de modèle (API)gemini-3.7-flash
Modalités d’entréeTexte, image, vidéo, audio, PDF
Fenêtre de contexteJusqu’à ~1M tokens en entrée
Sortie maximale~64k tokens (sortie reasoning facturée en output)
Structured OutputresponseMimeType + Schema pris en charge
Function CallingPris en charge ; même format de déclaration d’outils que la série 3.x
Context CachingPris en charge ; lecture cache intro ~$0,075 / 1M tokens

L’entrée multimodale plus un long contexte convient à des tâches comme « rapport annuel PDF complet → JSON structuré » ou « capture d’écran UI → code ». Le Schema contraint la forme de la sortie, pas ce que vous passez dans contents.

Tarifs actuels

3.7 Flash a été lancé avec un tarif introductif — environ la moitié du tarif standard de 3.6 Flash. Google a publié les tarifs standard à partir de 2027 ; budgétisez les deux niveaux.

NiveauPériodeEntrée / 1M tokensSortie / 1M tokens
Intro2026-08-13 – 2026-12-31$0.75$3.75
StandardÀ partir du 2027-01-01$1.50$7.50

Détails (API Gemini / AI Studio ; Vertex AI a ses propres SKU — confirmez avant d’engager le budget) :

  • Reasoning en sortie : les tokens de réflexion et les tokens de réponse finale comptent tous deux dans la tarification output.
  • Context Caching : lecture cache intro ~$0,075 / 1M ; à partir de 2027 ~$0,15 / 1M. Idéal pour les prompts système fixes + schémas d’outils dans les agents.
  • Batch : les tâches bulk hors ligne ont souvent des tarifs réduits séparés.
  • Free tier : AI Studio peut encore offrir une utilisation gratuite limitée en débit — consultez la console.

Les factures d’agents penchent souvent vers les tokens de sortie. Au tarif intro de $3,75 / 1M en output, 3.7 Flash coûte la moitié du standard de 3.6 Flash à $7,50 — utile pour les tests de charge d’agents au Q4 2026.

Accès API et ID de modèle

Utilisez le SDK officiel google-genai (pip install google-genai) avec GEMINI_API_KEY depuis AI Studio. Nom du modèle : gemini-3.7-flash.

from google import genai

client = genai.Client()
response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="Explain MCP vs Function Calling in three sentences.",
)
print(response.text)

REST est identique à 2.5 / 3.6, avec le modèle dans le chemin :

POST https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContent
Header: x-goog-api-key: YOUR_KEY

{
  "contents": [{ "role": "user", "parts": [{ "text": "Hello" }] }]
}

Sur Vertex AI, Structured Output et la configuration des outils correspondent ; seuls l’endpoint et l’authentification GCP diffèrent. Gardez les clés API côté serveur — jamais dans les frontends statiques ou les logs MCP.

Sortie JSON structurée

3.7 Flash prend entièrement en charge Gemini Structured Outputs : définissez response_mime_type: application/json plus response_schema (Pydantic) ou response_json_schema (dictionnaire JSON Schema). Même décodage contraint que 2.5 / 3.6.

from google import genai
from pydantic import BaseModel, Field

class Task(BaseModel):
    title: str
    priority: str = Field(description="low | medium | high")
    due_date: str | None = None

client = genai.Client()
response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="Extract a todo: finish budget review by next Friday, high priority.",
    config={
        "response_mime_type": "application/json",
        "response_schema": Task,
    },
)
task = response.parsed
print(task.priority)

Structured Output vs Function Calling : le premier est le JSON final utilisateur/aval ; le second est le JSON des arguments d’outil. Voir Du prompt au Structured Output et Tutoriel JSON Gemini. 3.7 Flash est souvent choisi pour la stabilité des schémas complexes.

Validez toujours deux fois : json.loads + JSON Schema ; règles métier (p. ex. totaux) dans votre code. Comparez les échantillons localement dans la boîte à outils JSON — rien n’est téléversé.

Function Calling / Tool Calling

Déclarez tools avec des paramètres JSON Schema ; le modèle renvoie des appels de fonction ; votre hôte exécute et renvoie les résultats. 3.7 Flash met l’accent sur une planification multi-étapes d’outils plus rigoureuse — moins de mauvaises relances, parfois moins de tokens au total.

from google import genai
from google.genai import types

get_weather = types.FunctionDeclaration(
    name="get_weather",
    description="Current weather for a city",
    parameters={
        "type": "object",
        "properties": {
            "city": {"type": "string", "description": "e.g. Shanghai"}
        },
        "required": ["city"],
    },
)

client = genai.Client()
response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="Is it good for a run in Shanghai now?",
    config=types.GenerateContentConfig(
        tools=[types.Tool(function_declarations=[get_weather])],
    ),
)

for part in response.candidates[0].content.parts:
    if part.function_call:
        print(part.function_call.name, part.function_call.args)

Boucle d’agent typique : Tool Calling pour les faits → Structured Output pour un JSON fixe → MCP pour Cursor / Claude Desktop. Alignez le Schema d’outil avec le inputSchema MCP. Voir JSON Schema, Function Calling et l’évolution de MCP.

Structured OutputFunction Calling
Rôle du JSONRéponse finale / extractionArguments d’outil
ExécutionParse uniquement, sans effets de bordVotre code / serveur MCP
Avantage 3.7 FlashSchémas plus longs, champs imbriquésPlans d’outils multi-étapes cohérents

vs 3.6 Flash et quand choisir

ScénarioRecommandation
Nouvel agent / codage (Q3–Q4 2026)Par défaut gemini-3.7-flash, profitez du tarif intro
Stable sur 3.6, pas de problème JSON/outilsMigration optionnelle ; tarifs standard alignés en 2027
Raisonnement long, hallucinations minimalesEnvisagez Gemini Pro / modèles thinking
Surtout Structured Output3.7 Flash + validation Schema locale
Boucles d’outils MCP intensives3.7 Flash + Context Caching pour les schémas d’outils

Au-delà du prix catalogue, mesurez le taux de réussite Structured Output et les relances d’outils sur vos tâches — c’est là que 3.7 Flash est censé gagner.

Conseils de production

  1. Changer le modèle globalement : définissez le défaut sur gemini-3.7-flash ; gardez 3.6 en fallback une semaine.
  2. Tester les chemins JSON séparément : mêmes prompts pour Structured Output vs Tool Calling ; validez avec JSON Schema.
  3. Mettre en cache system + tools : prompt système fixe et tools via Context Caching.
  4. Budgétiser aux tarifs standard 2027 : le tarif output intro double après le 31 décembre 2026.
  5. Séparer clés et schémas : les schémas peuvent être publics ; les clés uniquement côté serveur.

FAQ

Quel est l’ID de modèle API pour Gemini 3.7 Flash ?

Utilisez gemini-3.7-flash dans l’API Gemini et le SDK google-genai. Chemin REST : models/gemini-3.7-flash:generateContent. Vertex AI peut afficher des suffixes de région ou de version — suivez la doc de votre projet.

Quand se termine le tarif intro ?

Le tarif intro est de $0,75 en entrée / $3,75 en sortie par million de tokens jusqu’au 31 décembre 2026. À partir du 1er janvier 2027, le tarif standard est de $1,50 / $7,50 ; les tarifs de lecture Context Caching doublent aussi.

3.7 Flash prend-il en charge la sortie structurée JSON Schema ?

Oui. Comme 2.5 / 3.6 : response_mime_type=application/json avec response_schema ou response_json_schema. Pour l’extraction en production et les charges utiles d’agents, utilisez toujours Schema — pas du JSON par prompt seul.

Puis-je n’utiliser que Function Calling ou seulement Structured Output ?

Oui, mais les rôles diffèrent. Structured Output pour classification, formulaires, extraction ; Function Calling pour bases de données, e-mail, MCP. Les agents de production utilisent souvent les deux dans une même conversation.

Dois-je modifier le code en migrant depuis gemini-3.6-flash ?

En général, seulement la chaîne de modèle plus des tests de régression. tools, responseJsonSchema et les parts multimodales restent compatibles. Comparez des échantillons JSON en staging avant bascule complète.

Comment valider localement le JSON du modèle ?

Enregistrez responseJsonSchema et les sorties en fichiers JSON ; utilisez la boîte à outils JSON dans le navigateur pour la syntaxe et le diff structurel — rien n’est téléversé.

Résumé

Gemini 3.7 Flash est le workhorse 2026 de Google pour le codage et les agents : ID de modèle gemini-3.7-flash, tarif intro jusqu’en 2026 à $0,75 / $3,75 par million de tokens input/output, doublé en 2027. La surface API correspond aux modèles Flash précédents ; le gain est une stabilité accrue des outils multi-étapes et du Structured Output en production.

Essayez 3.7 Flash en staging avec régression JSON + outils, et comparez les sorties au Schema localement. Pour la profondeur de configuration, continuez avec les articles de la série — Structured Output et Function Calling ne sont pas la même API.