Le 13 août 2026, Google a publié Gemini 3.7 Flash — seulement trois semaines après 3.6 Flash — en le présentant comme « notre modèle workhorse le plus intelligent à ce jour pour le codage et les agents ». Si vous utilisez déjà l’API Gemini pour du JSON structuré ou du Tool Calling, ce guide couvre le positionnement, les tarifs introductifs, l’appel à l’API, la sortie JSON et Function Calling, et s’inscrit dans la série JSON / Agent de ce blog.
L’article précédent, Comment générer du JSON structuré avec l’API Gemini, explique responseMimeType et Schema. Plus tôt, Tool Calling → flux de données MCP a traité le JSON des paramètres d’outils. 3.7 Flash améliore les deux : planification multi-étapes plus fiable, appels d’outils plus précis et tarif introductif plus bas.
Qu’est-ce que Gemini 3.7 Flash
Gemini 3.7 Flash appartient à la gamme Flash de Google — fort débit, faible latence, conçu pour les agents de production et le codage. Ce n’est pas un flagship Pro/Ultra de « réflexion profonde », mais Google affirme qu’il surpasse 3.6 Flash en ingénierie logicielle, travail de connaissance et développement web.
Trois thèmes au lancement :
- Codage : débogage, résolution de problèmes, meilleure précision au premier passage (FrontierCode 1.1 Main 43,6 % vs 34,4 % pour 3.6).
- Agents : planification multi-étapes et utilisation d’outils plus rigoureuses — DeepSWE v1.1 65,3 % vs 49,0 %, AutomationBench 30,4 % vs 17,0 %.
- Travail de connaissance : finance, droit, biosciences sur de longs documents (GDP.pdf 34,0 % vs 22,0 %).
Pour les particuliers, Spark sur Google AI Pro/Ultra utilise désormais 3.7 Flash. Pour les entreprises, le même modèle est disponible sur Gemini Enterprise Agent Platform et Vertex AI. La plupart des développeurs commencent toujours par l’API Gemini (clé AI Studio).
Spécifications et entrée multimodale
| Élément | Gemini 3.7 Flash |
|---|---|
| ID de modèle (API) | gemini-3.7-flash |
| Modalités d’entrée | Texte, image, vidéo, audio, PDF |
| Fenêtre de contexte | Jusqu’à ~1M tokens en entrée |
| Sortie maximale | ~64k tokens (sortie reasoning facturée en output) |
| Structured Output | responseMimeType + Schema pris en charge |
| Function Calling | Pris en charge ; même format de déclaration d’outils que la série 3.x |
| Context Caching | Pris en charge ; lecture cache intro ~$0,075 / 1M tokens |
L’entrée multimodale plus un long contexte convient à des tâches comme « rapport annuel PDF complet → JSON structuré » ou « capture d’écran UI → code ». Le Schema contraint la forme de la sortie, pas ce que vous passez dans contents.
Tarifs actuels
3.7 Flash a été lancé avec un tarif introductif — environ la moitié du tarif standard de 3.6 Flash. Google a publié les tarifs standard à partir de 2027 ; budgétisez les deux niveaux.
| Niveau | Période | Entrée / 1M tokens | Sortie / 1M tokens |
|---|---|---|---|
| Intro | 2026-08-13 – 2026-12-31 | $0.75 | $3.75 |
| Standard | À partir du 2027-01-01 | $1.50 | $7.50 |
Détails (API Gemini / AI Studio ; Vertex AI a ses propres SKU — confirmez avant d’engager le budget) :
- Reasoning en sortie : les tokens de réflexion et les tokens de réponse finale comptent tous deux dans la tarification output.
- Context Caching : lecture cache intro ~$0,075 / 1M ; à partir de 2027 ~$0,15 / 1M. Idéal pour les prompts système fixes + schémas d’outils dans les agents.
- Batch : les tâches bulk hors ligne ont souvent des tarifs réduits séparés.
- Free tier : AI Studio peut encore offrir une utilisation gratuite limitée en débit — consultez la console.
Les factures d’agents penchent souvent vers les tokens de sortie. Au tarif intro de $3,75 / 1M en output, 3.7 Flash coûte la moitié du standard de 3.6 Flash à $7,50 — utile pour les tests de charge d’agents au Q4 2026.
Accès API et ID de modèle
Utilisez le SDK officiel google-genai (pip install google-genai) avec GEMINI_API_KEY depuis AI Studio. Nom du modèle : gemini-3.7-flash.
from google import genai
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="Explain MCP vs Function Calling in three sentences.",
)
print(response.text)
REST est identique à 2.5 / 3.6, avec le modèle dans le chemin :
POST https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContent
Header: x-goog-api-key: YOUR_KEY
{
"contents": [{ "role": "user", "parts": [{ "text": "Hello" }] }]
}
Sur Vertex AI, Structured Output et la configuration des outils correspondent ; seuls l’endpoint et l’authentification GCP diffèrent. Gardez les clés API côté serveur — jamais dans les frontends statiques ou les logs MCP.
Sortie JSON structurée
3.7 Flash prend entièrement en charge Gemini Structured Outputs : définissez response_mime_type: application/json plus response_schema (Pydantic) ou response_json_schema (dictionnaire JSON Schema). Même décodage contraint que 2.5 / 3.6.
from google import genai
from pydantic import BaseModel, Field
class Task(BaseModel):
title: str
priority: str = Field(description="low | medium | high")
due_date: str | None = None
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="Extract a todo: finish budget review by next Friday, high priority.",
config={
"response_mime_type": "application/json",
"response_schema": Task,
},
)
task = response.parsed
print(task.priority)
Structured Output vs Function Calling : le premier est le JSON final utilisateur/aval ; le second est le JSON des arguments d’outil. Voir Du prompt au Structured Output et Tutoriel JSON Gemini. 3.7 Flash est souvent choisi pour la stabilité des schémas complexes.
Validez toujours deux fois : json.loads + JSON Schema ; règles métier (p. ex. totaux) dans votre code. Comparez les échantillons localement dans la boîte à outils JSON — rien n’est téléversé.
Function Calling / Tool Calling
Déclarez tools avec des paramètres JSON Schema ; le modèle renvoie des appels de fonction ; votre hôte exécute et renvoie les résultats. 3.7 Flash met l’accent sur une planification multi-étapes d’outils plus rigoureuse — moins de mauvaises relances, parfois moins de tokens au total.
from google import genai
from google.genai import types
get_weather = types.FunctionDeclaration(
name="get_weather",
description="Current weather for a city",
parameters={
"type": "object",
"properties": {
"city": {"type": "string", "description": "e.g. Shanghai"}
},
"required": ["city"],
},
)
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="Is it good for a run in Shanghai now?",
config=types.GenerateContentConfig(
tools=[types.Tool(function_declarations=[get_weather])],
),
)
for part in response.candidates[0].content.parts:
if part.function_call:
print(part.function_call.name, part.function_call.args)
Boucle d’agent typique : Tool Calling pour les faits → Structured Output pour un JSON fixe → MCP pour Cursor / Claude Desktop. Alignez le Schema d’outil avec le inputSchema MCP. Voir JSON Schema, Function Calling et l’évolution de MCP.
| Structured Output | Function Calling | |
|---|---|---|
| Rôle du JSON | Réponse finale / extraction | Arguments d’outil |
| Exécution | Parse uniquement, sans effets de bord | Votre code / serveur MCP |
| Avantage 3.7 Flash | Schémas plus longs, champs imbriqués | Plans d’outils multi-étapes cohérents |
vs 3.6 Flash et quand choisir
| Scénario | Recommandation |
|---|---|
| Nouvel agent / codage (Q3–Q4 2026) | Par défaut gemini-3.7-flash, profitez du tarif intro |
| Stable sur 3.6, pas de problème JSON/outils | Migration optionnelle ; tarifs standard alignés en 2027 |
| Raisonnement long, hallucinations minimales | Envisagez Gemini Pro / modèles thinking |
| Surtout Structured Output | 3.7 Flash + validation Schema locale |
| Boucles d’outils MCP intensives | 3.7 Flash + Context Caching pour les schémas d’outils |
Au-delà du prix catalogue, mesurez le taux de réussite Structured Output et les relances d’outils sur vos tâches — c’est là que 3.7 Flash est censé gagner.
Conseils de production
- Changer le modèle globalement : définissez le défaut sur
gemini-3.7-flash; gardez 3.6 en fallback une semaine. - Tester les chemins JSON séparément : mêmes prompts pour Structured Output vs Tool Calling ; validez avec JSON Schema.
- Mettre en cache system + tools : prompt système fixe et
toolsvia Context Caching. - Budgétiser aux tarifs standard 2027 : le tarif output intro double après le 31 décembre 2026.
- Séparer clés et schémas : les schémas peuvent être publics ; les clés uniquement côté serveur.
FAQ
Quel est l’ID de modèle API pour Gemini 3.7 Flash ?
Utilisez gemini-3.7-flash dans l’API Gemini et le SDK google-genai. Chemin REST : models/gemini-3.7-flash:generateContent. Vertex AI peut afficher des suffixes de région ou de version — suivez la doc de votre projet.
Quand se termine le tarif intro ?
Le tarif intro est de $0,75 en entrée / $3,75 en sortie par million de tokens jusqu’au 31 décembre 2026. À partir du 1er janvier 2027, le tarif standard est de $1,50 / $7,50 ; les tarifs de lecture Context Caching doublent aussi.
3.7 Flash prend-il en charge la sortie structurée JSON Schema ?
Oui. Comme 2.5 / 3.6 : response_mime_type=application/json avec response_schema ou response_json_schema. Pour l’extraction en production et les charges utiles d’agents, utilisez toujours Schema — pas du JSON par prompt seul.
Puis-je n’utiliser que Function Calling ou seulement Structured Output ?
Oui, mais les rôles diffèrent. Structured Output pour classification, formulaires, extraction ; Function Calling pour bases de données, e-mail, MCP. Les agents de production utilisent souvent les deux dans une même conversation.
Dois-je modifier le code en migrant depuis gemini-3.6-flash ?
En général, seulement la chaîne de modèle plus des tests de régression. tools, responseJsonSchema et les parts multimodales restent compatibles. Comparez des échantillons JSON en staging avant bascule complète.
Comment valider localement le JSON du modèle ?
Enregistrez responseJsonSchema et les sorties en fichiers JSON ; utilisez la boîte à outils JSON dans le navigateur pour la syntaxe et le diff structurel — rien n’est téléversé.
Résumé
Gemini 3.7 Flash est le workhorse 2026 de Google pour le codage et les agents : ID de modèle gemini-3.7-flash, tarif intro jusqu’en 2026 à $0,75 / $3,75 par million de tokens input/output, doublé en 2027. La surface API correspond aux modèles Flash précédents ; le gain est une stabilité accrue des outils multi-étapes et du Structured Output en production.
Essayez 3.7 Flash en staging avec régression JSON + outils, et comparez les sorties au Schema localement. Pour la profondeur de configuration, continuez avec les articles de la série — Structured Output et Function Calling ne sont pas la même API.