El 13 de agosto de 2026, Google lanzó Gemini 3.7 Flash — solo tres semanas después de 3.6 Flash — describiéndolo como «nuestro modelo workhorse más inteligente hasta ahora para codificación y agentes». Si ya usas la API Gemini para JSON estructurado o Tool Calling, esta guía cubre posicionamiento, precios introductorios, cómo llamar a la API, salida JSON y Function Calling, y se conecta con la serie JSON / Agent de este blog.
El artículo anterior, Cómo generar JSON estructurado con la API Gemini, explica responseMimeType y Schema. Antes, Tool Calling → flujo de datos MCP cubrió el JSON de parámetros de herramientas. 3.7 Flash mejora ambos: planificación multi-paso más fiable, llamadas a herramientas más precisas y un precio introductorio más bajo.
Qué es Gemini 3.7 Flash
Gemini 3.7 Flash forma parte de la línea Flash de Google — alto rendimiento, baja latencia, diseñado para agentes de producción y codificación. No es un flagship Pro/Ultra de «pensamiento profundo», pero Google afirma que supera a 3.6 Flash en ingeniería de software, trabajo de conocimiento y desarrollo web.
Tres temas del lanzamiento:
- Codificación: depuración, resolución de incidencias, mayor precisión en el primer intento (FrontierCode 1.1 Main 43,6 % vs 34,4 % para 3.6).
- Agentes: planificación multi-paso y uso de herramientas más riguroso — DeepSWE v1.1 65,3 % vs 49,0 %, AutomationBench 30,4 % vs 17,0 %.
- Trabajo de conocimiento: finanzas, legal, biosciencias en documentos largos (GDP.pdf 34,0 % vs 22,0 %).
Para consumidores, Spark en Google AI Pro/Ultra ya usa 3.7 Flash. Para empresas, el mismo modelo está en Gemini Enterprise Agent Platform y Vertex AI. La mayoría de desarrolladores siguen empezando con la API Gemini (clave de AI Studio).
Especificaciones y entrada multimodal
| Elemento | Gemini 3.7 Flash |
|---|---|
| ID del modelo (API) | gemini-3.7-flash |
| Modalidades de entrada | Texto, imagen, vídeo, audio, PDF |
| Ventana de contexto | Hasta ~1M tokens de entrada |
| Salida máxima | ~64k tokens (salida reasoning facturada como output) |
| Structured Output | responseMimeType + Schema compatible |
| Function Calling | Compatible; mismo formato de declaración de herramientas que 3.x |
| Context Caching | Compatible; lectura de caché intro ~$0,075 / 1M tokens |
La entrada multimodal más un contexto largo encaja en tareas como «informe anual PDF completo → JSON estructurado» o «captura de UI → código». El Schema restringe la forma de la salida, no lo que pasas en contents.
Precios actuales
3.7 Flash se lanzó con una tarifa introductoria — aproximadamente la mitad del precio estándar de 3.6 Flash. Google ha publicado precios estándar a partir de 2027; presupuesta ambos niveles.
| Nivel | Periodo | Entrada / 1M tokens | Salida / 1M tokens |
|---|---|---|---|
| Intro | 2026-08-13 – 2026-12-31 | $0.75 | $3.75 |
| Standard | Desde 2027-01-01 | $1.50 | $7.50 |
Detalles (API Gemini / AI Studio; Vertex AI tiene sus propios SKU — confirma antes de comprometer presupuesto):
- Reasoning en la salida: los tokens de razonamiento y los de respuesta final cuentan en la tarificación de output.
- Context Caching: lectura de caché intro ~$0,075 / 1M; a partir de 2027 ~$0,15 / 1M. Ideal para prompts de sistema fijos + esquemas de herramientas en agentes.
- Batch: trabajos bulk offline suelen tener tarifas con descuento separadas.
- Free tier: AI Studio puede seguir ofreciendo uso gratuito con límite de tasa — consulta la consola.
Las facturas de agentes suelen inclinarse hacia tokens de salida. Con intro de $3,75 / 1M en output, 3.7 Flash cuesta la mitad del estándar de 3.6 Flash a $7,50 — útil para pruebas de carga de agentes en Q4 2026.
Acceso a la API e ID del modelo
Usa el SDK oficial google-genai (pip install google-genai) con GEMINI_API_KEY de AI Studio. Nombre del modelo: gemini-3.7-flash.
from google import genai
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="Explain MCP vs Function Calling in three sentences.",
)
print(response.text)
REST es igual que 2.5 / 3.6, con el modelo en la ruta:
POST https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContent
Header: x-goog-api-key: YOUR_KEY
{
"contents": [{ "role": "user", "parts": [{ "text": "Hello" }] }]
}
En Vertex AI, Structured Output y la configuración de herramientas coinciden; solo difieren el endpoint y la autenticación GCP. Mantén las claves API en el servidor — nunca en frontends estáticos ni en logs MCP.
Salida JSON estructurada
3.7 Flash admite por completo Gemini Structured Outputs: define response_mime_type: application/json más response_schema (Pydantic) o response_json_schema (diccionario JSON Schema). Mismo decodificado restringido que 2.5 / 3.6.
from google import genai
from pydantic import BaseModel, Field
class Task(BaseModel):
title: str
priority: str = Field(description="low | medium | high")
due_date: str | None = None
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="Extract a todo: finish budget review by next Friday, high priority.",
config={
"response_mime_type": "application/json",
"response_schema": Task,
},
)
task = response.parsed
print(task.priority)
Structured Output vs Function Calling: el primero es el JSON final para usuario/downstream; el segundo es el JSON de argumentos de herramienta. Ver Del prompt al Structured Output y Tutorial JSON de Gemini. 3.7 Flash se elige a menudo por esquemas complejos estables.
Sigue validando dos veces: json.loads + JSON Schema; reglas de negocio (p. ej. totales) en tu código. Compara muestras localmente en la caja de herramientas JSON — nada se sube.
Function Calling / Tool Calling
Declara tools con parámetros JSON Schema; el modelo devuelve llamadas a funciones; tu host ejecuta y devuelve los resultados. 3.7 Flash enfatiza una planificación multi-paso de herramientas más rigurosa — menos reintentos fallidos, a veces menos tokens en total.
from google import genai
from google.genai import types
get_weather = types.FunctionDeclaration(
name="get_weather",
description="Current weather for a city",
parameters={
"type": "object",
"properties": {
"city": {"type": "string", "description": "e.g. Shanghai"}
},
"required": ["city"],
},
)
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="Is it good for a run in Shanghai now?",
config=types.GenerateContentConfig(
tools=[types.Tool(function_declarations=[get_weather])],
),
)
for part in response.candidates[0].content.parts:
if part.function_call:
print(part.function_call.name, part.function_call.args)
Bucle de agente típico: Tool Calling para hechos → Structured Output para JSON fijo → MCP para Cursor / Claude Desktop. Alinea el Schema de herramienta con el inputSchema MCP. Ver JSON Schema, Function Calling y la evolución de MCP.
| Structured Output | Function Calling | |
|---|---|---|
| Rol del JSON | Respuesta final / extracción | Argumentos de herramienta |
| Ejecución | Solo parse, sin efectos secundarios | Tu código / servidor MCP |
| Ventaja 3.7 Flash | Esquemas más largos, campos anidados | Planes de herramientas multi-paso coherentes |
vs 3.6 Flash y cuándo elegir
| Escenario | Recomendación |
|---|---|
| Nuevo agente / codificación (Q3–Q4 2026) | Por defecto gemini-3.7-flash, usa precio intro |
| Estable en 3.6, sin problemas JSON/herramientas | Migración opcional; precios estándar alineados en 2027 |
| Razonamiento largo, alucinaciones mínimas | Considera Gemini Pro / modelos thinking |
| Sobre todo Structured Output | 3.7 Flash + validación Schema local |
| Bucles intensivos de herramientas MCP | 3.7 Flash + Context Caching para esquemas de herramientas |
Más allá del precio de lista, mide la tasa de éxito de Structured Output y los reintentos de herramientas en tus tareas — ahí es donde 3.7 Flash debe ganar.
Consejos de producción
- Cambiar el modelo globalmente: establece el predeterminado en
gemini-3.7-flash; mantén 3.6 como fallback una semana. - Probar rutas JSON por separado: mismos prompts para Structured Output vs Tool Calling; valida con JSON Schema.
- Cachear system + tools: prompt de sistema fijo y
toolsvía Context Caching. - Presupuestar a tarifas estándar 2027: el precio intro de output se duplica tras el 31 de diciembre de 2026.
- Separar claves y esquemas: los esquemas pueden ser públicos; las claves solo en el servidor.
FAQ
¿Cuál es el ID de modelo API para Gemini 3.7 Flash?
Usa gemini-3.7-flash en la API Gemini y el SDK google-genai. Ruta REST: models/gemini-3.7-flash:generateContent. Vertex AI puede mostrar sufijos de región o versión — sigue la documentación de tu proyecto.
¿Cuándo termina el precio intro?
El precio intro es $0,75 de entrada / $3,75 de salida por millón de tokens hasta el 31 de diciembre de 2026. Desde el 1 de enero de 2027, el precio estándar es $1,50 / $7,50; las tarifas de lectura de Context Caching también se duplican.
¿3.7 Flash admite salida estructurada JSON Schema?
Sí. Igual que 2.5 / 3.6: response_mime_type=application/json con response_schema o response_json_schema. Para extracción en producción y cargas de agentes, usa siempre Schema — no JSON solo por prompt.
¿Puedo usar solo Function Calling o solo Structured Output?
Sí, pero los roles difieren. Structured Output para clasificación, formularios, extracción; Function Calling para bases de datos, correo, MCP. Los agentes de producción suelen usar ambos en una conversación.
¿Necesito cambios de código al migrar desde gemini-3.6-flash?
Normalmente solo la cadena del modelo más pruebas de regresión. tools, responseJsonSchema y parts multimodales siguen compatibles. Compara muestras JSON en staging antes del corte completo.
¿Cómo valido localmente el JSON del modelo?
Guarda responseJsonSchema y las salidas como archivos JSON; usa la caja de herramientas JSON en el navegador para sintaxis y diff estructural — nada se sube.
Resumen
Gemini 3.7 Flash es el workhorse 2026 de Google para codificación y agentes: ID de modelo gemini-3.7-flash, precio intro hasta 2026 en $0,75 / $3,75 por millón de tokens input/output, duplicado en 2027. La superficie de la API coincide con modelos Flash anteriores; la ventaja es mayor estabilidad de herramientas multi-paso y Structured Output en producción.
Prueba 3.7 Flash en staging con regresión JSON + herramientas, y compara salidas con Schema localmente. Para profundidad de configuración, sigue usando los artículos de la serie — Structured Output y Function Calling no son la misma API.