Gemini 3.7 Flash: precios, API, salida JSON y Function Calling

Gemini 3.7 Flash de Google (agosto 2026): posicionamiento, precios intro vs 2027, API gemini-3.7-flash, Structured Output, Function Calling y comparación con 3.6 Flash.

El 13 de agosto de 2026, Google lanzó Gemini 3.7 Flash — solo tres semanas después de 3.6 Flash — describiéndolo como «nuestro modelo workhorse más inteligente hasta ahora para codificación y agentes». Si ya usas la API Gemini para JSON estructurado o Tool Calling, esta guía cubre posicionamiento, precios introductorios, cómo llamar a la API, salida JSON y Function Calling, y se conecta con la serie JSON / Agent de este blog.

El artículo anterior, Cómo generar JSON estructurado con la API Gemini, explica responseMimeType y Schema. Antes, Tool Calling → flujo de datos MCP cubrió el JSON de parámetros de herramientas. 3.7 Flash mejora ambos: planificación multi-paso más fiable, llamadas a herramientas más precisas y un precio introductorio más bajo.

Qué es Gemini 3.7 Flash

Gemini 3.7 Flash forma parte de la línea Flash de Google — alto rendimiento, baja latencia, diseñado para agentes de producción y codificación. No es un flagship Pro/Ultra de «pensamiento profundo», pero Google afirma que supera a 3.6 Flash en ingeniería de software, trabajo de conocimiento y desarrollo web.

Tres temas del lanzamiento:

  • Codificación: depuración, resolución de incidencias, mayor precisión en el primer intento (FrontierCode 1.1 Main 43,6 % vs 34,4 % para 3.6).
  • Agentes: planificación multi-paso y uso de herramientas más riguroso — DeepSWE v1.1 65,3 % vs 49,0 %, AutomationBench 30,4 % vs 17,0 %.
  • Trabajo de conocimiento: finanzas, legal, biosciencias en documentos largos (GDP.pdf 34,0 % vs 22,0 %).

Para consumidores, Spark en Google AI Pro/Ultra ya usa 3.7 Flash. Para empresas, el mismo modelo está en Gemini Enterprise Agent Platform y Vertex AI. La mayoría de desarrolladores siguen empezando con la API Gemini (clave de AI Studio).

Especificaciones y entrada multimodal

ElementoGemini 3.7 Flash
ID del modelo (API)gemini-3.7-flash
Modalidades de entradaTexto, imagen, vídeo, audio, PDF
Ventana de contextoHasta ~1M tokens de entrada
Salida máxima~64k tokens (salida reasoning facturada como output)
Structured OutputresponseMimeType + Schema compatible
Function CallingCompatible; mismo formato de declaración de herramientas que 3.x
Context CachingCompatible; lectura de caché intro ~$0,075 / 1M tokens

La entrada multimodal más un contexto largo encaja en tareas como «informe anual PDF completo → JSON estructurado» o «captura de UI → código». El Schema restringe la forma de la salida, no lo que pasas en contents.

Precios actuales

3.7 Flash se lanzó con una tarifa introductoria — aproximadamente la mitad del precio estándar de 3.6 Flash. Google ha publicado precios estándar a partir de 2027; presupuesta ambos niveles.

NivelPeriodoEntrada / 1M tokensSalida / 1M tokens
Intro2026-08-13 – 2026-12-31$0.75$3.75
StandardDesde 2027-01-01$1.50$7.50

Detalles (API Gemini / AI Studio; Vertex AI tiene sus propios SKU — confirma antes de comprometer presupuesto):

  • Reasoning en la salida: los tokens de razonamiento y los de respuesta final cuentan en la tarificación de output.
  • Context Caching: lectura de caché intro ~$0,075 / 1M; a partir de 2027 ~$0,15 / 1M. Ideal para prompts de sistema fijos + esquemas de herramientas en agentes.
  • Batch: trabajos bulk offline suelen tener tarifas con descuento separadas.
  • Free tier: AI Studio puede seguir ofreciendo uso gratuito con límite de tasa — consulta la consola.

Las facturas de agentes suelen inclinarse hacia tokens de salida. Con intro de $3,75 / 1M en output, 3.7 Flash cuesta la mitad del estándar de 3.6 Flash a $7,50 — útil para pruebas de carga de agentes en Q4 2026.

Acceso a la API e ID del modelo

Usa el SDK oficial google-genai (pip install google-genai) con GEMINI_API_KEY de AI Studio. Nombre del modelo: gemini-3.7-flash.

from google import genai

client = genai.Client()
response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="Explain MCP vs Function Calling in three sentences.",
)
print(response.text)

REST es igual que 2.5 / 3.6, con el modelo en la ruta:

POST https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContent
Header: x-goog-api-key: YOUR_KEY

{
  "contents": [{ "role": "user", "parts": [{ "text": "Hello" }] }]
}

En Vertex AI, Structured Output y la configuración de herramientas coinciden; solo difieren el endpoint y la autenticación GCP. Mantén las claves API en el servidor — nunca en frontends estáticos ni en logs MCP.

Salida JSON estructurada

3.7 Flash admite por completo Gemini Structured Outputs: define response_mime_type: application/json más response_schema (Pydantic) o response_json_schema (diccionario JSON Schema). Mismo decodificado restringido que 2.5 / 3.6.

from google import genai
from pydantic import BaseModel, Field

class Task(BaseModel):
    title: str
    priority: str = Field(description="low | medium | high")
    due_date: str | None = None

client = genai.Client()
response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="Extract a todo: finish budget review by next Friday, high priority.",
    config={
        "response_mime_type": "application/json",
        "response_schema": Task,
    },
)
task = response.parsed
print(task.priority)

Structured Output vs Function Calling: el primero es el JSON final para usuario/downstream; el segundo es el JSON de argumentos de herramienta. Ver Del prompt al Structured Output y Tutorial JSON de Gemini. 3.7 Flash se elige a menudo por esquemas complejos estables.

Sigue validando dos veces: json.loads + JSON Schema; reglas de negocio (p. ej. totales) en tu código. Compara muestras localmente en la caja de herramientas JSON — nada se sube.

Function Calling / Tool Calling

Declara tools con parámetros JSON Schema; el modelo devuelve llamadas a funciones; tu host ejecuta y devuelve los resultados. 3.7 Flash enfatiza una planificación multi-paso de herramientas más rigurosa — menos reintentos fallidos, a veces menos tokens en total.

from google import genai
from google.genai import types

get_weather = types.FunctionDeclaration(
    name="get_weather",
    description="Current weather for a city",
    parameters={
        "type": "object",
        "properties": {
            "city": {"type": "string", "description": "e.g. Shanghai"}
        },
        "required": ["city"],
    },
)

client = genai.Client()
response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="Is it good for a run in Shanghai now?",
    config=types.GenerateContentConfig(
        tools=[types.Tool(function_declarations=[get_weather])],
    ),
)

for part in response.candidates[0].content.parts:
    if part.function_call:
        print(part.function_call.name, part.function_call.args)

Bucle de agente típico: Tool Calling para hechos → Structured Output para JSON fijo → MCP para Cursor / Claude Desktop. Alinea el Schema de herramienta con el inputSchema MCP. Ver JSON Schema, Function Calling y la evolución de MCP.

Structured OutputFunction Calling
Rol del JSONRespuesta final / extracciónArgumentos de herramienta
EjecuciónSolo parse, sin efectos secundariosTu código / servidor MCP
Ventaja 3.7 FlashEsquemas más largos, campos anidadosPlanes de herramientas multi-paso coherentes

vs 3.6 Flash y cuándo elegir

EscenarioRecomendación
Nuevo agente / codificación (Q3–Q4 2026)Por defecto gemini-3.7-flash, usa precio intro
Estable en 3.6, sin problemas JSON/herramientasMigración opcional; precios estándar alineados en 2027
Razonamiento largo, alucinaciones mínimasConsidera Gemini Pro / modelos thinking
Sobre todo Structured Output3.7 Flash + validación Schema local
Bucles intensivos de herramientas MCP3.7 Flash + Context Caching para esquemas de herramientas

Más allá del precio de lista, mide la tasa de éxito de Structured Output y los reintentos de herramientas en tus tareas — ahí es donde 3.7 Flash debe ganar.

Consejos de producción

  1. Cambiar el modelo globalmente: establece el predeterminado en gemini-3.7-flash; mantén 3.6 como fallback una semana.
  2. Probar rutas JSON por separado: mismos prompts para Structured Output vs Tool Calling; valida con JSON Schema.
  3. Cachear system + tools: prompt de sistema fijo y tools vía Context Caching.
  4. Presupuestar a tarifas estándar 2027: el precio intro de output se duplica tras el 31 de diciembre de 2026.
  5. Separar claves y esquemas: los esquemas pueden ser públicos; las claves solo en el servidor.

FAQ

¿Cuál es el ID de modelo API para Gemini 3.7 Flash?

Usa gemini-3.7-flash en la API Gemini y el SDK google-genai. Ruta REST: models/gemini-3.7-flash:generateContent. Vertex AI puede mostrar sufijos de región o versión — sigue la documentación de tu proyecto.

¿Cuándo termina el precio intro?

El precio intro es $0,75 de entrada / $3,75 de salida por millón de tokens hasta el 31 de diciembre de 2026. Desde el 1 de enero de 2027, el precio estándar es $1,50 / $7,50; las tarifas de lectura de Context Caching también se duplican.

¿3.7 Flash admite salida estructurada JSON Schema?

Sí. Igual que 2.5 / 3.6: response_mime_type=application/json con response_schema o response_json_schema. Para extracción en producción y cargas de agentes, usa siempre Schema — no JSON solo por prompt.

¿Puedo usar solo Function Calling o solo Structured Output?

Sí, pero los roles difieren. Structured Output para clasificación, formularios, extracción; Function Calling para bases de datos, correo, MCP. Los agentes de producción suelen usar ambos en una conversación.

¿Necesito cambios de código al migrar desde gemini-3.6-flash?

Normalmente solo la cadena del modelo más pruebas de regresión. tools, responseJsonSchema y parts multimodales siguen compatibles. Compara muestras JSON en staging antes del corte completo.

¿Cómo valido localmente el JSON del modelo?

Guarda responseJsonSchema y las salidas como archivos JSON; usa la caja de herramientas JSON en el navegador para sintaxis y diff estructural — nada se sube.

Resumen

Gemini 3.7 Flash es el workhorse 2026 de Google para codificación y agentes: ID de modelo gemini-3.7-flash, precio intro hasta 2026 en $0,75 / $3,75 por millón de tokens input/output, duplicado en 2027. La superficie de la API coincide con modelos Flash anteriores; la ventaja es mayor estabilidad de herramientas multi-paso y Structured Output en producción.

Prueba 3.7 Flash en staging con regresión JSON + herramientas, y compara salidas con Schema localmente. Para profundidad de configuración, sigue usando los artículos de la serie — Structured Output y Function Calling no son la misma API.