Gemini 3.7 Flash: Benchmarks, Precios, Disponibilidad de API y Qué Cambió

Avatar
Lisa Ernst · 17.08.2026 · Inteligencia Artificial · 15 min de lectura

Google lanzó Gemini 3.7 Flash el 13 de agosto de 2026, solo tres semanas después de Gemini 3.6 Flash. La actualización está dirigida específicamente a la codificación, flujos de trabajo agéncicos, desarrollo web y trabajo de conocimiento intensivo en documentos, y Google publica ganancias sustanciales sobre 3.6 Flash en varios benchmarks de ingeniería de software y automatización.

La parte inusual son los precios: Gemini 3.7 Flash se lanza a $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida en la API de pago estándar hasta el 31 de diciembre de 2026. Esas tarifas son temporales y se duplicarán el 1 de enero de 2027. Esta guía explica los resultados de los benchmarks, la disponibilidad de la API, los límites del modelo, las herramientas compatibles, los niveles de precios y las diferencias prácticas con Gemini 3.6 Flash.

Puntos clave

Gemini 3.7 Flash de un vistazo

Especificación Gemini 3.7 Flash
Fecha de lanzamiento 13 de agosto de 2026
Etapa de lanzamiento Disponible generalmente (GA)
ID de modelo de API estable gemini-3.7-flash
Modalidades de entrada Texto, imagen, video, audio y PDF
Modalidad de salida Texto
Límite de tokens de entrada 1.048.576 tokens
Salida máxima 65.536 tokens
Niveles de pensamiento Bajo, medio y alto; mínimo no es compatible
Precio de API de pago estándar hasta el 31 de diciembre de 2026 $0.75 / 1M de tokens de entrada; $3.75 / 1M de tokens de salida

¿Qué es Gemini 3.7 Flash?

Gemini 3.7 Flash es la próxima iteración de la familia Gemini 3 Flash de Google. Google DeepMind dice que se basa en Gemini 3.6 Flash y agrega mejoras algorítmicas a la base de razonamiento central del modelo. El posicionamiento también se ha vuelto más explícito: Google llama a 3.7 Flash su "caballo de batalla" principal para la codificación y los agentes, en lugar de un modelo diseñado simplemente para maximizar el rendimiento bruto.

Esa distinción es importante. Los modelos Flash se han seleccionado tradicionalmente porque son más rápidos y económicos que los modelos de razonamiento más grandes. Con 3.7, Google intenta mover más trabajo de varios pasos a ese nivel de costo-eficiencia: codificación a nivel de repositorio, interacción con navegadores o computadoras, llamadas a funciones, procesamiento complejo de documentos y flujos de trabajo comerciales que requieren varias llamadas a herramientas antes de que una respuesta esté completa.

Si vienes del predecesor, la visión general de Gemini 3.6 Flash de Zerlo proporciona el contexto de lanzamiento del modelo anterior. La actualización importante ahora es que 3.7 Flash mantiene la misma ventana de contexto de un millón de tokens y un amplio conjunto de herramientas, al tiempo que aumenta el rendimiento en muchas de las evaluaciones publicadas por Google de agentes y codificación.

¿Qué cambió de Gemini 3.6 Flash?

Área Cambio de Gemini 3.7 Flash Efecto práctico
Codificación Puntuaciones más altas en FrontierCode, DeepSWE y Terminal-bench Caso más sólido para trabajo de repositorio, depuración y agentes de codificación de larga duración
Desarrollo web Code Arena aumenta de 1538 a 1588 Elo en la tarjeta de modelo de Google Mejor rendimiento publicado en diseños funcionales y tareas web completas de funciones
Automatización empresarial AutomationBench aumenta del 17.0% al 30.4% Más prometedor para flujos de trabajo que combinan razonamiento, herramientas y sistemas empresariales
Razonamiento de documentos GDP.pdf aumenta del 22.0% al 34.0% Mejor resultado publicado para trabajos de conocimiento difíciles basados en PDF
Contexto largo GDM-MRCR v2 a 128k aumenta del 91.8% al 97.0% Mejor recuperación y razonamiento en entradas largas en esa evaluación
Comportamiento del desarrollador Google dice que el modelo se adapta mejor a los obstáculos, aclara la intención y sigue las instrucciones de manera más fiel Potencialmente menos reintentos y menos supervisión manual en flujos de trabajo de varios pasos
Precios 3.7 se lanza a una tarifa temporal de $0.75 de entrada / $3.75 de salida por 1M tokens Costo a corto plazo menor que la tarifa de lanzamiento original de 3.6, aunque 3.6 ahora está en la misma tarifa temporal

La última fila es fácil de malinterpretar. Google describe Gemini 3.7 Flash como un lanzamiento a la mitad del costo original de Gemini 3.6 Flash. Sin embargo, la tarjeta de modelo actual de Google lista tanto 3.6 Flash como 3.7 Flash a $0.75 de entrada y $3.75 de salida por millón de tokens bajo la misma promoción temporal. Por lo tanto, 3.7 no es actualmente más barato por token estándar que 3.6; la comparación es contra los precios de lanzamiento originales de 3.6.

Benchmarks de Gemini 3.7 Flash

La tarjeta de modelo de agosto de 2026 de Google publica un amplio conjunto de benchmarks que cubren ingeniería de software, uso de terminal agéncico, automatización empresarial, trabajo de conocimiento, PDFs, contexto largo, uso de computadoras y razonamiento científico. Las cifras a continuación comparan Gemini 3.7 Flash con Gemini 3.6 Flash utilizando los valores de esa tarjeta de modelo.

Benchmark Qué mide Gemini 3.6 Flash Gemini 3.7 Flash
Índice de Inteligencia de Análisis Artificial Inteligencia de modelos compuestos 52 56
FrontierCode 1.1 Principal Calidad del código de producción 34.4% 43.6%
DeepSWE v1.1 Ingeniería de software de largo alcance 48.6% 65.3%
Code Arena Desarrollo web 1538 Elo 1588 Elo
Terminal-bench 2.1 Codificación de terminal agentica 78.0% 85.8%
AutomationBench Automatización de flujos de trabajo empresariales 17.0% 30.4%
GDP.pdf Comprensión experta de PDF 22.0% 34.0%
GDM-MRCR v2 a 128k Recuperación y razonamiento de contexto largo 91.8% 97.0%
OSWorld-2.0 Uso de computadora agentico 33.8% 47.9%
Tabla de referencia de Google comparando Gemini 3.7 Flash con Gemini 3.6 Flash y otros modelos de IA

Fuente: blog.google

La tabla de evaluación de Google de agosto de 2026 muestra ganancias especialmente grandes de 3.7 Flash en ingeniería de software de largo alcance, automatización de flujos de trabajo empresariales, comprensión de documentos y uso de computadora. Los puntos de referencia miden diferentes cargas de trabajo y no deben combinarse en una sola puntuación universal.

Donde las ganancias son más fuertes

El movimiento más claro se da en cargas de trabajo que requieren que el modelo siga trabajando en lugar de responder una vez. DeepSWE aumenta del 48.6% al 65.3%, mientras que AutomationBench pasa del 17.0% al 30.4%. Esto respalda la afirmación de Google de que el modelo es más útil para agentes que necesitan planificar, llamar herramientas, inspeccionar resultados y recuperarse de obstáculos.

El trabajo con documentos también mejora sustancialmente en los datos publicados por Google. GDP.pdf pasa del 22.0% al 34.0%, y la compañía destaca específicamente las finanzas, el derecho y las biociencias como dominios densos en conocimiento donde espera un mejor razonamiento. Eso no significa que el modelo pueda reemplazar la revisión experta en trabajos regulados o de alto riesgo; significa que el resultado de la referencia es materialmente más alto que 3.6 Flash en las tareas probadas.

3.7 Flash no gana todas las referencias

El lanzamiento no es una barrida limpia. En CharXiv sin herramientas, Gemini 3.7 Flash puntúa 84.5% frente al 85.2% de 3.6 Flash; con herramientas puntúa 88.7% frente al 89.4%. En la tabla inter-modelos de Google, GPT-5.6 Terra también se mantiene por delante en algunas evaluaciones de codificación y terminal. Es por eso que se debe usar una tabla de referencias para identificar cargas de trabajo prometedoras, no para declarar un ganador universal.

También hay una pequeña diferencia de informe que vale la pena notar: el artículo de lanzamiento de Google redondea el resultado de DeepSWE de Gemini 3.6 Flash a 49.0%, mientras que la tarjeta de modelo detallada de DeepMind enumera 48.6%. Este artículo utiliza el valor más preciso de la tarjeta de modelo en la tabla de comparación.

Gráfico de costo versus rendimiento de Google para Gemini 3.7 Flash en DeepSWE v1.1

Fuente: blog.google

Google también enmarca el lanzamiento en torno al costo por tarea de ingeniería de software completada, no solo el precio por token. Esa es la métrica de producción correcta para los agentes: los reintentos, los tokens de razonamiento y las llamadas repetidas a herramientas pueden importar más que la tasa de tokens principal.

Precios de Gemini 3.7 Flash

Gemini 3.7 Flash tiene un programa de precios de tiempo limitado. Las tarifas introductorias actuales se extienden hasta el 31 de diciembre de 2026. La documentación de precios de Google duplica las tarifas de tokens el 1 de enero de 2027.

Opción de consumo Entrada / 1M de tokens hasta el 31 de diciembre de 2026 Salida / 1M de tokens hasta el 31 de diciembre de 2026 Entrada / salida a partir del 1 de enero de 2027
Estándar de pago $0.75 $3.75 $1.50 / $7.50
Lote $0.375 $1.875 $0.75 / $3.75
Flex $0.375 $1.875 $0.75 / $3.75
Prioridad $1.35 $6.75 $2.70 / $13.50

Los precios de salida incluyen tokens de pensamiento. El almacenamiento en caché de contexto estándar cuesta $0.075 por millón de tokens almacenados en caché durante el período introductorio, más $0.50 por millón de tokens por hora para el almacenamiento en caché; esas tarifas también se duplican en 2027. La conexión a tierra de Google Search y la conexión a tierra de Google Maps pueden generar cargos adicionales después del subsidio mensual compartido descrito en la documentación de precios de Google.

La API estándar también tiene un nivel gratuito que se indica como gratuito. Eso no debe tratarse como capacidad de producción garantizada: los límites de tasa dependen del modelo, el proyecto, el nivel de uso y el estado de la cuenta, y Google dice explícitamente que los límites publicados no están garantizados. Para las cargas de trabajo de producción de pago, los costos del modelo son solo una parte del presupuesto; la conexión a tierra, las API externas, el almacenamiento y los pasos de agente fallidos o repetidos pueden cambiar el total.

Costos de ejemplo de la API estándar

Uso de tokens mensuales Costo estimado hasta el 31 de diciembre de 2026 Costo estimado a partir del 1 de enero de 2027
10M de entrada + 2M de salida $15.00 $30.00
50M de entrada + 5M de salida $56.25 $112.50
100M de entrada + 20M de salida $150.00 $300.00

Estos ejemplos incluyen solo tokens de entrada y salida del modelo. No incluyen conexión a tierra, almacenamiento en caché, servicios externos o infraestructura de aplicaciones.

Disponibilidad de la API Gemini 3.7 Flash

Gemini 3.7 Flash no es un anuncio exclusivo para vista previa. Google Cloud enumera gemini-3.7-flash como GA con fecha de lanzamiento del 13 de agosto de 2026, y la documentación de la API Gemini identifica la misma cadena como la versión estable del modelo.

Grupo de usuarios Dónde está disponible Gemini 3.7 Flash Detalle importante
Desarrolladores de API API Gemini y Google AI Studio Use el ID de modelo estable gemini-3.7-flash
Desarrolladores de Android Android Studio Google enumera Android Studio como una plataforma de lanzamiento para desarrolladores
Desarrolladores de agentes Google Antigravity Diseñado para codificación basada en agentes y flujos de trabajo de varios pasos
Empresas Plataforma de Agentes Gemini Enterprise y aplicación Gemini Enterprise Se aplican controles de gobernanza, facturación y regionales para empresas
Individuos Gemini Spark en la aplicación Gemini Google dice que Spark utiliza 3.7 Flash para suscriptores de Google AI Pro y Ultra en más de 160 países admitidos

Para los desarrolladores que aún no han configurado el acceso, la guía de claves de API de Gemini de Zerlo cubre la configuración de Google AI Studio. Una vez que el acceso esté listo, el cambio crítico de implementación es el identificador del modelo; la migración de producción aún debe incluir pruebas de regresión para herramientas, esquemas, latencia y uso total de tokens.

Desarrollador trabajando con código fuente en una computadora portátil

Fuente: pexels.com

Pasar a un nuevo ID de modelo es la parte fácil. La migración más segura es probar tareas de codificación y agente representativas en staging, registrar el éxito de la tarea, la latencia, el uso de tokens, los reintentos y las llamadas a herramientas, y solo entonces cambiar el tráfico de producción.

Los límites de tasa son específicos del proyecto

No existe un único número de RPM o TPM de Gemini 3.7 Flash que se aplique a todas las cuentas. Google mide los límites utilizando solicitudes por minuto, tokens por minuto y solicitudes por día, los aplica por proyecto en lugar de por clave de API, y los ajusta según el nivel de uso y el estado de la cuenta. Google recomienda verificar los límites activos para el proyecto directamente en AI Studio. El tráfico por lotes tiene límites separados; por ejemplo, la cola por lotes de Nivel 1 documentada permite 3,000,000 de tokens en cola para Gemini 3.7 Flash.

Ventana de contexto, modalidades y herramientas compatibles

El sobre de la API principal es familiar para cualquiera que ya esté usando 3.6 Flash: un contexto de entrada de 1.048.576 tokens y una salida de texto máxima de 65.536 tokens. El modelo puede ingerir texto, imágenes, video, audio y documentos PDF, pero no genera imágenes ni audio por sí mismo.

Capacidad Estado en Gemini 3.7 Flash
Almacenamiento en caché Soportado
Ejecución de código Soportado
Uso de computadora Soportado en vista previa
Búsqueda de archivos Soportado
Llamada a función Soportado
Anclaje de búsqueda de Google Soportado
Anclaje de Google Maps Soportado
Salidas estructuradas Soportado
Contexto de URL Soportado
Niveles de pensamiento Bajo, medio y alto
API en vivo No soportado
Generación de imágenes No soportado
Generación de audio No soportado

Una trampa de migración es la configuración de pensamiento. Gemini 3.7 Flash soporta bajo, medio y alto. Google Cloud documenta medio como el valor predeterminado en su Plataforma de Agentes Empresariales, mientras que establecer explícitamente mínimo devuelve un error de validación. Las aplicaciones que anteriormente usaban una configuración mínima deben mapear ese comportamiento a un nivel soportado y volver a medir la latencia y la calidad de la salida.

Trabajadores de oficina revisando documentos junto a una laptop

Fuente: pexels.com

Gemini 3.7 Flash mejora los resultados publicados de Google en PDF y trabajo de conocimiento, lo cual es relevante para flujos de trabajo con muchos documentos. Una puntuación de benchmark más alta no elimina el riesgo de alucinaciones, por lo que los hechos extraídos importantes y las decisiones consecuentes aún necesitan verificación.

Lo que significan los cambios en la práctica

Para agentes de codificación

Gemini 3.7 Flash tiene la historia de actualización más sólida cuando una aplicación realiza codificación a largo plazo en lugar de fragmentos aislados. Las ganancias en DeepSWE, FrontierCode y Terminal-bench apuntan en la misma dirección: el modelo es más capaz de continuar a través de tareas de ingeniería de varios pasos. Google también dice que es más disciplinado para adaptarse a los obstáculos y aclarar la intención, lo que puede ser importante cuando un agente tiene permiso para editar archivos o llamar a herramientas repetidamente.

Para flujos de trabajo de documentos y conocimiento

La ventana de contexto de un millón de tokens no ha cambiado, pero la calidad del trabajo con material denso parece mejorar en las evaluaciones de lanzamiento. Esto hace que 3.7 Flash sea un candidato más fuerte para informes anuales, canalizaciones de documentos legales, literatura científica, bases de conocimiento internas y flujos de trabajo de PDF mixtos. Una ventana de contexto enorme no es lo mismo que una recuperación perfecta, sin embargo; los sistemas de recuperación, la búsqueda de archivos y la segmentación de prompts aún pueden ser más confiables y económicos que enviar todo en cada solicitud.

Para desarrollo web

Google destaca una mayor precisión del código en el primer intento, diseños más funcionales y menos prompts para llegar a aplicaciones completas. La puntuación Elo de 1588 de Code Arena es el indicador publicado más claro. Los equipos aún deben evaluar la adherencia al diseño, el comportamiento del navegador, la accesibilidad y las convenciones específicas del framework en su propio código, ya que un benchmark web agregado no puede representar todas las pilas de front-end.

Para tareas simples de alto volumen

No asuma que 3.7 Flash debería reemplazar a todos los modelos más económicos. Si la carga de trabajo es clasificación, extracción o transformación de plantillas a muy alto volumen, un modelo Flash-Lite aún puede ganar en costo y rendimiento. El propósito de 3.7 Flash es impulsar un razonamiento y un rendimiento de agente más sólidos en el nivel Flash, no convertirse en la opción de menor costo para cada solicitud.

¿Debería migrar de Gemini 3.6 Flash?

Carga de trabajo Dirección recomendada Por qué
Agente de codificación a nivel de repositorio Pruebe intensamente 3.7 Flash Grandes ganancias publicadas en DeepSWE y FrontierCode
Automatización de procesos de negocio Pruebe 3.7 Flash AutomationBench mejora del 17.0% al 30.4%
Análisis de PDF y documentos Pruebe 3.7 Flash Mejores resultados de GDP.pdf y de contexto largo
Canalización estable existente de 3.6 Flash Evalúe antes de cambiar Las tarifas de tokens introductorias actuales son las mismas, por lo que la calidad, la latencia y el costo de la tarea deben decidir
Extracción simple de alto volumen Compare con Flash-Lite Un modelo más ligero aún puede tener un mejor perfil de rendimiento/costo
Aplicación de voz en tiempo real Utilice un modelo compatible con API en vivo Gemini 3.7 Flash no soporta la API en vivo
Generación de imágenes o audio Utilice otro modelo 3.7 Flash produce salida de texto, no imágenes o audio generados

Lista de verificación de migración para Gemini 3.7 Flash

  1. Cambie el modelo de destino a gemini-3.7-flash en un entorno de staging primero.
  2. Revise la configuración de pensamiento. No envíe minimal; elija bajo, medio o alto.
  3. Vuelva a ejecutar las pruebas de llamada a funciones, validación de salida estructurada y comprobaciones de permisos de herramientas.
  4. Pruebe flujos de trabajo de contexto largo y PDF con los mismos documentos representativos utilizados en producción.
  5. Mida la finalización exitosa de la tarea, la latencia, los tokens de entrada, la salida y los tokens de pensamiento, los reintentos, los turnos y las llamadas a herramientas.
  6. Incluya los cargos de anclaje y caché al comparar el costo total por tarea.
  7. Despliegue gradualmente y mantenga una ruta de reversión probada al modelo de producción existente.

Limitaciones a tener en cuenta

La tarjeta de modelo de Google DeepMind enumera las limitaciones estándar de los modelos fundacionales, incluidas las alucinaciones, y señala que pueden ocurrir problemas ocasionales de lentitud o tiempo de espera. Asigna a Gemini 3.7 Flash un corte de conocimiento de marzo de 2026, advirtiendo que algunos dominios pueden limitarse efectivamente a enero de 2025. Por lo tanto, la información actual aún requiere anclaje o recuperación de fuentes actualizadas cuando la frescura es importante.

El uso de computadora está marcado como Vista previa, por lo que las aplicaciones deben restringir permisos, validar acciones y mantener la confirmación humana para pasos consecuentes. El modelo también carece de API en vivo, generación de imágenes y generación de audio. Finalmente, los atractivos precios de lanzamiento son explícitamente temporales; las aplicaciones con un uso significativo en 2027 deben presupuestar contra las tarifas posteriores a la promoción en lugar de asumir que los precios de agosto de 2026 persistirán.Comparación técnica de Gemini vs. Claude proporciona contexto adicional. Dado que las generaciones de modelos y los precios cambian rápidamente, utilice la documentación actual del proveedor para las decisiones de adquisición y evalúe los modelos exactos que planea implementar.

Preguntas frecuentes

¿Cuándo se lanzó Gemini 3.7 Flash?

Google anunció y lanzó Gemini 3.7 Flash el 13 de agosto de 2026. Google Cloud enumera el modelo estable como generalmente disponible en lugar de solo vista previa.

¿Cuál es el nombre del modelo API de Gemini 3.7 Flash?

El identificador del modelo estable es gemini-3.7-flash. Google enumera este ID exacto tanto en la documentación del modelo de la API Gemini como en su documentación de modelos empresariales.

¿Cuánto cuesta Gemini 3.7 Flash?

Hasta el 31 de diciembre de 2026, el uso de la API de pago estándar cuesta $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida, incluidos los tokens de pensamiento. A partir del 1 de enero de 2027, esas tarifas aumentarán a $1.50 y $7.50. Batch, Flex y Priority tienen tarifas separadas.

¿Es Gemini 3.7 Flash más barato que Gemini 3.6 Flash?

No a las tarifas introductorias actuales de tokens. La tarjeta de modelo de agosto de 2026 de Google enumera tanto Gemini 3.6 Flash como Gemini 3.7 Flash a $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida hasta el 31 de diciembre de 2026. La redacción de lanzamiento de Google de "la mitad del costo" compara 3.7 con el precio de lanzamiento original de 3.6 Flash.

¿Está Gemini 3.7 Flash disponible en la API?

Sí. Está disponible a través de la API Gemini y Google AI Studio con el ID de modelo estable gemini-3.7-flash. Google también lo distribuye a través de Antigravity y productos empresariales de Gemini.

¿Cuál es la ventana de contexto de Gemini 3.7 Flash?

El límite de tokens de entrada es de 1,048,576 tokens y la salida máxima es de 65,536 tokens. Las entradas pueden incluir texto, imágenes, video, audio y documentos PDF; la salida es texto.

¿Es compatible Gemini 3.7 Flash con la API en vivo?

No. La documentación del modelo de Google indica que la API en vivo no es compatible. Las aplicaciones que requieren interacción de voz nativa en tiempo real deben elegir un modelo compatible con la API en vivo.

¿Es Gemini 3.7 Flash mejor que Gemini 3.6 Flash?

Las evaluaciones publicadas por Google muestran mejoras sustanciales en varios puntos de referencia de codificación, automatización, PDF, contexto largo y uso de la computadora, pero no todos los puntos de referencia mejoran. La respuesta práctica depende de la carga de trabajo, el objetivo de latencia, el comportamiento de la herramienta y el costo por tarea exitosa, por lo que los equipos de producción deben realizar sus propias evaluaciones representativas.

En resumen

Gemini 3.7 Flash es una actualización significativa para la parte de la familia Flash que más importa a los desarrolladores: codificación de varios pasos, agentes, automatización y flujos de trabajo con muchos documentos. Las mejoras publicadas más sólidas de Google no son pequeños cambios en la clasificación; DeepSWE pasa del 48.6% al 65.3%, AutomationBench del 17.0% al 30.4% y GDP.pdf del 22.0% al 34.0%, mientras que el modelo mantiene la misma ventana de contexto de un millón de tokens y un amplio soporte para herramientas Gemini.

La historia de precios es igualmente importante. El uso estándar de la API es temporalmente de $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida, pero esas tarifas se duplicarán el 1 de enero de 2027. Para los equipos que ya usan Gemini 3.6 Flash, la mejor razón para migrar es, por lo tanto, un mejor rendimiento de la tarea al mismo precio introductorio actual por token, no un recorte de precio permanente. Pruebe 3.7 Flash en cargas de trabajo reales, incluya los costos de herramientas y reintentos, y tome la decisión de migración basándose en el costo y la confiabilidad por tarea exitosa en lugar de solo en el nombre del modelo.

¡Comparte nuestra publicación!
Fuentes