Volver al Blog

Gemini 3.7 Flash: análisis, precio y mi veredicto

20 de agosto de 20269 min de lectura·Nicolas Farchica

Gemini 3.7 Flash salió el 13 de agosto de 2026 como el Flash más capaz de Google para código y agentes.

La propuesta es sólida: mejora frente a 3.6 Flash, cerca de 1 millón de tokens de contexto, entrada multimodal y un precio introductorio competitivo.

Mi veredicto es más reservado. Es un modelo capaz, pero no sería mi primera opción para mi trabajo de programación, investigación y agentes. En esos usos valoro otras combinaciones de calidad, latencia y costo.

Esta es una evaluación personal informada por fuentes oficiales y datos independientes. No es un benchmark propio controlado ni demuestra que Gemini sea universalmente inferior.

Primero revisaré lo que ofrece el modelo. Después, sus límites y las alternativas que yo consideraría. Al final, explicaré cuándo sí lo usaría.

Representación abstracta de señales multimodales atravesando un núcleo geométrico de IA

La ficha técnica del modelo

DatoGemini 3.7 Flash
ID establegemini-3.7-flash
BaseGemini 3.6 Flash, con mejoras algorítmicas
Contexto de entrada1.048.576 tokens
Salida máxima65.536 tokens
EntradasTexto, imagen, video, audio y PDF
SalidaTexto
Thinkinglow, medium y high (minimal devuelve error)
Funciones del modelo y la APIFunction calling, code execution, file search y caching
Integraciones del ecosistemaGrounding con Search y Maps; computer use en preview
No soportadoLive API, generación de imagen o audio y tuning
Knowledge cutoffMarzo de 2026, con algunos dominios limitados a enero de 2025

La documentación de la API detalla el contexto, las modalidades, los niveles de thinking y las funciones compatibles.

La model card de DeepMind confirma que el modelo parte de Gemini 3.6 Flash y documenta sus límites conocidos.

Al 20 de agosto de 2026, Google solo documentaba la variante 3.7 Flash, no un "Gemini 3.7 Pro". En la aplicación de consumo, el acceso anunciado llegaba mediante Spark.

También está disponible en Gemini API, Google AI Studio, Antigravity y productos empresariales. Esa disponibilidad pertenece al ecosistema que rodea al modelo, no a sus cualidades intrínsecas.

Lo que el modelo hace genuinamente bien

Hay tres fortalezas verificables que conviene separar del discurso de lanzamiento.

La salida es muy rápida. Artificial Analysis registraba casi 390 tokens de salida por segundo en high al 20 de agosto de 2026.

La mejora frente a 3.6 Flash es relevante. La tabla oficial de DeepMind informa 43,6% frente a 34,4% en FrontierCode y 30,4% frente a 17,0% en AutomationBench.

En comprensión de PDF expertos, Google informa 34,0% frente a 22,0%. Son resultados del proveedor y no reemplazan una evaluación independiente, pero muestran un avance consistente frente a la generación anterior.

La entrada es ampliamente multimodal. Acepta texto, imagen, video, audio y PDF con cerca de 1 millón de tokens de contexto. Ese conjunto es especialmente atractivo para cargas documentales y audiovisuales.

Search, Maps, AI Studio y Antigravity pueden aportar mucho valor operativo. Sin embargo, son funciones o productos del ecosistema; no deben confundirse con calidad, razonamiento o confiabilidad del modelo.

Donde el modelo queda corto

Mi escepticismo empieza cuando las fortalezas se comparan con lo que necesito a diario.

En high, el Artificial Analysis Intelligence Index marcaba 56 puntos, unos US$0,40 por tarea, casi 390 tokens de salida por segundo y unos 15,4 segundos hasta la primera respuesta.

La misma fuente mostraba low: 51 puntos, US$0,16 por tarea y 1,0 s; medium: 53, US$0,26 y 4,9 s; high: 56, US$0,40 y 15,4 s.

Son métricas vivas, móviles y dependientes de la configuración, consultadas el 20 de agosto de 2026. El costo por tarea corresponde a la ejecución del índice, no a una tarifa oficial por solicitud.

La velocidad y la latencia proceden de un ensayo de rendimiento separado: P50 móvil de 72 horas con una carga de 10.000 tokens de entrada.

El Artificial Analysis Intelligence Index sintetiza varias evaluaciones. Unos puntos de diferencia sirven como señal, pero no equivalen a "más inteligencia" universal ni anticipan todos los casos de uso.

La tabla oficial de Google tampoco muestra un dominio total. GPT-5.6 Terra aparece por delante en Terminal-Bench 2.1 y Claude Sonnet 5, en Agent's Last Exam.

La metodología de Google combina resultados propios, leaderboards públicos y cifras de otros proveedores. Es evidencia útil, no una comparación perfectamente controlada.

Google también reconoce alucinaciones, lentitud ocasional y timeouts.

Su model card añade un límite específico: puede resolver tareas de código individuales, pero no encadenar por sí solo un flujo de investigación de IA de extremo a extremo.

Ese límite se refiere a investigación de IA de extremo a extremo. No demuestra que el modelo falle en todos los flujos de trabajo ni en cualquier uso de agentes con varios pasos.

El precio es una trampa de calendario

Hasta el 31 de diciembre de 2026, Standard cuesta US$0,75 por millón de tokens de entrada y US$3,75 por millón de salida, incluido el thinking.

Desde el 1 de enero de 2027, sube a US$1,50 de entrada y US$7,50 de salida por millón. El tarifario oficial deja claro que el precio actual es introductorio.

Por eso evaluaría cualquier caso de producción con la tarifa de 2027, salvo que el proyecto termine antes. El precio de lanzamiento puede distorsionar una decisión de largo plazo.

Las alternativas que yo miraría primero

Mi lista no es un ranking universal. Para programación, investigación y trabajo con agentes, primero evalúo Claude o modelos de OpenAI.

Grok puede entrar después si una tarea concreta encaja con sus fortalezas, pero no es mi elección predeterminada.

Si el presupuesto es limitado y necesito maximizar los tokens por dólar, considero primero GPT-5.6 Luna, la opción económica de OpenAI.

Después considero GLM, Kimi o DeepSeek. Su volumen a menor costo puede ser útil, pero probaría sus compromisos de calidad, latencia y confiabilidad con tareas reales.

OpenAI documenta oficialmente gpt-5.6-luna con cerca de 1,05 millones de tokens de contexto.

Su precio publicado es US$0,20 por millón de tokens de entrada, US$0,02 por millón de entrada en caché y US$1,20 por millón de salida.

Cualquier costo por tarea que Artificial Analysis muestre para Luna es una estimación de su benchmark. No es el precio oficial publicado por OpenAI.

Estas alternativas encajan mejor con algunas de mis prioridades, pero también tienen compromisos propios. La elección correcta depende de las tareas, la configuración y el entorno real de ejecución.

Cuándo sí usaría Gemini 3.7 Flash

Hay tres escenarios donde sus fortalezas pueden pesar más que mis reservas:

  1. Carga multimodal intensa. Si el trabajo combina video, audio, imágenes y PDF en volumen, su entrada multimodal y el contexto amplio forman una propuesta difícil de ignorar.
  2. Velocidad de salida crítica. Casi 390 tokens por segundo en la medición consultada pueden ser decisivos cuando importa generar grandes volúmenes de texto con rapidez.
  3. Ecosistema Google. Search, Maps, AI Studio y Antigravity reducen fricción si la operación ya vive allí, aunque ese valor provenga del producto alrededor del modelo.

Mi veredicto

Gemini 3.7 Flash es rápido, multimodal, capaz y competitivo mientras dura el precio introductorio. No necesito negar esas cualidades para explicar por qué no sería mi primera opción.

En mi trabajo pesan más la calidad sostenida en programación, investigación y agentes, junto con la latencia inicial y el costo de largo plazo.

Por eso evalúo primero Claude o modelos de OpenAI. Grok queda como opción secundaria para tareas concretas, no como punto de partida.

Si el presupuesto exige maximizar los tokens por dólar, dentro de OpenAI empiezo por Luna. Después considero GLM, Kimi o DeepSeek y mido sus compromisos con tareas reales.

Eso no prueba que esas alternativas sean mejores para todos. Tampoco realicé un benchmark propio controlado que permita afirmar una inferioridad universal de Gemini.

Si se está considerando una migración, la prueba válida es ejecutar tareas reales con la misma entrada, herramientas, presupuesto y criterio de aceptación.

Es la misma cautela metodológica que apliqué en la comparativa de Opus 5, GPT-5.6 y Gemini.

Yo, hoy, no lo elegiría como primera opción. No porque una tabla lo condene, sino porque sus ventajas principales no son las que más necesito.

Preguntas frecuentes

¿Qué es Gemini 3.7 Flash y cuándo salió?

Es el modelo que Google lanzó el 13 de agosto de 2026 como su Flash más inteligente para código y agentes. El ID estable es gemini-3.7-flash.

Admite texto, imagen, video, audio y PDF como entrada, con cerca de 1 millón de tokens de contexto, y genera texto como salida.

¿Cuánto cuesta Gemini 3.7 Flash?

Hasta el 31 de diciembre de 2026 cuesta US$0,75 por millón de tokens de entrada y US$3,75 por millón de salida en Standard.

Desde el 1 de enero de 2027, el precio Standard sube a US$1,50 de entrada y US$7,50 de salida por millón de tokens.

¿Qué velocidad tiene Gemini 3.7 Flash?

Artificial Analysis, consultado el 20 de agosto de 2026, registraba en high casi 390 tokens de salida por segundo y unos 15,4 segundos hasta el primer token de respuesta.

Son métricas móviles y dependientes de la configuración. En low, la misma fuente mostraba cerca de 1,0 segundo hasta la primera respuesta, con un puntaje y un costo por tarea menores.

¿Es Gemini 3.7 Flash el mejor modelo de su clase?

No existe una respuesta universal. Es un modelo capaz, pero para mi trabajo de programación, investigación y agentes no sería la primera opción.

Ese veredicto es una evaluación personal informada por evidencia. No es un benchmark propio controlado ni una prueba de inferioridad universal.

Fuentes consultadas

Nicolas Farchica

Nicolas Farchica

Especialista en Agentes de IA · Copenhague

Diseño e implemento agentes IA, MCP servers y harnesses en producción: el loop, las herramientas y el contexto que hacen que un modelo pase de contestar a trabajar. Todo lo que ves en este sitio está construido así.

Artículos relacionados