Volver al Blog

Gemini 3.8 Flash: análisis, precio y el costo real por tarea

2 de septiembre de 202611 min de lectura·Nicolas Farchica

Google lanzó Gemini 3.8 Flash el 2 de septiembre de 2026, el tercer modelo Flash en seis semanas, con un argumento directo: casi iguala a Claude Opus 5 en ingeniería de software agéntica a una fracción del precio por token.

Pero el mismo anuncio esconde la letra chica más honesta que leí de Google en un rato: el modelo "trabaja más", consume más tokens por tarea, y la propia Google recomienda seguir usando el 3.7 Flash cuando lo que prima es la eficiencia.

Mi veredicto corto: como motor de código agéntico a precio introductorio, el 3.8 es una opción seria que corrige gran parte de lo que le critiqué al 3.7 Flash. Como decisión de adopción, el número que importa no es el precio del token sino el costo de la tarea completa, y ahí el 3.8 es más caro que su propio predecesor.

Esta es una evaluación informada por el anuncio oficial de Google y por datos independientes de Artificial Analysis. No es un benchmark propio controlado, y las comparativas entre proveedores vienen de harnesses distintos: sirven para dimensionar, no para coronar un ganador universal.

La ficha técnica del modelo

DatoGemini 3.8 Flash
Lanzamiento2 de septiembre de 2026
Variantes3.8 Flash (general) · 3.8 Flash Cyber (ciberseguridad, restringida)
CadenciaTercer Flash en 6 semanas (3.6 → 3.7 → 3.8)
Precio introductorioUS$0,75 / M tokens de entrada · US$3,75 / M de salida
Precio desde el 1/1/2027US$1,50 / US$7,50
DisponibilidadAI Studio, Antigravity, Android Studio, Gemini Enterprise, app Gemini, AI Mode y Sheets

El dato de cadencia no es un detalle de color. Tres lanzamientos Flash en mes y medio mientras el modelo frontera de Google (3.5 Pro y la próxima generación) sigue sin aparecer dice algo de la estrategia: competir por ahora en precio-rendimiento, con la esperanza de que el "trabaja más" compense la ausencia de frontera.

Los números oficiales de Google: a un paso de Opus 5

La tabla oficial de evals que acompaña el anuncio compara a 3.8 Flash con los modelos de referencia de cada competidor. En DeepSWE v1.1, el benchmark de ingeniería de software de largo aliento donde un agente resuelve problemas completos de principio a fin, Google reporta estos resultados:

ModeloDeepSWE v1.1
Claude Opus 574,0%
Gemini 3.8 Flash73,7%
GPT-5.6 Sol72,7%
Gemini 3.7 Flash65,3%
Claude Sonnet 553,8%

Tabla oficial de evals de Gemini 3.8 Flash comparada con modelos de Anthropic y OpenAI Fuente: Google.

Dos lecturas sobre esa tabla. La primera: la brecha con su propio predecesor es enorme, más de ocho puntos, y el salto cualitativo es real. La segunda: la distancia con Opus 5 es de tres décimas, dentro de cualquier margen de ruido entre harnesses distintos. Que un modelo de US$3,75 por millón de tokens de salida empatc técnico con uno de US$25 es la noticia, no el orden entre 73,7 y 74,0.

Gráfico oficial de Google del resultado de Gemini 3.8 Flash en DeepSWE v1.1 Fuente: Google.

La advertencia metodológica va en el cuerpo del artículo y no en una nota al pie: estos números los midió Google con su propio harness. El resultado es legítimo como evidencia de Google, pero no es directamente comparable con las tablas que publica Anthropic u OpenAI, porque cada uno elige prompts, herramientas y graders distintos. En el análisis de Opus 5 contra GPT-5.6 y Gemini ya vimos cómo la misma carrera se cuenta de formas distintas según quién mide.

El precio de lista: la mitad de Opus 5, y duplicando en enero

ModeloEntrada / M tokensSalida / M tokens
Gemini 3.8 Flash (intro, hasta 31/12/2026)US$0,75US$3,75
Gemini 3.8 Flash (desde 1/1/2027)US$1,50US$7,50
Gemini 3.7 FlashUS$0,75US$3,75
GPT-5.6 SolUS$4,00US$20,00
Claude Opus 5US$5,00US$25,00

En precio de lista, 3.8 Flash arranca siendo entre 5 y 7 veces más barato que los modelos frontera de la competencia, y el precio introductorio es idéntico al del 3.7. Hasta acá, la historia es impecable.

El problema es lo que ese precio no dice.

La trampa del "works harder": precio por token no es costo por tarea

La explicación oficial de por qué 3.8 rinde tanto más que 3.7 es un diseño interno que Google resume en dos palabras: works harder. En tareas complejas, el modelo ejecuta más pasos de razonamiento y llama herramientas de forma iterativa. Y ese esfuerzo se paga en tokens: "en ocasiones el modelo puede usar más tokens para maximizar el rendimiento, especialmente en niveles de esfuerzo altos", dice el anuncio.

El efecto, medido por Artificial Analysis (plataforma independiente de benchmarking), es concreto:

Métrica (esfuerzo alto)Gemini 3.7 FlashGemini 3.8 Flash
Intelligence Index (AA)5659
Precio por tokenUS$0,75 / US$3,75US$0,75 / US$3,75 (igual)
Costo por tareaUS$0,40US$0,58
Tiempo promedio por tarea2,2 min2,5 min

El costo por tarea subió cerca de 45% sin que el precio por token se moviera un centavo. Con el 3.7, una tarea típica salía 40 centavos; con el 3.8, 58. La tarifa por kilómetro es la misma, pero el viaje consume más kilómetros porque el modelo se toma el camino largo para llegar mejor.

Pensalo así: el precio por token es la tarifa, el costo por tarea es lo que pagás al final del viaje. Adoptar un modelo mirando solo la tarifa es como elegir un taxi por el costo del kilómetro sin preguntar cuántos kilómetros necesita para llegar.

Y acá está el detalle que hace único a este lanzamiento: Google no lo esconde. En el mismo anuncio recomienda, para "aplicaciones donde la eficiencia de cómputo es la restricción principal", usar niveles de esfuerzo más bajos o seguir con Gemini 3.7 Flash, que permanece totalmente soportado. Que un proveedor lance un modelo nuevo y en la misma página sugiera mantener el anterior para parte de tus cargas es raro, honesto, y la mejor evidencia de que la elección dejó de ser "el último modelo gana".

Para dimensionar el costo total también importa la velocidad: a esfuerzo alto, 3.8 tarda unos 2,5 minutos por tarea según Artificial Analysis, apenas más que el 3.7 (2,2) y que Claude Fable 5.1 (2,1). No es un modelo lento, pero el "Flash" de su nombre hoy describe su precio más que su tiempo de resolución.

Seguridad para agentes: el avance silencioso en prompt injection

El dato que más me interesa para mi trabajo no aparece en el titular: en el benchmark Gray Swan de indirect prompt injection, 3.8 Flash muestra una tasa de éxito de ataque de 5,5%. Es el segundo mejor registro de la tabla oficial, apenas detrás de Claude Opus 5 (4,8%) y muy lejos del resto de los modelos comparados, que superan el 51%.

Gráfico oficial del benchmark Gray Swan de prompt injection donde Gemini 3.8 Flash registra 5,5% de ataques exitosos Fuente: Google.

Para un agente que lee correos, documentos o páginas web, la robustez contra inyección de prompts no es un benchmark más: es la diferencia entre un sistema confiable y uno que puede ser secuestrado por el contenido que procesa. Que un modelo económico llegue cerca del mejor registro de la industria cambia el presupuesto de cualquier arquitectura de agentes: la capa de defensa ya no tiene que estar solo en el modelo caro.

Flash Cyber: el mismo patrón de los modelos restringidos

La segunda mitad del anuncio es Gemini 3.8 Flash Cyber, una variante especializada en ciberseguridad que no está disponible públicamente: se distribuye a gobiernos, operadores de infraestructura crítica y mantenedores de software a través del programa Fairwind.

Los números que reporta Google son fuertes: 86,2% en CyberGym (detección de vulnerabilidades en C/C++), por encima del 3.5 Flash Cyber (77,5%) y de GPT-5.6 Sol (83,6%), y 47,2% en CWE-Bench de parcheo automatizado, casi empatado con el modelo frontera líder (47,8%) a costo mucho menor. Google además lo usa internamente: el equipo de seguridad de Chrome reporta 2,6 veces más parches correctos que los mejores modelos comerciales más grandes.

Este patrón ya no es novedad: Anthropic lo abrió con Mythos (su modelo más potente, con acceso restringido) y OpenAI lo confirmó con Astra. Los modelos más capaces en tareas de doble uso se vuelven acceso controlado, y la versión general conserva las capacidades atenuadas. Para quien construye agentes defensivos, la conclusión operativa es que la ciberseguridad de punta ahora se negocia por programa, no se contrata por API.

Cuándo sí conviene y cuándo no

Después de revisar las dos caras del lanzamiento, mi criterio de adopción queda así:

Tiene sentido usarlo si:

  • Tu carga es código agéntico o razonamiento multi-paso donde la calidad justifica más tokens, y querés aprovechar el precio introductorio hasta el 31 de diciembre de 2026.
  • Necesitás robustez contra prompt injection sin pagar precio de frontera.
  • Evaluás el costo por tarea completo de tu caso, no el precio del token.

Conviene esperar o quedarse en el 3.7 si:

  • Tu carga es de alto volumen y baja complejidad, donde la eficiencia manda: es exactamente el caso donde Google recomienda el 3.7.
  • Tu presupuesto depende de precios estables: el costo por token duplica el 1 de enero de 2027, y toda decisión de migración debería estar estresada contra ese número.
  • Tu caso ya está resuelto y verificado con otro modelo: cambiar por el puntaje de una tabla con otro harness no es una decisión, es un costumbre caro.

Mi veredicto

Hace dos semanas escribí que el 3.7 Flash era un modelo capaz que no sería mi primera opción. El 3.8 corrige lo principal: el salto en código agéntico es real, medible y viene al mismo precio introductorio. Para prototipar y para cargas de código agéntico entre ahora y diciembre, es una opción que tomaría en serio.

Lo que no cambia es el criterio de decisión. El número que gobierna esta adopción no está en la tabla de benchmarks: está en cuántos tokens consume tu tarea real. Google fue lo bastante honesta como para escribirlo en su propio anuncio; sería un error leer el lanzamiento e ignorar esa parte.

Y la cadencia sigue siendo la señal estratégica: tres Flash en seis semanas es la táctica de quien compite por precio-rendimiento mientras resuelve su frontera. Para quien adopta, eso significa una cosa: toda decisión de hoy debería sobrevivir al precio de enero y al modelo del mes que viene.

Preguntas frecuentes

¿Qué es Gemini 3.8 Flash y cuándo salió?

Es el modelo Flash de Google lanzado el 2 de septiembre de 2026, el tercero en seis semanas. Viene en dos versiones: 3.8 Flash, de propósito general para razonamiento y código, y 3.8 Flash Cyber, especializada en ciberseguridad y disponible solo por el programa Fairwind para defensores verificados.

¿Cuánto cuesta Gemini 3.8 Flash?

El precio introductorio, igual al del 3.7, es de US$0,75 por millón de tokens de entrada y US$3,75 por millón de salida hasta el 31 de diciembre de 2026. Desde el 1 de enero de 2027 pasa a US$1,50 y US$7,50.

¿Gemini 3.8 Flash es mejor que Claude Opus 5?

En DeepSWE v1.1, medido por Google, quedan empatados técnicos: 73,7% contra 74,0%, con el 3.8 a una fracción del precio por token. Es evidencia de un solo proveedor con su propio harness: dimensiona capacidad, no garantiza el mismo orden en tu caso de uso.

¿Por qué el precio por token no refleja el costo real?

Porque el modelo razona en más pasos y llama herramientas de forma iterativa, consumiendo más tokens por tarea. Según Artificial Analysis, el costo por tarea pasó de US$0,40 (3.7) a US$0,58 (3.8) sin cambio de tarifa. Para cargas donde prima la eficiencia, la propia Google sugiere niveles de esfuerzo menores o seguir con el 3.7.

Fuentes consultadas

Nicolas Farchica
Nicolas Farchica

Especialista en Agentes de IA · Copenhague

Diseño e implemento agentes IA, MCP servers y harnesses en producción: el loop, las herramientas y el contexto que hacen que un modelo pase de contestar a trabajar. Todo lo que ves en este sitio está construido así.

Artículos relacionados