Gemini 3.8 Flash: análisis, precio y el costo real por tarea
En este artículo
Google lanzó Gemini 3.8 Flash el 2 de septiembre de 2026, el tercer modelo Flash en seis semanas, con un argumento directo: casi iguala a Claude Opus 5 en ingeniería de software agéntica a una fracción del precio por token.
Pero el mismo anuncio esconde la letra chica más honesta que leí de Google en un rato: el modelo "trabaja más", consume más tokens por tarea, y la propia Google recomienda seguir usando el 3.7 Flash cuando lo que prima es la eficiencia.
Mi veredicto corto: como motor de código agéntico a precio introductorio, el 3.8 es una opción seria que corrige gran parte de lo que le critiqué al 3.7 Flash. Como decisión de adopción, el número que importa no es el precio del token sino el costo de la tarea completa, y ahí el 3.8 es más caro que su propio predecesor.
Esta es una evaluación informada por el anuncio oficial de Google y por datos independientes de Artificial Analysis. No es un benchmark propio controlado, y las comparativas entre proveedores vienen de harnesses distintos: sirven para dimensionar, no para coronar un ganador universal.
La ficha técnica del modelo
| Dato | Gemini 3.8 Flash |
|---|---|
| Lanzamiento | 2 de septiembre de 2026 |
| Variantes | 3.8 Flash (general) · 3.8 Flash Cyber (ciberseguridad, restringida) |
| Cadencia | Tercer Flash en 6 semanas (3.6 → 3.7 → 3.8) |
| Precio introductorio | US$0,75 / M tokens de entrada · US$3,75 / M de salida |
| Precio desde el 1/1/2027 | US$1,50 / US$7,50 |
| Disponibilidad | AI Studio, Antigravity, Android Studio, Gemini Enterprise, app Gemini, AI Mode y Sheets |
El dato de cadencia no es un detalle de color. Tres lanzamientos Flash en mes y medio mientras el modelo frontera de Google (3.5 Pro y la próxima generación) sigue sin aparecer dice algo de la estrategia: competir por ahora en precio-rendimiento, con la esperanza de que el "trabaja más" compense la ausencia de frontera.
Los números oficiales de Google: a un paso de Opus 5
La tabla oficial de evals que acompaña el anuncio compara a 3.8 Flash con los modelos de referencia de cada competidor. En DeepSWE v1.1, el benchmark de ingeniería de software de largo aliento donde un agente resuelve problemas completos de principio a fin, Google reporta estos resultados:
| Modelo | DeepSWE v1.1 |
|---|---|
| Claude Opus 5 | 74,0% |
| Gemini 3.8 Flash | 73,7% |
| GPT-5.6 Sol | 72,7% |
| Gemini 3.7 Flash | 65,3% |
| Claude Sonnet 5 | 53,8% |
Fuente: Google.
Dos lecturas sobre esa tabla. La primera: la brecha con su propio predecesor es enorme, más de ocho puntos, y el salto cualitativo es real. La segunda: la distancia con Opus 5 es de tres décimas, dentro de cualquier margen de ruido entre harnesses distintos. Que un modelo de US$3,75 por millón de tokens de salida empatc técnico con uno de US$25 es la noticia, no el orden entre 73,7 y 74,0.
Fuente: Google.
La advertencia metodológica va en el cuerpo del artículo y no en una nota al pie: estos números los midió Google con su propio harness. El resultado es legítimo como evidencia de Google, pero no es directamente comparable con las tablas que publica Anthropic u OpenAI, porque cada uno elige prompts, herramientas y graders distintos. En el análisis de Opus 5 contra GPT-5.6 y Gemini ya vimos cómo la misma carrera se cuenta de formas distintas según quién mide.
El precio de lista: la mitad de Opus 5, y duplicando en enero
| Modelo | Entrada / M tokens | Salida / M tokens |
|---|---|---|
| Gemini 3.8 Flash (intro, hasta 31/12/2026) | US$0,75 | US$3,75 |
| Gemini 3.8 Flash (desde 1/1/2027) | US$1,50 | US$7,50 |
| Gemini 3.7 Flash | US$0,75 | US$3,75 |
| GPT-5.6 Sol | US$4,00 | US$20,00 |
| Claude Opus 5 | US$5,00 | US$25,00 |
En precio de lista, 3.8 Flash arranca siendo entre 5 y 7 veces más barato que los modelos frontera de la competencia, y el precio introductorio es idéntico al del 3.7. Hasta acá, la historia es impecable.
El problema es lo que ese precio no dice.
La trampa del "works harder": precio por token no es costo por tarea
La explicación oficial de por qué 3.8 rinde tanto más que 3.7 es un diseño interno que Google resume en dos palabras: works harder. En tareas complejas, el modelo ejecuta más pasos de razonamiento y llama herramientas de forma iterativa. Y ese esfuerzo se paga en tokens: "en ocasiones el modelo puede usar más tokens para maximizar el rendimiento, especialmente en niveles de esfuerzo altos", dice el anuncio.
El efecto, medido por Artificial Analysis (plataforma independiente de benchmarking), es concreto:
| Métrica (esfuerzo alto) | Gemini 3.7 Flash | Gemini 3.8 Flash |
|---|---|---|
| Intelligence Index (AA) | 56 | 59 |
| Precio por token | US$0,75 / US$3,75 | US$0,75 / US$3,75 (igual) |
| Costo por tarea | US$0,40 | US$0,58 |
| Tiempo promedio por tarea | 2,2 min | 2,5 min |
El costo por tarea subió cerca de 45% sin que el precio por token se moviera un centavo. Con el 3.7, una tarea típica salía 40 centavos; con el 3.8, 58. La tarifa por kilómetro es la misma, pero el viaje consume más kilómetros porque el modelo se toma el camino largo para llegar mejor.
Pensalo así: el precio por token es la tarifa, el costo por tarea es lo que pagás al final del viaje. Adoptar un modelo mirando solo la tarifa es como elegir un taxi por el costo del kilómetro sin preguntar cuántos kilómetros necesita para llegar.
Y acá está el detalle que hace único a este lanzamiento: Google no lo esconde. En el mismo anuncio recomienda, para "aplicaciones donde la eficiencia de cómputo es la restricción principal", usar niveles de esfuerzo más bajos o seguir con Gemini 3.7 Flash, que permanece totalmente soportado. Que un proveedor lance un modelo nuevo y en la misma página sugiera mantener el anterior para parte de tus cargas es raro, honesto, y la mejor evidencia de que la elección dejó de ser "el último modelo gana".
Para dimensionar el costo total también importa la velocidad: a esfuerzo alto, 3.8 tarda unos 2,5 minutos por tarea según Artificial Analysis, apenas más que el 3.7 (2,2) y que Claude Fable 5.1 (2,1). No es un modelo lento, pero el "Flash" de su nombre hoy describe su precio más que su tiempo de resolución.
Seguridad para agentes: el avance silencioso en prompt injection
El dato que más me interesa para mi trabajo no aparece en el titular: en el benchmark Gray Swan de indirect prompt injection, 3.8 Flash muestra una tasa de éxito de ataque de 5,5%. Es el segundo mejor registro de la tabla oficial, apenas detrás de Claude Opus 5 (4,8%) y muy lejos del resto de los modelos comparados, que superan el 51%.
Fuente: Google.
Para un agente que lee correos, documentos o páginas web, la robustez contra inyección de prompts no es un benchmark más: es la diferencia entre un sistema confiable y uno que puede ser secuestrado por el contenido que procesa. Que un modelo económico llegue cerca del mejor registro de la industria cambia el presupuesto de cualquier arquitectura de agentes: la capa de defensa ya no tiene que estar solo en el modelo caro.
Flash Cyber: el mismo patrón de los modelos restringidos
La segunda mitad del anuncio es Gemini 3.8 Flash Cyber, una variante especializada en ciberseguridad que no está disponible públicamente: se distribuye a gobiernos, operadores de infraestructura crítica y mantenedores de software a través del programa Fairwind.
Los números que reporta Google son fuertes: 86,2% en CyberGym (detección de vulnerabilidades en C/C++), por encima del 3.5 Flash Cyber (77,5%) y de GPT-5.6 Sol (83,6%), y 47,2% en CWE-Bench de parcheo automatizado, casi empatado con el modelo frontera líder (47,8%) a costo mucho menor. Google además lo usa internamente: el equipo de seguridad de Chrome reporta 2,6 veces más parches correctos que los mejores modelos comerciales más grandes.
Este patrón ya no es novedad: Anthropic lo abrió con Mythos (su modelo más potente, con acceso restringido) y OpenAI lo confirmó con Astra. Los modelos más capaces en tareas de doble uso se vuelven acceso controlado, y la versión general conserva las capacidades atenuadas. Para quien construye agentes defensivos, la conclusión operativa es que la ciberseguridad de punta ahora se negocia por programa, no se contrata por API.
Cuándo sí conviene y cuándo no
Después de revisar las dos caras del lanzamiento, mi criterio de adopción queda así:
Tiene sentido usarlo si:
- Tu carga es código agéntico o razonamiento multi-paso donde la calidad justifica más tokens, y querés aprovechar el precio introductorio hasta el 31 de diciembre de 2026.
- Necesitás robustez contra prompt injection sin pagar precio de frontera.
- Evaluás el costo por tarea completo de tu caso, no el precio del token.
Conviene esperar o quedarse en el 3.7 si:
- Tu carga es de alto volumen y baja complejidad, donde la eficiencia manda: es exactamente el caso donde Google recomienda el 3.7.
- Tu presupuesto depende de precios estables: el costo por token duplica el 1 de enero de 2027, y toda decisión de migración debería estar estresada contra ese número.
- Tu caso ya está resuelto y verificado con otro modelo: cambiar por el puntaje de una tabla con otro harness no es una decisión, es un costumbre caro.
Mi veredicto
Hace dos semanas escribí que el 3.7 Flash era un modelo capaz que no sería mi primera opción. El 3.8 corrige lo principal: el salto en código agéntico es real, medible y viene al mismo precio introductorio. Para prototipar y para cargas de código agéntico entre ahora y diciembre, es una opción que tomaría en serio.
Lo que no cambia es el criterio de decisión. El número que gobierna esta adopción no está en la tabla de benchmarks: está en cuántos tokens consume tu tarea real. Google fue lo bastante honesta como para escribirlo en su propio anuncio; sería un error leer el lanzamiento e ignorar esa parte.
Y la cadencia sigue siendo la señal estratégica: tres Flash en seis semanas es la táctica de quien compite por precio-rendimiento mientras resuelve su frontera. Para quien adopta, eso significa una cosa: toda decisión de hoy debería sobrevivir al precio de enero y al modelo del mes que viene.
Preguntas frecuentes
¿Qué es Gemini 3.8 Flash y cuándo salió?
Es el modelo Flash de Google lanzado el 2 de septiembre de 2026, el tercero en seis semanas. Viene en dos versiones: 3.8 Flash, de propósito general para razonamiento y código, y 3.8 Flash Cyber, especializada en ciberseguridad y disponible solo por el programa Fairwind para defensores verificados.
¿Cuánto cuesta Gemini 3.8 Flash?
El precio introductorio, igual al del 3.7, es de US$0,75 por millón de tokens de entrada y US$3,75 por millón de salida hasta el 31 de diciembre de 2026. Desde el 1 de enero de 2027 pasa a US$1,50 y US$7,50.
¿Gemini 3.8 Flash es mejor que Claude Opus 5?
En DeepSWE v1.1, medido por Google, quedan empatados técnicos: 73,7% contra 74,0%, con el 3.8 a una fracción del precio por token. Es evidencia de un solo proveedor con su propio harness: dimensiona capacidad, no garantiza el mismo orden en tu caso de uso.
¿Por qué el precio por token no refleja el costo real?
Porque el modelo razona en más pasos y llama herramientas de forma iterativa, consumiendo más tokens por tarea. Según Artificial Analysis, el costo por tarea pasó de US$0,40 (3.7) a US$0,58 (3.8) sin cambio de tarifa. Para cargas donde prima la eficiencia, la propia Google sugiere niveles de esfuerzo menores o seguir con el 3.7.
Fuentes consultadas
- Anuncio oficial de Gemini 3.8 Flash y 3.8 Flash Cyber — Google, 2 de septiembre de 2026 (benchmarks, precios, disponibilidad, recomendación del 3.7).
- Gemini 3.8 Flash is Google's third budget model in six weeks — The Decoder, 2 de septiembre de 2026 (números de DeepSWE por modelo, contexto de cadencia).
- Análisis de Gemini 3.8 Flash — Artificial Analysis (Intelligence Index, costo y tiempo por tarea).
- Tablas y gráficos oficiales de evals rehosteados con atribución "Fuente: Google".
Especialista en Agentes de IA · Copenhague
Diseño e implemento agentes IA, MCP servers y harnesses en producción: el loop, las herramientas y el contexto que hacen que un modelo pase de contestar a trabajar. Todo lo que ves en este sitio está construido así.
Artículos relacionados
Claude Buddy: Guía Completa del Tamagotchi de Claude Code (18 Especies y Rarezas)
Claude Buddy: las 18 especies, 5 rarezas, comandos /buddy y cómo conseguir un Shiny Legendary (0.01% de probabilidad). Guía completa en español.
Qué es Grok Bot y cómo evaluarlo con un piloto controlado
Cómo funciona Grok Bot, qué comparte entre agentes y qué revisar sobre permisos, privacidad, gobierno y costos antes de probar un único proceso.
Inteligencia Artificial para PyMEs: Por Dónde Empezar en 2026 (Guía Práctica)
IA para PyMEs: por dónde empezar, qué herramientas usar, cuánto cuesta y qué esperar. Sin tecnicismos. Con plan de acción de 30 días.