Volver al Blog

Claude Opus 5 vs GPT-5.6 vs Gemini: Cuál Es Mejor

25 de julio de 202612 min de lectura·Nicolas Farchica

Claude Opus 5 salió el 24 de julio de 2026, quince días después de que OpenAI lanzara GPT-5.6 Sol. Ya conté qué trae Opus 5 y cuánto cuesta, y antes cuándo usar cada modelo de Anthropic. Falta la pregunta incómoda: contra la competencia, ¿quién gana?

No es una pregunta con una sola respuesta — es una pregunta con tres respuestas distintas según qué necesites. Y hay un problema de fondo que casi nadie menciona: los dos anuncios se declaran state-of-the-art, y los dos tienen razón, porque miden cosas diferentes.

Acá están los números oficiales de cada empresa, quién gana en qué, y qué parte de la comparación directamente no se puede hacer.


El problema de fondo: cada uno gana en su propia cancha

Empecemos por el ejemplo que lo explica todo. Codificación agéntica en terminal, dos mediciones oficiales, dos ganadores opuestos:

Quién publicaBenchmarkGanador
OpenAITerminal-Bench 2.1GPT-5.6 Sol (88,8% vs 83,1% de Fable 5)
AnthropicFrontier-Bench v0.1Claude Opus 5 (43,3% vs 34,4% de Sol)

Misma categoría de tarea. Veredictos invertidos. Cada empresa eligió el benchmark donde gana y lo corrió en su propio harness.

Ahora, un punto importante que se repite mal en casi todas las comparativas de esta semana: Anthropic sí mide a OpenAI. La tabla oficial del anuncio de Opus 5 tiene una columna entera de GPT-5.6 Sol con doce benchmarks.

Tabla oficial de benchmarks de Claude Opus 5 contra Fable 5, Opus 4.8 y GPT-5.6 Sol

Tabla oficial de Anthropic. Notá la columna de la derecha.

A quien Anthropic no menciona en ninguna parte del anuncio es a Google. No hay columna de Gemini. Volvemos sobre eso más abajo.

Y sumale un detalle de calendario que explica la mitad de las contradicciones: GPT-5.6 Sol salió el 9 de julio, quince días antes que Opus 5. Todos los números que OpenAI publica sobre Claude están medidos contra Opus 4.8. Nunca midió contra Opus 5, porque no existía.

Traducción práctica: las diferencias grandes (2x, 4x, 70x) son señal real. Las de uno o dos puntos son ruido de metodología.


Razonamiento sobre problemas nuevos → Opus 5, por casi 4x

ARC-AGI-3 mide algo que importa mucho y se publicita poco: resolver problemas que el modelo no vio durante el entrenamiento. No es memoria, es razonamiento.

Claude Opus 5 y GPT-5.6 Sol en ARC-AGI-3, rendimiento por costo

ModeloARC-AGI-3Fuente
Claude Opus 530,2%Anthropic
GPT-5.6 Sol7,8%Anthropic
Claude Opus 4.81,5%Anthropic
Gemini 3.1 Pro0,42%OpenAI

Opus 5 casi cuadruplica a Sol y saca setenta veces a Gemini. Y las dos primeras cifras salen de la misma tabla, corridas por la misma empresa: no hay problema de harness acá.

Esta es la brecha más grande de toda la comparativa, y es la que menos aparece en los titulares.


Terminal: Opus 5 llega más alto, Sol llega más barato

El gráfico de Frontier-Bench es más honesto que cualquier número suelto, porque muestra la curva completa de rendimiento contra costo.

Claude Opus 5, Fable 5, Opus 4.8 y GPT-5.6 Sol en Frontier-Bench v0.1

Leelo así:

  • En el techo gana Opus 5: 43,3% contra el 34,4% de Sol. Ninguna discusión.
  • En la zona barata gana Sol: alrededor de los $3 por intento, Sol ya está en 22% y Opus 5 todavía no arrancó su ladder.
  • Fable 5, el buque insignia de Anthropic, queda tercero — detrás de Opus 5 y de Sol.

Y hay una letra chica que vale más que el gráfico. La nota al pie dice que Opus 4.8 se usó como fallback cuando el clasificador de seguridad rechazó tareas de Opus 5 y Fable 5. O sea: los modelos nuevos se negaron a hacer parte del benchmark de codificación y hubo que taparlo con el modelo viejo.

Eso no aparece en ningún titular. Sí, en serio.

En Terminal-Bench 2.1 —benchmark de OpenAI, que Anthropic no publica— Sol marca 88,8% y 91,9% en modo ultra. Ese modo coordina cuatro agentes en paralelo por defecto: no es un modelo distinto, es la misma capacidad comprada con más cómputo.


Búsqueda agéntica → Opus 5, por cuatro décimas

Acá está la corrección que ninguna comparativa publicada esta semana hizo.

ModeloBrowseComp
Claude Opus 590,8%
GPT-5.6 Sol90,4%
Claude Fable 587,4%
Claude Opus 4.884,3%

OpenAI presentó BrowseComp como una victoria suya, y lo era: 90,4% contra el 84,3% de Opus 4.8, que era el mejor Claude disponible el 9 de julio. Cuando Anthropic vuelve a correr el mismo benchmark con Opus 5, se da vuelta.

Detalle que da confianza: las dos empresas reportan el mismo 90,4% para Sol. Donde miden lo mismo, coinciden. Eso hace creíble el 90,8% de Opus 5.

Cuatro décimas es empate técnico, no una paliza. Pero la conclusión que circula —"Sol gana en navegación"— quedó vieja el 24 de julio.


Trabajo profesional y computer use → Opus 5, sin matices

GDPval-AA v2 mide tareas de trabajo real, del tipo que hace una persona en su empleo durante horas.

ModeloGDPval-AA v2
Claude Opus 51.861 Elo
Claude Fable 51.747 Elo
GPT-5.6 Sol1.736 Elo
Claude Opus 4.81.593 Elo

Los cuatro números salen de la tabla de Anthropic, a propósito: OpenAI publica el mismo benchmark con un anclaje distinto y todos sus valores dan ~11 puntos más altos. Mezclar las dos fuentes en una sola tabla sería exactamente el error que este artículo viene señalando.

Opus 5 le saca 125 puntos a Sol. Y —dato que Anthropic subraya— le gana a Fable 5, que cuesta el doble.

En computer use, lo mismo:

Claude Opus 5, Fable 5, Opus 4.8 y GPT-5.6 Sol en OSWorld 2.0

Opus 5 marca 70,6% en OSWorld 2.0 contra 62,6% de Sol, y lo hace por menos plata por tarea. Es el gráfico más limpio de todo el anuncio.

También le saca ocho puntos en flujos de negocio: 26,0% contra 18,1% en AutomationBench. Y en el Legal Agent Benchmark la diferencia es de otro orden — 11,7% contra 2,5%.


Las dos filas donde Anthropic admite que pierde

Esto es lo más interesante del anuncio y no lo contó nadie. En su propia tabla, Anthropic resaltó en verde una celda donde gana OpenAI:

BenchmarkOpus 5GPT-5.6 Sol
DeepSWE v1.1 (codificación agéntica)68,8%72,7%
HealthBench Professional59,8%60,5%

En DeepSWE, Opus 5 queda tercero: detrás de Sol y también de Fable 5 (69,7%).

Publicar un benchmark donde perdés, y encima destacarlo visualmente, es una decisión editorial deliberada. Es la clase de gesto que hace que el resto de la tabla se lea con más confianza.


Gemini no está en esta carrera, y eso es la noticia

Google no tiene un modelo de frontera actualizado en el mercado. El 21 de julio lanzó Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber — toda la línea Flash, ninguno de frontera. Y sobre el Pro, el blog oficial de Google dice que sigue en pruebas con partners, sin fecha.

La señal más elocuente no es un benchmark: es que Anthropic no le dedicó una columna. Midió a OpenAI en doce pruebas y a Google en ninguna.

El Pro que sí se puede medir es Gemini 3.1 Pro, de febrero, y los números que existen vienen de la tabla de OpenAI:

BenchmarkOpus 5GPT-5.6 SolGemini 3.1 Pro
GDPval-AA v21.8611.736962,3
ARC-AGI-330,2%7,8%0,42%
Terminal-Bench 2.188,8%70,7%
SWE-Bench Pro64,6%54,2%

En quince días hubo dos lanzamientos de frontera. Ninguno fue de Google.

Ojo con la lectura fácil: Gemini 3.6 Flash cuesta $1,50 / $7,50 por millón de tokens y es competitivo en su categoría. Comparar un Flash contra un modelo de frontera no es una derrota de Google, es otra categoría. La derrota real es que el Pro no sale.


Precio: Opus 5 es un 20% más barato en output

ModeloInput /1MOutput /1M
Claude Opus 5$5$25
GPT-5.6 Sol$5$30
GPT-5.6 Terra$2,50$15
Gemini 3.6 Flash$1,50$7,50
GPT-5.6 Luna$1$6

Mismo input, output un 20% más caro en OpenAI. En cargas agénticas —donde el output domina la factura— esa diferencia se acumula rápido.

Opus 5 además mantiene exactamente el precio de Opus 4.8 con más del doble de rendimiento en Frontier-Bench, y es el nuevo modelo por defecto en Claude Max.


Qué dice quien ya lo está usando

El anuncio de Opus 5 juntó 2.700 votos y casi 600 comentarios en r/ClaudeAI en menos de un día. El resumen de la comunidad: Opus 5 es el nuevo rey por ahora, le gana a Fable 5 en benchmarks clave y encima sale más barato.

Pero el hilo más revelador es otro, y su título es una pregunta: cómo puede ser que Opus 5 sea el mejor para programar y al mismo tiempo no sea "el mejor modelo" de Anthropic.

La respuesta es que Fable 5 sigue siendo el buque insignia nominal, aunque Opus 5 lo supere en varias métricas a mitad de precio. Es confuso, y la confusión es legítima.

Hubo también, a 18 horas del lanzamiento, un hilo preguntando si Opus 5 ya había sido "nerfeado".


Lo que todavía no se puede saber

Cuatro cosas que ninguna tabla te va a resolver hoy, y que conviene tener presentes antes de migrar nada:

  1. No hay un benchmark independiente que corra los tres modelos en el mismo harness con Opus 5 incluido. Todo lo de arriba son mediciones de parte interesada.
  2. Opus 5 rechazó tareas del propio benchmark de codificación de Anthropic y se usó Opus 4.8 como fallback. Cuánto mueve eso el resultado real, no está publicado.
  3. Gemini 3.5 Pro es una incógnita real. Google no publicó números y podría cambiar el cuadro completo cuando salga.
  4. En ciberseguridad ofensiva, Opus 5 queda detrás de Mythos 5, el modelo especializado de la propia Anthropic. Lo dice Anthropic, no yo.

Tabla resumen: quién gana en qué

Necesitás…ModeloDato
Resolver problemas novedososClaude Opus 530,2% ARC-AGI-3 (4x Sol)
Trabajo profesional largoClaude Opus 51.861 Elo GDPval-AA v2
Computer useClaude Opus 570,6% OSWorld 2.0
Búsqueda agénticaClaude Opus 590,8% BrowseComp (por poco)
Flujos de negocio y legalClaude Opus 526,0% AutomationBench · 11,7% Legal
Terminal según OpenAIGPT-5.6 Sol88,8% Terminal-Bench 2.1
Terminal según AnthropicClaude Opus 543,3% Frontier-Bench v0.1
Codificación en DeepSWEGPT-5.6 Sol72,7% — lo publica Anthropic
Costo por outputClaude Opus 5$25 vs $30
Volumen baratoGemini 3.6 Flash$1,50 / $7,50
Exploits y seguridad ofensivaClaude Mythos 5Opus 5 queda detrás

Si tuviera que resumirlo en una línea: Opus 5 gana casi todo lo que se midió dos veces, y Sol gana donde OpenAI eligió la prueba. Google, por ahora, mira de afuera.


Preguntas frecuentes

¿Cuál es mejor para programar, Claude Opus 5 o GPT-5.6 Sol?

Depende de quién corra la prueba. En Terminal-Bench 2.1, el benchmark que publica OpenAI, Sol marca 88,8%. En Frontier-Bench v0.1, el que publica Anthropic, Opus 5 marca 43,3% contra 34,4% de Sol. Cada empresa gana en su propia cancha. Donde sí hay un ganador claro es en DeepSWE v1.1: Sol saca 72,7% contra 68,8% de Opus 5, y el dato lo publica la propia Anthropic.

¿Cuánto cuesta cada modelo por millón de tokens?

Claude Opus 5 cuesta $5 de input y $25 de output. GPT-5.6 Sol cuesta $5 de input y $30 de output, un 20% más caro en output. Gemini 3.6 Flash cuesta $1,50 y $7,50, pero es un modelo de clase Flash, no de frontera. Los tres precios son oficiales y están publicados por cada empresa.

¿Por qué Gemini quedó atrás en esta comparativa?

Porque Google no tiene un modelo de frontera actualizado en el mercado. Su Gemini 3.5 Pro sigue, según el blog oficial de Google, en pruebas con partners y sin fecha de lanzamiento. Lo último que publicó fueron modelos de clase Flash el 21 de julio de 2026. Anthropic ni siquiera lo incluye en su tabla comparativa oficial.

¿Anthropic compara Claude Opus 5 contra los modelos de OpenAI?

Sí. La tabla oficial del anuncio de Opus 5 incluye una columna completa de GPT-5.6 Sol con doce benchmarks, y Anthropic destaca la fila de DeepSWE v1.1 donde el modelo de OpenAI gana. A Google, en cambio, no lo menciona en ninguna parte del anuncio.


Si estás decidiendo qué modelo poner en producción y el cuadro te parece más confuso que aclarador, es porque lo es: la respuesta correcta cambia según la tarea, no según el ranking. Escribime y lo charlamos sobre tu caso concreto.

Fuentes: Anthropic — Introducing Claude Opus 5 · OpenAI — GPT-5.6 · Google — Gemini 3.6 Flash

Gráficos de benchmarks: material oficial de Anthropic, republicado con atribución.

Nicolas Farchica

Nicolas Farchica

Especialista Claude Code · Copenhague

Referente en Claude Code en español. Diseño e implemento sistemas de agentes IA, MCP servers y automatizaciones en producción. Ecosistema completo construido con Claude Code — el blog técnico más completo sobre Claude Code en español.

Artículos relacionados