Volver al Blog

Claude Opus 5: La Frontera a Mitad de Precio (Benchmarks)

25 de julio de 20267 min de lectura·Nicolas Farchica

Claude Opus 5 salió el 24 de julio de 2026 y cambia una cosa concreta: acerca la inteligencia de frontera a la mitad del precio. No es el modelo más potente de Anthropic —ese sigue siendo Fable 5— pero es el que vas a querer correr todos los días. Acá te dejo los benchmarks oficiales, el precio real y cuándo conviene usarlo.

Claude Opus 5, anuncio oficial de Anthropic

Es el cuarto modelo que Anthropic lanza en menos de dos meses: Mythos 5, Fable 5 y Sonnet 5 en junio, y ahora Opus 5. La cadencia es brutal, y la jerarquía quedó clara: Fable 5 en el tope, Opus 5 como el caballo de batalla eficiente, Sonnet 5 debajo.


Qué es Claude Opus 5

Opus 5 es un modelo pensado para uso diario: rinde cerca de la frontera pero trabaja de forma más eficiente que el resto. Es el nuevo modelo por defecto en Claude Max y el más fuerte disponible en Claude Pro.

La promesa de Anthropic en una frase: rendimiento cercano a Fable 5, a la mitad del precio. Y a diferencia de otros lanzamientos, acá los números lo respaldan.

Rendimiento y costo-efectividad de Claude Opus 5 Fuente: Anthropic

Tiene ventana de contexto de 1M de tokens, modo de razonamiento xhigh, y dos features nuevas en beta que importan para agentes: cambio de herramientas a mitad de conversación sin invalidar el prompt cache, y fallbacks automáticos que rutean requests marcados a modelos alternativos.


Los benchmarks oficiales

Estos son los números que publicó Anthropic en el anuncio oficial de Opus 5. Nada de fuentes terciarias —ya me pasó comparando Sonnet 5 vs Opus 4.8 que los sitios de terceros invierten ganadores por errores de transcripción.

CategoríaBenchmarkOpus 5Fable 5Opus 4.8
Coding agéntico (terminal)Frontier-Bench v0.143.3%33.7%21.1%
Trabajo de conocimientoGDPval-AA v2186117471593
Problemas novedososARC-AGI-330.2%1.5%
Búsqueda agénticaBrowseComp90.8%87.4%84.3%
Razonamiento (con tools)Humanity's Last Exam64.7%63.9%57.9%
Computer useOSWorld 2.070.6%66.1%55.7%
Workflows de negocioAutomationBench26.0%17.4%17.0%

El patrón es claro: Opus 5 le gana a Opus 4.8 en todas las categorías —muchas veces por márgenes grandes— y le gana o empata a Fable 5 en la mayoría, salvo coding agéntico puro donde Fable queda apenas arriba. Ahora los gráficos oficiales, categoría por categoría:

Frontier-Bench v0.1: state-of-the-art. Opus 5 supera a todos los modelos y más que duplica el rendimiento de Opus 4.8 a un costo por tarea menor.

Claude Opus 5 en Frontier-Bench v0.1 Fuente: Anthropic

CursorBench 3.2: a 0.5% de Fable 5. En máximo esfuerzo, Opus 5 queda dentro del medio punto porcentual de Fable 5 —el tope de gama— a la mitad del costo por tarea.

Claude Opus 5 en CursorBench 3.2 Fuente: Anthropic

ARC-AGI 3: 3x el siguiente mejor. En resolución de problemas novedosos, Opus 5 triplica el score del segundo modelo. Este es el benchmark que mide capacidad de razonar sobre cosas que no vio en entrenamiento.

Claude Opus 5 en ARC-AGI 3 Fuente: Anthropic

OSWorld 2.0: le gana a Fable 5. En computer use, Opus 5 supera el resultado de Fable 5 a un tercio del costo. Acá el modelo eficiente le gana al buque insignia.

Claude Opus 5 en OSWorld 2.0 Fuente: Anthropic

El resto: GDPval-AA v2 también state-of-the-art, y en Zapier AutomationBench un pass rate ~1.5x el siguiente mejor al mismo costo. La única categoría donde queda claramente atrás es ciberseguridad ofensiva, donde Mythos 5 —el modelo especializado— sigue adelante en desarrollo de exploits.


El effort setting: controlás costo vs inteligencia

Esta es, para mí, la feature más relevante si trabajás con Claude Code o la API. Opus 5 expone un effort setting con niveles low, medium, high y xhigh.

  • Más esfuerzo → más inteligencia, más tokens gastados, más costo.
  • Menos esfuerzo → respuesta más barata y rápida, sacrificando algo de capacidad.

En criollo: dejás de pagar razonamiento de frontera para tareas triviales. Un agente que clasifica tickets no necesita el mismo esfuerzo que uno que refactoriza un módulo legacy. Con el effort setting, ajustás eso por tarea en vez de elegir modelo distinto.

Sumale el Fast Mode (2x precio base, ~2.5x velocidad) disponible en la plataforma y vía créditos en Claude Code, y tenés control fino sobre el triángulo costo–velocidad–calidad.


El precio: misma tarifa que Opus 4.8

ModeloInputOutput
Opus 5$5 /MTok$25 /MTok
Opus 4.8$5 /MTok$25 /MTok
Fable 5~2x Opus 5~2x Opus 5

Acá está el truco: Opus 5 cuesta exactamente lo mismo que Opus 4.8, pero rinde más del doble en Frontier-Bench. No es "más caro por más capacidad" —es más capacidad al mismo precio. Y contra Fable 5, obtenés rendimiento comparable pagando la mitad.

Si venís usando Opus 4.8 en producción, migrar a Opus 5 es de las decisiones más fáciles del año: mismo costo, salto real de rendimiento.


Cuándo conviene usar Opus 5

Sí, para casi todo el trabajo diario. Coding agéntico, trabajo de conocimiento, computer use, automatizaciones: Opus 5 es el punto dulce entre costo y capacidad. Es el default correcto.

Sí, si venías con Opus 4.8. Mismo precio, mejor rendimiento. Migración directa.

Fable 5 solo cuando necesites el último punto porcentual. Si tu tarea vive o muere por estar en el tope absoluto de capacidad y el costo no importa, ahí sí pagás el premium de Fable 5. Para el resto, Opus 5 alcanza y sobra.

Mythos 5 para ciberseguridad ofensiva. Es el único territorio donde Opus 5 queda atrás a propósito.

Auditoría de alineación de Claude Opus 5 Fuente: Anthropic

Un dato que no es menor si lo vas a poner en producción: Opus 5 es el Opus más alineado hasta ahora, con el score de comportamiento desalineado más bajo (2.3) entre los modelos recientes, y adhiere a la Constitución de Claude mejor que Fable 5, Sonnet 5 y Opus 4.8. Sus clasificadores de ciberseguridad intervienen ~85% menos que los de Fable 5 —menos falsos positivos bloqueando trabajo legítimo.


Preguntas frecuentes sobre Claude Opus 5

¿Cuánto cuesta Claude Opus 5?

$5 por millón de tokens de input y $25 por millón de output —el mismo precio que Opus 4.8, con más del doble de rendimiento en Frontier-Bench. Hay un Fast Mode a 2x el precio base que corre ~2.5x más rápido.

¿Opus 5 es mejor que Fable 5?

En el tope absoluto, no: Fable 5 sigue siendo el modelo más capaz. Pero Opus 5 se le acerca muchísimo (dentro del 0.5% en CursorBench a máximo esfuerzo) a la mitad del costo, y en OSWorld 2.0 incluso lo supera a un tercio del precio.

¿Qué es el effort setting de Opus 5?

Un control para elegir cuánto cómputo gasta el modelo por tarea (low, medium, high, xhigh). Más esfuerzo es más inteligencia y más tokens; menos esfuerzo es más ahorro. Ajustás el balance costo/capacidad prompt por prompt.

¿Dónde está disponible Claude Opus 5?

En Claude.ai, Claude Code, Claude Cowork y la Claude API. Es el default en Claude Max y el modelo más fuerte en Claude Pro.


Opus 5 no reescribe la frontera —Fable 5 sigue ahí arriba— pero mueve el piso: por lo que antes pagabas Opus 4.8, ahora tenés más del doble de rendimiento, y por la mitad de Fable 5 tenés casi lo mismo. Para la mayoría de los casos de uso reales, esa es la ecuación que importa.

¿Estás evaluando qué modelo de Claude usar en tu stack y no tenés claro cuál conviene? Escribime.

Nicolas Farchica

Nicolas Farchica

Especialista Claude Code · Copenhague

Referente en Claude Code en español. Diseño e implemento sistemas de agentes IA, MCP servers y automatizaciones en producción. Ecosistema completo construido con Claude Code — el blog técnico más completo sobre Claude Code en español.

Artículos relacionados