Claude Opus 5: La Frontera a Mitad de Precio (Benchmarks)
En este artículo
Claude Opus 5 salió el 24 de julio de 2026 y cambia una cosa concreta: acerca la inteligencia de frontera a la mitad del precio. No es el modelo más potente de Anthropic —ese sigue siendo Fable 5— pero es el que vas a querer correr todos los días. Acá te dejo los benchmarks oficiales, el precio real y cuándo conviene usarlo.

Es el cuarto modelo que Anthropic lanza en menos de dos meses: Mythos 5, Fable 5 y Sonnet 5 en junio, y ahora Opus 5. La cadencia es brutal, y la jerarquía quedó clara: Fable 5 en el tope, Opus 5 como el caballo de batalla eficiente, Sonnet 5 debajo.
Qué es Claude Opus 5
Opus 5 es un modelo pensado para uso diario: rinde cerca de la frontera pero trabaja de forma más eficiente que el resto. Es el nuevo modelo por defecto en Claude Max y el más fuerte disponible en Claude Pro.
La promesa de Anthropic en una frase: rendimiento cercano a Fable 5, a la mitad del precio. Y a diferencia de otros lanzamientos, acá los números lo respaldan.
Fuente: Anthropic
Tiene ventana de contexto de 1M de tokens, modo de razonamiento xhigh, y dos features nuevas en beta que importan para agentes: cambio de herramientas a mitad de conversación sin invalidar el prompt cache, y fallbacks automáticos que rutean requests marcados a modelos alternativos.
Los benchmarks oficiales
Estos son los números que publicó Anthropic en el anuncio oficial de Opus 5. Nada de fuentes terciarias —ya me pasó comparando Sonnet 5 vs Opus 4.8 que los sitios de terceros invierten ganadores por errores de transcripción.
| Categoría | Benchmark | Opus 5 | Fable 5 | Opus 4.8 |
|---|---|---|---|---|
| Coding agéntico (terminal) | Frontier-Bench v0.1 | 43.3% | 33.7% | 21.1% |
| Trabajo de conocimiento | GDPval-AA v2 | 1861 | 1747 | 1593 |
| Problemas novedosos | ARC-AGI-3 | 30.2% | — | 1.5% |
| Búsqueda agéntica | BrowseComp | 90.8% | 87.4% | 84.3% |
| Razonamiento (con tools) | Humanity's Last Exam | 64.7% | 63.9% | 57.9% |
| Computer use | OSWorld 2.0 | 70.6% | 66.1% | 55.7% |
| Workflows de negocio | AutomationBench | 26.0% | 17.4% | 17.0% |
El patrón es claro: Opus 5 le gana a Opus 4.8 en todas las categorías —muchas veces por márgenes grandes— y le gana o empata a Fable 5 en la mayoría, salvo coding agéntico puro donde Fable queda apenas arriba. Ahora los gráficos oficiales, categoría por categoría:
Frontier-Bench v0.1: state-of-the-art. Opus 5 supera a todos los modelos y más que duplica el rendimiento de Opus 4.8 a un costo por tarea menor.
Fuente: Anthropic
CursorBench 3.2: a 0.5% de Fable 5. En máximo esfuerzo, Opus 5 queda dentro del medio punto porcentual de Fable 5 —el tope de gama— a la mitad del costo por tarea.
Fuente: Anthropic
ARC-AGI 3: 3x el siguiente mejor. En resolución de problemas novedosos, Opus 5 triplica el score del segundo modelo. Este es el benchmark que mide capacidad de razonar sobre cosas que no vio en entrenamiento.
Fuente: Anthropic
OSWorld 2.0: le gana a Fable 5. En computer use, Opus 5 supera el resultado de Fable 5 a un tercio del costo. Acá el modelo eficiente le gana al buque insignia.
Fuente: Anthropic
El resto: GDPval-AA v2 también state-of-the-art, y en Zapier AutomationBench un pass rate ~1.5x el siguiente mejor al mismo costo. La única categoría donde queda claramente atrás es ciberseguridad ofensiva, donde Mythos 5 —el modelo especializado— sigue adelante en desarrollo de exploits.
El effort setting: controlás costo vs inteligencia
Esta es, para mí, la feature más relevante si trabajás con Claude Code o la API. Opus 5 expone un effort setting con niveles low, medium, high y xhigh.
- Más esfuerzo → más inteligencia, más tokens gastados, más costo.
- Menos esfuerzo → respuesta más barata y rápida, sacrificando algo de capacidad.
En criollo: dejás de pagar razonamiento de frontera para tareas triviales. Un agente que clasifica tickets no necesita el mismo esfuerzo que uno que refactoriza un módulo legacy. Con el effort setting, ajustás eso por tarea en vez de elegir modelo distinto.
Sumale el Fast Mode (2x precio base, ~2.5x velocidad) disponible en la plataforma y vía créditos en Claude Code, y tenés control fino sobre el triángulo costo–velocidad–calidad.
El precio: misma tarifa que Opus 4.8
| Modelo | Input | Output |
|---|---|---|
| Opus 5 | $5 /MTok | $25 /MTok |
| Opus 4.8 | $5 /MTok | $25 /MTok |
| Fable 5 | ~2x Opus 5 | ~2x Opus 5 |
Acá está el truco: Opus 5 cuesta exactamente lo mismo que Opus 4.8, pero rinde más del doble en Frontier-Bench. No es "más caro por más capacidad" —es más capacidad al mismo precio. Y contra Fable 5, obtenés rendimiento comparable pagando la mitad.
Si venís usando Opus 4.8 en producción, migrar a Opus 5 es de las decisiones más fáciles del año: mismo costo, salto real de rendimiento.
Cuándo conviene usar Opus 5
Sí, para casi todo el trabajo diario. Coding agéntico, trabajo de conocimiento, computer use, automatizaciones: Opus 5 es el punto dulce entre costo y capacidad. Es el default correcto.
Sí, si venías con Opus 4.8. Mismo precio, mejor rendimiento. Migración directa.
Fable 5 solo cuando necesites el último punto porcentual. Si tu tarea vive o muere por estar en el tope absoluto de capacidad y el costo no importa, ahí sí pagás el premium de Fable 5. Para el resto, Opus 5 alcanza y sobra.
Mythos 5 para ciberseguridad ofensiva. Es el único territorio donde Opus 5 queda atrás a propósito.
Fuente: Anthropic
Un dato que no es menor si lo vas a poner en producción: Opus 5 es el Opus más alineado hasta ahora, con el score de comportamiento desalineado más bajo (2.3) entre los modelos recientes, y adhiere a la Constitución de Claude mejor que Fable 5, Sonnet 5 y Opus 4.8. Sus clasificadores de ciberseguridad intervienen ~85% menos que los de Fable 5 —menos falsos positivos bloqueando trabajo legítimo.
Preguntas frecuentes sobre Claude Opus 5
¿Cuánto cuesta Claude Opus 5?
$5 por millón de tokens de input y $25 por millón de output —el mismo precio que Opus 4.8, con más del doble de rendimiento en Frontier-Bench. Hay un Fast Mode a 2x el precio base que corre ~2.5x más rápido.
¿Opus 5 es mejor que Fable 5?
En el tope absoluto, no: Fable 5 sigue siendo el modelo más capaz. Pero Opus 5 se le acerca muchísimo (dentro del 0.5% en CursorBench a máximo esfuerzo) a la mitad del costo, y en OSWorld 2.0 incluso lo supera a un tercio del precio.
¿Qué es el effort setting de Opus 5?
Un control para elegir cuánto cómputo gasta el modelo por tarea (low, medium, high, xhigh). Más esfuerzo es más inteligencia y más tokens; menos esfuerzo es más ahorro. Ajustás el balance costo/capacidad prompt por prompt.
¿Dónde está disponible Claude Opus 5?
En Claude.ai, Claude Code, Claude Cowork y la Claude API. Es el default en Claude Max y el modelo más fuerte en Claude Pro.
Opus 5 no reescribe la frontera —Fable 5 sigue ahí arriba— pero mueve el piso: por lo que antes pagabas Opus 4.8, ahora tenés más del doble de rendimiento, y por la mitad de Fable 5 tenés casi lo mismo. Para la mayoría de los casos de uso reales, esa es la ecuación que importa.
¿Estás evaluando qué modelo de Claude usar en tu stack y no tenés claro cuál conviene? Escribime.
Nicolas Farchica
Especialista Claude Code · Copenhague
Referente en Claude Code en español. Diseño e implemento sistemas de agentes IA, MCP servers y automatizaciones en producción. Ecosistema completo construido con Claude Code — el blog técnico más completo sobre Claude Code en español.
Artículos relacionados
Claude Fable 5: 3 extensiones y el límite de cómputo
Anthropic extendió el acceso gratuito a Claude Fable 5 tres veces en 12 días. No es generosidad: es la señal más clara de un límite de capacidad de cómputo.
Claude Sonnet 5 vs Opus 4.8: Cuándo Pagar el Premium (Benchmarks Oficiales)
Comparativa de Claude Sonnet 5 vs Opus 4.8 por tipo de tarea con los 6 benchmarks oficiales de Anthropic: coding, razonamiento, computer use y precio.
Claude Certified Associate y Developer: lo que viene el 13/07
Claude Certified Associate, Developer y Architect Professional aparecen en Skilljar para el 13 de julio. Qué está confirmado y qué no todavía.