Volver al Blog

Claude Sonnet 5 vs Opus 4.8: Cuándo Pagar el Premium (Benchmarks Oficiales)

13 de julio de 20265 min de lectura·Nicolas Farchica

Ya escribí sobre cuándo usar Fable 5, Opus 4.8 o Sonnet 5 según el caso de uso: agente de horizonte largo, debugging escalado, chat interactivo, compliance. Esa comparación fue por escenario.

Esta es distinta: Sonnet 5 vs Opus 4.8, tarea por tarea, con los números que publicó Anthropic en el anuncio oficial de Sonnet 5. Nada de benchmarks de terceros ni promedios inventados — la tabla completa que Anthropic mostró para justificar el lanzamiento.

La pregunta que responde este artículo: si Sonnet 5 cuesta menos de la mitad que Opus 4.8, ¿en qué casos igual conviene pagar el premium?


La tabla oficial, completa

Estos son los 6 benchmarks que Anthropic publicó comparando Sonnet 5 contra Opus 4.8 (fuente: anthropic.com/news/claude-sonnet-5):

CategoríaBenchmarkSonnet 5Opus 4.8Gana
Coding agénticoSWE-bench Pro63.2%69.2%Opus
Coding agéntico (terminal)Terminal-Bench 2.180.4%82.7%Opus
Razonamiento sin herramientasHumanity's Last Exam43.2%49.8%Opus
Razonamiento con herramientasHumanity's Last Exam57.4%57.9%Opus
Computer useOSWorld-Verified81.2%83.4%Opus
Trabajo de conocimientoGDPval-AA v216181615Sonnet

El patrón es claro y no es el que esperaba antes de mirar los números: Opus 4.8 gana en 5 de las 6 categorías. Sonnet 5 achica la brecha respecto a Sonnet 4.6 (su predecesor), pero no la cierra contra Opus. La única categoría donde Sonnet 5 gana es trabajo de conocimiento — y por un margen mínimo (1618 vs 1615, prácticamente empate).

Esto importa porque el ángulo de marketing habitual es "Sonnet 5 tiene el rendimiento de Opus a precio de Sonnet". Es cierto que achica la distancia — pero la distancia sigue estando ahí, especialmente en coding agéntico y razonamiento puro.


El precio: la otra mitad de la ecuación

ModeloInputOutput
Sonnet 5$2/MTok (hasta 31 ago) → $3/MTok$10/MTok → $15/MTok
Opus 4.8$5/MTok$25/MTok

Opus 4.8 cuesta entre 2 y 2.5 veces más que Sonnet 5, dependiendo de si todavía estás dentro de la ventana de precio de lanzamiento (vence el 31 de agosto de 2026).

Con esto, la pregunta deja de ser "cuál es mejor" y pasa a ser "cuánto vale cada punto porcentual de mejora". En SWE-bench Pro, pagar 2.5x más te compra 6 puntos porcentuales (63.2% → 69.2%). En Terminal-Bench, 2.3 puntos (80.4% → 82.7%). Ninguno de los dos saltos es dramático — pero en producción, con volumen alto, esos puntos se traducen en menos reintentos, menos debugging manual y menos intervención humana.


Cuándo pagar el premium de Opus 4.8

Coding agéntico de alta dificultad. Si tu pipeline corre tareas de refactor grande, migración de código legacy o debugging de bugs no triviales, la brecha de 6 puntos en SWE-bench Pro no es cosmética — es la diferencia entre una tarea que termina sola y una que necesita intervención a mitad de camino.

Razonamiento sin herramientas. La brecha más grande de toda la tabla está acá: 43.2% vs 49.8% en Humanity's Last Exam sin tools. Si tu caso de uso depende de razonamiento puro (análisis, síntesis, argumentación) sin apoyo de herramientas externas, Opus tiene ventaja real.

Computer use en producción. 81.2% vs 83.4% en OSWorld-Verified parece poco, pero en flujos de automatización de escritorio con múltiples pasos encadenados, un punto de error se multiplica por cada paso de la cadena.

Cuándo Sonnet 5 alcanza (y conviene)

Trabajo de conocimiento. Es la única categoría donde Sonnet 5 empata o supera a Opus (1618 vs 1615). Si tu caso de uso es research, síntesis de documentos o Q&A sobre bases de conocimiento, no hay razón técnica para pagar el premium.

Razonamiento con herramientas. La brecha se achica a casi nada (57.4% vs 57.9%) cuando el modelo tiene acceso a tools. Si tu agente ya usa function calling o búsqueda, gran parte de la ventaja de Opus se diluye.

Volumen alto con presupuesto ajustado. Con 2-2.5x de diferencia de precio, si tu caso de uso no cae en las tres categorías de arriba, Sonnet 5 es la decisión económicamente correcta. La diferencia de rendimiento no justifica el costo extra a escala.


Lo que no incluyo (y por qué)

Vas a encontrar artículos de terceros citando benchmarks como USAMO 2026, BrowseComp, Toolathlon o CursorBench para esta misma comparación. No los incluyo acá porque no aparecen en el anuncio oficial de Anthropic — y al verificar cifras de fuentes de terceros contra la tabla oficial, encontré errores reales: un sitio reportaba Opus 4.8 en 74.6% en Terminal-Bench (el número real es 82.7%), lo cual invertía el ganador de esa categoría.

Prefiero un artículo con 6 números verificados que uno con 12 números de los cuales no puedo confirmar la mitad.


La decisión en una frase

Si tu tarea es coding agéntico difícil, razonamiento sin herramientas o computer use en producción, pagá el premium de Opus 4.8. Si es trabajo de conocimiento, tenés herramientas conectadas, o el volumen hace que el costo pese más que un puñado de puntos porcentuales, Sonnet 5 es la opción correcta — no la opción barata.

¿Tenés un caso de uso específico y no estás seguro de cuál conviene? Escribime.

Nicolas Farchica

Nicolas Farchica

Especialista Claude Code · Copenhague

Referente en Claude Code en español. Diseño e implemento sistemas de agentes IA, MCP servers y automatizaciones en producción. Ecosistema completo construido con Claude Code — el blog técnico más completo sobre Claude Code en español.

Artículos relacionados