Claude Sonnet 5 vs Opus 4.8: Cuándo Pagar el Premium (Benchmarks Oficiales)
En este artículo
Ya escribí sobre cuándo usar Fable 5, Opus 4.8 o Sonnet 5 según el caso de uso: agente de horizonte largo, debugging escalado, chat interactivo, compliance. Esa comparación fue por escenario.
Esta es distinta: Sonnet 5 vs Opus 4.8, tarea por tarea, con los números que publicó Anthropic en el anuncio oficial de Sonnet 5. Nada de benchmarks de terceros ni promedios inventados — la tabla completa que Anthropic mostró para justificar el lanzamiento.
La pregunta que responde este artículo: si Sonnet 5 cuesta menos de la mitad que Opus 4.8, ¿en qué casos igual conviene pagar el premium?
La tabla oficial, completa
Estos son los 6 benchmarks que Anthropic publicó comparando Sonnet 5 contra Opus 4.8 (fuente: anthropic.com/news/claude-sonnet-5):
| Categoría | Benchmark | Sonnet 5 | Opus 4.8 | Gana |
|---|---|---|---|---|
| Coding agéntico | SWE-bench Pro | 63.2% | 69.2% | Opus |
| Coding agéntico (terminal) | Terminal-Bench 2.1 | 80.4% | 82.7% | Opus |
| Razonamiento sin herramientas | Humanity's Last Exam | 43.2% | 49.8% | Opus |
| Razonamiento con herramientas | Humanity's Last Exam | 57.4% | 57.9% | Opus |
| Computer use | OSWorld-Verified | 81.2% | 83.4% | Opus |
| Trabajo de conocimiento | GDPval-AA v2 | 1618 | 1615 | Sonnet |
El patrón es claro y no es el que esperaba antes de mirar los números: Opus 4.8 gana en 5 de las 6 categorías. Sonnet 5 achica la brecha respecto a Sonnet 4.6 (su predecesor), pero no la cierra contra Opus. La única categoría donde Sonnet 5 gana es trabajo de conocimiento — y por un margen mínimo (1618 vs 1615, prácticamente empate).
Esto importa porque el ángulo de marketing habitual es "Sonnet 5 tiene el rendimiento de Opus a precio de Sonnet". Es cierto que achica la distancia — pero la distancia sigue estando ahí, especialmente en coding agéntico y razonamiento puro.
El precio: la otra mitad de la ecuación
| Modelo | Input | Output |
|---|---|---|
| Sonnet 5 | $2/MTok (hasta 31 ago) → $3/MTok | $10/MTok → $15/MTok |
| Opus 4.8 | $5/MTok | $25/MTok |
Opus 4.8 cuesta entre 2 y 2.5 veces más que Sonnet 5, dependiendo de si todavía estás dentro de la ventana de precio de lanzamiento (vence el 31 de agosto de 2026).
Con esto, la pregunta deja de ser "cuál es mejor" y pasa a ser "cuánto vale cada punto porcentual de mejora". En SWE-bench Pro, pagar 2.5x más te compra 6 puntos porcentuales (63.2% → 69.2%). En Terminal-Bench, 2.3 puntos (80.4% → 82.7%). Ninguno de los dos saltos es dramático — pero en producción, con volumen alto, esos puntos se traducen en menos reintentos, menos debugging manual y menos intervención humana.
Cuándo pagar el premium de Opus 4.8
Coding agéntico de alta dificultad. Si tu pipeline corre tareas de refactor grande, migración de código legacy o debugging de bugs no triviales, la brecha de 6 puntos en SWE-bench Pro no es cosmética — es la diferencia entre una tarea que termina sola y una que necesita intervención a mitad de camino.
Razonamiento sin herramientas. La brecha más grande de toda la tabla está acá: 43.2% vs 49.8% en Humanity's Last Exam sin tools. Si tu caso de uso depende de razonamiento puro (análisis, síntesis, argumentación) sin apoyo de herramientas externas, Opus tiene ventaja real.
Computer use en producción. 81.2% vs 83.4% en OSWorld-Verified parece poco, pero en flujos de automatización de escritorio con múltiples pasos encadenados, un punto de error se multiplica por cada paso de la cadena.
Cuándo Sonnet 5 alcanza (y conviene)
Trabajo de conocimiento. Es la única categoría donde Sonnet 5 empata o supera a Opus (1618 vs 1615). Si tu caso de uso es research, síntesis de documentos o Q&A sobre bases de conocimiento, no hay razón técnica para pagar el premium.
Razonamiento con herramientas. La brecha se achica a casi nada (57.4% vs 57.9%) cuando el modelo tiene acceso a tools. Si tu agente ya usa function calling o búsqueda, gran parte de la ventaja de Opus se diluye.
Volumen alto con presupuesto ajustado. Con 2-2.5x de diferencia de precio, si tu caso de uso no cae en las tres categorías de arriba, Sonnet 5 es la decisión económicamente correcta. La diferencia de rendimiento no justifica el costo extra a escala.
Lo que no incluyo (y por qué)
Vas a encontrar artículos de terceros citando benchmarks como USAMO 2026, BrowseComp, Toolathlon o CursorBench para esta misma comparación. No los incluyo acá porque no aparecen en el anuncio oficial de Anthropic — y al verificar cifras de fuentes de terceros contra la tabla oficial, encontré errores reales: un sitio reportaba Opus 4.8 en 74.6% en Terminal-Bench (el número real es 82.7%), lo cual invertía el ganador de esa categoría.
Prefiero un artículo con 6 números verificados que uno con 12 números de los cuales no puedo confirmar la mitad.
La decisión en una frase
Si tu tarea es coding agéntico difícil, razonamiento sin herramientas o computer use en producción, pagá el premium de Opus 4.8. Si es trabajo de conocimiento, tenés herramientas conectadas, o el volumen hace que el costo pese más que un puñado de puntos porcentuales, Sonnet 5 es la opción correcta — no la opción barata.
¿Tenés un caso de uso específico y no estás seguro de cuál conviene? Escribime.
Nicolas Farchica
Especialista Claude Code · Copenhague
Referente en Claude Code en español. Diseño e implemento sistemas de agentes IA, MCP servers y automatizaciones en producción. Ecosistema completo construido con Claude Code — el blog técnico más completo sobre Claude Code en español.
Artículos relacionados
Claude Fable 5: 3 extensiones y el límite de cómputo
Anthropic extendió el acceso gratuito a Claude Fable 5 tres veces en 12 días. No es generosidad: es la señal más clara de un límite de capacidad de cómputo.
Claude Certified Associate y Developer: lo que viene el 13/07
Claude Certified Associate, Developer y Architect Professional aparecen en Skilljar para el 13 de julio. Qué está confirmado y qué no todavía.
Claude Science: el workbench de IA para investigadores
Anthropic lanzó Claude Science, un workbench de IA para científicos con 60+ skills para genómica, proteómica y más. Qué es, para quién y cómo aplicar a las becas.