
Por qué no respondo esto con una ficha técnica
Nunca te fíes de la lista de precios. Ese es el único hábito que tres años metiendo agentes de IA en colas de soporte ajenas me han enseñado. He visto a un usuario de prueba ejecutar doce conversaciones de test limpias y amar cada respuesta. Luego abrió la página de facturación, y presentó una solicitud de cancelación en el acto. Entre esos dos momentos no cambió nada del producto. Lo único que cambió fue que el número abstracto por unidad se convirtió en una factura real.
La misma trampa está dentro de la pregunta Claude Opus 5 vs Sonnet 5. Por millón de tokens, Opus 5 figura a $5 de entrada y $25 de salida. Para Sonnet 5 la lista es $3 y $15. Deja de leer ahí y eliges Sonnet, y una buena parte de quienes hacen eso acabará gastando más.

Así que el orden de esta pieza es: primero las especificaciones, después los benchmarks, luego cómo se ve la factura de verdad. Termina con una regla de enrutamiento que puedes aplicar esta misma tarde.
Qué es Claude Opus 5
Claude Opus 5 se lanzó el 24 de julio de 2026, y Anthropic lo describe como algo que se acerca a la inteligencia de frontera de Claude Fable 5 a mitad de precio. El id de API es claude-opus-5, tiene una ventana de contexto de 1M de tokens junto con 128k de salida máxima, y el corte de conocimiento confiable se sitúa en mayo de 2026.
El posicionamiento aquí es inusualmente directo. La documentación de Anthropic te dice que empieces con Claude Opus 5 para la codificación agéntica compleja y el trabajo empresarial, y que subas a Fable 5 solo cuando necesites el techo absoluto. Vale la pena señalar: Sonnet 5 no aparece en esa recomendación en absoluto.
El precio no se movió desde Opus 4.8, sigue siendo $5 y $25. Lo que se movió es el comportamiento. El thinking ahora está activado por defecto, lo que significa que una petición que antes se ejecutaba sin thinking ahora gastará tokens en razonamiento, a menos que digas lo contrario. Desgrané toda la ruta de actualización en mi análisis de Opus 5, y el cara a cara con Fable 5 cubre el nivel de arriba.
Qué es Claude Sonnet 5
Claude Sonnet 5 salió el 30 de junio de 2026, presentado como "el modelo Sonnet más agéntico hasta la fecha" y, en palabras de la propia Anthropic, cercano a Opus 4.8 en rendimiento pero con precios más bajos. El contexto de 1M es el mismo, y también el techo de salida de 128k. Cinco niveles de effort en ambos también. Es además el modelo por defecto en los planes Free y Pro de Claude, lo que lo convierte en el Claude que más gente usa sin haberlo elegido nunca.
Hay dos cosas de él que son fáciles de pasar por alto.
Primero, el ancla de comparación para él es Opus 4.8, no Opus 5. Sonnet 5 se lanzó tres semanas y media antes de que Opus 5 existiera, así que Anthropic nunca ha publicado una comparación de Sonnet 5 contra Opus 5. Cada cara a cara que leas, este también, se monta a partir de dos lanzamientos separados.
Segundo, las puntuaciones de benchmark destacadas de Sonnet 5 están publicadas como una imagen en la página del producto, no como texto. El 27 de julio volví a revisar la publicación de lanzamiento, la página del producto y también la documentación, y los números siguen encerrados dentro de un PNG. Así que dondequiera que cite una cifra de Sonnet 5 abajo, viene de la system card de Opus 5 de Anthropic o de una evaluación independiente, nunca de un número que no pudiera verificar. La mirada más profunda al modelo en sí vive en mi análisis de Sonnet 5, mientras que el resumen de alternativas cubre qué más encaja en ese espacio.
La comparación de especificaciones
Todo lo que hay aquí sale de la tabla comparativa de modelos de Anthropic y la documentación de precios, más la guía de migración.
| Claude Opus 5 | Claude Sonnet 5 | |
|---|---|---|
| API id | claude-opus-5 | claude-sonnet-5 |
| Entrada / salida por MTok | $5 / $25 | $3 / $15 (intro $2 / $10 hasta el 31 ago 2026) |
| Tarifa Batch API | $2.50 / $12.50 | $1.50 / $7.50 (intro $1 / $5) |
| Ventana de contexto | 1M tokens | 1M tokens |
| Salida máxima | 128k (300k en Batch) | 128k (300k en Batch) |
| Niveles de effort | low a max, cinco ajustes | low a max, cinco ajustes |
| Adaptive thinking | Sí, activado por defecto | Sí, activado por defecto |
| Latencia comparativa | Moderada | Rápida |
| Corte de conocimiento confiable | Mayo 2026 | Enero 2026 |
| Prefijo cacheable mínimo | 512 tokens | 1,024 tokens |
| Modo rápido | Sí, $10 / $50 | No |
role: "system" dentro de messages | Sí | No |
| Recargo por contexto largo | Ninguno | Ninguno |
Cuatro de esas filas cambian según cómo construyes, no solo lo que pagas.
La brecha del corte de conocimiento es de cuatro meses de ancho, y va en la dirección que quizás no esperas: el modelo caro es aquí el más fresco. Opus 5 sabe hasta mayo de 2026, mientras que Sonnet 5 se detiene en enero.
El suelo de caché de 512 tokens en Opus 5 es la mitad del de Sonnet 5. Los prompts de sistema cortos que eran silenciosamente no cacheables en Sonnet pasan a ser cacheables en Opus, y un acierto de caché cuesta el 10% de la entrada base. En una carga de trabajo de alta frecuencia y prompts cortos, esto estrecha silenciosamente la brecha de precio.
El modo rápido es exclusivo de Opus. A $10 / $50 por aproximadamente 2.5x la velocidad de salida, el modo rápido sigue siendo una vista previa de investigación solo en la API de primera parte, así que queda fuera de la mesa para Bedrock y las nubes asociadas.
Y role: "system" dentro del array de messages funciona en Opus 5, mientras que no está soportado en Sonnet 5. Si has estado reconstruyendo todo el historial de mensajes solo para actualizar instrucciones a mitad de ejecución, Opus 5 te deja dejar de hacer eso, y sin perder los aciertos de caché de prompt de los turnos anteriores. Es una simplificación real del código, y también es el tipo de detalle que nunca aparece en un gráfico de benchmark. Para elegir una API entre proveedores en lugar de dentro de uno, mi comparación de tres APIs cubre el campo más amplio.
En capacidad, esto no está reñido
La system card de Opus 5 de Anthropic es el único sitio donde ambos modelos se miden con el mismo arnés, y las brechas ahí son amplias.
| Evaluación | Claude Opus 5 | Claude Sonnet 5 |
|---|---|---|
| Frontier-Bench v0.1 (tareas de terminal) | 44.4% en xhigh | 17% |
| BBQ disambiguated accuracy | 81.6% | 72.4% |
| Diseño de proteínas | 42.5% | 21.2% |
| Química orgánica V2 | 61.6% | 40.6% |
| Inyección de prompts, uso de navegador con modo auto | 0% de ataques exitosos | 0% de ataques exitosos |
Frontier-Bench es la fila con la que hay que sentarse. Es el sucesor de Terminal-Bench 2.1, 74 tareas más difíciles ejecutándose en entornos de terminal en contenedores, y Opus 5 puntúa más de dos veces y media lo que puntúa Sonnet 5. Eso no lo describe una diferencia de nivel. Para ese tipo de trabajo es una clase de herramienta distinta.
Dos advertencias honestas sobre esto. Anthropic afirma en la system card que los clasificadores de seguridad de Opus 5 marcaron y rechazaron el 5% de las llamadas API dentro de esa evaluación, recayendo en Opus 4.8. Y en la fila de seguridad ambos modelos se mantienen: ninguno produjo un exploit funcional en la evaluación de Firefox 147, y con el modo auto activado ningún ataque de inyección de prompts tuvo éxito contra ninguno de los dos a lo largo de 129 entornos de uso de navegador.
Ahora la parte que decide esto
La capacidad nunca fue realmente la pregunta aquí. Con un presupuesto ilimitado simplemente ejecutarías Fable 5 para todo. La pregunta real es cuánto cuesta una pieza de trabajo terminada, y este es el lugar donde los dos modelos dejan de comportarse como sus etiquetas de precio.
Artificial Analysis ejecutó a los dos en AA-Briefcase, que es un benchmark de trabajo de conocimiento de largo horizonte construido alrededor de proyectos de varias semanas con miles de archivos fuente. Anthropic luego reproduce los resultados dentro de la system card de Opus 5.

Opus 5 se lleva los tres primeros puestos, 1720, 1693 y 1606 Elo, para max, xhigh y high en ese orden. Sonnet 5 en max se queda en 1386, que está por debajo de Opus 5 en medium (1470). Luego viene el gráfico de costes:

Ponlos a los dos en línea y el resultado se vuelve incómodo para el modelo barato:
| Ajuste | Elo en AA-Briefcase | Coste por tarea |
|---|---|---|
Opus 5 en max | 1720 | $17.79 |
Opus 5 en xhigh | 1693 | $14.26 |
Opus 5 en high | 1606 | $10.41 |
Opus 5 en medium | 1470 | $5.25 |
Sonnet 5 en max | 1386 | $14.43 |
Opus 5 en low | 1223 | $1.78 |
Opus 5 en high gana a Sonnet 5 en max en calidad, y cuesta $4 menos por tarea mientras lo hace. Opus 5 en medium sigue ganándole también, a más o menos un tercio del precio. El conteo de turnos es lo que lo explica: Sonnet 5 en max promedió 183 turnos por tarea, el más alto de cualquier modelo en el gráfico, frente a los 103 de Opus 5 en max.

Dónde ocurre lo contrario
Prefiero señalar esto antes de que lo descubras más tarde. En las tareas cortas, el orden se invierte. La ejecución del Intelligence Index de Artificial Analysis lo deja claro:
"Frontier intelligence with reduced cost: Claude Opus 5 (max) costs $2.03 on average per Intelligence Index task, below Claude Fable 5 (with fallback) at $2.75, but still above Claude Opus 4.8 (max) at $1.80 and Claude Sonnet 5 (max) at $1.53. However, at high and xhigh reasoning efforts Opus 5 can outperform both Opus 4.8 and Claude Sonnet 5 at a lower cost per task"
Así que en tareas a escala de índice, Sonnet 5 en max es el modelo más barato, $1.53 frente a $2.03. En trabajo agéntico de varias horas, ese mismo modelo se convierte en casi lo más caro del tablero. La duración de la tarea es la bisagra. Lo corto y superficial favorece a Sonnet, lo largo y profundo favorece a Opus, y no hay una única respuesta de "cuál es más barato" que sobreviva a ambos casos.
Haz tus propios números
Las tarifas de lista son la parte fácil. El multiplicador es la pieza que la gente se salta, así que esta calculadora te obliga a fijarlo tú mismo. Arrástralo hasta que refleje cuántos más tokens de salida necesita el modelo más barato para terminar el mismo trabajo, y observa dónde se cruzan las dos líneas.
Dos cosas que conviene mantener honestas sobre esto. El multiplicador se aplica solo a la salida, así que subestima un poco la brecha, porque más turnos también significa releer más entrada. Y esto es aritmética sobre precios de lista, no un benchmark: el prompt caching, el descuento de la Batch API y también la forma de tu propio prompt moverán el número real.
El mecanismo que codifica no es teórico. Un desarrollador lo midió directamente:
"Sonnet is supposed to be the cheaper model, but on the harder task it:
Cheaper per token does not always mean cheaper per completed task."
took longerwrote more codeused more than twice the output tokensneeded more fixesstill cost more than Fable
El dial de effort es la decisión real
Aquí está el replanteamiento que me hubiera gustado que me dieran: no estás eligiendo entre dos modelos, estás eligiendo un punto en un dial de effort de cinco pasos, y el nombre del modelo queda río abajo de esa elección.

Ambos modelos aceptan low, medium, high, xhigh y max, y ambos usan high por defecto en la API. La dispersión que produce ese ajuste es enorme. En la propia ejecución de AA-Briefcase de Anthropic, Opus 5 va de 1223 Elo en low hasta 1720 en max, y el coste va de $1.78 a $17.79. Dentro de un solo id de modelo eso es un rango de coste de 10x. El error es llamarlo "Claude Opus 5" como si tuviera un único perfil de rendimiento.
Por eso la regla más afilada que salió de la primera semana trata sobre el dial, y no sobre el nivel:
"The cost per task chart is telling me that I should never use Sonnet 5 above medium effort level - Opus always performs better for a given cost. So I guess the takeaway is that if Sonnet 5 medium isn't good enough for you, switch models, not effort levels."
Otros desarrolladores llegaron a la misma política de forma independiente:
"If I'm using medium or low reasoning, I use Sonnet 5. If high or above, I use Opus 4.8. (Before 5, I was never using Sonnet. This is a Sonnet 5 vs Opus 4.8 comparison.)"
Aplicado a la alineación actual, eso significa: Sonnet 5 en low o medium, Opus 5 en high y superior, y nunca Sonnet 5 en max. Si tu instinto te dice que subas el effort de Sonnet, esa es la señal para cambiar de modelo en su lugar. La documentación de effort lo respalda desde el otro lado: la guía de Anthropic para Opus 5 pasó del "empieza en xhigh" de la era 4.x, a empezar en high y recurrir a low y medium como el control de coste principal.
Compañeros prácticos, si estás conectando esto a un flujo de trabajo: mi guía de selección de modelo y las notas sobre la ventana de contexto. También la visión general de Claude Code más amplia.
Lo que la gente hace de verdad: Opus planifica, Sonnet implementa
Pregúntale a los desarrolladores cuál de los dos eligieron y la mayoría se negará a responder la pregunta. El patrón dominante de la primera semana es un pipeline de dos modelos.

También sirve como el arreglo para la queja más común sobre Opus 5, el consumo del límite del plan:
"Control which subagents get spawned on your workflows. Opus 5 is spawning Opus 5 (most probably) and eating up your usage. Get a grip of the promo and use Opus 5 to orchestrate and Sonnet 5 to implement and that's it."
Ese consumo es real, y se reporta repetidamente. Un usuario del plan de $20 puso un número al cambio en la otra dirección: "Puedo confirmar, le pedí que hiciera una cosa que antes le hacía hacer a Sonnet 5 y usó como el 15% de mi límite de uso de Pro." Otras personas dicen lo contrario y no logran hacer mella en su cuota de Max con esto en absoluto, así que trata los reportes de límite de plan como dependientes de la carga de trabajo, no como algo zanjado.
El patrón tiene un modo de fallo honesto, y este tiene nombre:
"Sonnet 5 is great at following concrete specs but will fill in gaps with reasonable-sounding defaults that quietly diverge from what Opus intended."
La solución aquí es una especificación más ajustada, no un mejor modelo. Como dijo una respuesta dentro de ese hilo, un plan suficientemente detallado como para que la implementación se vuelva mecánica no se desviará, sin importar qué modelo lo esté ejecutando. Si construyes bien este pipeline, Claude Skills y subagents son los contenedores, y mi comparativa de skills frente a subagents cubre qué hace cada uno.
Una trampa en vivo que vale la pena conocer antes de construir sobre esto. Desarrolladores en r/ClaudeCode reportan una instrucción hardcodeada dentro de los binarios recientes de Claude Code que desalienta específicamente a Opus 5 de delegar a subagentes, y eso podría socavar silenciosamente una configuración de Opus-planifica-Sonnet-implementa. Vale la pena verificar contra tu propia versión antes de asumir que el enrutamiento está ocurriendo. Mis notas sobre herramientas MCP y sobre las mejores prácticas de Claude Code cubren la fontanería que lo rodea.
El caso a favor de Sonnet 5, dicho con justicia
He gastado la mayor parte de este artículo explicando por qué el modelo caro suele ser el barato, así que déjame darle a la otra parte lo que le corresponde, porque el respaldo es real.
"I daily drive Sonnet 5/medium because it gets most things right most of the time at first try, while costing a lot less than Fable.
Opus can give better results on architectural/concept tasks and I use it sparingly, but it still costs more than Sonnet 5. Opus 5 seems to achieve results very close to Fable 5 while costing less (keeps Opus 4.8 pricing IIUC), but still more than Sonnet 5 then."
Sonnet 5 gana claramente en cuatro sitios. Según la propia calificación de latencia de Anthropic es el modelo más rápido, algo que importa enormemente para cualquier cosa de cara al usuario. En los niveles Free y Pro de Claude viene gratis y por defecto. Es de verdad más barato en trabajo corto, superficial y de alto volumen, y eso describe la mayor parte del tráfico de producción. Y en low o medium sobre una tarea bien especificada, la diferencia de calidad con frecuencia no se nota en el resultado.
También hay una corriente real que argumenta que el nivel medio no debería existir en absoluto, y el lanzamiento de Opus 5 afiló ese argumento:
"Seeing Opus 5 vs Sonnet 5 or even Sol vs Terra, I really think it doesn't make sense having mid tier models, just train top tier and low tier, AI labs saves money and users have 1 less model to choose/try/discard, no?"
No estoy de acuerdo con eso, y mi razón es el patrón de enrutamiento de arriba: los sistemas de producción son multiagente, así que las fortalezas ortogonales ganan a una única escalera de inteligencia. Sigue siendo un argumento vivo, eso sí, y no marginal. Si quieres ampliar el campo más allá de Anthropic, mis resúmenes de alternativas a GPT-5.6 Sol y alternativas a Kimi K3 cubren a los competidores más cercanos, y también lo hace el análisis de Gemini 3.6 Flash.
Entonces, ¿cuál deberías usar?
La elección va por el trabajo aquí, no por preferencia:
| Tu situación | Elige | Effort |
|---|---|---|
| Tareas de alto volumen, superficiales y bien especificadas | Sonnet 5 | low o medium |
| Cualquier cosa de cara al usuario donde la latencia importa | Sonnet 5 | low o medium |
| Estás en el plan Free o Pro de $20 | Sonnet 5 | medium |
| Trabajo agéntico de varios pasos ejecutándose sin supervisión | Opus 5 | high |
| Planificación, arquitectura, problemas ambiguos | Opus 5 | high o xhigh |
| Investigación de largo horizonte en muchos archivos | Opus 5 | xhigh |
Una tarea en la que Sonnet 5 en medium falló | Opus 5 | high |
| Techo absoluto, coste sin importar | Fable 5 | max |
Dos antirrecomendaciones, dichas sin rodeos. No ejecutes Sonnet 5 en max. Todos los conjuntos de datos que encontré apuntan en la misma dirección: en ese ajuste pagas dinero a escala Opus por resultados a escala Sonnet. Y tampoco pongas Opus 5 en max por defecto. En cada gráfico de aquí fue el ajuste más caro, mientras que high o xhigh superaron a la mayor parte del campo por una fracción de eso.
Si ninguno de los dos encaja, las alternativas a Claude y mi resumen de los mejores agentes de IA cubren el mercado más amplio.
Para las herramientas alrededor del modelo, los mejores asistentes de codificación con IA cubre los editores en los que viven estos modelos, y las CLI de codificación agéntica es la pieza compañera para el lado de terminal.
Los costes en los niveles de consumidor viven en mis desgloses de precios de Claude Code y precios de Cowork. Por debajo de Sonnet hay un nivel todavía más barato, y lo cubrí en Haiku en Claude Code.
Si el modelo va a responder a clientes reales
Todo lo anterior asume que eres tú quien controla el dial de effort. Cuando el plan es una cola de soporte, esa suposición se rompe y todo el planteamiento cambia.
A un cliente no le importa que hayas enrutado su pregunta de reembolso en medium. Le importa si la respuesta fue correcta. Y los dos números que deciden eso no están en ninguno de los rankings de arriba: qué fracción de tickets cierra el agente sin un humano, y luego con qué frecuencia dice algo con confianza pero equivocado. La propia system card de Anthropic señala que Opus 5 alucina ligeramente más que Opus 4.8 pese a ser más preciso en general, y esta es exactamente la forma de problema que convierte prevenir alucinaciones en soporte en un asunto de producto y no de modelo.
El trabajo poco glamuroso sigue siendo el mismo, sin importar qué Claude hayas elegido. Empieza con entrenar sobre tu base de conocimiento. Después viene condicionar las respuestas a la confianza, y seguir la tasa de resolución con honestidad en lugar de contar el spam autocerrado.
Luego se trata de mantener a un humano en el bucle, además de diseñar cuándo la IA cede el relevo para que el cliente nunca sienta la costura. Nada de esto viene incluido con una clave de API.
Guías prácticas sobre el resto: mi recorrido de desvío de tickets y la pieza sobre las mejores prácticas de traspaso. También está el desglose de coste de agente frente a agente humano.
Más sobre esta vertical en mis notas sobre IA para soporte técnico.
Prueba eesel
Si llegaste hasta aquí porque una cola de soporte es el destino, la respuesta honesta a Claude Opus 5 vs Sonnet 5 es que la decisión no debería ser tuya en absoluto. eesel elige y cambia el modelo subyacente por ti. También simula cada despliegue contra tus tickets históricos antes de que toque una conversación en vivo, y la facturación es por resolución en lugar de por token. Así que el modo de fallo del que trata todo este artículo, donde el modelo barato acaba subiendo la factura más grande en silencio, nunca cae sobre ti.

Se conecta al helpdesk que ya usas y aprende de los tickets que ya has respondido. Y puedes ver lo que habría dicho en conversaciones pasadas reales, antes de que nadie externo vea una sola palabra de ello. Gratis para probar.
Frequently Asked Questions
¿Es Claude Opus 5 mejor que Claude Sonnet 5?
¿Cuánto más barato es Claude Sonnet 5 que Claude Opus 5?
¿Qué modelo de Claude debería usar en Claude Code?
¿Claude Opus 5 agota los límites de uso más rápido que Sonnet 5?
¿Va a subir el precio de Claude Sonnet 5?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








