
Resumen
El 24 de julio de 2026 fue la fecha de lanzamiento de Claude Opus 5. El precio: $5 por millón de tokens de entrada y $25 por millón de salida. Exactamente lo que costaba Opus 4.8, algo que pilló desprevenida a mucha gente. Luego el resto de la hoja de especificaciones, rápido. ID del modelo claude-opus-5. Contexto de 1M de tokens, salida máxima de 128k, y un corte de conocimiento situado en mayo de 2026. La documentación de Anthropic ahora recomienda empezar aquí, y subir a Fable 5 solo cuando el techo sea lo que realmente necesitas.
La mayoría de los artículos se saltan la siguiente parte. «Claude Opus 5» no es un modelo, son cinco. El parámetro effort va de low a max, y Artificial Analysis evalúa cada configuración como una entrada separada, lo cual es bastante justo, porque así es como se comporta. 497 puntos Elo de diferencia en trabajo de conocimiento de largo alcance. Aproximadamente 8 veces más tokens de salida del extremo inferior al superior del regulador. Así que cuando la gente discute en línea sobre si Opus 5 es absurdamente barato o un horno de tokens, lo que realmente están discutiendo es cuál de las cinco configuraciones usó cada uno.
Hay un límite que vale la pena nombrar desde el principio, y me lo encuentro casi cada semana: este modelo tarda 63 segundos en producir su primer token con esfuerzo max. Trabajador en segundo plano. Esa es la categoría a la que pertenece. Apúntalo a una ventana de chat en vivo y la espera por sí sola termina la conversación por ti, y después de unos años poniendo agentes de IA en colas de soporte reales en eesel, la lección que sigo reaprendiendo es que el modelo nunca fue la parte difícil de ese trabajo.
Lo que realmente es Claude Opus 5
En unos dos meses Anthropic ha lanzado cuatro versiones de la generación Claude 5, y Opus 5 es la cuarta. Se sitúa justo por encima de Opus 4.8, a un precio que no ha cambiado. El mensaje de lanzamiento dice que «se acerca a la inteligencia de frontera de Claude Fable 5 a mitad de precio». De forma inusual para un mensaje de lanzamiento, los números independientes lo respaldan en su mayoría.
Aquí están las especificaciones, tomadas de la descripción general de modelos:
| Especificación | Claude Opus 5 |
|---|---|
| ID del modelo en la API de Claude | claude-opus-5 |
| ID de AWS Bedrock | anthropic.claude-opus-5 |
| ID de Google Cloud | claude-opus-5 |
| Ventana de contexto | 1M de tokens, sin encabezado beta, sin recargo por contexto largo |
| Salida máxima | 128k síncrono, 300k en la API Batch |
| Precio | $5 / $25 por MTok |
| Thinking adaptativo | Sí, activado por defecto |
| Niveles de esfuerzo | low, medium, high, xhigh, max |
| Corte de conocimiento | Mayo de 2026 |
| Web fetch | No soportado |
| Priority Tier | No soportado |
Dos filas ahí suelen sorprender a la gente. Primero, la ventana de contexto de 1M se cobra a tarifas estándar, así que una solicitud de 900k tokens factura por token a la misma tarifa que una de 9k, como explica la documentación de precios. Segundo, no hay Priority Tier en absoluto. Opus 4.8 sí lo mantiene, así que quien tenga un compromiso de capacidad tiene que planificar esa parte por separado.
Si tu última mirada a esta familia fue hace un par de lanzamientos, vale la pena registrar el ritmo. Mi análisis de Opus 4.5 tiene solo unos meses y ya se lee como una herramienta de otro nivel, con Opus 4.6 situándose en algún punto intermedio.
«Claude Opus 5» son cinco modelos con un solo nombre
Todo lo demás en este artículo se reformula a partir de esta única parte, así que quiero dedicarle tiempo real aquí.
El parámetro effort no es un regulador de calidad que ajustas al gusto. En toda la API es la palanca más grande, con diferencia, para el costo y la latencia, y también para la calidad de salida, y la distancia entre sus dos extremos es mayor que lo que separa a la mayoría de los modelos competidores.

Artificial Analysis pasó cada configuración por AA-Briefcase. Ese benchmark cubre trabajo de conocimiento de largo alcance, construido sobre proyectos de varias semanas con miles de archivos fuente. La dispersión es la verdadera historia aquí:
| Configuración de esfuerzo | AA-Briefcase Elo | Costo por tarea | Minutos por tarea | Turnos por tarea |
|---|---|---|---|---|
max | 1720 | $17.79 | 36.2 | 103 |
xhigh | 1693 | $14.26 | 34.3 | 91 |
high | 1606 | $10.41 | 25.7 | 76 |
medium | 1470 | no publicado | – | – |
low | 1223 | no publicado | – | – |
| Claude Fable 5, como referencia | 1574 | $22.30 | – | – |
Lee la fila de Fable 5 junto a la fila high y lo que sale es el mejor dato de valor de todo el conjunto: con esfuerzo high, Opus 5 supera a Fable 5 por 32 Elo, y lo hace a $10.41 por tarea, menos de la mitad del precio de Fable. Ahora lee la misma fila contra low. 1223, que está por debajo de GLM-5.2. El mismo ID de modelo, la misma semana, y ambas cosas son ciertas.
GDPval-AA v2 muestra la misma forma, donde los niveles de esfuerzo abarcan 407 puntos Elo y el uso de tokens de salida ronda las 8 veces más de low a max.

Vale la pena notar lo que el gráfico admite: en el extremo económico de la escalera, GPT-5.6 Sol queda por encima de Opus 5 y no por debajo. Solo cuando pagas dinero real por tarea la línea de Anthropic se adelanta. Un solo rango destacado esconde exactamente ese tipo de detalle.
Una complicación más, y es el número más extraño de todo el lanzamiento. En FrontierCode 1.1 de Cognition, el mejor puntaje de Opus 5 aparece con esfuerzo medium. No max. Anthropic explica por qué directamente en el system card: con mayor esfuerzo el modelo «hace más cambios de los que la tarea requiere», y las ediciones fuera de alcance son penalizadas por el evaluador. Añadir una breve instrucción de mantenerse dentro del alcance «recuperó el rendimiento en la mayoría de estas tareas». Más thinking, entonces, no es monótonamente mejor, y en al menos un benchmark de codificación real, es peor.
Elige tu nivel de esfuerzo
En lugar de hacerte desplazar hacia arriba a esa tabla, aquí está la misma decisión presentada como un selector. Elige la configuración que pensabas usar, y mira qué te da.
Por qué nadie se pone de acuerdo en línea sobre si es barato
Una vez que el regulador de esfuerzo está claro en tu cabeza, el caos de la semana de lanzamiento deja de parecer confuso por completo.
Dentro de las mismas 48 horas, Reddit tuvo dos hilos destacados que se contradecían por completo. Un bando publicó que el uso de tokens es increíble, y un usuario de r/ClaudeCode reportó ahí ocho horas de trabajo por el 5% de una cuota semanal. El otro bando publicó sobre agotar el límite de 5 horas 10 veces más rápido, describiendo un límite que solían alcanzar en seis horas y que ahora llega en menos de dos. Luego un hilo titulado, literalmente, so which is it atrajo más de 150 comentarios de gente preguntando por el vaivén.
Hacker News llegó a la respuesta más rápido que la cobertura de benchmarks:
«El gráfico muestra esfuerzo max, usado sobre todo por usuarios empresariales poco sensibles al precio. Con esfuerzo medium cae a casi la mitad del costo de K3, y probablemente sea suficiente para el 95% de las tareas de codificación.»
«Piensa de más bastante por encima de esfuerzo medium, prueba a usar eso.»
Debajo de esa primera causa hay una segunda, y esta atrapa a la gente que nunca tocó el parámetro effort. El thinking está activado por defecto en Opus 5 y no lo estaba en Opus 4.8, así que una solicitud que nunca cambiaste ahora gasta tokens en razonamiento que antes se saltaba. Alguien lo detectó en las notas de migración pocas horas después del lanzamiento:
«Los breaking changes respecto a Opus 4.8 son interesantes: 1. Thinking activado por defecto: en Claude Opus 4.8, las solicitudes sin un campo thinking corren sin thinking; en Claude Opus 5, las mismas solicitudes corren con thinking adaptativo. 2. Desactivar el thinking está limitado a esfuerzo high»
Ambos bandos, entonces, decían la verdad. Solo sobre configuraciones distintas del mismo modelo. Esa es toda la disputa.
Las dos cosas que se rompen cuando migras
Anthropic llama a Opus 5 «una actualización directa de Claude Opus 4.8 al mismo precio», y la guía de migración luego enumera exactamente dos breaking changes.
El thinking está activado por defecto. En 4.8, una solicitud sin campo thinking corría sin thinking; en Opus 5 esa misma solicitud corre con thinking adaptativo. Y como max_tokens limita la salida total, razonamiento incluido, cualquier carga de trabajo que antes corría ajustada debería revisar su tope antes de que empiece a truncarte resultados.
Desactivar el thinking está limitado a high. Enviar thinking: {type: "disabled"} sigue funcionando, pero combinado con xhigh o max obtienes un 400 de vuelta. Esa comprobación corre por solicitud, lo que significa que subir el esfuerzo a mitad de conversación con el thinking desactivado se rechaza incluso cuando turnos anteriores pasaron sin problema. Anthropic advierte también que con el thinking desactivado, el modelo «puede ocasionalmente emitir tool calls como texto plano o incluir etiquetas XML internas en su salida visible».
El resto de la actualización es todo ganancia, y hay algunas partes que vale la pena activar deliberadamente:
- El mínimo de la caché de prompts bajó a 512 tokens, desde 1.024 en Opus 4.8 y 4.096 en Opus 4.6. Los system prompts cortos que antes nunca eran cacheables ahora lo son, y no se necesita ningún cambio de código para ello.
- Los cambios de herramientas a mitad de conversación, detrás del encabezado beta
mid-conversation-tool-changes-2026-07-01, permiten añadir o quitar herramientas entre turnos, y los aciertos de caché de los turnos anteriores sobreviven a eso. - Un parámetro
fallbacksenvía los rechazos del clasificador cibernético a Opus 4.8 en lugar de devolver un error, de modo que las solicitudes «siempre se dirigen por defecto al mejor modelo disponible en lugar de ser bloqueadas». El truco está en la disponibilidad: no está en la API Batch, no está en Bedrock, y no está en Google Cloud ni en Microsoft Foundry. - Opus 5 tiene su propio bucket de límite de tasa. La página de límites de tasa es explícita en que no forma parte del pool combinado de Opus 4.x, y lista el bucket en 1.000 RPM con 2.000.000 de tokens de entrada por minuto.
Dos cambios de prompting son fáciles de pasar por alto aquí. Anthropic dice que hay que eliminar cualquier instrucción de verificación heredada, porque «Claude Opus 5 verifica su propio trabajo sin que se le indique», y también dice que hay que limitar la generación de subagentes, ya que el modelo delega con más facilidad que sus predecesores. Claude Code se tomó ese segundo punto lo bastante en serio como para lanzar una instrucción codificada que le dice a Opus 5 que no use subagentes. La reacción en HN se dividió, previsiblemente.
Hasta dónde llega, y hasta dónde no
El titular es bastante real. En su Intelligence Index, Artificial Analysis pone a Opus 5 con esfuerzo max en 61, puesto #1 frente a una mediana de clase de 32. Antes de emocionarte, lee a los perseguidores: Fable 5 con 60, GPT-5.6 Sol con 59, Kimi K3 con 57, luego Opus 4.8 con 56. Las propias palabras de Artificial Analysis para Opus 5 son «por poco, el modelo más inteligente», y toda la frontera cabe dentro de una banda de cinco puntos.
Donde están las victorias amplias e inequívocas es todo en un solo lugar: el trabajo agéntico. El AutomationBench de Zapier coloca a un agente en una empresa simulada con decenas de endpoints REST repartidos en 47 apps, y ahí Opus 5 puntúa 26.0% frente a 17.0 de Opus 4.8, 17.4 de Fable 5 y 18.1 de GPT-5.6 Sol.

El otro caso atípico real es ARC-AGI-3, con 30.16% de Relative Human Action Efficiency frente al 7.78% de GPT-5.6 Sol. Y vale la pena señalarlo para el argumento de este artículo: ese puntaje salió con esfuerzo high, no max.

Ahora la otra columna, la honesta. Artificial Analysis midió 53% en Humanity's Last Exam, «en línea con Fable 5», así que un empate y no una victoria. En física de frontera de CritPt empata con Fable 5, quedando detrás de tres modelos de OpenAI. Terminal-Bench v2.1 le da 89%, que está «aproximadamente en línea» con el líder. Anthropic mismo dice que Opus 5 se queda detrás de Mythos 5 en investigación biológica, y también en ciberseguridad ofensiva.
Luego está el leaderboard que finalmente tiene datos. En el lanzamiento, LMArena no tenía ninguna entrada para Opus 5, así que nadie podía decir qué opinaban los humanos de él. A principios de agosto ya está listado. La respuesta no es la que predeciría el Intelligence Index.

En el leaderboard de texto de LMArena, claude-opus-5-high está en el puesto 7 con 1492 Elo, y claude-opus-5-max en el puesto 8 con 1490. Por encima de ambos: Fable 5 con 1509, más tres modelos Claude más antiguos. Los benchmarks que miden la finalización de tareas, y los humanos que votan por la respuesta que más les gustó, están midiendo dos cosas distintas, y Opus 5 demuestra esa brecha con claridad. La comunidad lo puso en términos más sencillos:
«Comparé el estilo de escritura de Opus 5 con Fable 5, y Opus 5 continúa muchos de los "claude-ismos" de su predecesor 4.8, de los cuales Fable se alejó.»
Cómo conseguirlo de verdad
Seis rutas hacia él, y no todas te dan lo mismo.
| Ruta | Qué obtienes | Notas |
|---|---|---|
| Claude Free, $0 | Nada de Opus | Solo Sonnet y Haiku, contexto de 200k |
| Claude Pro, $20/mes | Opus 5 como el modelo más potente disponible | $17/mes con facturación anual. Fable mediante créditos de uso |
| Claude Max 5x, $100/mes | Opus 5 como modelo por defecto | Fable limitado al 50% de los límites semanales |
| Claude Max 20x, $200/mes | Igual, 20x el uso de Pro por sesión | Límites basados en sesión, no en conteo de mensajes |
| Claude Team, $25/puesto/mes | Las cuatro familias de modelos | $20/puesto con facturación anual, equipos de 2 a 150 |
| Claude API | claude-opus-5 a $5 / $25 | El Batch lo reduce a la mitad, los aciertos de caché cuestan $0.50 |
Claude Code viene incluido en todos los planes de pago y saca del mismo pool. Si tu selector todavía muestra 4.8, /model claude-opus-5 funciona directamente, y en versiones de CLI más antiguas /model claude-opus-5[1m] te da la variante de contexto de 1M. También vale la pena saber: Claude Code al principio solo expuso una ventana de 200K para él, que es justo el tipo de cosa para la que existen mis notas sobre la ventana de contexto de Claude Code.
En las plataformas cloud, Bedrock y Google Cloud son operadas por socios, te facturan directamente, y los endpoints regionales tienen un recargo del 10% sobre los globales. Claude Platform en AWS factura en Claude Consumption Units a $0.01 por CCU, y lo mismo hace Microsoft Foundry. Además de los tokens, Managed Agents añade $0.08 por hora de sesión de tiempo de ejecución activo.
Fast mode es la única ruta con condiciones reales. Hasta 2.5x más tokens de salida por segundo, al doble exacto del precio, $10 y $50, aplicado a toda la ventana de contexto. Las condiciones: sigue siendo una research preview, solo en la API de Claude de primera parte, con acceso restringido tras una lista de espera o un account manager, y no funciona con Batch. Por token, esas tarifas aterrizan en el mismo lugar que el Fable 5 estándar, así que lo que compras ahí es latencia y no capacidad. Mi desglose de precios de Claude Opus 5 analiza lo que eso hace a una factura mensual, mientras que precios de Claude Code cubre el lado de la CLI.
El muro entre Opus 5 y un cliente en vivo
Todo lo anterior ha sido sobre elegir una configuración. Esta sección trata del lugar donde ninguna configuración ayuda.

En este momento, Artificial Analysis mide a Opus 5 en 55.7 tokens de salida por segundo, que es el puesto #111 de 184, y el tiempo hasta el primer token se sitúa en 63.43 segundos. Bajar el esfuerzo recupera muy poca velocidad. Las tres configuraciones superiores en AA-Briefcase promedian más de 25 minutos por tarea. La frase que Artificial Analysis escribió para él: Opus 5 está «entre los modelos líderes en inteligencia, pero particularmente caro en comparación con otros modelos de precio similar. También es notablemente lento y muy verboso».
El segundo número es el que más me importa, y apunta en dirección contraria al marketing. Frente a Opus 4.8, Opus 5 ganó 7 puntos de precisión en AA-Omniscience, y al mismo tiempo su tasa de alucinaciones subió 14 puntos hasta el 50%, por la razón de que responde más a menudo cuando no está seguro. El propio system card de Anthropic lo dice sin rodeos: «El modelo alucina afirmaciones factuales ligeramente más que Opus 4.8, a pesar de ser más preciso en general».
Para un agente de codificación que vuelve a ejecutar sus propias pruebas, ese intercambio está bien. Ahora pon el mismo intercambio en una respuesta de soporte que sale hacia un cliente que paga, con tu logo adjunto. Una respuesta equivocada dicha con confianza es ahí el modo de fallo que te cuesta la cuenta, y por eso prevenir alucinaciones en soporte termina siendo un problema de diseño de producto en lugar de uno de selección de modelo.
He visto esto desarrollarse tantas veces que puedo ser directo al respecto. Algo así como el 10% de un despliegue de soporte que funciona es el modelo. El otro 90% es recuperación de conocimiento que se mantiene actualizada, más un umbral de confianza que decide qué puede tocar siquiera la IA, un pase de simulación sobre tickets históricos para que la tasa de respuesta se conozca antes de que la vea cualquier cliente, y luego un traspaso que no deja caer el contexto. Un cliente de eesel, que opera una red de cajeros automáticos de criptomonedas, expresó el lado de construir versus comprar mejor de lo que yo podría:
«Podríamos intentar escribir nuestra propia aplicación de LLM, pero no queríamos invertir nuestro tiempo en eso. Queríamos algo que no tuviéramos que mantener.»
Karel, GENERAL BYTES
Una responsable de CX en una marca de suplementos DTC describió luego el problema de control en una frase que se me ha quedado durante años: la IA nunca responderá al 100% de las preguntas, así que lo que ella necesitaba era una IA que solo manejara los tickets de los que está segura y dejara el resto en paz. Ningún parámetro effort te da eso. Es una decisión de enrutamiento, y se toma fuera del modelo.
Prueba eesel
Si llegaste aquí porque se está eligiendo un modelo para una cola de soporte, el consejo honesto es este: Opus 5 es un buen motor, y el motor nunca fue tu cuello de botella. eesel es la parte que se envuelve alrededor de él. Se conecta al helpdesk que ya usas, entrena con tus tickets pasados y tu centro de ayuda en lugar de un prompt pegado, y simula contra tu propio historial de tickets, así que la tasa de resolución está ante ti antes de que cualquier cliente vea al agente. La configuración toma minutos en lugar de un trimestre, y el precio cuenta tickets resueltos y no tokens, así que un modelo verboso no puede inflar la factura silenciosamente.

Esa vista de informes es la pieza que ninguna clave de API en bruto te da: qué tickets tomó realmente el agente, qué disparó cada ejecución, y los puntos donde intervino un humano. Para ver cómo se ven tus propios números, puedes probar eesel gratis, o leer cómo se desarrolla la misma decisión en las herramientas de soporte de este año y cuánto cuesta un agente de soporte de IA.
Para el resto del panorama de Opus 5: el análisis completo tiene el veredicto sobre si vale la pena actualizar, Opus 5 frente a Fable 5 cubre el nivel superior y Opus 5 frente a Sonnet 5 el nivel inferior, y precios de Sonnet 5 importa justo ahora, ya que sus tarifas introductorias de $2 y $10 vencen el 31 de agosto de 2026.
Preguntas frecuentes
¿Qué es Claude Opus 5?
claude-opus-5, tiene una ventana de contexto de 1M de tokens con 128k de salida máxima, y cuesta $5 por millón de tokens de entrada y $25 por millón de salida. La documentación de Anthropic recomienda empezar aquí para coding agéntico y trabajo empresarial, y subir a Fable 5 solo cuando necesites el techo. Mi análisis de Opus 5 tiene el veredicto completo.¿Cuánto cuesta Claude Opus 5?
¿Es Claude Opus 5 mejor que Claude Fable 5?
¿Cuál es la diferencia entre los niveles de esfuerzo de Claude Opus 5?
low, medium, high, xhigh, max. En el AA-Briefcase de Artificial Analysis abarcan 497 puntos Elo, y el uso de tokens de salida es unas 8 veces mayor de low a max en GDPval-AA v2. El valor por defecto de la API es high. Trata el esfuerzo como tu principal control de costos antes de mirar modelos más baratos como Sonnet 5.¿Necesito cambiar mi código para actualizar desde Opus 4.8?
max_tokens en razonamiento. Y enviar thinking: disabled junto con esfuerzo xhigh o max devuelve un 400. Todo lo demás es un reemplazo directo al mismo precio. Si lo usas a través de la CLI, mis notas sobre selección de modelo en Claude Code cubren el lado del selector.¿Dónde puedo usar Claude Opus 5 gratis?
¿Puede Claude Opus 5 gestionar tickets de soporte al cliente?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.







