
Qué es Claude Opus 5 en realidad
En unos dos meses Anthropic ha lanzado cuatro versiones de la generación Claude 5, y Opus 5 es la cuarta. Se sitúa justo por encima de Opus 4.8, a un precio que no ha cambiado. El mensaje de lanzamiento dice que "se acerca a la inteligencia de frontera de Claude Fable 5 a mitad de precio". De forma inusual para el discurso de lanzamiento, las cifras independientes en su mayoría lo respaldan.
Aquí están las especificaciones, tomadas del resumen de modelos:
| Especificación | Claude Opus 5 |
|---|---|
| ID de modelo en la API de Claude | claude-opus-5 |
| ID de AWS Bedrock | anthropic.claude-opus-5 |
| ID de Google Cloud | claude-opus-5 |
| Ventana de contexto | 1M de tokens, sin cabecera beta, sin sobreprecio por contexto largo |
| Salida máxima | 128k síncrono, 300k en la API Batch |
| Precio | 5 $ / 25 $ por MTok |
| Pensamiento adaptativo | Sí, activado por defecto |
| Niveles de esfuerzo | low, medium, high, xhigh, max |
| Fecha de corte del conocimiento | Mayo de 2026 |
| Web fetch | No soportado |
| Priority Tier | No soportado |
Dos filas ahí suelen sorprender a la gente. Primero, la ventana de contexto de 1M se factura a tarifas estándar, así que una petición de 900k tokens se cobra por token igual que una de 9k, algo que detalla la documentación de precios. Segundo, no hay Priority Tier en absoluto. Opus 4.8 mantiene uno, así que cualquiera con un compromiso de capacidad tiene que planificar esa parte por separado.
Si la última vez que miraste esta familia fue hace un par de versiones, el ritmo merece atención. Mi reseña de Opus 4.5 tiene solo unos meses, y ya se lee como una herramienta de otra categoría, con Opus 4.6 situado en algún punto intermedio.
"Claude Opus 5" son cinco modelos con un solo nombre
Todo lo demás en este artículo se reencuadra por esta única parte, así que quiero dedicarle tiempo de verdad aquí.
El parámetro effort no es una especie de control de calidad que ajustas por gusto. En toda la API es la palanca individual con mayor impacto en coste y latencia, y también en la calidad de la salida, y la distancia entre sus dos extremos es más amplia que lo que separa a la mayoría de modelos de la competencia.

Artificial Analysis probó cada configuración con AA-Briefcase. Ese benchmark cubre trabajo de conocimiento a largo plazo, construido sobre proyectos de varias semanas con miles de archivos fuente. La dispersión es lo que cuenta la historia aquí:
| Nivel de esfuerzo | Elo en AA-Briefcase | Coste por tarea | Minutos por tarea | Turnos por tarea |
|---|---|---|---|---|
max | 1720 | 17,79 $ | 36,2 | 103 |
xhigh | 1693 | 14,26 $ | 34,3 | 91 |
high | 1606 | 10,41 $ | 25,7 | 76 |
medium | 1470 | no publicado | – | – |
low | 1223 | no publicado | – | – |
| Claude Fable 5, como referencia | 1574 | 22,30 $ | – | – |
Leer la fila de Fable 5 junto a la de high revela el mejor dato de valor de todo el conjunto: en esfuerzo alto, Opus 5 supera a Fable 5 por 32 Elo, y lo hace a 10,41 $ por tarea, menos de la mitad del precio de Fable. Ahora lee esa misma fila frente a low. 1223, que está por debajo de GLM-5.2. Mismo ID de modelo, misma semana, y ambas cosas ciertas.
GDPval-AA v2 muestra la misma forma, donde los niveles de esfuerzo abarcan 407 puntos Elo y el uso de tokens de salida ronda un 8x al pasar de low a max.

Vale la pena notar lo que el gráfico admite: en el extremo barato de la escalera, GPT-5.6 Sol se sitúa por encima de Opus 5, no por debajo. Solo cuando pagas dinero de verdad por tarea la línea de Anthropic se adelanta. Un único ranking titular esconde precisamente ese tipo de detalle.
Otro matiz más, y este es el número más extraño de todo el lanzamiento. En FrontierCode 1.1 de Cognition, la mejor puntuación de Opus 5 se da en esfuerzo medium. No max. Anthropic lo explica sin rodeos en la ficha del sistema: con mayor esfuerzo el modelo "hace más cambios de los que requiere la tarea", y las ediciones fuera de alcance son penalizadas por el evaluador. Añadir una breve instrucción para mantenerse dentro del alcance "recuperó el rendimiento en la mayoría de esas tareas". Pensar más, entonces, no es sistemáticamente mejor, y en al menos un benchmark real de programación es peor.
Elige tu nivel de esfuerzo
En lugar de hacerte volver arriba a esa tabla, aquí está la misma decisión en forma de selector. Elige la configuración que ibas a usar y comprueba qué te ofrece.
Por qué nadie se pone de acuerdo sobre si es barato
Una vez que el dial de esfuerzo se te queda grabado en la cabeza, el caos de la semana de lanzamiento deja de parecer confuso.
En las mismas 48 horas, Reddit tuvo dos hilos destacados que se contradecían por completo. Un bando publicó que el uso de tokens es increíble, y un usuario de r/ClaudeCode reportó allí ocho horas de trabajo por el 5% de una cuota semanal. El otro bando publicó sobre quemar el límite de 5 horas 10 veces más rápido, describiendo un límite que antes alcanzaban en seis horas y que ahora llega en menos de dos. Después un hilo titulado, literalmente, así que en qué quedamos reunió más de 150 comentarios de gente preguntando por ese vaivén.
Hacker News llegó a la respuesta más rápido que la cobertura de benchmarks:
"El gráfico muestra el esfuerzo máximo, usado sobre todo por usuarios empresariales insensibles al precio. Con esfuerzo medio cae a casi la mitad del coste de K3, y probablemente sea suficiente para el 95% de las tareas de programación."
"Se pasa bastante de rosca por encima de medium, prueba a usar eso."
Bajo esa primera causa hay una segunda, y esta atrapa a gente que nunca tocó el parámetro effort. El pensamiento está activado por defecto en Opus 5 y no lo estaba en Opus 4.8, así que una petición que nunca cambiaste ahora gasta tokens en razonamiento que antes se saltaba. Alguien lo detectó en las notas de migración a las pocas horas del lanzamiento:
"Los cambios importantes respecto a Opus 4.8 son interesantes: 1. Pensamiento activado por defecto: en Claude Opus 4.8, las peticiones sin campo thinking se ejecutan sin pensamiento; en Claude Opus 5, esas mismas peticiones se ejecutan con pensamiento adaptativo. 2. Desactivar el pensamiento está limitado a esfuerzo high"
Ambos bandos, entonces, decían la verdad. Solo hablaban de configuraciones distintas del mismo modelo. Esa es toda la disputa.
Las dos cosas que se rompen al migrar
Anthropic llama a Opus 5 "una actualización directa para Claude Opus 4.8 al mismo precio", y la guía de migración enumera exactamente dos cambios que rompen compatibilidad.
El pensamiento está activado por defecto. En 4.8, una petición sin el campo thinking se ejecutaba sin pensamiento; en Opus 5 esa misma petición se ejecuta con pensamiento adaptativo. Y como max_tokens limita la salida total, razonamiento incluido, cualquier carga de trabajo que antes funcionara de forma ligera necesita revisar su límite antes de que empiece a truncarse.
Desactivar el pensamiento está limitado a high. Enviar thinking: {type: "disabled"} sigue funcionando, pero combinarlo con xhigh o max devuelve un 400. Esa comprobación se ejecuta por petición, lo que significa que subir el esfuerzo a mitad de conversación con el pensamiento desactivado se rechaza incluso cuando los turnos anteriores pasaron sin problema. Anthropic también advierte de que, con el pensamiento desactivado, el modelo "puede ocasionalmente emitir llamadas a herramientas como texto plano o incluir etiquetas XML internas en su salida visible".
El resto de la actualización es todo ventaja, y hay varias piezas que merece la pena activar de forma deliberada:
- El umbral mínimo de la caché de prompts bajó a 512 tokens, desde los 1.024 de Opus 4.8 y los 4.096 de Opus 4.6. Los prompts de sistema cortos que antes no eran cacheables ahora lo son, sin necesidad de cambiar código.
- Los cambios de herramientas a mitad de conversación, tras la cabecera beta
mid-conversation-tool-changes-2026-07-01, permiten añadir o quitar herramientas entre turnos, y los aciertos de caché de turnos anteriores sobreviven. - Un parámetro
fallbacksenvía los rechazos del clasificador cibernético a Opus 4.8 en lugar de devolver un error, de forma que las peticiones "siempre se enrutan por defecto al mejor modelo disponible en lugar de ser bloqueadas". El truco está en la disponibilidad: no funciona en la API Batch, ni en Bedrock, ni en Google Cloud ni en Microsoft Foundry. - Opus 5 tiene su propio conjunto de límites de tasa. La página de límites de tasa es explícita en que no forma parte del pool combinado de Opus 4.x, y sitúa ese conjunto en 1.000 RPM con 2.000.000 de tokens de entrada por minuto.
Hay dos matices de prompting fáciles de pasar por alto aquí. Anthropic dice que elimines cualquier instrucción de verificación heredada, porque "Claude Opus 5 verifica su propio trabajo sin que se le pida", y dice que limites también la generación de subagentes, ya que el modelo delega con más facilidad que sus predecesores. Claude Code se tomó ese segundo punto lo bastante en serio como para lanzar una instrucción fija que le dice a Opus 5 que no use subagentes. La reacción en HN se dividió, como era de esperar.
Dónde lidera, y dónde no
El titular es real. En su Intelligence Index, Artificial Analysis sitúa a Opus 5 con esfuerzo máximo en 61, en el puesto #1 frente a una mediana de la clase de 32. Antes de emocionarte, lee a los que le siguen: Fable 5 con 60, GPT-5.6 Sol con 59, Kimi K3 con 57, y luego Opus 4.8 con 56. Las propias palabras de Artificial Analysis para Opus 5 son "por poco, el modelo más inteligente", y toda la frontera cabe dentro de una banda de cinco puntos.
Donde viven las victorias amplias e inequívocas es todo en un mismo lugar, el trabajo agéntico. AutomationBench de Zapier deja caer a un agente en una empresa simulada con decenas de endpoints REST repartidos en 47 aplicaciones, y ahí Opus 5 puntúa 26,0% frente a 17,0 de Opus 4.8, 17,4 de Fable 5 y 18,1 de GPT-5.6 Sol.

El otro caso atípico real es ARC-AGI-3, con un 30,16% de Relative Human Action Efficiency frente al 7,78% de GPT-5.6 Sol. Y algo que conviene señalar para el argumento de este artículo: esa puntuación salió de esfuerzo high, no max.

Ahora la otra columna, la honesta. Artificial Analysis midió un 53% en Humanity's Last Exam, "en línea con Fable 5", así que un empate, no una victoria. En CritPt, física de frontera, iguala a Fable 5, quedando por detrás de tres modelos de OpenAI. Terminal-Bench v2.1 le da un 89%, lo que está "aproximadamente en línea" con el líder. Anthropic mismo dice que Opus 5 se queda por detrás de Mythos 5 en investigación biológica, y también en ciberseguridad ofensiva.
Y luego está el ranking que por fin tiene datos. En el lanzamiento, LMArena no tenía entrada para Opus 5, así que nadie podía decir qué opinaban los humanos de él. A principios de agosto ya aparece listado. La respuesta no es la que predeciría el Intelligence Index.

En el ranking de texto de LMArena, claude-opus-5-high está en el puesto 7 con 1492 Elo, y claude-opus-5-max en el puesto 8 con 1490. Por encima de ese par: Fable 5 con 1509, más otros tres modelos Claude más antiguos. Los benchmarks que miden la finalización de tareas, y los humanos votando qué respuesta prefieren, están midiendo dos cosas distintas, y Opus 5 demuestra esa brecha con claridad. La comunidad lo puso en palabras más sencillas:
"Comparé el estilo de escritura de Opus 5 frente a Fable 5, y Opus 5 sigue arrastrando muchos de los 'claudismos' de su predecesor 4.8, de una forma de la que Fable se desmarcó."
Cómo conseguirlo en la práctica
Seis rutas para llegar a él, y no todas te dan lo mismo.
| Ruta | Qué obtienes | Notas |
|---|---|---|
| Claude Free, 0 $ | Nada de Opus | Solo Sonnet y Haiku, contexto de 200k |
| Claude Pro, 20 $/mes | Opus 5 como el modelo más potente disponible | 17 $/mes facturado anualmente. Fable vía créditos de uso |
| Claude Max 5x, 100 $/mes | Opus 5 como modelo por defecto | Fable limitado al 50% de los límites semanales |
| Claude Max 20x, 200 $/mes | Lo mismo, 20 veces el uso de Pro por sesión | Límites basados en sesión, no en número de mensajes |
| Claude Team, 25 $/asiento/mes | Las cuatro familias de modelos | 20 $/asiento anualmente, equipos de 2 a 150 |
| API de Claude | claude-opus-5 a 5 $ / 25 $ | Batch lo reduce a la mitad, los aciertos de caché cuestan 0,50 $ |
Claude Code viene incluido en todos los planes de pago y usa el mismo pool. Si tu selector sigue mostrando 4.8, /model claude-opus-5 funciona directamente, y en versiones más antiguas de la CLI, /model claude-opus-5[1m] te da la variante de 1M de contexto. También vale la pena saber que Claude Code al principio solo exponía una ventana de 200K para esto, que es justo el tipo de cosa para la que existen mis notas sobre la ventana de contexto de Claude Code.
En las plataformas en la nube, Bedrock y Google Cloud operan a través de socios, te facturan directamente, y los endpoints regionales llevan una prima del 10% sobre los globales. Claude Platform en AWS factura en Claude Consumption Units a 0,01 $ por CCU, y lo mismo hace Microsoft Foundry. Además de los tokens, Managed Agents añade 0,08 $ por hora de sesión de tiempo de ejecución activo.
Fast mode es la única ruta con condiciones de verdad. Hasta 2,5 veces más tokens de salida por segundo, a exactamente el doble de precio, 10 $ y 50 $, aplicado en toda la ventana de contexto. Las condiciones: sigue siendo una vista previa de investigación, solo API de Claude de primera parte, tras una lista de espera o un gestor de cuenta, y no funciona con Batch. Por token, esas tarifas caen en el mismo sitio que el Fable 5 estándar, así que lo que compras ahí es latencia, no capacidad. Mi desglose de precios de Claude Opus 5 analiza qué le hace eso a una factura mensual, mientras que los precios de Claude Code cubren el lado de la CLI.
El muro entre Opus 5 y un cliente real
Todo lo anterior ha girado en torno a elegir una configuración. Esta sección trata sobre el lugar donde ninguna configuración ayuda.

Ahora mismo Artificial Analysis mide a Opus 5 en 55,7 tokens de salida por segundo, lo que lo sitúa en el puesto #111 de 184, y el tiempo hasta el primer token es de 63,43 segundos. Bajar el esfuerzo recupera muy poca velocidad. Las tres configuraciones superiores en AA-Briefcase promedian más de 25 minutos por tarea. La frase que le dedicó Artificial Analysis: Opus 5 está "entre los modelos líderes en inteligencia, pero es especialmente caro en comparación con otros modelos de precio similar. También es notablemente lento y muy verboso".
El segundo número es el que más me importa, y apunta en dirección contraria al marketing. Con respecto a Opus 4.8, Opus 5 ganó 7 puntos de precisión en AA-Omniscience, y al mismo tiempo su tasa de alucinaciones subió 14 puntos hasta el 50%, por el motivo de que responde con más frecuencia cuando no está seguro. La propia ficha del sistema de Anthropic lo dice sin rodeos: "El modelo alucina afirmaciones factuales un poco más que Opus 4.8, a pesar de ser más preciso en general".
Para un agente de programación que vuelve a ejecutar sus propias pruebas, ese intercambio está bien. Ahora pon el mismo intercambio en una respuesta de soporte que sale hacia un cliente de pago con tu logo puesto. Una respuesta incorrecta pero segura de sí misma ahí es el modo de fallo que te cuesta la cuenta, y por eso prevenir las alucinaciones en soporte acaba siendo un problema de diseño de producto en lugar de un problema de selección de modelo.
He visto esto repetirse tantas veces que puedo ser directo al respecto. Algo así como el 10% de un despliegue de soporte que funciona de verdad es el modelo. El otro 90% es recuperación de conocimiento que se mantiene actualizada, más un umbral de confianza que decide qué puede tocar la IA siquiera, una pasada de simulación sobre tickets históricos para que la tasa de respuesta se conozca antes de que la vea cualquier cliente, y luego una transferencia que no pierde contexto por el camino. Un cliente de eesel, que gestiona una red de cajeros automáticos de criptomonedas, planteó el dilema entre construir o comprar mejor de lo que yo podría hacerlo:
"Podríamos haber intentado escribir nuestra propia aplicación de LLM, pero no queríamos invertir nuestro tiempo en eso. Queríamos algo que no tuviéramos que mantener."
Karel, GENERAL BYTES
Una responsable de CX en una marca de suplementos DTC describió después el problema del control en una frase que se me ha quedado grabada durante años: la IA nunca va a responder al 100% de las preguntas, así que lo que ella necesitaba era una IA que gestionara solo los tickets sobre los que tuviera confianza y dejara el resto sin tocar. Ningún parámetro effort te da eso. Es una decisión de enrutamiento, y se toma fuera del modelo.
Prueba eesel
Si has llegado aquí porque estás eligiendo un modelo para una cola de soporte, el consejo honesto es este: Opus 5 es un motor estupendo y el motor nunca fue tu cuello de botella. eesel es la parte que envuelve a ese motor. Se conecta al helpdesk que ya usas, entrena con tus tickets pasados y tu centro de ayuda en lugar de con un prompt pegado a mano, y simula sobre tu propio historial de tickets, así que la tasa de resolución está delante de ti antes de que ningún cliente vea al agente. La configuración se hace en minutos en lugar de en un trimestre, y el precio se cuenta por tickets resueltos y no por tokens, así que un modelo verboso no puede inflarte la factura sin que te des cuenta.

Esa vista de informes es la pieza que ninguna clave de API en crudo te da: qué tickets tomó realmente el agente, qué desencadenó cada ejecución, y en qué puntos intervino una persona. Para ver cómo se ven tus propios números puedes probar eesel gratis, o leer cómo se juega la misma decisión en las herramientas de soporte de este año y cuánto cuesta un agente de soporte con IA.
Para el resto del panorama de Opus 5: la reseña completa tiene el veredicto sobre si vale la pena actualizar, Opus 5 frente a Fable 5 cubre el nivel superior y Opus 5 frente a Sonnet 5 el nivel inferior, y los precios de Sonnet 5 importan justo ahora, ya que sus tarifas de lanzamiento de 2 $ y 10 $ expiran el 31 de agosto de 2026.
Preguntas frecuentes
¿Qué es Claude Opus 5?
claude-opus-5, tiene una ventana de contexto de 1M de tokens con 128k de salida máxima, y cuesta 5 dólares por millón de tokens de entrada y 25 por millón de salida. La documentación de Anthropic recomienda empezar aquí para programación agéntica y trabajo empresarial, y subir a Fable 5 solo cuando necesitas el techo. Mi reseña de Opus 5 tiene el veredicto completo.¿Cuánto cuesta Claude Opus 5?
¿Es Claude Opus 5 mejor que Claude Fable 5?
¿Cuál es la diferencia entre los niveles de esfuerzo de Claude Opus 5?
low, medium, high, xhigh, max. En AA-Briefcase de Artificial Analysis abarcan 497 puntos Elo, y el uso de tokens de salida ronda un 8x de low a max en GDPval-AA v2. El valor por defecto de la API es high. Trata el esfuerzo como tu principal control de coste antes de mirar modelos más baratos como Sonnet 5.¿Necesito cambiar mi código para actualizar desde Opus 4.8?
max_tokens en razonamiento. Y pasar thinking: disabled junto con esfuerzo xhigh o max devuelve un error 400. Todo lo demás es un reemplazo directo al mismo precio. Si lo usas a través de la CLI, mis notas sobre selección de modelo en Claude Code cubren el lado del selector.¿Dónde puedo usar Claude Opus 5 gratis?
¿Puede Claude Opus 5 gestionar tickets de atención al cliente?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.







