Reseña de Claude Opus 5: programación casi de nivel frontera a mitad de precio

Alicia Kirana Utomo
Escrito por

Alicia Kirana Utomo

Katelin Teen
Revisado por

Katelin Teen

Última edición July 27, 2026

Verificado por expertos
Illustration of a developer at a laptop watching an agentic coding loop run through code, checks and a bot

Qué es Claude Opus 5 en realidad

Opus 5 es el nuevo caballo de batalla de Anthropic. El buque insignia sigue siendo Fable 5. Pero Opus 5 es el modelo que Anthropic te dice que pruebes primero: la documentación indica empezar con Claude Opus 5 para programación agéntica compleja y trabajo empresarial, y subir de nivel solo cuando realmente necesites el techo. En Claude Max ya es el nuevo modelo por defecto. En Claude Pro, según Anthropic, es el modelo más potente disponible.

La publicación de lanzamiento lo plantea así: "se acerca a la inteligencia de frontera de Claude Fable 5 a mitad de precio". Eso suena, primero, como una afirmación de posicionamiento. Lo inusual es que los datos independientes, por una vez, la respaldan en gran medida.

El ritmo aquí merece atención, sobre todo si la última vez que miraste esta familia fue hace un par de lanzamientos. Mi reseña de Opus 4.5 tiene apenas unos meses, y ya se lee como un modelo de otro nivel. Opus 4.6 quedó en algún punto intermedio.

Las especificaciones, brevemente. El id del modelo es claude-opus-5. Ventana de contexto: 1M de tokens, con 128k de salida máxima, según la visión general de modelos. El corte de conocimiento está en mayo de 2026, más reciente que Fable 5 y Sonnet 5. Las solicitudes por lotes pueden llevar la salida hasta 300k tokens con una cabecera beta. Tampoco hay recargo por contexto largo: una solicitud de 900k tokens factura a la misma tarifa por token que una de 9k, según la documentación de precios.

Where Claude Opus 5 sits against Opus 4.8 and Fable 5 on capability versus cost per task
Where Claude Opus 5 sits against Opus 4.8 and Fable 5 on capability versus cost per task

Llevo tres años construyendo agentes de IA que corren sobre colas de soporte reales de otras empresas en eesel. Así que leo los lanzamientos de modelos con una pregunta en mente: ¿esto cambia lo que puedo poner con seguridad delante de un cliente? Esta reseña mira primero los logros en programación. Después, los dos números que deciden si un modelo tiene cabida cerca de una conversación en vivo.

El panorama de los benchmarks: victorias reales, más delgadas que el titular

Empecemos por el número que Anthropic destaca. Frontier-Bench v0.1 es el sucesor de Terminal-Bench, construido por el mismo equipo, y Opus 5 alcanzó un 44.4% de recompensa media con esfuerzo xhigh. Opus 4.8 logró 18.7%, según la tarjeta de sistema. Fable 5 quedó en 33.7%, y GPT-5.6 Sol en 37.5%. No es un salto incremental, este.

Frontier-Bench v0.1 score plotted against cost per attempt for Opus 5, Fable 5, Opus 4.8 and GPT-5.6 Sol, as taken from Anthropic
Frontier-Bench v0.1 score plotted against cost per attempt for Opus 5, Fable 5, Opus 4.8 and GPT-5.6 Sol, as taken from Anthropic

Lo que importa aquí es la forma del gráfico, más que el pico. La línea de Opus 5 queda por encima y a la izquierda de todo lo demás. Esa es la posición que quieres, más puntuación por menos dinero. Toda la curva de Fable 5 vive a la derecha, pagando entre dos y tres veces más por intento por un techo más bajo.

La tabla de cabecera de abajo viene directamente de la tarjeta de sistema, reproducida exactamente.

EvaluationClaude Opus 5Claude Opus 4.8Claude Fable 5GPT-5.6 Sol
SWE-bench Pro79.269.28064.6
SWE-bench Multilingual89.584.486.6
SWE-bench Multimodal59.438.454.1
DeepSWE v1.168.859.069.772.7
FrontierCode 1.1 (Main)53.446.553.547.5
FrontierBench v0.143.321.133.834.4
BrowseComp90.884.387.490.4
Humanity's Last Exam (no tools)56.349.856.5
OSWorld 2.070.655.766.162.6
GDPval-AA v2 (Elo)1861159317471736
AA-Briefcase (Elo)1720134615741505
AutomationBench26.017.017.418.1
ARC-AGI-290.472.192.5
ARC-AGI-330.21.57.8

Lee las filas, el promedio esconde demasiado. Opus 5 pierde SWE-bench Pro frente a Fable 5 y DeepSWE frente a GPT-5.6 Sol, y también pierde ARC-AGI-2, por dos puntos. Pero donde gana, gana a lo grande: SWE-bench Multimodal salta 21 puntos sobre Opus 4.8. ARC-AGI-3 pasa de 1.5 a 30.2, lo que la tarjeta de sistema llama aproximadamente cuatro veces la mejor puntuación reportada anteriormente.

También hay una puntuación perfecta genuina escondida aquí. Celebrada el 15 y 16 de julio, la Olimpiada Internacional de Matemáticas de 2026 vio a Opus 5 obtener un 42 sobre 42 perfecto, sin arnés de agente y sin herramientas. El corte para medalla de oro fue 29, según la tarjeta de sistema.

Si sigues las comparaciones directas, esta reordena varias. Mi comparación con Gemini 3 Pro necesita una nueva línea base ahora, y también el artículo de Codex frente a Opus 4.6.

Lo que dicen los números independientes

Artificial Analysis sitúa a Opus 5 en 61 en su Intelligence Index. Puesto uno de 190 modelos, frente a una mediana de la clase de 32. El puesto uno es real, claro, pero también es una ventaja de un solo punto: Fable 5 se sitúa en 60, GPT-5.6 Sol en 59, según el análisis de AA, con Opus 4.8 quedando atrás en 56. La propia AA lo describe como "por poco" el modelo más inteligente.

Las ventajas amplias viven en algo más específico que la "inteligencia". Toma GDPval-AA v2, un conjunto de 220 tareas ocupacionales reales: Opus 5 se lleva los dos primeros puestos, con 1861 y 1827 Elo, según la tarjeta de sistema, 114 puntos por delante de Fable 5. En AA-Briefcase, trabajo de conocimiento de largo horizonte en proyectos de varias semanas, se lleva los tres primeros puestos directamente. Estos son los resultados que realmente justifican el lanzamiento. Tratan de sostener un trabajo largo y desordenado, una habilidad distinta a responder una pregunta difícil.

Una advertencia que casi ninguna cobertura menciona: Anthropic ejecutó sus propios números de Frontier-Bench con Opus 4.8 como respaldo para los rechazos del clasificador de seguridad, según la tarjeta de sistema, y ese respaldo capturó el 5% de las llamadas a la API. Artificial Analysis ejecutó su Index exactamente de la misma manera. Así que una pequeña porción de cada puntuación "de Opus 5" fue producida en realidad por Opus 4.8.

Es un modelo de agentes antes que un modelo de programación

Lo que más me sorprendió no está en ninguna tabla de clasificación de programación. Es AutomationBench de Zapier, que coloca a un agente en una empresa simulada con decenas de endpoints REST repartidos en 47 apps, y luego evalúa si completa un flujo de trabajo empresarial real. Opus 5 obtuvo 26.0%, frente a 17.0 de Opus 4.8, 17.4 de Fable 5, y también 18.1 de GPT-5.6 Sol, según la tarjeta de sistema.

AutomationBench pass rate against cost per task, with Opus 5 clearing every other model at lower cost, as taken from Anthropic
AutomationBench pass rate against cost per task, with Opus 5 clearing every other model at lower cost, as taken from Anthropic

Fíjate en dónde empieza la línea naranja: el ajuste más barato de Opus 5 ya supera al mejor ajuste de cualquier otro modelo, a apenas unos $0.75 por tarea. Anthropic reporta 24% con esfuerzo medio a $0.89 por tarea, y afirma que supera tanto a Opus 4.8 como a Fable 5 a menos de la mitad del coste. Esa es la verdadera historia de este lanzamiento: no un chatbot más inteligente, un agente más barato.

El comportamiento detrás de esto aparece en las anécdotas. En una tarea de Frontier-Bench, a Opus 5 le dieron el dibujo de una pieza mecánica y le pidieron reconstruirla en FreeCAD, y encima, deliberadamente, sin ninguna forma de ver el dibujo, según la publicación de lanzamiento. Escribió su propia canalización de visión por computadora para leer la geometría a partir de los píxeles en bruto, y ningún modelo rival lo resolvió en cinco intentos. JetBrains enmarcó el cambio como criterio: el modelo detecta sus propios fallos lógicos durante la planificación, en lugar de después de los hechos.

Las cifras del acceso anticipado respaldan también el patrón. Box midió una mejora general del 8% sobre Opus 4.8, que sube al 17% en flujos de trabajo de debida diligencia. Lovable lo situó un 22% por encima de Opus 4.7 en sus tareas de programación agéntica más difíciles, con mucha menos variación entre ejecuciones. Una firma de trading reportó alcanzar el mismo resultado con aproximadamente un séptimo de los tokens de razonamiento, según la publicación de lanzamiento.

Diferencias de eficiencia como esa importan más que las puntuaciones brutas, una vez que un modelo hace trabajo real sin supervisión. Es el mismo cambio que describí en mi artículo sobre CLI de programación agéntica, y también en el resumen de agentes de IA más amplio: la pregunta interesante dejó de ser "¿puede responder?" para convertirse en "¿puede terminar?".

Los dos números que deberían hacerte pausar

Esta es la sección que querría leer primero, así que no la voy a enterrar.

Alucina más que el modelo al que reemplaza

En AA-Omniscience, un benchmark factual de libro cerrado, Opus 5 mejoró la precisión en 7 puntos sobre Opus 4.8, y su tasa de alucinaciones subió también 14 puntos, hasta el 50%, según Artificial Analysis. La propia tarjeta de sistema de Anthropic registra el mismo intercambio con sus propias palabras: la precisión queda 11% más alta que Opus 4.8, pero la tasa de alucinaciones también es 6% más alta.

Eso, en realidad, no es una contradicción. El modelo simplemente responde más a menudo cuando no está seguro. En una tarea de programación con pruebas, adivinar sale barato: la prueba falla, el bucle continúa. En la pregunta de un cliente sobre un reembolso, una suposición hecha con confianza es todo el modo de fallo, y es la objeción que sale en casi todas las llamadas de evaluación en las que participo.

"The AI will never be able to answer 100% of the questions. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

Esa es una responsable de CX de una marca de suplementos DTC, y la frase resume la tesis de toda la categoría. Más inteligencia bruta por sí sola no lo resuelve, el filtrado por confianza sí, por eso prevenir alucinaciones en soporte es un problema de producto, no de modelo.

Es lento, y lento en el peor lugar

Artificial Analysis midió a Opus 5 en 52.6 tokens de salida por segundo, puesto 117 de 190, frente a una mediana de la clase de 76. Bien, para trabajo en segundo plano. Lo que realmente lo descalifica para uso en tiempo real es el tiempo hasta el primer token: 68.04 segundos con esfuerzo máximo, frente a una mediana de la clase de 2.81. Eso es aproximadamente 24 veces más lento antes de que aparezca un solo carácter.

Bajar el nivel de esfuerzo apenas ayuda: 52.8 tokens por segundo con xhigh, 56.8 con high, según Artificial Analysis. El modo rápido compra unas 2.5 veces la velocidad, por el doble del precio base. El propio resumen de AA es más directo de lo que yo escribiría: Opus 5 es "notablemente lento y muy verboso".

Hay un tercer número que vale la pena conocer antes de fijar effort: "max" y olvidarse del asunto. En AA-Briefcase, el esfuerzo máximo promedió 36.2 minutos y 103 turnos por tarea, según Artificial Analysis, frente a 24.1 minutos y 55 turnos de Opus 4.8. En coste por tarea del Index, Opus 5 con esfuerzo máximo corre a $2.03, frente a los $1.80 de Opus 4.8, y también los $1.53 de Sonnet 5, según el análisis de AA. Sale un 26% más barato que Fable 5, y más caro que su propio predecesor.

La solución aquí es simple: no uses max por defecto. El mejor punto de valor de todo el conjunto de datos es Opus 5 con esfuerzo alto, que supera a Fable 5 por 32 Elo a $10.41 por tarea, según Artificial Analysis, menos de la mitad de los $22.30 de Fable 5. Anthropic incluso revirtió su propia guía para coincidir con esto, recomendando ahora empezar en high en lugar de xhigh, según las notas de lanzamiento.

Lo que dice quien ha trabajado con él

La semana de lanzamiento en X se dividió de una forma que no había visto antes. El debate no era si Opus 5 es bueno, la mayoría de la gente cree que es el mejor modelo disponible. El debate era que es el mejor modelo disponible y desagradable de trabajar.

La versión más afilada vino de alguien que lo colocó en primer lugar:

"BIG NEWS: Opus 5 is here...and I hate working with it. And yet in a blind taste test, I ranked it above every other model (even Fable and my beloved GPT-5.6)"

La parte a ciegas es lo que lo hace útil. Clasificar modelos sin saber cuál es cuál elimina la lealtad de marca, así que "lo odio" habla puramente de la ergonomía, no de la capacidad. Dan Shipper, de Every, pasó una semana probándolo antes del lanzamiento, en programación y escritura, además de su agente interno, y llegó al mismo sitio: "es un modelo difícil de amar". "Discutía las instrucciones, se detenía antes de terminar el trabajo", y no encajaba bien con sus skills y plugins existentes.

La queja más útil operativamente viene con una solución incorporada:

"Opus 5 is out now! And it broke Compound Engineering, but I also like it. Love it and hate it. I have been coding with it without many skills and it's nice at a medium effort level. Just remember to let go of you skills and big mega prompts."

Describe un fallo concreto: en un flujo autónomo, el modelo seguía devolviendo el control al humano. La propia guía de prompting de Anthropic dice más o menos lo mismo, desde el otro lado: le dice a los desarrolladores que quiten las instrucciones tipo "incluye un paso de verificación final", porque Opus 5 ahora se sobre-verifica por su cuenta. El scaffolding construido para Opus 4.8 ahora juega en tu contra.

Hay una explicación mecánica clara, y viene del lado de los benchmarks:

"Claude Opus 5 averages 103, 91, and 76 turns per task across its top three effort levels, compared to 55 for Opus 4.8 (max)"

Aproximadamente el doble del bucle de agente. Ese único número explica "neurótico", "discutía las instrucciones" y también "seguía devolviendo el control" al mismo tiempo. Es el mismo comportamiento, solo visto desde fuera.

La única medición dura de terceros en todo el ruido de la semana de lanzamiento vino de CodeRabbit, que pasó a Opus 5 por su benchmark de revisión de código en producción. La precisión subió, del 35.2% al 39.3%. El recall bajó, del 61.1% al 55.2%, y también cuatro veces más quejas menores. Su veredicto fue "un especialista en precisión, que combina bien con un modelo de recall", y venden revisión de código, así que hay que leer la recomendación de conjunto con eso en mente. La disyuntiva en sí encaja con todo lo demás aquí: más cuidadoso y más minucioso, y también más hablador.

Que el recall baje mientras la precisión sube es el hallazgo que vale la pena rumiar más tiempo, si un modelo es tu revisor. Cambia para qué sirve realmente un pase de revisión de código con IA, y vale la pena recalcular tus propios números antes de asumir que es una simple mejora.

La misma cautela aplica dentro de editores como Cursor. También aplica a Windsurf, y dentro de Claude Cowork también.

El ajuste de esfuerzo es todo el debate

El hilo de lanzamiento en Hacker News llegó a 1,315 comentarios, y contiene lo que parece una contradicción plana. La mitad del hilo dice que Opus 5 es notablemente barato de ejecutar, la otra mitad dice que está quemando su límite de cinco horas. Ambas cosas son ciertas. La variable es el ajuste de esfuerzo.

Hacker News

"It overthinks quite a bit above medium effort, try using that."

Hacker News

"The chart shows max effort, used mostly by price-insensitive enterprise users. At medium effort it drops to almost half K3's cost, and is probably sufficient for 95% of coding tasks."

Entonces el hilo encontró algo mejor que quejas. Leyendo la tarjeta de sistema, varias personas notaron que la puntuación de programación de Opus 5 en realidad cae por encima de esfuerzo medio, lo que suena a bug, o algo peor:

Hacker News

"Page 151 of the linked system card - did Opus 5 get nerfed to prevent it being better than Fable? The graph makes no sense. Huge decline in coding performance at effort levels higher than medium."

La tarjeta de sistema lo responde con claridad, y la respuesta real es más interesante que un debilitamiento deliberado. Ambos mejores resultados de FrontierCode se dan con esfuerzo medio, y Anthropic explica que con esfuerzo más alto Opus 5 "hace más cambios de los que la tarea requiere", lo que el evaluador luego penaliza como fuera de alcance. Añadir una breve instrucción de mantenerse dentro del alcance "recuperó el rendimiento en la mayoría de estas tareas". Así que el modelo no se vuelve más tonto con esfuerzo máximo en absoluto. Se vuelve más ambicioso, y la ambición es un problema cuando la tarea era pequeña.

Eso es probablemente lo más accionable de toda esta reseña: subir el esfuerzo no es una mejora gratis, y en trabajo bien acotado puede costarte tanto dinero como puntuación.

Vale la pena notar también que ese mismo comportamiento se lee como una ventaja para un público distinto. Al desplegar Opus 5 en Copilot, el anuncio de GitHub lo elogió por "validar su propio trabajo y reducir la sobrecarga de ejecución innecesaria en tareas complejas". El mismo bucle de autoverificación, una lectura distinta: un equipo lo llama minucioso, el otro lo llama neurótico. Cuál de los dos obtienes depende por completo de si hay un humano esperando el resultado.

Precios, en detalle

Nada cambió a nivel de token, lo cual es honestamente lo más interesante de todo esto. La línea Opus se ha mantenido en $5 y $25 desde Opus 4.5, según la documentación de precios, un recorte de 3 veces frente a los $15 y $75 de Opus 4.1.

Rate (per million tokens)Claude Opus 5Claude Fable 5Claude Sonnet 5Claude Haiku 4.5
Base input$5$10$2 (to Aug 31)$1
Output$25$50$10 (to Aug 31)$5
5-minute cache write$6.25$12.50$2.50$1.25
1-hour cache write$10$20$4$2
Cache read$0.50$1$0.20$0.10
Batch input / output$2.50 / $12.50$5 / $25$1 / $5$0.50 / $2.50
Fast mode input / output$10 / $50
Context window1M1M1M200k

Cuatro cosas cambian tu factura sin hacer ruido:

  • Los $2 y $10 de Sonnet 5 son solo de introducción y vuelven a $3 y $15 el 1 de septiembre de 2026, según la documentación de precios. Presupuestar Sonnet frente a Opus hoy significa compararse con una tarifa que expira en unas cinco semanas.
  • El tokenizador cambió. Los modelos desde 4.7 en adelante pueden usar hasta un 35% más de tokens para el mismo texto, según la guía de migración. Una comparación plana por token contra un modelo de la era 4.6 subestimará el coste real.
  • El umbral de caché bajó a 512 tokens, el más bajo de la gama, ocho veces menos que Opus 4.5. Los prompts de sistema cortos que antes nunca podían cachearse, ahora sí pueden. Los prompts por debajo del umbral se procesan igual, solo que sin error y sin caché.
  • La inferencia solo en EE. UU. cuesta 1.1x en todas las categorías de tokens, lo que sale a $5.50 y $27.50 para Opus 5.

Del lado de consumo, Pro cuesta $20 al mes (o $17 con facturación anual). Max cuesta $100 o $200, y los puestos de Team también vienen a $25 o $125. Los límites de uso son por sesión, en una ventana rodante de cinco horas en lugar de un conteo de mensajes, y web, escritorio, móvil y Claude Code sacan del mismo fondo.

Las cifras completas están en mi desglose de precios de Claude Code, y si estás decidiendo qué modelo asignar a qué tarea, la guía de selección de modelo y las notas sobre la ventana de contexto son el complemento práctico de esta sección.

Qué se rompe al migrar

Anthropic llama a Opus 5 un reemplazo directo de Opus 4.8, y en su mayoría, lo es. Dos cosas sí se rompen de verdad:

  1. El pensamiento adaptativo viene activado por defecto. Revisa tu max_tokens, porque los tokens de pensamiento ahora salen de ahí, en solicitudes que antes no tenían ninguno.
  2. Desactivar el pensamiento está limitado. thinking: {"type": "disabled"} devuelve un error 400 con esfuerzo xhigh o max, según las notas de lanzamiento, aplicado por solicitud. Opus 4.8 solía aceptar esa combinación.

Dos funciones también desaparecieron por completo, en lugar de simplemente cambiar: web fetch no está disponible en Opus 5, según la guía de migración, y tampoco lo está Priority Tier, que Opus 4.8 sí conserva. Si tienes un compromiso de capacidad, planifica alrededor de eso antes de cambiar el tráfico.

Viniendo de Opus 4.6 o anterior, hay una lista más larga. Parámetros de muestreo como temperature y top_p devuelven un error 400 con cualquier valor distinto al predeterminado, según la guía de migración, y los tipos del SDK aún los aceptan, así que tu código pasa el chequeo de tipos sin problema y la API lo rechaza de todos modos. El prefill del asistente también desapareció. El contenido de pensamiento se omite por defecto, lo que para cualquier cosa que transmita el razonamiento al usuario se parece a un largo silencio antes de que aparezca cualquier salida.

Del lado de las adiciones, dos betas se lanzaron junto con el modelo: cambios de herramientas a mitad de conversación, que intercambian las herramientas disponibles sin invalidar la caché del prompt, y los respaldos automáticos del lado del servidor. Si construyes agentes de varios pasos, ese primero es, en silencio, un gran cambio.

También modifica cómo se componen los agentes. Intercambiar herramientas en pleno funcionamiento sin fallar la caché abarata el patrón de subagente. Convive junto a Claude Skills también, y también junto a las herramientas MCP, sin reemplazar a ninguno de los dos.

Mi análisis de skills frente a subagentes cubre cuándo cada uno es el contenedor correcto. Si operas sobre un proveedor de nube en lugar de la API de primera parte, ten en cuenta que el modo rápido es solo de primera parte, algo que mis notas sobre Bedrock y Claude Code abordan.

Seguridad, y el respaldo que nadie menciona

La auditoría previa al despliegue de Anthropic llama a Opus 5 su modelo más alineado hasta la fecha, con una puntuación de 2.3 en comportamiento desalineado general, la más baja entre sus modelos recientes. Se despliega bajo protecciones ASL-3, el mismo nivel que Opus 4.8.

El resultado que más me importa es la resistencia a la inyección de prompts, porque eso es lo que rompe a los agentes conectados a datos reales de clientes. El éxito del atacante en la evaluación de inyección indirecta de prompts cayó de 5.5% a 2.0%, el mejor de cualquier modelo probado y muy por delante del 20.0% de GPT-5.6 Sol. El éxito de ataques por uso de navegador cayó de 31.5% a 3.70%, y luego hasta 0% en 129 escenarios con el modo automático activado. Para cualquiera que dé acceso a herramientas a un agente, eso importa más que cualquier puntuación de programación.

La parte que se suele pasar por alto: Opus 5 no siempre responde a tu solicitud.

How a flagged request quietly falls back from Opus 5 to Opus 4.8 instead of returning an error
How a flagged request quietly falls back from Opus 5 to Opus 4.8 instead of returning an error

En Claude.ai y Claude Code, y también en Claude Cowork, las solicitudes marcadas por los clasificadores de ciberseguridad caen por defecto a Opus 4.8, según la publicación de lanzamiento, y el mismo comportamiento está disponible en la API también. Sin error, sin señal evidente, solo un modelo distinto respondiendo en silencio. Anthropic espera que esos clasificadores intervengan alrededor de un 85% menos que para Fable 5, según Anthropic, lo cual es una mejora real, pero si estás haciendo benchmarking o depuración, conviene saber que una fracción de tu tráfico puede no ser el modelo que crees.

Donde Opus 5 se mantiene deliberadamente contenido: queda por detrás de Mythos 5 tanto en ciberseguridad como en investigación biológica, según la publicación de lanzamiento. En OSS-Fuzz encuentra vulnerabilidades casi tan bien como Mythos 5, pero va muy por detrás a la hora de convertirlas en exploits.

OSS-Fuzz results showing Opus 5 near Mythos 5 at finding vulnerabilities and well behind on exploit development, as taken from Anthropic
OSS-Fuzz results showing Opus 5 near Mythos 5 at finding vulnerabilities and well behind on exploit development, as taken from Anthropic

Quién debería actualizar, y quién no

Actualiza si ejecutas agentes: tareas largas de varios pasos, bucles de programación, pipelines de investigación, uso de computadora, cualquier cosa donde el modelo trabaje veinte minutos sin supervisión. Los resultados de AutomationBench y AA-Briefcase no están cerca, y el precio tampoco se movió. Si estás eligiendo entre asistentes, mi resumen de herramientas de programación con IA y la reseña de GPT-5.3 Codex cubren las alternativas, con más contexto en mi lista de alternativas a Opus 4.6.

Quédate donde estás si tu carga de trabajo es chat corto y sensible a la latencia. Un primer token de 68 segundos no es algo que puedas resolver con configuración. Sonnet 5 es la opción correcta ahí, también lo es Haiku, y con esfuerzo máximo Opus 5 cuesta más por tarea terminada que cualquiera de los dos.

Mira otras opciones si necesitas conocimiento factual actual sin una capa de recuperación. Opus 5 tiene un conocimiento factual menor que Fable 5, según Artificial Analysis, y la cifra de alucinaciones dice el resto.

Compáralo con Gemini 3. Mira también Kimi K3. O considera Mistral antes de decidirte.

Un vacío honesto: todavía no hay ningún dato de preferencia humana. Opus 5 no aparece en la tabla de clasificación de texto de LMArena, cuya instantánea actual es anterior al lanzamiento. Vale la pena notar que Opus 4.8 ocupa el puesto 13 ahí a pesar de ser un modelo top cinco en el Index, así que la inteligencia de benchmark y lo que la gente realmente prefiere claramente no son lo mismo.

Qué significa esto si estás construyendo IA de soporte

Cada lanzamiento de frontera dispara la misma conversación, en las llamadas de mi equipo. Alguien técnico mira un modelo de $5 por millón de tokens que puntúa 26% en automatización de flujos de trabajo empresariales, y hace la pregunta razonable: ¿por qué pagamos por un producto de soporte cuando podríamos conectarlo nosotros mismos?

Me lo tomo en serio, porque lo he visto ocurrir de verdad. Un par de cuentas técnicas, incluida una marca de belleza DTC, dejaron eesel para construir directamente sobre la API de Claude. Es la alternativa competitiva más común con la que me encuentro, y tampoco es un plan tonto.

What a frontier model gives you versus what a live support desk still needs
What a frontier model gives you versus what a live support desk still needs

Lo que suele pasar es que el modelo nunca fue la parte difícil. La parte difícil es todo lo que queda a la derecha de esa flecha: autenticarse en el helpdesk y mantener los tickets sincronizados, entrenar con tu base de conocimiento, ejecutarlo contra tickets pasados antes de que toque uno en vivo, enrutar por confianza para que se quede callado cuando no está seguro, traspasar a un humano sin perder contexto, y conocer de antemano tu coste por ticket en lugar de conciliar una factura de tokens después de los hechos.

Suma los dos números de esta reseña y las salvaguardas dejan de ser un lujo. Una tasa de alucinaciones del 50% es exactamente aquello por lo que se juzga a todo chatbot de atención al cliente con IA, y un primer token de 68 segundos es más de lo que la mayoría de la gente esperará en una ventana de chat. Hay una razón por la que la tasa de resolución se mide en resultados en lugar de puntuaciones de benchmark, y por la que las herramientas de helpdesk que funcionan son las que te dejan ver lo que la IA habría dicho, antes de que realmente lo diga.

Un cliente resumió la disyuntiva entre construir y comprar mejor de lo que yo podría hacerlo.

"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."

Karel, GENERAL BYTES, from their case study

Ese es el verdadero intercambio. Opus 5 hace que el motor sea drásticamente mejor y más barato, pero no hace nada respecto a los doce meses de mantenimiento que lo rodean. Si disfrutas ese tipo de trabajo, constrúyelo tú. Si solo quieres el resultado, no lo hagas.

Dónde encaja eesel

Si lo que realmente quieres es un razonamiento de nivel Opus respondiendo a tus tickets mañana, no el próximo trimestre, eesel es eso. Conéctalo al helpdesk que ya usas, entrena con tus macros y documentos existentes, y también con tus tickets pasados, y empieza a redactar o resolver desde el primer día. Sin contabilidad de tokens, sin blindaje contra inyección de prompts, sin lógica de respaldo que escribir.

The eesel AI dashboard showing live ticket activity across a connected helpdesk
The eesel AI dashboard showing live ticket activity across a connected helpdesk

Lo primero que le mostraría a un ingeniero escéptico es la simulación. Antes de que eesel responda un solo ticket en vivo, puedes ejecutarlo sobre tus tickets históricos y ver exactamente qué habría dicho, que es la única forma honesta de saber si la confianza de un modelo se gana sobre tus propios datos, y no sobre un benchmark. Después de eso, el enrutamiento basado en confianza decide qué responde y qué deja en paz, y el precio funciona por tarea en lugar de por token, así que un modelo hablador nunca te sorprende al final del mes.

No es para todo el mundo, para que quede claro. Si tu caso de uso es código, usa Claude Code directamente. Pero si es una cola de soporte, y el plan era pasar un trimestre reconstruyendo la desviación de tickets, más la escalación, encima de una API nueva, prueba primero eesel. Es gratis empezar.

Preguntas frecuentes

¿Vale la pena Claude Opus 5 frente a Opus 4.8?
Para trabajo agéntico, sí. Opus 5 más que duplica la puntuación de Opus 4.8 en Frontier-Bench al mismo precio de $5 / $25 por millón de tokens, y las propias notas de migración de Anthropic lo describen como un reemplazo directo con solo dos cambios disruptivos. La trampa es que su tasa de alucinaciones subió en lugar de bajar, así que cualquier uso de cara al cliente sigue necesitando las salvaguardas descritas en cómo prevenir alucinaciones de IA. Si sigues en la línea anterior, nuestro análisis de Opus 4.6 muestra cuánto ha avanzado la familia.
¿Cuánto cuesta Claude Opus 5?
$5 por millón de tokens de entrada y $25 por millón de tokens de salida en la API de Claude, sin cambios respecto a Opus 4.8, con un descuento del 50% en la Batch API y sin recargo por contexto largo en la ventana de 1M. El modo rápido duplica ambas cifras. El acceso para consumidores va desde el plan Pro de $20/mes hasta Max a $200/mes, y los precios de Claude Code se toman del mismo fondo.
¿Es Claude Opus 5 mejor que Claude Fable 5?
No en capacidad bruta, pero se acerca mucho por mucho menos dinero. Opus 5 queda a un 0.5% de la puntuación máxima de Fable 5 en CursorBench a la mitad del coste por tarea, y lo supera claramente en trabajo de conocimiento agéntico. Fable 5 sigue liderando en conocimiento factual. Nuestro análisis de Fable 5 explica dónde el modelo insignia todavía justifica su precio.
¿Puedo usar Claude Opus 5 para atención al cliente?
Como motor de razonamiento detrás de un producto de soporte, sí. Como generador de respuestas directo en un chat en vivo, ten cuidado: 68 segundos hasta el primer token con esfuerzo máximo es demasiado lento para un widget de chat, y la tasa de alucinaciones subió 14 puntos. La mayoría de los equipos obtienen mejores resultados añadiendo un producto diseñado específicamente para eso, que es justo lo que hacen el soporte técnico con IA y las herramientas de automatización de soporte.
¿Qué se rompe al migrar a Claude Opus 5?
Dos cosas. El pensamiento adaptativo viene activado por defecto, así que revisa tu max_tokens, y desactivar el pensamiento devuelve un error 400 con esfuerzo xhigh o max. Web fetch y Priority Tier también faltan en Opus 5. El nuevo tokenizador cuenta hasta un 35% más de tokens para el mismo texto, así que recalcula tus costes en lugar de reutilizar estimaciones antiguas. Cualquiera que lo integre en agentes debería leer también nuestra guía de selección de modelo.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Illustration comparing a heavyweight reasoning model against a fast balanced model on cost and capability
Trending

Claude Opus 5 vs Sonnet 5: ¿cuál deberías usar?

Claude Opus 5 cuesta 1.7x lo que Sonnet 5 por token y aun así termina algunos trabajos más barato. Aquí va el cara a cara sobre precio, benchmarks y coste real por tarea.

Rama Adi NugrahaRama Adi NugrahaJul 27, 2026
Una ilustración de una persona seleccionando uno de los cinco diales de esfuerzo de razonamiento en una tira de control estilo Claude Opus 5
Trending

Claude Opus 5: qué es y cómo usarlo de verdad

Claude Opus 5 no es un modelo, son cinco. Una guía práctica sobre las especificaciones, el dial de esfuerzo que decide tu factura y los dos cambios de API que rompen el código antiguo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
Illustration of a person weighing a small low-cost AI model against a larger caped flagship model on pedestals
Trending

Claude Opus 5 vs Fable 5: ¿cuál deberías usar en realidad?

Fable 5 cuesta exactamente el doble que Opus 5. Repasé ambas system cards, la documentación y los benchmarks independientes para averiguar cuándo ese dólar extra realmente compra algo.

Rama Adi NugrahaRama Adi NugrahaJul 27, 2026
Ilustración que compara un núcleo de modelo pequeño y ordenado con otro mucho mayor y enmarañado, para un análisis de Inkling-Small
Trending

Análisis de Inkling-Small: un cuarto del tamaño, y casi igual de listo

Un análisis práctico de Inkling-Small: supera a su propio modelo padre de 975B en programación con un cuarto del tamaño y un cuarto del precio, y luego se desploma en factualidad. Esto es lo que ese intercambio realmente te cuesta.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustración editorial para una guía sobre lo que puede hacer Claude Fable 5, el modelo de IA más potente de Anthropic
Guides

¿Qué puede hacer Claude Fable 5? Una guía capacidad por capacidad

¿Qué puede hacer Claude Fable 5? Trabajar durante días sin supervisión, escribir y desplegar código, leer documentos de 1 millón de tokens y revisar su propio trabajo. Esto es lo que significa en la práctica.

Riellvriany IndriawanRiellvriany IndriawanJun 17, 2026
Un agente de IA saliendo de un monitor para operar ventanas de aplicaciones y documentos mientras dos colegas observan, en el color azul de marca de Meta
Trending

Meta Muse Spark 1.1: qué es, cuánto cuesta y dónde falla

La primera API de modelos de pago de Meta lanza un modelo agente con 1M de contexto a $1.25/$4.25. En qué es realmente bueno Muse Spark 1.1, y los benchmarks que Meta dejó fuera de la diapositiva.

Alicia Kirana UtomoAlicia Kirana UtomoAug 5, 2026
Ilustración de un chip de modelo compacto que enruta un token por dos rutas de expertos iluminadas entre muchas apagadas, para una explicación de Inkling-Small
Trending

Inkling-Small explicado: un modelo de 276B con 12B activos

Qué es realmente Inkling-Small: un MoE de pesos abiertos de 276B/12B de Thinking Machines, la ventana de contexto en la que la documentación y los proveedores no coinciden, lo que realmente cuesta un millón de tokens y dónde encaja en una pila de soporte.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustración editorial que representa una comparación de modelos de IA como alternativas a Inkling
Trending

8 mejores alternativas a Inkling en 2026

Inkling es abierto e interesante, pero es caro para ser de pesos abiertos y no es el modelo más inteligente que puedes usar. Aquí tienes las 8 alternativas que realmente probaría, con precios reales y en qué gana cada una.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Ilustración de Inkling, el modelo de IA de pesos abiertos de Thinking Machines Lab analizado en este artículo
Trending

Análisis de Inkling: ¿vale la pena el modelo abierto de Thinking Machines?

Un análisis honesto de Inkling: en qué es realmente bueno el primer modelo de pesos abiertos de Thinking Machines Lab, dónde fallan el precio y los benchmarks, y quién debería usarlo realmente.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis