
La tarifa completa de la API de Anthropic
Todo lo siguiente procede de la propia documentación detallada de precios de Anthropic, comprobada el 13 de agosto de 2026. Los precios están en USD por millón de tokens, que la documentación abrevia como MTok. Algo que conviene saber antes de copiar una URL: platform.claude.com/docs/en/pricing es un stub de redirección que no devuelve nada, y la página real está en /about-claude/pricing.
| Modelo | Entrada | Salida | Escritura caché 5 min | Escritura caché 1 h | Lectura caché | Batch entrada | Batch salida |
|---|---|---|---|---|---|---|---|
| Claude Fable 5 | $10 | $50 | $12.50 | $20 | $1 | $5 | $25 |
| Claude Mythos 5 | $10 | $50 | $12.50 | $20 | $1 | $5 | $25 |
| Claude Opus 5 | $5 | $25 | $6.25 | $10 | $0.50 | $2.50 | $12.50 |
| Claude Opus 4.8 | $5 | $25 | $6.25 | $10 | $0.50 | $2.50 | $12.50 |
| Claude Opus 4.7 | $5 | $25 | $6.25 | $10 | $0.50 | $2.50 | $12.50 |
| Claude Opus 4.6 | $5 | $25 | $6.25 | $10 | $0.50 | $2.50 | $12.50 |
| Claude Opus 4.5 | $5 | $25 | $6.25 | $10 | $0.50 | $2.50 | $12.50 |
| Claude Sonnet 5 | $2 | $10 | $2.50 | $4 | $0.20 | $1 | $5 |
| Claude Sonnet 4.6 | $3 | $15 | $3.75 | $6 | $0.30 | $1.50 | $7.50 |
| Claude Sonnet 4.5 | $3 | $15 | $3.75 | $6 | $0.30 | $1.50 | $7.50 |
| Claude Haiku 4.5 | $1 | $5 | $1.25 | $2 | $0.10 | $0.50 | $2.50 |
| Claude Opus 4.1 (retired) | $15 | $75 | $18.75 | $30 | $1.50 | $7.50 | $37.50 |
| Claude Haiku 3.5 (retired) | $0.80 | $4 | $1 | $1.60 | $0.08 | $0.40 | $2 |
Tres cosas de esa tabla merecen una pausa.
Cinco generaciones de Opus tienen el mismo precio. Opus 5, 4.8, 4.7, 4.6 y 4.5 se facturan todas a 5 $ de entrada y 25 $ de salida. Si sigues aferrado a un Opus antiguo por motivos de reproducibilidad, no estás ahorrando dinero por ello, y el retirado Opus 4.1 es el único que sigue en la antigua tarifa de 15 $ y 75 $.
Sonnet se abarató, algo que normalmente no ocurre así. Sonnet 5 se sitúa en 2 $ y 10 $ frente a 3 $ y 15 $ de Sonnet 4.6, un recorte del 33 % en ambos medidores en una sola generación. Para la mayoría del tráfico de producción, eso convierte a Sonnet 5 en la opción obvia por defecto y no en un compromiso.
Fable 5, con 10 $ y 50 $, es exactamente el doble de Opus 5. Guarda esa cifra, porque vuelve a aparecer cuando lleguemos al modo rápido.
Si quieres el contexto de capacidades de los modelos Claude junto a los precios, las especificaciones quedan así:
| Fable 5 | Opus 5 | Sonnet 5 | Haiku 4.5 | |
|---|---|---|---|---|
| ID de API | claude-fable-5 | claude-opus-5 | claude-sonnet-5 | claude-haiku-4-5-20251001 |
| Ventana de contexto | 1M | 1M | 1M | 200k |
| Salida máx. | 128k | 128k | 128k | 64k |
| Corte de conocimiento | Jan 2026 | May 2026 | Jan 2026 | Feb 2025 |
| Latencia | Más lento | Moderado | Rápido | El más rápido |
La propia recomendación de Anthropic es empezar con Claude Opus 5 para trabajo agéntico complejo y de empresa, y tratar Fable 5 como el modelo de máximo alcance en vez de como opción por defecto.
Calcula tu propia cifra
La tarifa solo se convierte en un presupuesto cuando le pasas tu propio tráfico. Configura los cuatro valores de abajo y calculará el mes, y luego te mostrará lo que habría costado la misma carga de trabajo sin caché ni descuento de batch.
Mueve el control deslizante de caché y observa el total, porque ese único control mueve la cifra más de lo que lo hace cambiar de nivel de modelo en una carga de trabajo con mucha entrada. Ese es todo el argumento de la siguiente sección.
Cuatro multiplicadores deciden la factura, no la tarifa
Anthropic publica el precio por token de forma destacada y los multiplicadores en voz baja. El dinero está en los multiplicadores.
El prompt caching es la palanca más grande, y la caché corta es la barata
El caché tiene tres precios, todos expresados sobre la tarifa base de entrada del modelo: una escritura de caché de 5 minutos cuesta 1,25x, una escritura de 1 hora cuesta 2x, y un acierto de caché cuesta 0,1x. Establecer los propios breakpoints es gratis. El techo en estado estable es un descuento del 90 % sobre cualquier prefijo que reutilices.
La aritmética del punto de equilibrio es donde la gente se equivoca. Cada acierto ahorra 0,9x de la base, así que la caché de 5 minutos se amortiza tras un acierto, y la de 1 hora necesita dos. Escritura más un acierto en el TTL de 1 hora sale a 2,1x frente a 2,0x de no cachear nada, así que un prompt de reutilización única en la caché larga es realmente peor que dejar el caché desactivado.

La propia recomendación de Anthropic es quedarse con la caché de 5 minutos para todo lo que se use con más frecuencia que cada cinco minutos, porque se refresca sin coste adicional cada vez que se usa. El TTL de 1 hora es para huecos: una ejecución larga de un agente secundario, o un usuario que quizá no responda en diez minutos.
Luego está la parte que casi nadie tiene en cuenta. Las lecturas de caché no se descuentan de tu límite de tasa de tokens de entrada. El ejemplo trabajado de Anthropic es un límite de 2.000.000 ITPM combinado con una tasa de acierto de caché del 80 %, lo que permite llevar 10.000.000 de tokens de entrada por minuto por la misma cuenta. El caché no es solo un descuento, es un multiplicador de rendimiento de 5x, y es la forma más barata de subir un techo que de otro modo tendrías que pedirle a Anthropic que suba por ti.

Haiku 3.5 es la excepción documentada en la que las lecturas de caché sí cuentan para el límite, y de todos modos está retirado en la API de primera parte.
Esto también explica por qué los recuentos de tokens que se anuncian confunden tanto. Un profesional que corregía la estimación de costes de otra persona en Hacker News lo dijo de la forma más clara posible:
"i run a bunch of claude agents for automation and like 85% of input tokens end up being cached reads -which cost 1/10th of the sticker price. so your $200k number is probably closer to $25-30k in real cost"
Varias personas que ejecutan automatización en producción informan de manera independiente que entre el 85 % y el 92 % de los tokens de entrada terminan siendo lecturas de caché. Si valoras un recuento de tokens al precio de lista, estás sobrestimando una factura real por un factor de aproximadamente 10x.
El prefijo mínimo cacheable es la trampa que subyace a todo esto, porque no avanza en línea recta entre generaciones:
| Tokens mínimos cacheables | Modelos |
|---|---|
| 512 | Opus 5, Fable 5, Mythos 5 |
| 1.024 | Opus 4.8, Sonnet 5, Sonnet 4.6, Sonnet 4.5 |
| 2.048 | Opus 4.7, Haiku 3.5 |
| 4.096 | Opus 4.6, Opus 4.5, Haiku 4.5 |
Opus 5 cachea desde 512 tokens. Haiku 4.5 necesita ocho veces eso. Si te quedas por debajo del umbral, el caché simplemente no hace nada y no devuelve ningún error, por lo que una factura que se niega a bajar después de "activar el caché" suele deberse a un prompt que nunca cumplió la condición. Que tanto cache_creation_input_tokens como cache_read_input_tokens estén en cero en la respuesta es la señal.
Unas cuantas mecánicas más que cuestan dinero en silencio. La ventana de lookback de lectura es de 20 bloques, así que un turno que añade más de 20 se pasa de tu última escritura y falla. Modificar las definiciones de herramientas invalida toda la caché, ya que la jerarquía recorre herramientas, luego sistema, luego mensajes. Y el error común documentado es poner el breakpoint en un bloque que contiene una marca de tiempo o el mensaje entrante del usuario, lo que compra una escritura nueva en cada solicitud y nunca una lectura.
El batch da un 50 % plano, con dos exclusiones
La Batch API quita un 50 % tanto de la entrada como de la salida en cada modelo activo, y se combina con el caché. Los límites son 100.000 solicitudes o 256 MB por lote, la mayoría se completan en menos de una hora, y el techo absoluto son 24 horas.
El detalle de facturación que me gusta: las solicitudes errored, canceled y expired no se facturan en absoluto. Solo los éxitos cuestan dinero, lo que hace del batch un lugar de bajo riesgo para ejecutar un gran trabajo de clasificación. El contrapeso es que un lote puede superar ligeramente tu límite de gasto configurado debido al procesamiento concurrente, así que no es una barrera de presupuesto absoluta.
Dos exclusiones con las que hay que contar: el batch no se combina con el modo rápido, y el descuento no se aplica a las sesiones de Managed Agents.
Effort es el valor por defecto que nadie configura
output_config.effort controla cuántos tokens gasta Claude, y cubre tanto el texto como las llamadas a herramientas y el razonamiento, así que afecta incluso con el razonamiento desactivado. Los niveles son low, medium, high, xhigh, max.
El valor por defecto es high en todos los modelos que documenta Anthropic, la segunda opción más cara de la escala. La propia lista de buenas prácticas de Anthropic empieza con "configura effort explícitamente", que es una forma educada de decir que el comportamiento de fábrica no es el que quieres para trabajo de volumen.
No se publican multiplicadores de tokens para ningún nivel, así que trátalo como un dial que hay que medir y no como un descuento que reclamar. El único punto de referencia comparable que da Anthropic es que Sonnet 5 en medium equivale aproximadamente a Sonnet 4.6 en high. Dos trampas que conviene conocer antes de empezar a ajustar: cambiar el effort entre solicitudes invalida tus prefijos en caché, así que las dos palancas se pelean entre sí, y en Opus 5 un effort más bajo acorta el razonamiento en lugar de la respuesta visible, así que pide extensión explícitamente si buscas brevedad.
Los dos recargos escondidos en la documentación
El modo rápido da a Opus 5 y Opus 4.8 hasta 2,5 veces más velocidad de salida a 10 $ de entrada y 50 $ de salida, exactamente el doble del estándar. Lo que produce la decisión de compra que encuentro más interesante de toda la tabla: Opus 5 en modo rápido cuesta exactamente lo mismo que Fable 5 estándar. Si estás recurriendo al modo rápido para un problema difícil, calcula el modelo más capaz al mismo precio antes de decidirte. El modo rápido es solo para la API de primera parte, y no se combina con el batch.
El más silencioso es la residencia de datos. Fijar la inferencia en EE. UU. con inference_geo: "us" en Claude 4.6 y posteriores aplica un multiplicador de 1,1x a cada categoría de token, y eso incluye las escrituras y lecturas de caché, no solo la entrada y la salida. Es un recargo del 10 % sobre toda la factura, es fácil configurarlo una vez y olvidarlo, y el enrutamiento global es la opción por defecto con precio estándar.
Apila las cuatro palancas y el rango en un solo modelo se vuelve más grande que la brecha entre niveles de modelo:

Los costes de herramientas y agentes que se suman a los tokens
Las herramientas del lado del servidor se facturan por separado, y estas son las líneas que sorprenden a quienes leen una factura mensual por primera vez.
| Elemento | Coste | El detalle que importa |
|---|---|---|
| Búsqueda web | 10 $ por cada 1.000 búsquedas | Cada búsqueda cuenta como un uso, sin importar cuántos resultados devuelva. Las búsquedas con error son gratis. Los resultados se facturan luego como tokens de entrada en ese turno y en todos los turnos posteriores. |
| Web fetch | Sin coste adicional | Solo tokens. Anthropic calcula una página típica en unos 2.500 tokens y un PDF de investigación en unos 125.000. |
| Ejecución de código | 0,05 $ por hora de contenedor | Totalmente gratis si se combina con búsqueda web o web fetch, y gratis por debajo de 1.550 horas al mes. Mínimo de cinco minutos, y los archivos adjuntos facturan tiempo de ejecución aunque la herramienta nunca se llegue a ejecutar. |
| Managed Agents | 0,08 $ por hora de sesión | Se mide solo en estado running, al milisegundo. El tiempo inactivo esperando tu próximo mensaje es gratis. Los tokens se facturan aparte. |
| System prompt de uso de herramientas | 286 a 675 tokens de entrada | Se añade a cada solicitud con herramientas habilitadas, encima de tus propios esquemas. |
Esa última fila merece una nota, porque se mueve en la dirección correcta. Opus 4.7 tenía el peor overhead fijo de herramientas de la tabla, con 675 tokens en auto, y Opus 5 lo redujo a 286. Si ejecutas una instalación pesada de herramientas MCP con miles de solicitudes pequeñas, eso es una reducción real del 58 % en una línea de coste que nunca elegiste.
Anthropic publica su propio ejemplo trabajado para una sesión de codificación de una hora con Managed Agents en Opus 5, y es la cifra de ROI de caché más clara disponible en toda la documentación:
| Concepto | Sin caché | Con caché |
|---|---|---|
| Entrada | 0,25 $ | 0,05 $ sin caché más 0,02 $ de lecturas de caché |
| Salida | 0,375 $ | 0,375 $ |
| Tiempo de sesión | 0,08 $ | 0,08 $ |
| Total | 0,705 $ | 0,525 $ |
Eso es un recorte del 25,5 % en toda la sesión solo por el caché, en una carga de trabajo donde domina la salida y el caché solo puede tocar parte de la factura.
Ya no existe recargo por contexto largo
Este es el cambio que la mayoría de los artículos de precios de terceros aún se equivocan. Claude 4.6 y posteriores incluyen la ventana completa de 1M de tokens a tarifas estándar, y la documentación de precios lo dice sin rodeos: una solicitud de 900k tokens se factura al mismo precio por token que una de 9k. Los descuentos de caché y batch también se aplican a lo largo de toda la ventana.
Dos advertencias impiden que eso sea gratis del todo. La propia Anthropic advierte de que la precisión y la memoria se degradan a medida que crece el número de tokens, así que pagar por una ventana más completa puede comprar respuestas peores. Y el comportamiento de desbordamiento cambió en Claude 4.5 y posteriores: si la entrada más max_tokens supera la ventana, la solicitud se acepta y se detiene con stop_reason: "model_context_window_exceeded" a mitad de camino, y pagas por lo que se haya generado antes de detenerse.
Cómo se compara la tarifa de la API de Anthropic
Aquí está la comparación honesta frente a las otras API de vanguardia, tomada de la propia página de cada proveedor el mismo día. Si quieres la versión más profunda, tenemos un desglose completo de los tres proveedores de API y una comparación directa con la API de Anthropic.
| Nivel | Modelo | Entrada | Salida | Entrada en caché | Batch | Contexto largo |
|---|---|---|---|---|---|---|
| Vanguardia | Claude Opus 5 | $5.00 | $25.00 | $0.50 | 50% | Sin recargo |
| Vanguardia | gpt-5.6-sol | $5.00 | $30.00 | $0.50 | 50% | $10 / $45, umbral no publicado |
| Vanguardia | Gemini 3.1 Pro | $2.00 | $12.00 | $0.20 | 50 % solo en tokens | $4 / $18 por encima de 200K |
| Vanguardia | grok-4.6 | $2.00 | $6.00 | $0.50 | Ninguno | $4 / $12 en 200K, todos los tokens |
| Medio | Claude Sonnet 5 | $2.00 | $10.00 | $0.20 | 50% | Sin recargo |
| Medio | gpt-5.6-terra | $2.00 | $12.00 | $0.20 | 50% | $4 / $18, umbral no publicado |
| Medio | Gemini 3.6 Flash | $1.50 | $7.50 | $0.15 | 50% | Ninguno |
| Económico | Claude Haiku 4.5 | $1.00 | $5.00 | $0.10 | 50% | Sin recargo |
| Económico | gpt-5.6-luna | $0.20 | $1.20 | $0.02 | 50% | $0.40 / $1.80 |
| Económico | deepseek-v4-flash | $0.14 | $0.28 | $0.0028 | Ninguno | Ninguno |
Leyendo esa tabla con justicia, Claude no es lo más barato en nada. Los precios de Gemini superan a Sonnet 5 en entrada en el nivel medio, grok-4.6 es dramáticamente más barato en salida en el nivel de vanguardia, y deepseek-v4-flash está en un universo totalmente distinto con $0.14 y $0.28, con un precio de lectura de caché unas 50 veces por debajo del precio sin acierto.
Donde gana Anthropic es en previsibilidad, y a escala eso vale dinero de verdad.
Empecemos por el contexto largo, ya que ningún modelo Claude actual tiene recargo ahí, mientras que Gemini 3 publica una tarifa duplicada por encima de 200K. La versión de xAI es más dura: su tarifa de contexto largo se aplica a todos los tokens de la solicitud en cuanto el prompt supera los 200K, así que un token de más recalcula el precio de toda la llamada. Compara luego la forma de la factura. Anthropic mide cuatro cosas: entrada, salida, escrituras de caché y lecturas de caché, más un pequeño conjunto de herramientas con nombre. La página de xAI enumera cinco tipos de token facturados por separado, seis invocaciones de herramientas con precio, almacenamiento de archivos y colecciones, salida de datos (egress), y una tarifa de 0,05 $ en cualquier solicitud que incumpla sus directrices de uso. La paridad en batch también es un mito: OpenAI descuenta cada medidor, Google mantiene el context caching a precio estándar en sus filas de batch de Pro, y xAI no da ningún descuento de batch a grok-4.6.
También hay un matiz que conviene conocer si estás comprando por precio. DeepSeek publica una URL base con formato de Anthropic en api.deepseek.com/anthropic, lo que significa que el SDK que escribiste para Claude apuntará, en su mayoría, a un modelo mucho más barato con solo cambiar la URL base. La propia página de DeepSeek también advierte de una subida de precio significativa próximamente, así que trata la cifra de hoy como un suelo y no como un plan. Si la factura es la razón por la que lees esto, nuestro resumen de alternativas a Claude es el punto de partida. El extremo más barato de peso abierto se cubre por separado, con tarifas por modelo para Qwen y para Kimi K2.5.
Por qué las facturas públicas de la API de Claude difieren en cuatro órdenes de magnitud
Si buscas lo que cuesta la API de Anthropic en la práctica, encontrarás cifras que no pueden describir el mismo producto. Vale la pena entender por qué antes de tomar cualquiera de ellas como referencia.
Casi todas las cifras llamativas vienen de desarrolladores que apuntan un agente de codificación directamente a una clave de API sin filtrar. Así es la forma que tiene eso:
"At API prices it's incredibly easy to burn cash. I ran through my Claude Max 20x last week and had $100 credit from when Anthropic banned OpenClaw, so I decided to use it to get some chores done. Three hours of very light work on Sonnet cost me $55."
Ten en cuenta que eso es Sonnet, no Opus, y él describe el trabajo como muy ligero. En el mismo hilo, otro desarrollador informa de una tasa de quema máxima de unos 50 $ por hora, y otra persona perdió 300 $ en doce horas en una ejecución nocturna sin supervisión. Un comentarista nombra el fallo concreto que produce esas cifras: 20 $ perdidos por un agente atascado en un bucle de llamadas a herramientas, lo cual es un argumento a favor de los topes de gasto y las protecciones contra bucles, no un argumento sobre el precio.
Ahora la misma API, en el mismo hilo, haciendo trabajo acotado:
"I'm using the API to relevance classify hundreds of articles a day. Been running for 2 ish weeks, I think I'm almost up to $2 in cost"
Cincuenta dólares por hora y dos dólares en dos semanas, en la misma tarifa. La variable no es la lista de precios, sino si la carga de trabajo tiene un prompt acotado y una salida acotada, o un bucle de agente que decide por sí mismo cuánto gastar. Casi todas las afirmaciones de «la API de Claude es cara» que leerás están midiendo lo segundo, y casi toda integración de producto del lado del servidor es lo primero.
La lectura práctica: ignora por completo las cifras por hora cuando estés dimensionando una integración normal, y modela en su lugar la forma de tus propios tokens.
Cómo se ve la factura en tres cargas de trabajo reales
Los precios de lista no dicen mucho hasta que los aplicas a un trabajo concreto. Los tres ejemplos de abajo usan tarifas publicadas, y la aritmética es la misma que ejecuta el widget de arriba.
Un clasificador de triaje de soporte. 50.000 tickets al mes, Haiku 4.5, un bloque de instrucciones de 3.000 tokens reutilizado en cada llamada más 400 tokens de texto del ticket, y 150 tokens de salida. Eso son 170 $ de entrada y 37,50 $ de salida, unos 208 $ al mes, o cuatro décimas de centavo por ticket. Con batch, se reduce a la mitad de nuevo. Esta es la carga de trabajo en la que la API en bruto es prácticamente gratis, y por eso el precio por ticket de una herramienta de soporte tiene que justificarse frente a algo tan barato.
Un agente de codificación. 2.000 sesiones al mes en Opus 5, 60.000 tokens de entrada por sesión con el 80 % servido desde caché, y 12.000 tokens de salida. La entrada sale a 120 $ sin caché más 48 $ de lecturas de caché, y la salida a 600 $. En total, unos 768 $, con la salida representando el 78 %. En cargas de trabajo agénticas, el medidor de salida es la factura, así que el caché ayuda mucho menos de lo que sugiere el titular del descuento. Eso es lo más útil que se puede saber antes de modelar el coste de un agente.
Una carga puntual de documentos. 200.000 documentos, Sonnet 5, 5.000 tokens de entrada y 800 de salida, ejecutado mediante batch. La entrada sale a 1.000 $ a la tarifa de batch de 1 $ y la salida a 800 $ a 5 $, así que 1.800 $ por la ejecución frente a 3.600 $ de forma síncrona. Aquí no hay nada que cachear, ya que cada documento es distinto, y esta es exactamente la forma para la que existe el batch.
El patrón en los tres casos: el caché gana en tráfico repetitivo con mucha entrada, el batch gana en todo lo que se pueda esperar, y ninguno de los dos ayuda mucho con un agente que escribe mucho. Ajusta la palanca a la forma del trabajo.
Dónde la API en bruto deja de ser la opción barata
Todo lo anterior pone precio a los tokens. No pone precio al sistema que los rodea, y ahí es donde la mayoría de las cuentas de construir contra comprar se caen en silencio.
He pasado los últimos años poniendo agentes de IA en colas de soporte reales, y el patrón en las llamadas de ventas es lo bastante constante como para ser previsible. Un cliente potencial hace una prueba de una tarde, ve cómo se mueve el contador de llamadas, y no puede extrapolar. Una empresa de seguridad de correo electrónico en Freshdesk, que avanzaba hacia 20.000 tickets al año, quemó 200 llamadas a la API en un solo día de prueba y volvió preocupada por completo por lo que 9.000 interacciones al mes harían a la cifra, no por si las respuestas eran buenas. Otro operador que se dirigía hacia 150.000 tickets al mes hizo la cuenta a unos 20 centavos por ticket, llegó a unos 30.000 $ al mes, y se quedó ahí estancado.
Ninguno de los dos es un problema de precio por token. Ambos son problemas de unidad. Nadie hace previsiones en millones de tokens, y un medidor por token convierte cada conversación de capacidad en un ejercicio de modelado en lugar de una línea de presupuesto.
El contraargumento también es real, y prefiero citarlo antes que dar rodeos:
"We switched to a system that is working well at half the cost. But long term we will just build our own, which is so possible now with AI. I think you have a decent system for now, but we are probably too large of a customer for this."
Una marca canadiense de accesorios para armas de fuego que usa Zendesk con 2.190 documentos sincronizados, de los registros internos de llamadas de ventas de eesel
Ese lector tiene razón en que los modelos ya son lo bastante baratos como para hacer tentador construir por cuenta propia, y frameworks como AgentKit también han abaratado el andamiaje. Lo que la factura de tokens deja fuera es la recuperación de información sobre tu centro de ayuda, una integración con el helpdesk que sobreviva a un cambio de API, reglas de escalado, una forma de probar contra tickets históricos antes de exponerlo a clientes, y alguien cuyo trabajo sea mantener todo eso funcionando. Hemos visto a un bot que sonaba seguro de sí mismo dar respuestas incorrectas en producción, por lo que ahora cada lanzamiento se simula primero contra tickets reales pasados, y la simulación no es una partida que se pueda comprar en una tarifa.
La versión honesta del trato: si necesitas un clasificador o un resumidor, constrúyelo sobre la API y disfruta de una factura medida en centavos. Si necesitas algo que responda a clientes, calcula el coste del agente de IA de principio a fin, incluyendo el riesgo de alucinaciones de IA y el mantenimiento que nadie presupuesta.
Luego compáralo con el coste por resolución de algo que ya esté construido. Nuestro desglose de coste de chatbot recorre la misma aritmética, y el resumen de software de helpdesk con IA cubre con qué lo estarías comparando.
Una última nota práctica sobre gobernanza, ya que es lo que la gente pregunta después de su primera factura sorprendente. Los topes de gasto son de 500 $ en Start, 1.000 $ en Build, y 200.000 $ en Scale, y Custom elimina el tope por completo. Los niveles se asignan según el historial de uso en lugar de comprarse, y las organizaciones nuevas pueden empezar en un nivel de Evaluación por debajo de los límites publicados. Alcanzar el tope pausa el uso hasta el siguiente mes natural, lo cual funciona igual que los límites de tasa de OpenAI si ya te has topado con ellos antes.
La página de uso de la Console muestra tu tasa de acierto de caché directamente, que es la cifra que hay que mirar primero, y merece la pena instrumentarlo bien con herramientas de seguimiento de LLM si la factura importa. Una nota estructural para quien compare rutas: en el plan enterprise, los puestos cuestan 20 $ al mes cada uno más el uso a estas mismas tarifas de API, así que esta tarifa es la factura de uso enterprise. Eso es un cálculo distinto al de Claude Pro, donde una suscripción plana absorbe el uso en su lugar.
Prueba eesel para la automatización de soporte
Si la razón por la que estás calculando el precio de la API de Anthropic es una cola de soporte, la unidad es lo que hay que arreglar antes que la tarifa. eesel cobra 0,40 $ por ticket, sin puestos y sin cuota de plataforma, una cifra que puedes meter en una previsión sin modelar recuentos de tokens por conversación. Se conecta con Zendesk, Freshdesk o Gorgias en unos minutos, se entrena con tu centro de ayuda existente y tickets pasados, y simula contra tu historial de tickets antes de responder nunca a un cliente, para que veas la tasa de resolución y el coste proyectados antes de salir a producción.

Sigues teniendo la visibilidad por acción que una construcción con la API en bruto te obligaría a montar tú mismo, que suele ser lo primero que a los equipos se les pasa al estimar la construcción. Gratis para probar, y puedes ver las cifras proyectadas antes de comprometerte con nada de ello.
Preguntas frecuentes
¿Cuánto cuesta la API de Anthropic?
¿Cuál es la forma más barata de reducir una factura de la API de Anthropic?
¿La tarifa de la API de Anthropic cobra extra por la ventana de contexto de 1M?
¿Claude Opus 5 o Claude Sonnet 5 ofrece mejor relación calidad-precio en la API?
effort menor en Opus 5 no acorta la respuesta visible, solo el razonamiento. Consulta selección de modelo para saber cómo elegir.¿Qué costes ocultos tiene la tarifa de la API de Anthropic?
¿Existe un nivel gratuito para la API de Anthropic?
¿Construir sobre la API de Anthropic es más barato que comprar una herramienta de soporte?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








