Precios de la API de Anthropic en 2026: todas las tarifas y las palancas reales de coste

Kurnia Kharisma Agung Samiadjie
Escrito por

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Revisado por

Katelin Teen

Última edición August 12, 2026

Verificado por expertos
Dos personas revisando medidores de tokens, tarjetas de precio por millón de tokens y una larga factura impresa

La tarifa completa de la API de Anthropic

Todo lo siguiente procede de la propia documentación detallada de precios de Anthropic, comprobada el 13 de agosto de 2026. Los precios están en USD por millón de tokens, que la documentación abrevia como MTok. Algo que conviene saber antes de copiar una URL: platform.claude.com/docs/en/pricing es un stub de redirección que no devuelve nada, y la página real está en /about-claude/pricing.

ModeloEntradaSalidaEscritura caché 5 minEscritura caché 1 hLectura cachéBatch entradaBatch salida
Claude Fable 5$10$50$12.50$20$1$5$25
Claude Mythos 5$10$50$12.50$20$1$5$25
Claude Opus 5$5$25$6.25$10$0.50$2.50$12.50
Claude Opus 4.8$5$25$6.25$10$0.50$2.50$12.50
Claude Opus 4.7$5$25$6.25$10$0.50$2.50$12.50
Claude Opus 4.6$5$25$6.25$10$0.50$2.50$12.50
Claude Opus 4.5$5$25$6.25$10$0.50$2.50$12.50
Claude Sonnet 5$2$10$2.50$4$0.20$1$5
Claude Sonnet 4.6$3$15$3.75$6$0.30$1.50$7.50
Claude Sonnet 4.5$3$15$3.75$6$0.30$1.50$7.50
Claude Haiku 4.5$1$5$1.25$2$0.10$0.50$2.50
Claude Opus 4.1 (retired)$15$75$18.75$30$1.50$7.50$37.50
Claude Haiku 3.5 (retired)$0.80$4$1$1.60$0.08$0.40$2

Tres cosas de esa tabla merecen una pausa.

Cinco generaciones de Opus tienen el mismo precio. Opus 5, 4.8, 4.7, 4.6 y 4.5 se facturan todas a 5 $ de entrada y 25 $ de salida. Si sigues aferrado a un Opus antiguo por motivos de reproducibilidad, no estás ahorrando dinero por ello, y el retirado Opus 4.1 es el único que sigue en la antigua tarifa de 15 $ y 75 $.

Sonnet se abarató, algo que normalmente no ocurre así. Sonnet 5 se sitúa en 2 $ y 10 $ frente a 3 $ y 15 $ de Sonnet 4.6, un recorte del 33 % en ambos medidores en una sola generación. Para la mayoría del tráfico de producción, eso convierte a Sonnet 5 en la opción obvia por defecto y no en un compromiso.

Fable 5, con 10 $ y 50 $, es exactamente el doble de Opus 5. Guarda esa cifra, porque vuelve a aparecer cuando lleguemos al modo rápido.

Si quieres el contexto de capacidades de los modelos Claude junto a los precios, las especificaciones quedan así:

Fable 5Opus 5Sonnet 5Haiku 4.5
ID de APIclaude-fable-5claude-opus-5claude-sonnet-5claude-haiku-4-5-20251001
Ventana de contexto1M1M1M200k
Salida máx.128k128k128k64k
Corte de conocimientoJan 2026May 2026Jan 2026Feb 2025
LatenciaMás lentoModeradoRápidoEl más rápido

La propia recomendación de Anthropic es empezar con Claude Opus 5 para trabajo agéntico complejo y de empresa, y tratar Fable 5 como el modelo de máximo alcance en vez de como opción por defecto.

Calcula tu propia cifra

La tarifa solo se convierte en un presupuesto cuando le pasas tu propio tráfico. Configura los cuatro valores de abajo y calculará el mes, y luego te mostrará lo que habría costado la misma carga de trabajo sin caché ni descuento de batch.

Mueve el control deslizante de caché y observa el total, porque ese único control mueve la cifra más de lo que lo hace cambiar de nivel de modelo en una carga de trabajo con mucha entrada. Ese es todo el argumento de la siguiente sección.

Cuatro multiplicadores deciden la factura, no la tarifa

Anthropic publica el precio por token de forma destacada y los multiplicadores en voz baja. El dinero está en los multiplicadores.

El prompt caching es la palanca más grande, y la caché corta es la barata

El caché tiene tres precios, todos expresados sobre la tarifa base de entrada del modelo: una escritura de caché de 5 minutos cuesta 1,25x, una escritura de 1 hora cuesta 2x, y un acierto de caché cuesta 0,1x. Establecer los propios breakpoints es gratis. El techo en estado estable es un descuento del 90 % sobre cualquier prefijo que reutilices.

La aritmética del punto de equilibrio es donde la gente se equivoca. Cada acierto ahorra 0,9x de la base, así que la caché de 5 minutos se amortiza tras un acierto, y la de 1 hora necesita dos. Escritura más un acierto en el TTL de 1 hora sale a 2,1x frente a 2,0x de no cachear nada, así que un prompt de reutilización única en la caché larga es realmente peor que dejar el caché desactivado.

Gráfico de barras que compara el coste de entrada de diez solicitudes que reutilizan el mismo prefijo de 10.000 tokens en Claude Opus 5: 0,500 $ sin caché, 0,108 $ en la caché de 5 minutos, 0,145 $ en la caché de 1 hora
Gráfico de barras que compara el coste de entrada de diez solicitudes que reutilizan el mismo prefijo de 10.000 tokens en Claude Opus 5: 0,500 $ sin caché, 0,108 $ en la caché de 5 minutos, 0,145 $ en la caché de 1 hora

La propia recomendación de Anthropic es quedarse con la caché de 5 minutos para todo lo que se use con más frecuencia que cada cinco minutos, porque se refresca sin coste adicional cada vez que se usa. El TTL de 1 hora es para huecos: una ejecución larga de un agente secundario, o un usuario que quizá no responda en diez minutos.

Luego está la parte que casi nadie tiene en cuenta. Las lecturas de caché no se descuentan de tu límite de tasa de tokens de entrada. El ejemplo trabajado de Anthropic es un límite de 2.000.000 ITPM combinado con una tasa de acierto de caché del 80 %, lo que permite llevar 10.000.000 de tokens de entrada por minuto por la misma cuenta. El caché no es solo un descuento, es un multiplicador de rendimiento de 5x, y es la forma más barata de subir un techo que de otro modo tendrías que pedirle a Anthropic que suba por ti.

Dos barras de capacidad que muestran el mismo límite de 2.000.000 de tokens de entrada por minuto soportando 2 millones de tokens por minuto sin caché y 10 millones de tokens por minuto con una tasa de acierto de caché del 80 %
Dos barras de capacidad que muestran el mismo límite de 2.000.000 de tokens de entrada por minuto soportando 2 millones de tokens por minuto sin caché y 10 millones de tokens por minuto con una tasa de acierto de caché del 80 %

Haiku 3.5 es la excepción documentada en la que las lecturas de caché sí cuentan para el límite, y de todos modos está retirado en la API de primera parte.

Esto también explica por qué los recuentos de tokens que se anuncian confunden tanto. Un profesional que corregía la estimación de costes de otra persona en Hacker News lo dijo de la forma más clara posible:

"i run a bunch of claude agents for automation and like 85% of input tokens end up being cached reads -which cost 1/10th of the sticker price. so your $200k number is probably closer to $25-30k in real cost"

Hacker News

Varias personas que ejecutan automatización en producción informan de manera independiente que entre el 85 % y el 92 % de los tokens de entrada terminan siendo lecturas de caché. Si valoras un recuento de tokens al precio de lista, estás sobrestimando una factura real por un factor de aproximadamente 10x.

El prefijo mínimo cacheable es la trampa que subyace a todo esto, porque no avanza en línea recta entre generaciones:

Tokens mínimos cacheablesModelos
512Opus 5, Fable 5, Mythos 5
1.024Opus 4.8, Sonnet 5, Sonnet 4.6, Sonnet 4.5
2.048Opus 4.7, Haiku 3.5
4.096Opus 4.6, Opus 4.5, Haiku 4.5

Opus 5 cachea desde 512 tokens. Haiku 4.5 necesita ocho veces eso. Si te quedas por debajo del umbral, el caché simplemente no hace nada y no devuelve ningún error, por lo que una factura que se niega a bajar después de "activar el caché" suele deberse a un prompt que nunca cumplió la condición. Que tanto cache_creation_input_tokens como cache_read_input_tokens estén en cero en la respuesta es la señal.

Unas cuantas mecánicas más que cuestan dinero en silencio. La ventana de lookback de lectura es de 20 bloques, así que un turno que añade más de 20 se pasa de tu última escritura y falla. Modificar las definiciones de herramientas invalida toda la caché, ya que la jerarquía recorre herramientas, luego sistema, luego mensajes. Y el error común documentado es poner el breakpoint en un bloque que contiene una marca de tiempo o el mensaje entrante del usuario, lo que compra una escritura nueva en cada solicitud y nunca una lectura.

El batch da un 50 % plano, con dos exclusiones

La Batch API quita un 50 % tanto de la entrada como de la salida en cada modelo activo, y se combina con el caché. Los límites son 100.000 solicitudes o 256 MB por lote, la mayoría se completan en menos de una hora, y el techo absoluto son 24 horas.

El detalle de facturación que me gusta: las solicitudes errored, canceled y expired no se facturan en absoluto. Solo los éxitos cuestan dinero, lo que hace del batch un lugar de bajo riesgo para ejecutar un gran trabajo de clasificación. El contrapeso es que un lote puede superar ligeramente tu límite de gasto configurado debido al procesamiento concurrente, así que no es una barrera de presupuesto absoluta.

Dos exclusiones con las que hay que contar: el batch no se combina con el modo rápido, y el descuento no se aplica a las sesiones de Managed Agents.

Effort es el valor por defecto que nadie configura

output_config.effort controla cuántos tokens gasta Claude, y cubre tanto el texto como las llamadas a herramientas y el razonamiento, así que afecta incluso con el razonamiento desactivado. Los niveles son low, medium, high, xhigh, max.

El valor por defecto es high en todos los modelos que documenta Anthropic, la segunda opción más cara de la escala. La propia lista de buenas prácticas de Anthropic empieza con "configura effort explícitamente", que es una forma educada de decir que el comportamiento de fábrica no es el que quieres para trabajo de volumen.

No se publican multiplicadores de tokens para ningún nivel, así que trátalo como un dial que hay que medir y no como un descuento que reclamar. El único punto de referencia comparable que da Anthropic es que Sonnet 5 en medium equivale aproximadamente a Sonnet 4.6 en high. Dos trampas que conviene conocer antes de empezar a ajustar: cambiar el effort entre solicitudes invalida tus prefijos en caché, así que las dos palancas se pelean entre sí, y en Opus 5 un effort más bajo acorta el razonamiento en lugar de la respuesta visible, así que pide extensión explícitamente si buscas brevedad.

Los dos recargos escondidos en la documentación

El modo rápido da a Opus 5 y Opus 4.8 hasta 2,5 veces más velocidad de salida a 10 $ de entrada y 50 $ de salida, exactamente el doble del estándar. Lo que produce la decisión de compra que encuentro más interesante de toda la tabla: Opus 5 en modo rápido cuesta exactamente lo mismo que Fable 5 estándar. Si estás recurriendo al modo rápido para un problema difícil, calcula el modelo más capaz al mismo precio antes de decidirte. El modo rápido es solo para la API de primera parte, y no se combina con el batch.

El más silencioso es la residencia de datos. Fijar la inferencia en EE. UU. con inference_geo: "us" en Claude 4.6 y posteriores aplica un multiplicador de 1,1x a cada categoría de token, y eso incluye las escrituras y lecturas de caché, no solo la entrada y la salida. Es un recargo del 10 % sobre toda la factura, es fácil configurarlo una vez y olvidarlo, y el enrutamiento global es la opción por defecto con precio estándar.

Apila las cuatro palancas y el rango en un solo modelo se vuelve más grande que la brecha entre niveles de modelo:

Escalera de precios vertical para un millón de tokens de entrada en Claude Opus 5: 0,50 $ como lectura de caché, 2,50 $ en batch, 5,00 $ estándar, 10,00 $ en modo rápido, entre paréntesis como un rango de 20 veces
Escalera de precios vertical para un millón de tokens de entrada en Claude Opus 5: 0,50 $ como lectura de caché, 2,50 $ en batch, 5,00 $ estándar, 10,00 $ en modo rápido, entre paréntesis como un rango de 20 veces

Los costes de herramientas y agentes que se suman a los tokens

Las herramientas del lado del servidor se facturan por separado, y estas son las líneas que sorprenden a quienes leen una factura mensual por primera vez.

ElementoCosteEl detalle que importa
Búsqueda web10 $ por cada 1.000 búsquedasCada búsqueda cuenta como un uso, sin importar cuántos resultados devuelva. Las búsquedas con error son gratis. Los resultados se facturan luego como tokens de entrada en ese turno y en todos los turnos posteriores.
Web fetchSin coste adicionalSolo tokens. Anthropic calcula una página típica en unos 2.500 tokens y un PDF de investigación en unos 125.000.
Ejecución de código0,05 $ por hora de contenedorTotalmente gratis si se combina con búsqueda web o web fetch, y gratis por debajo de 1.550 horas al mes. Mínimo de cinco minutos, y los archivos adjuntos facturan tiempo de ejecución aunque la herramienta nunca se llegue a ejecutar.
Managed Agents0,08 $ por hora de sesiónSe mide solo en estado running, al milisegundo. El tiempo inactivo esperando tu próximo mensaje es gratis. Los tokens se facturan aparte.
System prompt de uso de herramientas286 a 675 tokens de entradaSe añade a cada solicitud con herramientas habilitadas, encima de tus propios esquemas.

Esa última fila merece una nota, porque se mueve en la dirección correcta. Opus 4.7 tenía el peor overhead fijo de herramientas de la tabla, con 675 tokens en auto, y Opus 5 lo redujo a 286. Si ejecutas una instalación pesada de herramientas MCP con miles de solicitudes pequeñas, eso es una reducción real del 58 % en una línea de coste que nunca elegiste.

Anthropic publica su propio ejemplo trabajado para una sesión de codificación de una hora con Managed Agents en Opus 5, y es la cifra de ROI de caché más clara disponible en toda la documentación:

ConceptoSin cachéCon caché
Entrada0,25 $0,05 $ sin caché más 0,02 $ de lecturas de caché
Salida0,375 $0,375 $
Tiempo de sesión0,08 $0,08 $
Total0,705 $0,525 $

Eso es un recorte del 25,5 % en toda la sesión solo por el caché, en una carga de trabajo donde domina la salida y el caché solo puede tocar parte de la factura.

Ya no existe recargo por contexto largo

Este es el cambio que la mayoría de los artículos de precios de terceros aún se equivocan. Claude 4.6 y posteriores incluyen la ventana completa de 1M de tokens a tarifas estándar, y la documentación de precios lo dice sin rodeos: una solicitud de 900k tokens se factura al mismo precio por token que una de 9k. Los descuentos de caché y batch también se aplican a lo largo de toda la ventana.

Dos advertencias impiden que eso sea gratis del todo. La propia Anthropic advierte de que la precisión y la memoria se degradan a medida que crece el número de tokens, así que pagar por una ventana más completa puede comprar respuestas peores. Y el comportamiento de desbordamiento cambió en Claude 4.5 y posteriores: si la entrada más max_tokens supera la ventana, la solicitud se acepta y se detiene con stop_reason: "model_context_window_exceeded" a mitad de camino, y pagas por lo que se haya generado antes de detenerse.

Cómo se compara la tarifa de la API de Anthropic

Aquí está la comparación honesta frente a las otras API de vanguardia, tomada de la propia página de cada proveedor el mismo día. Si quieres la versión más profunda, tenemos un desglose completo de los tres proveedores de API y una comparación directa con la API de Anthropic.

NivelModeloEntradaSalidaEntrada en cachéBatchContexto largo
VanguardiaClaude Opus 5$5.00$25.00$0.5050%Sin recargo
Vanguardiagpt-5.6-sol$5.00$30.00$0.5050%$10 / $45, umbral no publicado
VanguardiaGemini 3.1 Pro$2.00$12.00$0.2050 % solo en tokens$4 / $18 por encima de 200K
Vanguardiagrok-4.6$2.00$6.00$0.50Ninguno$4 / $12 en 200K, todos los tokens
MedioClaude Sonnet 5$2.00$10.00$0.2050%Sin recargo
Mediogpt-5.6-terra$2.00$12.00$0.2050%$4 / $18, umbral no publicado
MedioGemini 3.6 Flash$1.50$7.50$0.1550%Ninguno
EconómicoClaude Haiku 4.5$1.00$5.00$0.1050%Sin recargo
Económicogpt-5.6-luna$0.20$1.20$0.0250%$0.40 / $1.80
Económicodeepseek-v4-flash$0.14$0.28$0.0028NingunoNinguno

Leyendo esa tabla con justicia, Claude no es lo más barato en nada. Los precios de Gemini superan a Sonnet 5 en entrada en el nivel medio, grok-4.6 es dramáticamente más barato en salida en el nivel de vanguardia, y deepseek-v4-flash está en un universo totalmente distinto con $0.14 y $0.28, con un precio de lectura de caché unas 50 veces por debajo del precio sin acierto.

Donde gana Anthropic es en previsibilidad, y a escala eso vale dinero de verdad.

Empecemos por el contexto largo, ya que ningún modelo Claude actual tiene recargo ahí, mientras que Gemini 3 publica una tarifa duplicada por encima de 200K. La versión de xAI es más dura: su tarifa de contexto largo se aplica a todos los tokens de la solicitud en cuanto el prompt supera los 200K, así que un token de más recalcula el precio de toda la llamada. Compara luego la forma de la factura. Anthropic mide cuatro cosas: entrada, salida, escrituras de caché y lecturas de caché, más un pequeño conjunto de herramientas con nombre. La página de xAI enumera cinco tipos de token facturados por separado, seis invocaciones de herramientas con precio, almacenamiento de archivos y colecciones, salida de datos (egress), y una tarifa de 0,05 $ en cualquier solicitud que incumpla sus directrices de uso. La paridad en batch también es un mito: OpenAI descuenta cada medidor, Google mantiene el context caching a precio estándar en sus filas de batch de Pro, y xAI no da ningún descuento de batch a grok-4.6.

También hay un matiz que conviene conocer si estás comprando por precio. DeepSeek publica una URL base con formato de Anthropic en api.deepseek.com/anthropic, lo que significa que el SDK que escribiste para Claude apuntará, en su mayoría, a un modelo mucho más barato con solo cambiar la URL base. La propia página de DeepSeek también advierte de una subida de precio significativa próximamente, así que trata la cifra de hoy como un suelo y no como un plan. Si la factura es la razón por la que lees esto, nuestro resumen de alternativas a Claude es el punto de partida. El extremo más barato de peso abierto se cubre por separado, con tarifas por modelo para Qwen y para Kimi K2.5.

Por qué las facturas públicas de la API de Claude difieren en cuatro órdenes de magnitud

Si buscas lo que cuesta la API de Anthropic en la práctica, encontrarás cifras que no pueden describir el mismo producto. Vale la pena entender por qué antes de tomar cualquiera de ellas como referencia.

Casi todas las cifras llamativas vienen de desarrolladores que apuntan un agente de codificación directamente a una clave de API sin filtrar. Así es la forma que tiene eso:

"At API prices it's incredibly easy to burn cash. I ran through my Claude Max 20x last week and had $100 credit from when Anthropic banned OpenClaw, so I decided to use it to get some chores done. Three hours of very light work on Sonnet cost me $55."

Reddit

Ten en cuenta que eso es Sonnet, no Opus, y él describe el trabajo como muy ligero. En el mismo hilo, otro desarrollador informa de una tasa de quema máxima de unos 50 $ por hora, y otra persona perdió 300 $ en doce horas en una ejecución nocturna sin supervisión. Un comentarista nombra el fallo concreto que produce esas cifras: 20 $ perdidos por un agente atascado en un bucle de llamadas a herramientas, lo cual es un argumento a favor de los topes de gasto y las protecciones contra bucles, no un argumento sobre el precio.

Ahora la misma API, en el mismo hilo, haciendo trabajo acotado:

"I'm using the API to relevance classify hundreds of articles a day. Been running for 2 ish weeks, I think I'm almost up to $2 in cost"

Reddit

Cincuenta dólares por hora y dos dólares en dos semanas, en la misma tarifa. La variable no es la lista de precios, sino si la carga de trabajo tiene un prompt acotado y una salida acotada, o un bucle de agente que decide por sí mismo cuánto gastar. Casi todas las afirmaciones de «la API de Claude es cara» que leerás están midiendo lo segundo, y casi toda integración de producto del lado del servidor es lo primero.

La lectura práctica: ignora por completo las cifras por hora cuando estés dimensionando una integración normal, y modela en su lugar la forma de tus propios tokens.

Cómo se ve la factura en tres cargas de trabajo reales

Los precios de lista no dicen mucho hasta que los aplicas a un trabajo concreto. Los tres ejemplos de abajo usan tarifas publicadas, y la aritmética es la misma que ejecuta el widget de arriba.

Un clasificador de triaje de soporte. 50.000 tickets al mes, Haiku 4.5, un bloque de instrucciones de 3.000 tokens reutilizado en cada llamada más 400 tokens de texto del ticket, y 150 tokens de salida. Eso son 170 $ de entrada y 37,50 $ de salida, unos 208 $ al mes, o cuatro décimas de centavo por ticket. Con batch, se reduce a la mitad de nuevo. Esta es la carga de trabajo en la que la API en bruto es prácticamente gratis, y por eso el precio por ticket de una herramienta de soporte tiene que justificarse frente a algo tan barato.

Un agente de codificación. 2.000 sesiones al mes en Opus 5, 60.000 tokens de entrada por sesión con el 80 % servido desde caché, y 12.000 tokens de salida. La entrada sale a 120 $ sin caché más 48 $ de lecturas de caché, y la salida a 600 $. En total, unos 768 $, con la salida representando el 78 %. En cargas de trabajo agénticas, el medidor de salida es la factura, así que el caché ayuda mucho menos de lo que sugiere el titular del descuento. Eso es lo más útil que se puede saber antes de modelar el coste de un agente.

Una carga puntual de documentos. 200.000 documentos, Sonnet 5, 5.000 tokens de entrada y 800 de salida, ejecutado mediante batch. La entrada sale a 1.000 $ a la tarifa de batch de 1 $ y la salida a 800 $ a 5 $, así que 1.800 $ por la ejecución frente a 3.600 $ de forma síncrona. Aquí no hay nada que cachear, ya que cada documento es distinto, y esta es exactamente la forma para la que existe el batch.

El patrón en los tres casos: el caché gana en tráfico repetitivo con mucha entrada, el batch gana en todo lo que se pueda esperar, y ninguno de los dos ayuda mucho con un agente que escribe mucho. Ajusta la palanca a la forma del trabajo.

Dónde la API en bruto deja de ser la opción barata

Todo lo anterior pone precio a los tokens. No pone precio al sistema que los rodea, y ahí es donde la mayoría de las cuentas de construir contra comprar se caen en silencio.

He pasado los últimos años poniendo agentes de IA en colas de soporte reales, y el patrón en las llamadas de ventas es lo bastante constante como para ser previsible. Un cliente potencial hace una prueba de una tarde, ve cómo se mueve el contador de llamadas, y no puede extrapolar. Una empresa de seguridad de correo electrónico en Freshdesk, que avanzaba hacia 20.000 tickets al año, quemó 200 llamadas a la API en un solo día de prueba y volvió preocupada por completo por lo que 9.000 interacciones al mes harían a la cifra, no por si las respuestas eran buenas. Otro operador que se dirigía hacia 150.000 tickets al mes hizo la cuenta a unos 20 centavos por ticket, llegó a unos 30.000 $ al mes, y se quedó ahí estancado.

Ninguno de los dos es un problema de precio por token. Ambos son problemas de unidad. Nadie hace previsiones en millones de tokens, y un medidor por token convierte cada conversación de capacidad en un ejercicio de modelado en lugar de una línea de presupuesto.

El contraargumento también es real, y prefiero citarlo antes que dar rodeos:

"We switched to a system that is working well at half the cost. But long term we will just build our own, which is so possible now with AI. I think you have a decent system for now, but we are probably too large of a customer for this."

Una marca canadiense de accesorios para armas de fuego que usa Zendesk con 2.190 documentos sincronizados, de los registros internos de llamadas de ventas de eesel

Ese lector tiene razón en que los modelos ya son lo bastante baratos como para hacer tentador construir por cuenta propia, y frameworks como AgentKit también han abaratado el andamiaje. Lo que la factura de tokens deja fuera es la recuperación de información sobre tu centro de ayuda, una integración con el helpdesk que sobreviva a un cambio de API, reglas de escalado, una forma de probar contra tickets históricos antes de exponerlo a clientes, y alguien cuyo trabajo sea mantener todo eso funcionando. Hemos visto a un bot que sonaba seguro de sí mismo dar respuestas incorrectas en producción, por lo que ahora cada lanzamiento se simula primero contra tickets reales pasados, y la simulación no es una partida que se pueda comprar en una tarifa.

La versión honesta del trato: si necesitas un clasificador o un resumidor, constrúyelo sobre la API y disfruta de una factura medida en centavos. Si necesitas algo que responda a clientes, calcula el coste del agente de IA de principio a fin, incluyendo el riesgo de alucinaciones de IA y el mantenimiento que nadie presupuesta.

Luego compáralo con el coste por resolución de algo que ya esté construido. Nuestro desglose de coste de chatbot recorre la misma aritmética, y el resumen de software de helpdesk con IA cubre con qué lo estarías comparando.

Una última nota práctica sobre gobernanza, ya que es lo que la gente pregunta después de su primera factura sorprendente. Los topes de gasto son de 500 $ en Start, 1.000 $ en Build, y 200.000 $ en Scale, y Custom elimina el tope por completo. Los niveles se asignan según el historial de uso en lugar de comprarse, y las organizaciones nuevas pueden empezar en un nivel de Evaluación por debajo de los límites publicados. Alcanzar el tope pausa el uso hasta el siguiente mes natural, lo cual funciona igual que los límites de tasa de OpenAI si ya te has topado con ellos antes.

La página de uso de la Console muestra tu tasa de acierto de caché directamente, que es la cifra que hay que mirar primero, y merece la pena instrumentarlo bien con herramientas de seguimiento de LLM si la factura importa. Una nota estructural para quien compare rutas: en el plan enterprise, los puestos cuestan 20 $ al mes cada uno más el uso a estas mismas tarifas de API, así que esta tarifa es la factura de uso enterprise. Eso es un cálculo distinto al de Claude Pro, donde una suscripción plana absorbe el uso en su lugar.

Prueba eesel para la automatización de soporte

Si la razón por la que estás calculando el precio de la API de Anthropic es una cola de soporte, la unidad es lo que hay que arreglar antes que la tarifa. eesel cobra 0,40 $ por ticket, sin puestos y sin cuota de plataforma, una cifra que puedes meter en una previsión sin modelar recuentos de tokens por conversación. Se conecta con Zendesk, Freshdesk o Gorgias en unos minutos, se entrena con tu centro de ayuda existente y tickets pasados, y simula contra tu historial de tickets antes de responder nunca a un cliente, para que veas la tasa de resolución y el coste proyectados antes de salir a producción.

Panel de informes de eesel AI que muestra el volumen de tareas, eventos disparadores por tipo, y el uso de aprobación y rechazo por herramienta
Panel de informes de eesel AI que muestra el volumen de tareas, eventos disparadores por tipo, y el uso de aprobación y rechazo por herramienta

Sigues teniendo la visibilidad por acción que una construcción con la API en bruto te obligaría a montar tú mismo, que suele ser lo primero que a los equipos se les pasa al estimar la construcción. Gratis para probar, y puedes ver las cifras proyectadas antes de comprometerte con nada de ello.

Preguntas frecuentes

¿Cuánto cuesta la API de Anthropic?
Se factura por token, por modelo. Claude Opus 5 cuesta 5 $ por millón de tokens de entrada y 25 $ por millón de tokens de salida, Claude Sonnet 5 está en 2 $ y 10 $, y Claude Haiku 4.5 en 1 $ y 5 $. Claude Fable 5 encabeza la tabla con 10 $ y 50 $. No hay cuota por puesto ni mínimo, así que toda la factura depende del uso. Para comparar con el lado de suscripción, consulta nuestro desglose de precios de Claude.
¿Cuál es la forma más barata de reducir una factura de la API de Anthropic?
El prompt caching, con diferencia. Una lectura de caché cuesta el 10 % de la tarifa base de entrada, así que un prefijo reutilizado se queda con un 90 % de descuento, y se amortiza tras un solo acierto en la caché de 5 minutos. La Batch API añade un 50 % plano de descuento extra para todo lo que no necesites responder al instante.
¿La tarifa de la API de Anthropic cobra extra por la ventana de contexto de 1M?
No. Claude 4.6 y versiones posteriores incluyen la ventana completa de 1M de tokens a tarifas estándar, y Anthropic indica que una solicitud de 900k tokens se factura al mismo precio por token que una de 9k. Esa es una diferencia real frente a Google y xAI, que publican tarifas más altas por encima de 200K. Nuestra comparación de los tres proveedores de API cubre el resto.
¿Claude Opus 5 o Claude Sonnet 5 ofrece mejor relación calidad-precio en la API?
Sonnet 5 es 2,5 veces más barato en ambos medidores y salió más barato que el modelo al que sustituyó, por lo que es la opción por defecto para tráfico de producción. Recurre a Opus 5 cuando la tarea realmente lo necesite, y ten en cuenta que un effort menor en Opus 5 no acorta la respuesta visible, solo el razonamiento. Consulta selección de modelo para saber cómo elegir.
¿Qué costes ocultos tiene la tarifa de la API de Anthropic?
Tres que conviene presupuestar: la búsqueda web a 10 $ por cada 1.000 búsquedas, un multiplicador de 1,1x en cada categoría de token si fijas la inferencia en EE. UU., y el system prompt de uso de herramientas, que añade tokens de entrada fijos a cada solicitud con herramientas habilitadas. Managed Agents también añade 0,08 $ por hora de sesión en ejecución, además de los tokens.
¿Existe un nivel gratuito para la API de Anthropic?
Anthropic da a los nuevos usuarios una pequeña cantidad de crédito gratuito para probar, pero no publica una cifra en dólares, así que trátalo como una prueba y no como un nivel. Si necesitas capacidad genuinamente gratuita para hacer prototipos, nuestro resumen de APIs de IA gratuitas es mejor punto de partida.
¿Construir sobre la API de Anthropic es más barato que comprar una herramienta de soporte?
En tokens puros, casi siempre sí. En cuanto añades recuperación de información, una integración con el helpdesk, lógica de escalado y alguien que lo mantenga, la cuenta suele darse la vuelta. Desglosamos la comparación en coste por resolución y coste de chatbot.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Illustration of a person weighing a small low-cost AI model against a larger caped flagship model on pedestals
Trending

Claude Opus 5 vs Fable 5: ¿cuál deberías usar en realidad?

Fable 5 cuesta exactamente el doble que Opus 5. Repasé ambas system cards, la documentación y los benchmarks independientes para averiguar cuándo ese dólar extra realmente compra algo.

Rama Adi NugrahaRama Adi NugrahaJul 27, 2026
Illustration of a Claude Opus 5 pricing breakdown showing cost per million tokens
Guides

Precios de Claude Opus 5 en 2026: costos de API, planes y facturas reales

Anthropic mantuvo Opus 5 a los precios de Opus 4.8, pero ahora el thinking viene activado por defecto. Esto es lo que realmente cuesta ejecutar Claude Opus 5 una vez que entran en juego el effort y el cacheo.

Rama Adi NugrahaRama Adi NugrahaJul 27, 2026
Ilustración dibujada a mano de dos personas revisando un gráfico de desglose de precios con símbolos de dólar
Trending

Precios de Grok 4.5: tarifas de la API, coste de SuperGrok y cargos ocultos

Grok 4.5 cuesta 2 $/6 $ por 1 millón de tokens en la API y 30-300 $/mes como plan de consumidor. Aquí tienes el desglose completo, los cargos ocultos y lo que implica para tu presupuesto.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 9, 2026
DeepSeek V4 Flash: precios y lo que pagarás realmente
Trending

DeepSeek V4 Flash: precios y lo que pagarás realmente

DeepSeek V4 Flash figura a $0.14 de entrada y $0.28 de salida por millón de tokens. Usuarios reales han publicado tarifas combinadas por debajo de un centavo. Esto es lo que decide cuál te toca a ti.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
DeepSeek V4 Flash: especificaciones, precios y para qué sirve realmente
Trending

DeepSeek V4 Flash: especificaciones, precios y para qué sirve realmente

DeepSeek V4 Flash cuesta $0.14 de entrada y $0.28 de salida por millón de tokens, y supera a la propia gama alta de DeepSeek. Esto es lo que la tabla de precios no cuenta.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustración de un gato muy largo estirándose junto a dos personas revisando una tarjeta de puntuación, con el logo de LongCat
Trending

Review de LongCat 2.0: un caballo de batalla con un bloqueo real

Evalué LongCat 2.0 en siete aspectos que realmente le importan a un comprador, usando los propios archivos de Meituan y los testimonios de quienes le hicieron pasar miles de millones de tokens. Sale bien en seis.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustración de un gato muy largo estirado sobre un escritorio junto a un rack de servidores, con el logo de LongCat
Trending

LongCat 2.0: dentro del modelo abierto de 1,6T parámetros de Meituan

LongCat 2.0 es el modelo MoE de 1,6T parámetros de Meituan, con licencia MIT, a 0,30 dólares por millón de tokens de entrada. Leí todas las fuentes primarias para ver qué se entrega realmente.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Dos personas leyendo un gran medidor de uso y ajustando una pila de diales de facturación, en el color de marca azul de Meta
Trending

Precios de Meta Muse Spark 1.1: la factura tiene cuatro medidores

Muse Spark 1.1 tiene un precio de lista de $1.25 de entrada y $4.25 de salida por millón de tokens. Cuatro medidores separados determinan tu factura real, y el precio de lista es el más pequeño de todos.

Rama Adi NugrahaRama Adi NugrahaAug 5, 2026
Una ilustración de una persona seleccionando uno de cinco reguladores de esfuerzo de razonamiento en una barra de control al estilo Claude Opus 5
Trending

Claude Opus 5: qué es y cómo usarlo de verdad

Claude Opus 5 no es un modelo, son cinco. Una guía sencilla sobre las especificaciones, el regulador de esfuerzo que decide tu factura, y los dos cambios de API que rompen código antiguo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis