
Resumo
Os preços da API da Anthropic são por token, por modelo, sem assentos e sem mínimos. Claude Opus 5 custa $5 de entrada e $25 de saída por milhão de tokens, Claude Sonnet 5 custa $2 e $10, e Claude Haiku 4.5 custa $1 e $5. Claude Fable 5 lidera a tabela com $10 e $50. Cinco gerações do Opus estão todas no mesmo preço de $5, e o Sonnet na verdade ficou mais barato de geração para geração.
A tabela de preços é o número menos interessante da página. O que decide sua fatura são quatro multiplicadores empilhados sobre ela: uma leitura de cache custa 10% da entrada base, o batch tira 50% fixo, o effort vem por padrão na segunda configuração mais cara disponível, e a inferência restrita aos EUA silenciosamente adiciona 1,1x a tudo. No Opus 5, o mesmo token de entrada pode custar $0,50 ou $10,00 dependendo de qual desses fatores você mexeu, uma variação de 20x em um único modelo.
A armadilha não é o preço, é a unidade. Já vi um prospect queimar 200 chamadas de API em uma única tarde de teste e depois não conseguir me dizer quanto custaria um mês, porque ninguém orça em milhões de tokens. Se seu objetivo final é automação de suporte em vez de uma fatura de pesquisa, a eesel cobra na unidade que você já usa para prever custos, tickets, a $0,40 cada, sem assentos.
A tabela completa de preços da API da Anthropic
Tudo abaixo vem da própria documentação detalhada de preços da Anthropic, verificada em 13 de agosto de 2026. Os preços são em USD por milhão de tokens, que a documentação abrevia como MTok. Vale saber antes de copiar uma URL: platform.claude.com/docs/en/pricing é um stub de redirecionamento que não retorna nada, e a página real fica em /about-claude/pricing.
| Modelo | Entrada | Saída | Escrita de cache 5m | Escrita de cache 1h | Leitura de cache | Batch entrada | Batch saída |
|---|---|---|---|---|---|---|---|
| Claude Fable 5 | $10 | $50 | $12.50 | $20 | $1 | $5 | $25 |
| Claude Mythos 5 | $10 | $50 | $12.50 | $20 | $1 | $5 | $25 |
| Claude Opus 5 | $5 | $25 | $6.25 | $10 | $0.50 | $2.50 | $12.50 |
| Claude Opus 4.8 | $5 | $25 | $6.25 | $10 | $0.50 | $2.50 | $12.50 |
| Claude Opus 4.7 | $5 | $25 | $6.25 | $10 | $0.50 | $2.50 | $12.50 |
| Claude Opus 4.6 | $5 | $25 | $6.25 | $10 | $0.50 | $2.50 | $12.50 |
| Claude Opus 4.5 | $5 | $25 | $6.25 | $10 | $0.50 | $2.50 | $12.50 |
| Claude Sonnet 5 | $2 | $10 | $2.50 | $4 | $0.20 | $1 | $5 |
| Claude Sonnet 4.6 | $3 | $15 | $3.75 | $6 | $0.30 | $1.50 | $7.50 |
| Claude Sonnet 4.5 | $3 | $15 | $3.75 | $6 | $0.30 | $1.50 | $7.50 |
| Claude Haiku 4.5 | $1 | $5 | $1.25 | $2 | $0.10 | $0.50 | $2.50 |
| Claude Opus 4.1 (aposentado) | $15 | $75 | $18.75 | $30 | $1.50 | $7.50 | $37.50 |
| Claude Haiku 3.5 (aposentado) | $0.80 | $4 | $1 | $1.60 | $0.08 | $0.40 | $2 |
Três coisas nessa tabela merecem uma pausa.
Cinco gerações do Opus têm o mesmo preço. Opus 5, 4.8, 4.7, 4.6 e 4.5 são todos cobrados a $5 de entrada e $25 de saída. Se você ainda está preso a um Opus mais antigo por motivos de reprodutibilidade, não está economizando dinheiro com isso, e o Opus 4.1 aposentado é o único que continua na tabela antiga de $15 e $75.
O Sonnet ficou mais barato, o que geralmente não é como isso costuma acontecer. Sonnet 5 fica em $2 e $10 contra $3 e $15 do Sonnet 4.6, um corte de 33% nos dois medidores em uma única geração. Para a maior parte do tráfego de produção, isso torna o Sonnet 5 a escolha óbvia em vez de um meio-termo.
Fable 5, a $10 e $50, é exatamente 2x o Opus 5. Guarde esse número, porque ele volta quando chegarmos ao modo rápido.
Se você quiser o contexto de capacidade dos modelos Claude junto com os preços, as especificações se alinham assim:
| Fable 5 | Opus 5 | Sonnet 5 | Haiku 4.5 | |
|---|---|---|---|---|
| ID da API | claude-fable-5 | claude-opus-5 | claude-sonnet-5 | claude-haiku-4-5-20251001 |
| Janela de contexto | 1M | 1M | 1M | 200k |
| Saída máxima | 128k | 128k | 128k | 64k |
| Corte de conhecimento | Jan 2026 | Mai 2026 | Jan 2026 | Fev 2025 |
| Latência | Mais lenta | Moderada | Rápida | Mais rápida |
A própria orientação da Anthropic é começar com o Claude Opus 5 para trabalho agêntico complexo e corporativo, e tratar o Fable 5 como o modelo de exceção, não o padrão.
Calcule seu próprio número
A tabela de preços só vira um orçamento quando você coloca seu próprio tráfego nela. Defina as quatro entradas abaixo e ela calculará o mês, depois mostrará quanto o mesmo volume de trabalho custaria sem cache e sem desconto de batch.
Mova o controle deslizante de cache e observe o total, porque esse único controle move o número mais do que trocar o nível do modelo em um volume de trabalho com muita entrada. Esse é todo o argumento da próxima seção.
Quatro multiplicadores decidem a fatura, não a tabela de preços
A Anthropic publica o preço por token com destaque e os multiplicadores discretamente. É nos multiplicadores que está o dinheiro.
O cache de prompt é a maior alavanca, e o cache curto é o mais barato
O cache tem três preços, todos expressos em relação à tarifa base de entrada do modelo: uma escrita de cache de 5 minutos custa 1,25x, uma escrita de 1 hora custa 2x, e um acerto de cache custa 0,1x. Definir os próprios pontos de corte é gratuito. O teto em regime estável é um desconto de 90% sobre qualquer prefixo que você reutilizar.
A aritmética do ponto de equilíbrio é onde as pessoas erram. Cada acerto economiza 0,9x da base, então o cache de 5 minutos se paga após um acerto, e o cache de 1 hora precisa de dois. Escrita mais um acerto no TTL de 1 hora chega a 2,1x contra 2,0x de não usar cache algum, então um prompt de reuso único no cache longo é ativamente pior do que deixar o cache desligado.

A própria orientação da Anthropic é permanecer no cache de 5 minutos para qualquer coisa acessada com mais frequência do que a cada cinco minutos, porque ele se renova sem custo adicional toda vez que é usado. O TTL de 1 hora é para lacunas: a execução longa de um agente secundário, ou um usuário que talvez não responda por dez minutos.
Depois há a parte que quase ninguém orça. As leituras de cache não são deduzidas do seu limite de taxa de tokens de entrada. O exemplo prático da Anthropic é um limite de 2.000.000 ITPM combinado com uma taxa de acerto de cache de 80%, o que permite passar 10.000.000 de tokens de entrada por minuto pela mesma conta. O cache não é apenas um desconto, é um multiplicador de vazão de 5x, e é a forma mais barata de elevar um teto que, de outra forma, você teria que pedir à Anthropic para elevar por você.

Haiku 3.5 é a exceção documentada em que as leituras de cache contam para o limite, e ele já está aposentado na API de primeira parte de qualquer forma.
É por isso também que as contagens de tokens em manchetes enganam tanto. Uma pessoa corrigindo a estimativa de custo de outra no Hacker News colocou isso da forma mais clara possível:
"i run a bunch of claude agents for automation and like 85% of input tokens end up being cached reads -which cost 1/10th of the sticker price. so your $200k number is probably closer to $25-30k in real cost"
Várias pessoas que rodam automação em produção relatam de forma independente entre 85% e 92% dos tokens de entrada caindo como leituras de cache. Se você precificar uma contagem de tokens na tarifa de tabela, está superestimando uma fatura real em cerca de 10x.
O prefixo mínimo cacheável é a armadilha por trás de tudo isso, porque não se move de forma linear entre as gerações:
| Tokens mínimos cacheáveis | Modelos |
|---|---|
| 512 | Opus 5, Fable 5, Mythos 5 |
| 1.024 | Opus 4.8, Sonnet 5, Sonnet 4.6, Sonnet 4.5 |
| 2.048 | Opus 4.7, Haiku 3.5 |
| 4.096 | Opus 4.6, Opus 4.5, Haiku 4.5 |
Opus 5 faz cache a partir de 512 tokens. Haiku 4.5 precisa de oito vezes isso. Fique abaixo do limite e o cache silenciosamente não faz nada e não retorna erro algum, o que explica por que uma fatura que se recusa a cair depois que você "ativou o cache" geralmente é um prompt que nunca se qualificou. Ver cache_creation_input_tokens e cache_read_input_tokens zerados na resposta é o sinal.
Mais alguns mecanismos que custam dinheiro discretamente. A janela de retrospecção de leitura é de 20 blocos, então um turno que adiciona mais de 20 passa da sua última escrita e perde o cache. Modificar definições de ferramentas invalida o cache inteiro, já que a hierarquia roda ferramentas, depois sistema, depois mensagens. E o erro comum documentado é colocar o ponto de corte em um bloco que contém um timestamp ou a mensagem recebida do usuário, o que gera uma escrita nova a cada requisição e nunca uma leitura.
O batch é 50% fixo, com duas exceções
A Batch API tira 50% de entrada e saída em todo modelo ativo, e ela combina com o cache. Os limites são 100.000 requisições ou 256 MB por batch, a maioria completa dentro de uma hora, e o teto rígido é de 24 horas.
O detalhe de cobrança que eu gosto: requisições errored, canceled e expired não são cobradas de forma alguma. Só sucessos custam dinheiro, o que torna o batch um lugar de baixo risco para rodar um grande job de classificação. O contrapeso é que um batch pode ultrapassar levemente seu limite de gastos configurado por causa do processamento simultâneo, então não é uma cerca de orçamento rígida.
Duas exceções para planejar: o batch não se combina com o modo rápido, e o desconto não se aplica a sessões de Managed Agents.
O effort é o padrão que ninguém define
output_config.effort controla quantos tokens o Claude gasta, e isso cobre texto, chamadas de ferramentas e pensamento igualmente, então ele afeta mesmo com o pensamento desligado. Os níveis são low, medium, high, xhigh, max.
O padrão é high em todo modelo documentado pela Anthropic, que é a segunda configuração mais cara da escala. A própria lista de boas práticas da Anthropic abre com "defina o effort explicitamente", o que é uma forma educada de dizer que o comportamento pronto de fábrica não é o que você quer para trabalho em volume.
Nenhum multiplicador de tokens é publicado para qualquer nível, então trate isso como um controle a medir, não um desconto a reivindicar. A única âncora comparável que a Anthropic dá é que Sonnet 5 em medium é aproximadamente Sonnet 4.6 em high. Duas pegadinhas para saber antes de começar a ajustar: mudar o effort entre requisições invalida seus prefixos em cache, então as duas alavancas competem entre si, e no Opus 5 um effort menor encurta o pensamento em vez da resposta visível, então peça por extensão se brevidade era o que você buscava.
As duas sobretaxas escondidas na documentação
O modo rápido dá ao Opus 5 e ao Opus 4.8 saída até 2,5x mais rápida por $10 de entrada e $50 de saída, exatamente 2x o padrão. O que produz a decisão de compra que considero mais interessante em toda a tabela: o Opus 5 em modo rápido custa exatamente o mesmo que o Fable 5 padrão. Se você está recorrendo ao modo rápido em um problema difícil, precifique o modelo mais capaz na mesma tarifa antes de se comprometer. O modo rápido é apenas na API de primeira parte, e não se combina com batch.
O mais discreto é a residência de dados. Fixar a inferência nos EUA com inference_geo: "us" no Claude 4.6 e versões posteriores aplica um multiplicador de 1,1x a cada categoria de token, e isso inclui escritas e leituras de cache, não só entrada e saída. É uma sobretaxa de 10% em toda a fatura, é fácil de configurar uma vez e esquecer, e o roteamento global é o padrão com o preço normal.
Empilhe as quatro alavancas e a variação em um único modelo é maior do que a diferença entre os níveis de modelo:

Os custos de ferramentas e agentes que ficam em cima dos tokens
Ferramentas do lado do servidor são cobradas separadamente, e são essas as linhas que surpreendem quem lê uma fatura mensal pela primeira vez.
| Item | Cobrança | O detalhe que importa |
|---|---|---|
| Busca na web | $10 por 1.000 buscas | Cada busca conta como um uso, não importa quantos resultados voltem. Buscas com erro são gratuitas. Os resultados então são cobrados como tokens de entrada nesse turno e em todos os turnos seguintes. |
| Busca de página web | Sem cobrança extra | Só tokens. A Anthropic estima uma página típica em cerca de 2.500 tokens e um PDF de pesquisa em cerca de 125.000. |
| Execução de código | $0,05 por hora de contêiner | Totalmente gratuito quando combinado com busca ou busca de página web, e gratuito abaixo de 1.550 horas por mês. Mínimo de cinco minutos, e arquivos anexados cobram tempo de execução mesmo que a ferramenta nunca rode. |
| Managed Agents | $0,08 por hora de sessão | Medido apenas em running, ao milissegundo. Tempo ocioso esperando sua próxima mensagem é gratuito. Tokens são cobrados por cima. |
| Prompt de sistema de uso de ferramentas | 286 a 675 tokens de entrada | Adicionado a cada requisição habilitada para ferramentas, além dos seus próprios esquemas. |
Essa última linha merece uma nota, porque se move na direção certa. Opus 4.7 carregava o pior overhead fixo de ferramentas da tabela, 675 tokens com auto, e o Opus 5 cortou isso para 286. Se você roda uma configuração pesada de ferramentas MCP com milhares de pequenas requisições, isso é uma redução real de 58% em uma linha de custo que você nunca escolheu.
A Anthropic publica seu próprio exemplo prático para uma sessão de codificação de uma hora com Managed Agents no Opus 5, e é o número de ROI de cache mais claro disponível em toda a documentação:
| Linha | Sem cache | Com cache |
|---|---|---|
| Entrada | $0,25 | $0,05 sem cache mais $0,02 de leituras de cache |
| Saída | $0,375 | $0,375 |
| Tempo de execução da sessão | $0,08 | $0,08 |
| Total | $0,705 | $0,525 |
Isso é um corte de 25,5% na sessão inteira só com o cache, em um volume de trabalho onde a saída domina e o cache só consegue afetar parte da fatura.
Não existe mais sobretaxa de contexto longo
Essa é a mudança que a maioria dos posts de terceiros sobre preços ainda erra. Claude 4.6 e versões posteriores incluem a janela completa de 1M tokens nas tarifas padrão, e a documentação de preços afirma isso claramente: uma requisição de 900 mil tokens é cobrada na mesma tarifa por token que uma de 9 mil tokens. Os descontos de cache e batch também se aplicam em toda a janela.
Duas ressalvas impedem que isso seja um almoço grátis. A própria Anthropic avisa que precisão e recall degradam conforme a contagem de tokens cresce, então pagar por uma janela mais cheia pode comprar respostas piores. E o comportamento de estouro mudou no Claude 4.5 e versões posteriores: se entrada mais max_tokens excede a janela, a requisição é aceita e para no meio com stop_reason: "model_context_window_exceeded", e você paga por tudo que foi gerado antes disso.
Como os preços da API da Anthropic se comparam
Aqui está o confronto honesto contra as outras APIs de fronteira, retirado da própria página de cada fornecedor no mesmo dia. Se você quiser a versão mais aprofundada, temos um detalhamento completo de três provedores de API e uma comparação direta com a API da Anthropic.
| Nível | Modelo | Entrada | Saída | Entrada em cache | Batch | Contexto longo |
|---|---|---|---|---|---|---|
| Fronteira | Claude Opus 5 | $5.00 | $25.00 | $0.50 | 50% | Sem sobretaxa |
| Fronteira | gpt-5.6-sol | $5.00 | $30.00 | $0.50 | 50% | $10 / $45, limiar não publicado |
| Fronteira | Gemini 3.1 Pro | $2.00 | $12.00 | $0.20 | 50% só em tokens | $4 / $18 acima de 200K |
| Fronteira | grok-4.6 | $2.00 | $6.00 | $0.50 | Nenhum | $4 / $12 em 200K, todos os tokens |
| Médio | Claude Sonnet 5 | $2.00 | $10.00 | $0.20 | 50% | Sem sobretaxa |
| Médio | gpt-5.6-terra | $2.00 | $12.00 | $0.20 | 50% | $4 / $18, limiar não publicado |
| Médio | Gemini 3.6 Flash | $1.50 | $7.50 | $0.15 | 50% | Nenhuma |
| Barato | Claude Haiku 4.5 | $1.00 | $5.00 | $0.10 | 50% | Sem sobretaxa |
| Barato | gpt-5.6-luna | $0.20 | $1.20 | $0.02 | 50% | $0.40 / $1.80 |
| Barato | deepseek-v4-flash | $0.14 | $0.28 | $0.0028 | Nenhum | Nenhuma |
Lendo essa tabela com justiça, o Claude não é o mais barato em nada. Os preços do Gemini ficam abaixo do Sonnet 5 em entrada no nível médio, o grok-4.6 é dramaticamente mais barato em saída no nível de fronteira, e o deepseek-v4-flash está em um universo totalmente diferente, a $0,14 e $0,28, com uma taxa de acerto de cache cerca de 50x abaixo da taxa de erro.
Onde a Anthropic vence é na previsibilidade, e em escala isso vale dinheiro de verdade.
Comece pelo contexto longo, já que nenhum modelo Claude atual carrega sobretaxa ali, enquanto o Gemini 3 publica uma tarifa dobrada acima de 200K. A versão da xAI é mais dura: sua tarifa de contexto longo se aplica a todos os tokens da requisição assim que o prompt ultrapassa 200K, então um único token a mais reprecifica a chamada inteira. Depois compare o formato da fatura. A Anthropic mede quatro coisas, entrada, saída, escritas de cache e leituras de cache, além de um pequeno conjunto de ferramentas nomeadas. A página da xAI lista cinco tipos de token cobrados separadamente, seis invocações de ferramentas com preço, armazenamento de arquivos e coleções, egress, e uma taxa de $0,05 em qualquer requisição que viole suas diretrizes de uso. A paridade de batch também é um mito: a OpenAI desconta todo medidor, o Google mantém o cache de contexto em tarifas padrão nas linhas de batch do Pro, e a xAI não dá desconto de batch algum ao grok-4.6.
Há também uma ressalva importante se você está comparando por preço. A DeepSeek publica uma URL base no formato Anthropic em api.deepseek.com/anthropic, o que significa que o SDK que você escreveu para o Claude vai, na maior parte, apontar para um modelo muito mais barato com apenas uma mudança de URL base. A própria página da DeepSeek também avisa sobre um aumento significativo de preço a caminho, então trate o número de hoje como um piso, não como um plano. Se a fatura é o motivo de você estar lendo isto, nosso levantamento de alternativas ao Claude é o lugar para começar. A ponta mais barata de peso aberto é coberta separadamente, com tarifas por modelo para Qwen e para Kimi K2.5.
Por que as faturas públicas da API do Claude discordam por quatro ordens de grandeza
Se você for procurar quanto custa a API da Anthropic na prática, vai encontrar números que não podem descrever o mesmo produto. Vale entender o porquê antes de tomar qualquer um deles como referência.
Quase todos os números que fazem barulho vêm de desenvolvedores apontando um agente de codificação para uma chave de API crua. Veja o formato disso:
"At API prices it's incredibly easy to burn cash. I ran through my Claude Max 20x last week and had $100 credit from when Anthropic banned OpenClaw, so I decided to use it to get some chores done. Three hours of very light work on Sonnet cost me $55."
Note que isso é o Sonnet, não o Opus, e ele descreve o trabalho como muito leve. No mesmo tópico, outro desenvolvedor relata uma taxa de queima de pico de cerca de $50 por hora, e outra pessoa perdeu $300 em doze horas em uma execução noturna sem supervisão. Um comentarista nomeia o modo de falha específico que produz esses números: $20 perdidos para um agente preso em um loop de chamada de ferramenta, o que é um argumento a favor de limites de gasto e proteções contra loops, não um argumento sobre preço.
Agora a mesma API, no mesmo tópico, fazendo trabalho limitado:
"I'm using the API to relevance classify hundreds of articles a day. Been running for 2 ish weeks, I think I'm almost up to $2 in cost"
Cinquenta dólares por hora e dois dólares em quinze dias, na mesma tabela de preços. A variável não é a lista de preços, é se o volume de trabalho tem um prompt limitado e uma saída limitada ou um loop de agente que decide sozinho quanto gastar. Quase toda alegação de que "a API do Claude é cara" que você vai ler está medindo a segunda coisa, e quase toda integração de produto no lado do servidor é a primeira.
A leitura prática: ignore completamente os números por hora ao dimensionar uma integração normal, e modele o formato do seu próprio token em vez disso.
Como fica a fatura em três volumes de trabalho reais
Preços de tabela não dizem muito até você aplicá-los a um trabalho. Os três abaixo usam tarifas publicadas e a aritmética é a mesma que o widget acima executa.
Um classificador de triagem de suporte. 50.000 tickets por mês, Haiku 4.5, um bloco de instrução de 3.000 tokens reutilizado em cada chamada mais 400 tokens de texto do ticket, e 150 tokens de saída. Isso dá $170 de entrada e $37,50 de saída, então cerca de $208 por mês, ou quatro décimos de centavo por ticket. Coloque em batch e reduza pela metade de novo. Esse é o volume de trabalho onde a API crua realmente chega perto de ser de graça, e é por isso que a precificação por ticket em uma ferramenta de suporte precisa se justificar contra algo tão barato assim.
Um agente de codificação. 2.000 sessões por mês no Opus 5, 60.000 tokens de entrada por sessão com 80% servidos de cache, e 12.000 tokens de saída. A entrada dá $120 sem cache mais $48 em leituras de cache, e a saída $600. Chame de $768, com a saída carregando 78% disso. Em volumes de trabalho agênticos, o medidor de saída é a fatura, então o cache ajuda muito menos do que a manchete do desconto sugere. Essa é a coisa mais útil de saber antes de modelar o custo de um agente.
Um preenchimento único de documentos. 200.000 documentos, Sonnet 5, 5.000 tokens de entrada e 800 de saída, rodados via batch. A entrada fica em $1.000 na tarifa de batch de $1 e a saída em $800 a $5, então $1.800 pela execução contra $3.600 de forma síncrona. Nada para cachear aqui, já que cada documento é diferente, e é exatamente para esse formato que o batch existe.
O padrão nos três: o cache vence em tráfego repetitivo com muita entrada, o batch vence em qualquer coisa que você possa esperar, e nenhum dos dois faz muita diferença para um agente que escreve muito. Combine a alavanca com o formato do trabalho.
Onde a API crua deixa de ser a opção mais barata
Tudo acima precifica tokens. Não precifica o sistema em torno deles, e é aí que a maior parte da conta de construir versus comprar silenciosamente desmorona.
Passei os últimos anos colocando agentes de IA em filas de suporte ao vivo, e o padrão nas ligações de vendas é consistente o suficiente para ser previsível. Um prospect roda uma tarde de teste, observa o contador de chamadas se mover, e não consegue extrapolar. Uma empresa de segurança de e-mail no Freshdesk, crescendo em direção a 20.000 tickets por ano, queimou 200 chamadas de API em um único dia de teste e voltou preocupada inteiramente com o que 9.000 interações por mês fariam com o número, não com se as respostas eram boas. Outro operador caminhando para 150.000 tickets por mês fez a conta em cerca de 20 centavos por ticket, chegou a cerca de $30.000 por mês, e travou ali.
Nenhum dos dois é um problema de preço de token. Ambos são problemas de unidade. Ninguém prevê custos em milhões de tokens, e um medidor por token transforma toda conversa sobre capacidade em um exercício de modelagem em vez de uma linha de orçamento.
O contra-argumento também é real, e prefiro citá-lo a parafraseá-lo:
"We switched to a system that is working well at half the cost. But long term we will just build our own, which is so possible now with AI. I think you have a decent system for now, but we are probably too large of a customer for this."
Uma marca canadense de acessórios para armas de fogo rodando Zendesk com 2.190 documentos sincronizados, dos registros internos de chamadas de vendas da eesel
Esse leitor tem razão de que os modelos agora estão baratos o suficiente para tornar tentador construir, e frameworks como o AgentKit tornaram a estrutura mais barata também. O que a fatura de tokens deixa de fora é a recuperação sobre sua central de ajuda, uma integração com o helpdesk que sobrevive a uma mudança de API, regras de escalonamento, uma forma de testar contra tickets históricos antes de apontar isso para clientes, e alguém cujo trabalho é manter tudo isso rodando. Já vimos um bot de aparência confiante dar respostas erradas em produção, e é por isso que todo lançamento agora é simulado contra tickets passados reais primeiro, e simulação não é uma linha de item que você pode comprar em uma tabela de preços.
A versão honesta da troca: se você precisa de um classificador ou de um resumidor, construa na API e aproveite uma fatura medida em centavos. Se você precisa de algo que responda clientes, precifique o custo do agente de IA de ponta a ponta, incluindo o risco de alucinações de IA e a manutenção que ninguém orça.
Depois compare isso com o custo por resolução em algo já construído. Nosso detalhamento de custo de chatbot percorre a mesma aritmética, e o levantamento de software de helpdesk de IA cobre com o que você estaria comparando.
Uma última nota prática sobre governança, já que é a coisa que as pessoas perguntam depois da primeira fatura surpreendente. Os limites de gasto são $500 no Start, $1.000 no Build, e $200.000 no Scale, com o Custom removendo o limite por completo. Os níveis são atribuídos com base no histórico de uso, não comprados, e novas organizações podem começar em um nível de Avaliação abaixo dos limites publicados. Atingir o limite pausa o uso até o próximo mês do calendário, o que funciona da mesma forma que os limites de taxa da OpenAI, caso você já tenha esbarrado neles antes.
A página de uso do Console mostra sua taxa de acerto de cache diretamente, que é o número a olhar primeiro, e vale a pena instrumentar isso adequadamente com ferramentas de rastreamento de LLM se a fatura importa. Uma nota estrutural para quem está comparando rotas: no plano corporativo, os assentos custam $20 por mês cada mais uso nessas mesmas tarifas de API, então essa tabela de preços é a fatura de uso corporativo. Isso é um cálculo diferente do Claude Pro, onde uma assinatura fixa absorve o uso em vez disso.
Experimente a eesel para automação de suporte
Se o motivo de você estar precificando a API da Anthropic é uma fila de suporte, a unidade é a coisa a corrigir antes da tarifa. A eesel cobra $0,40 por ticket, sem assentos e sem taxa de plataforma, o que é um número que você pode colocar em uma previsão sem modelar contagens de tokens por conversa. Ela se conecta ao Zendesk, Freshdesk ou Gorgias em poucos minutos, treina com sua central de ajuda existente e tickets passados, e simula contra seu histórico de tickets antes mesmo de responder a um cliente, então você vê a taxa de resolução e o custo projetados antes de entrar no ar.

Você ainda ganha a visibilidade por ação que uma construção crua na API te faria montar sozinho, que geralmente é a primeira coisa que as equipes deixam de fora ao estimar a construção. Grátis para experimentar, e você pode ver os números projetados antes de se comprometer com qualquer parte disso.
Perguntas Frequentes
Quanto custa a API da Anthropic?
Qual é a forma mais barata de reduzir a fatura da API da Anthropic?
Os preços da API da Anthropic cobram algo a mais pela janela de contexto de 1M?
Claude Opus 5 ou Claude Sonnet 5 oferece melhor custo-benefício na API?
effort menor no Opus 5 não encurta a resposta visível, apenas o pensamento. Veja seleção de modelo para saber como escolher.Quais custos ocultos existem nos preços da API da Anthropic?
Existe um nível gratuito para a API da Anthropic?
Construir sobre a API da Anthropic é mais barato do que comprar uma ferramenta de suporte?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








