
Preços do Claude Opus 5 em resumo
O Claude Opus 5 foi lançado em 24 de julho de 2026, descrito pela Anthropic como um modelo que "se aproxima da inteligência de ponta do Claude Fable 5 pela metade do preço". A tarifa da API é a mesma que a linha Opus mantém desde o Opus 4.5.
| Pelo que você paga | Tarifa do Claude Opus 5 |
|---|---|
| Tokens de entrada | $5 por milhão |
| Tokens de saída (incluindo thinking) | $25 por milhão |
| Escrita em cache de 5 minutos | $6,25 por milhão |
| Escrita em cache de 1 hora | $10 por milhão |
| Leitura de cache | $0,50 por milhão |
| Batch API entrada / saída | $2,50 / $12,50 por milhão |
| Modo fast entrada / saída | $10 / $50 por milhão |
Inferência somente-EUA (inference_geo) | 1,1x em cada categoria de token |
Todos os números acima vêm da documentação de preços da Anthropic. Algumas especificações que definem a fatura mais do que a tarifa em si:
- O ID do modelo é
claude-opus-5na API da Claude,anthropic.claude-opus-5no Bedrock. - O contexto é de 1M tokens de entrada, 128k tokens de saída, subindo para 300k de saída na Batch API com um header beta.
- O corte de conhecimento confiável é maio de 2026.
- O Opus 5 tem seu próprio grupo de limite de taxa. Opus 4.8, 4.7, 4.6 e 4.5 compartilham um pool combinado e o Opus 5 não puxa dele, então mover tráfego entre eles não libera margem.
Se você está comparando isso com a geração anterior, nosso guia de preços do Opus 4.5 e o detalhamento do Opus 4.6 trazem a mesma tarifa, o que torna a comparação versão a versão excepcionalmente limpa.
Pelo que você realmente é cobrado
Aqui está a parte que pega quem está migrando do Opus 4.8. No 4.8, uma requisição que omitia o campo thinking rodava sem thinking. No Opus 5, a mesma requisição executa adaptive thinking, e cada token de thinking é cobrado como saída a $25 por milhão.

Dois efeitos colaterais que vale a pena orçar:
max_tokensagora cobre thinking e resposta juntos. Um limite que você ajustou de forma apertada em torno da resposta visível no 4.8 pode truncar a resposta no meio no Opus 5. O guia de migração da Anthropic sugere pelo menos 64k como ponto de partida em effort xhigh ou max.- O Opus 5 escreve mais longo por padrão. O guia de migração é direto: tanto as respostas visíveis quanto os entregáveis escritos são mais longos do que no 4.8, e reduzir o effort diminui o volume de thinking sem encurtar de forma confiável a resposta visível. O tamanho precisa ser pedido no prompt, não ajustado num controle.
Há uma terceira linha de cobrança que as pessoas esquecem em loops agênticos: cada resultado de ferramenta que você devolve reentra como input no próximo turno. Uma execução agêntica de 30 passos paga repetidamente pela mesma transcrição crescente, exatamente por isso o cache importa mais aqui do que no chat. Se seu loop puxa contexto por ferramentas MCP ou Claude Skills, cada um desses resultados cai no lado de input da mesma fatura.
Um modelo, quatro preços
Os mesmos pesos e o mesmo ID de modelo podem ser cobrados em quatro tarifas diferentes dependendo puramente de como você os chama.

O cache de prompt é a maior alavanca para qualquer coisa com um prefixo estável. As escritas custam 1,25x o input base no cache de 5 minutos e 2x no cache de 1 hora, e as leituras custam 0,1x. A melhoria silenciosa no Opus 5 está no piso: o prefixo mínimo cacheável cai para 512 tokens, ante 1.024 no 4.8 e 4.096 no Opus 4.6. System prompts que antes eram silenciosamente não cacheáveis agora entram em cache sem nenhuma mudança de código.
O Batch tira 50% em ambas as direções, e se combina com o cache. Se sua carga de trabalho tolera uma fila, isso é dinheiro de graça.
O modo fast vai na direção oposta. Segundo a documentação do modo fast, ele entrega até 2,5x mais tokens de saída por segundo por exatamente o dobro do preço, e vale a pena nomear a troca com precisão: a $10 e $50, o Opus 5 no modo fast custa o mesmo por token que o Claude Fable 5 padrão. Também é uma prévia de pesquisa disponível apenas na API de primeira parte, e não funciona com Batch.
A inferência somente-EUA adiciona um multiplicador fixo de 1,1x em cada categoria de token, o que dá $5,50 e $27,50.
O effort é o verdadeiro controle de preço
Esta é a seção que eu leria duas vezes se estivesse dimensionando um orçamento. O Opus 5 suporta cinco níveis de effort, e a orientação se inverteu em relação à era 4.x: onde 4.7 e 4.8 diziam para começar em xhigh em trabalho agêntico, o Opus 5 diz para começar no high padrão e diminuir a partir daí.

Os números por trás dessa orientação vêm da própria execução do Frontier-Bench v0.1 da Anthropic, um benchmark de terminal com 74 tarefas que sucedeu o Terminal-Bench 2.1:
| Effort | Pontuação Frontier-Bench | Nota sobre tokens |
|---|---|---|
| low | 25% | 64% menos tokens de saída |
| high | 39% | 19% menos tokens de saída |
| xhigh | 44,4% | melhor resultado |
| max | ~43% | mais gasto, levemente pior |
Duas coisas se destacam. O effort max pontuou pior que o xhigh enquanto custava mais, e o effort low entregou bem mais da metade da pontuação por cerca de um terço dos tokens de saída. A Anthropic explica a queda do effort max no FrontierCode 1.1 como o modelo fazendo "mais mudanças do que a tarefa exige", o que o avaliador penaliza.

Leia esse gráfico como um gráfico de preços, não como um placar. Todo o argumento de custo do Opus 5 é que sua curva fica acima e à esquerda da do Fable 5: ele alcança uma pontuação mais alta a um custo por tentativa mais baixo. Essa é uma afirmação mais útil do que qualquer número isolado de benchmark, e é a mesma forma que a Anthropic reporta no CursorBench, onde o Opus 5 fica "dentro de 0,5% da pontuação máxima do Fable 5, mas pela metade do custo por tarefa".
Calcule sua própria fatura mensal
As tarifas de tabela só se tornam reais quando você aplica seu próprio volume a elas. Insira um mês de uso e veja o que as alavancas fazem.
Uma ressalva que a calculadora não consegue modelar: contagens de tokens não são comparáveis entre gerações. A Anthropic observa que o Claude 4.7 em diante tokeniza o mesmo texto em cerca de 30% mais tokens do que o Sonnet 4.6 e anteriores, então uma comparação simples por milhão contra um modelo mais antigo subestima a fatura real.
Como o Opus 5 se compara ao resto da linha
| Modelo | Entrada / MTok | Saída / MTok | Contexto | Onde se encaixa |
|---|---|---|---|---|
| Claude Fable 5 | $10 | $50 | 1M | O teto de capacidade |
| Claude Opus 5 | $5 | $25 | 1M | Codificação agêntica, trabalho empresarial |
| Claude Opus 4.8 | $5 | $25 | 1M | Priority Tier, web fetch |
| Claude Sonnet 5 | $2 (depois $3) | $10 (depois $15) | 1M | Trabalho de volume |
| Claude Sonnet 4.6 | $3 | $15 | 1M | Cavalo de batalha anterior |
| Claude Haiku 4.5 | $1 | $5 | 200K | Classificação, roteamento |
A própria orientação da Anthropic é começar com o Opus 5 e subir para o Fable 5 só quando você precisar do teto.
Frente ao resto do mercado, nossas comparações de preços do Gemini e preços do GPT-5.6 colocam o Opus 5 na categoria caro-mas-eficiente. Os confrontos diretos em Gemini 3 Pro e Codex vs Opus 4.6 ainda descrevem a forma dessa troca, e a comparação das três APIs é a forma mais rápida de checar uma troca.
Duas coisas que o Opus 4.8 mantém e o Opus 5 perde, e importam para o planejamento: segundo as notas de migração, o web fetch não está disponível no Opus 5 e o Priority Tier não é suportado. Se você tem um compromisso de Priority Tier, essa capacidade não é transferida.
O que as cargas de trabalho reais realmente custam
Tarifas são abstratas. O que segue não é.
Uma sessão de codificação. O próprio exemplo prático da Anthropic coloca uma sessão de uma hora do Opus 5 em 50.000 tokens de entrada e 15.000 de saída: $0,25 mais $0,375 mais $0,08 de tempo de execução do Managed Agents, ou $0,705. Ative o cache para 40.000 desses tokens de entrada e a mesma sessão cai para $0,525, um corte de 25% sem nenhuma mudança de comportamento.
Um fluxo de trabalho empresarial. No AutomationBench da Zapier, o Opus 5 pontuou 24% em effort medium por $0,89 por tarefa, o que a Anthropic observa como "superando significativamente tanto o Claude Opus 4.8 quanto o Fable 5 a menos da metade do custo".

Uma suíte de avaliação completa. No outro extremo, a Artificial Analysis publica o quanto gastou rodando seu próprio índice:
"In total, it cost $3835.51 to evaluate Claude Opus 5 (Adaptive Reasoning, Max Effort) on the Intelligence Index."
Esse número é o contrapeso honesto para todos os gráficos de custo por tarefa acima. O Opus 5 lidera esse mesmo índice com 61 pontos, classificado em primeiro entre 190 modelos, mas queimou 100M tokens de saída para chegar lá contra uma mediana de 63M. Eficiência por tarefa concluída e gasto total são perguntas diferentes, e o Opus 5 as responde de forma diferente.

Vários clientes de acesso antecipado colocaram números no mesmo efeito. Uma equipe de agentes jurídicos relatou 26% menos tokens para desempenho similar em relação ao Opus 4.8 em max reasoning, e um benchmark de trading chegou a "aproximadamente um sétimo dos tokens de reasoning e menos da metade da latência". Esses dados vêm dos fornecedores e sem nome, então devem ser ponderados de acordo, mas a direção é consistente em seis relatos independentes.
Claude Pro, Max, Team e Enterprise
Nem todo mundo recorre à API. Segundo o post de lançamento, o Opus 5 é o novo modelo padrão no Claude Max e o modelo mais forte no Claude Pro.
| Plano | Mensal | Anual | Acesso ao Opus 5 |
|---|---|---|---|
| Free | $0 | $0 | Não, apenas Sonnet e Haiku |
| Pro | $20 | $17/mês, $200 adiantado | Sim, mais Fable via créditos |
| Max 5x | $100 | Somente mensal | Sim, modelo padrão |
| Max 20x | $200 | Somente mensal | Sim, modelo padrão |
| Team (standard) | $25/assento | $20/assento | Sim |
| Team (premium) | $125/assento | $100/assento | Sim, 5x o uso padrão |
| Enterprise | - | $20/assento mais uso | Sim, contexto de 500k |
Os preços são da página de preços da Claude. Dois detalhes que confundem compradores:
- Os limites são baseados em sessões, não em mensagens. Eles se reiniciam numa janela móvel de cinco horas com limites semanais por cima, e web, desktop, mobile e Claude Code puxam todos do mesmo pool. Não existe uma contagem de mensagens contra a qual planejar.
- Planos pagos transbordam para tarifas de API. Ao atingir um limite, você pode ativar créditos de uso para continuar trabalhando nas tarifas padrão, e é aí que os $5 e $25 mencionados acima começam a valer para um assento de assinatura.
Esse modelo de sessão está produzindo experiências muito diferentes no mesmo lançamento, e a divisão acompanha quase perfeitamente o nível do plano. Um usuário do Max 20x:
"I have now been using Opus 5 only (since I'm out of Fable) for about 7 hours and it drained about 6% of my weekly usage."
E um usuário Pro na mesma semana:
"I'm only on the Pro plan but a single prompt with Opus 5 w/ high thinking used 100% of my 5-hour usage limit."
Ambos podem ser verdade, porque um limite de sessão é um pool de tokens e o Opus 5 gasta dele mais rápido em effort alto. Num assento Pro de $20, esse pool é pequeno o suficiente para que um único prompt intensivo em thinking o esgote. A solução prática a que as pessoas chegaram não é um upgrade de plano: é reduzir o effort para trabalho rotineiro e reservar o high para as tarefas que realmente precisam dele.
Para equipes que pesam a via de assinatura contra o gasto bruto de API, nosso guia de preços do Claude Code e o passo a passo do Claude Code empresarial cobrem a conta de assentos. A configuração de modelo no Claude Code é onde você fixa o Opus 5 em vez de deixá-lo escolher automaticamente, e o guia de seleção de modelo cobre quando deixá-lo cair para um nível mais barato. Se você ainda está decidindo se todo o ecossistema serve para você, nossa análise do Claude e o guia de preços do Claude Cowork dão a visão mais ampla.
Bedrock, Vertex, Foundry e a peculiaridade do CCU
O Opus 5 está disponível em todas as plataformas desde o primeiro dia, mas a cobrança não é idêntica.
- Amazon Bedrock e Google Cloud são operados por parceiros. O provedor de nuvem emite sua fatura, e a Anthropic aponta para os preços do Bedrock e os preços do Vertex AI como a fonte de verdade em vez de publicar suas próprias tarifas.
- Endpoints regionais carregam uma sobretaxa de 10% em relação aos globais em ambas as nuvens.
- A Claude Platform na AWS e o Microsoft Foundry cobram em Claude Consumption Units. Elas são avaliadas em USD nas tarifas padrão por modelo e depois convertidas a $0,01 por CCU com medição horária. Sua fatura mostra um único item de linha de CCU, não um detalhamento de tokens.
- O modo fast é exclusivo de primeira parte. Ele não existe no Bedrock, Google Cloud ou Foundry.
Se sua equipe financeira está conciliando uma fatura da AWS com um modelo por token, a conversão de CCU é onde os dois deixam de bater.
O que os desenvolvedores estão dizendo
A reação da semana de lançamento se dividiu quase imediatamente em dois grupos, e a divisão é inteiramente sobre tokens, não sobre tarifas. O primeiro grupo fez as contas e descobriu que o preço plano escondia um aumento real.
"At the same levels of thinking it's appears that Opus 5 in it's current form uses about 2x the amount of output tokens to do similar tasks. So per token is the same, but the models don't use the same amount of tokens to do the same task."
Um desenvolvedor gastou dinheiro de verdade para resolver a questão. Rodando a mesma tarefa em diferentes níveis de effort, ele registrou o Opus 5 em $0,41514 no low e $0,801965 no medium, contra $0,210415 do Opus 4.8 no low:
"At matched effort, Opus 5 spends roughly 2x the output tokens of 4.8."
Rankings de terceiros captaram o mesmo sinal por outro ângulo:
"Vals Index Opus 4.8 > 5.0 goes from $2.90 to $8.54, for 4% gain ... That is a massive cost increase. Sure, 20% cheaper then Fable, but that is a 3x price increase compared to Opus 4.8 in that test."
O mecanismo que as pessoas continuam descrevendo é o scope creep, o mesmo comportamento contra o qual a própria documentação da Anthropic alerta ao dizer para excluir instruções de verificação herdadas porque o Opus 5 verifica seu próprio trabalho sem ser solicitado:
"it just reviews every minor change with unnecessary checks that would take a couple minutes to check manually, it wants to spend an hour and spend $25 of tokens"
O contra-argumento é justo e vale a pena guardar. O total de tokens queimados é o denominador errado se o modelo termina um trabalho que o mais barato abandona:
"When we look at some benchmarks that publish the cost per successful task, Claude seems to be way cheaper than I expected. For example on https://livebench.ai/
here the cost per successful task for Opus 5 is lower than Sol."
E bastante gente está simplesmente satisfeita com a troca:
"I switched from 4.8 to 5 yesterday and I'd have to say that I've noticed an improvement, though not hugely perceptible, the model seems to want to do more work per turn, possibly a tiny bit faster, and little less verbose when it isnt necessary to be so."
Minha leitura: os dois grupos estão certos, e a discordância na verdade é sobre contra qual denominador você está cobrando. Se você mede tokens, o Opus 5 ficou mais caro. Se você mede tarefas concluídas, ficou mais barato. Qual dos dois descreve o seu negócio é a pergunta real que esta página de preços não consegue responder por você.
O Claude Opus 5 vale os $5 e $25?
Para trabalho agêntico de longo prazo, sim, e o argumento não é realmente sobre a tarifa. O Opus 5 cobra o mesmo que o Opus 4.8 cobrava enquanto marca 96,0% no SWE-bench Verified e mais que dobra o 4.8 no Frontier-Bench. Quando uma execução custa $0,89 e termina em vez de custar $0,40 e falhar duas vezes, o modelo mais barato por token nunca foi realmente mais barato.
Três ressalvas honestas antes de padronizá-lo:
- É verboso, e a verbosidade é cobrada a $25. A Artificial Analysis o chama de "particularmente caro em comparação com outros modelos de preço semelhante" e "notavelmente lento e muito verboso". Orce tempo de engenharia de prompt para controle de tamanho, porque o effort sozinho não vai resolver isso.
- A alucinação foi levemente na direção errada. O system card declara sem rodeios que o modelo "aluciona afirmações factuais ligeiramente mais do que o Opus 4.8, apesar de ser mais preciso em geral".
- Modelos mais baratos ainda vencem muito trabalho. Para classificação, roteamento e redação em massa, o Claude Sonnet 5 a 40% do preço é a melhor compra, e o Haiku é ainda melhor. Se você está comparando opções, nosso panorama de alternativas ao Opus 4.6 e as anteriores alternativas ao Opus 4.5 cobrem o terreno, com preços do Mistral e preços do Groq na ponta mais barata.
Onde o modelo se encaixa numa cadeia de ferramentas real é uma pergunta separada da tabela de tarifas. Nossos panoramas de assistentes de codificação com IA, ferramentas de desenvolvedor da Claude e Cursor são onde isso se decide na prática.
Para registro, meu próprio padrão em ferramentas internas é effort high com cache de 1 hora no system prompt e Batch para tudo que puder esperar. Essa combinação faz a maioria dos trabalhos ficar entre um quarto e a metade da fatura ingênua na tarifa padrão.
Onde a fatura de tokens deixa de ser seu problema
Tudo acima assume que você quer ser dono do encanamento: a lógica de retentativa, o ajuste de effort, a invalidação de cache, o fallback quando um classificador de segurança recusa uma requisição. Isso é um projeto de engenharia de verdade, e já vi vários clientes técnicos deixarem a eesel para construir exatamente isso diretamente na API da Claude.
Alguns deles ficam perfeitamente satisfeitos. Outros acabam onde este cliente acabou:
"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."
Karel, GENERAL BYTES
Essa é a decisão real por trás de uma página de preços do Claude Opus 5. Se você quer um modelo de ponta respondendo tickets de suporte, a tarifa por token é talvez um quinto do trabalho. O resto é fundamentá-lo na sua central de ajuda e tickets passados, mantê-lo em silêncio nas perguntas que ele não deveria tocar, e saber o que ele vai fazer antes de tocar numa fila ao vivo.

A eesel é exatamente essa camada, vendida como um preço por tarefa com o gasto do modelo já incluído, então um mês corrido aparece como mais tickets resolvidos em vez de uma fatura de tokens que você precisa explicar. Você pode simulá-la contra seus próprios tickets históricos antes que ela responda a alguém, e conectá-la em poucos minutos. Experimente a eesel gratuitamente.
Se conteúdo em vez de suporte é o seu caso de uso, a mesma lógica move nosso redator de blog com IA, e os guias sobre o melhor LLM para blog e como fazer o conteúdo de IA soar humano são o ponto de partida.
Perguntas frequentes
Quanto custa o Claude Opus 5 por milhão de tokens?
O Claude Opus 5 é mais caro que o Claude Opus 4.8?
Qual é a forma mais barata de rodar o Claude Opus 5?
O preço do Claude Opus 5 muda com a janela de contexto de 1M?
Quanto custa o Claude Opus 5 nos planos Pro e Max?
Claude Opus 5 ou Claude Sonnet 5, qual tem melhor custo-benefício?
O que o modo fast acrescenta ao preço do Claude Opus 5?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.






