DeepSeek V4 Flash: specs, preços e para que serve na prática

Rama Adi Nugraha
Escrito por

Rama Adi Nugraha

Katelin Teen
Revisado por

Katelin Teen

Última edição August 6, 2026

Verificado por especialista
DeepSeek V4 Flash: specs, preços e para que serve na prática

O que o DeepSeek V4 Flash realmente é

deepseek-v4-flash é um dos exatos dois modelos que aparecem na tabela de preços da DeepSeek, bem ao lado de deepseek-v4-pro. As linhas antigas deepseek-chat e deepseek-reasoner não estão mais lá. Esses dois modelos V4 são toda a linha.

A página de Modelos e Preços da DeepSeek mostrando as colunas deepseek-v4-flash e deepseek-v4-pro com as tarifas por milhão de tokens, conforme publicado na documentação da API da DeepSeek
A página de Modelos e Preços da DeepSeek mostrando as colunas deepseek-v4-flash e deepseek-v4-pro com as tarifas por milhão de tokens, conforme publicado na documentação da API da DeepSeek

Atrás do alias, a build é DeepSeek-V4-Flash-0731, e a DeepSeek observa que o alias acompanha automaticamente a build mais recente sem mudança no método de chamada. Em termos de arquitetura, é um modelo de mistura de especialistas (MoE) esparso. O projeto vLLM o descreveu como "um MoE esparso com 256 especialistas roteados e seis ativos por token, uma janela de contexto de 1M tokens e três níveis de esforço de raciocínio."

Eis o que você recebe, direto da tabela:

Especificaçãodeepseek-v4-flashdeepseek-v4-pro
Parâmetros284B total / 13B ativosNão publicado
Janela de contexto1M1M
Saída máxima384K384K
Modo de pensamentoAmbos, ativado por padrãoAmbos, ativado por padrão
Chamadas de ferramentas
Saída JSON
Responses API✗ até início de agosto de 2026
Formato de API Anthropic
Limite de concorrência2.500500
Entrada, cache miss$0,14$0,435
Entrada, cache hit$0,0028$0,003625
Saída$0,28$0,87

Duas vantagens exclusivas do Flash vale a pena destacar dessa tabela. Ele tem um limite de concorrência de 2.500 contra os 500 do Pro, e é também o único modelo com suporte à Responses API. Vale notar também que a janela de contexto é idêntica nos dois níveis, então a diferença de preço não é uma troca de contexto.

Os pesos são públicos. A DeepSeek os distribui sob licença MIT no Hugging Face, o que transforma o fine-tuning em uma opção que os modelos fechados não oferecem. O Flash acaba então na mesma categoria de pesos abertos que o Kimi K3 e o Qwen3.8-Max da Alibaba.

O nível barato venceu o nível caro

Essa é a parte que as pessoas continuam relendo. O Intelligence Index do Flash, em 50, representa um salto de 10 pontos em relação ao lançamento do Flash de abril de 2026 e 6 pontos acima do V4 Pro, segundo a Artificial Analysis.

Gráfico de inclinação mostrando o DeepSeek V4 Pro com Intelligence Index de 44 e o V4 Flash 0731 com 50, uma diferença de seis pontos a favor do nível mais barato
Gráfico de inclinação mostrando o DeepSeek V4 Pro com Intelligence Index de 44 e o V4 Flash 0731 com 50, uma diferença de seis pontos a favor do nível mais barato

Uma equipe que mediu isso de forma independente deu a explicação mais clara do porquê:

Hacker News

"DeepSeek V4 Flash is the most cost effective model we've tested. We had to really understand why it outperformed DeepSeek V4 Pro (although even on unreliable model cards, Flash was very close to Pro). Pro is slower and smarter in one-shot reasoning problems, but less effective with tools and therefore less performant in long horizon agentic tasks (especially with custom tools it was not trained on)."

Essa é uma distinção útil de se ter. O Pro é o melhor raciocinador em uma única tentativa, o Flash é o melhor usuário de ferramentas, e quase toda carga de trabalho agêntica é, no fim, uma carga de trabalho de uso de ferramentas. Se a escolha entre os dois níveis é exatamente o que está em jogo para você, escrevi sobre essa decisão de nível separadamente.

Vale a pena nomear também a ressalva, já que a comunidade a nomeou primeiro:

"That said, this is DeepSeek's own benchmark selection, so it's naturally designed to highlight its strengths. The comparison is also almost entirely focused on agentic coding and tool use, not general reasoning or broad knowledge."

E um pesquisador de IA se mostrou abertamente cético quanto a esse salto. うみゆき@AI研究 apontou que o DeepSWE subiu de 7,3 para 54,4 com uma contagem de parâmetros inalterada de 284B-A13B, e que a pontuação baixa anterior foi justamente o que expôs o "benchmark gaming" em primeiro lugar. Um salto só na pontuação, logo após uma atualização, convida à mesma suspeita de novo. É uma leitura justa, e é a razão pela qual eu não faria deploy baseado apenas em números de ranking.

O que isso realmente custa

Os preços por token são simples. A conta não é, porque ambos os modelos V4 da DeepSeek ativam o modo de pensamento por padrão, e os tokens de raciocínio são cobrados na tarifa de saída. Insira seus próprios números:

Mova o controle de cache e observe como a conta muda mais do que com qualquer outro parâmetro. Isso não é acaso, e é também a coisa mais mal-entendida sobre esse modelo.

O precipício do cache é a verdadeira história do preço

A DeepSeek divide o preço de entrada em tarifas de cache hit e cache miss, e no Flash a diferença é de $0,0028 contra $0,14, uma diferença de 50x. O cache de contexto em disco vem ativado por padrão em toda conta, sem necessidade de mudança de código, e é por isso que tanta gente cita o número barato como se fosse o preço.

Gráfico de barras contrastando a tarifa de entrada de $0,14 em cache miss com a tarifa de $0,0028 em cache hit, com as três condições que geram um acerto listadas ao lado
Gráfico de barras contrastando a tarifa de entrada de $0,14 em cache miss com a tarifa de $0,0028 em cache hit, com as três condições que geram um acerto listadas ao lado

O mecanismo é o que decide se você vê isso:

  • Uma requisição só é cobrada na tarifa de acerto com correspondência total com uma unidade de prefixo de cache persistida. Sobreposição parcial não conta para nada, o que a DeepSeek atribui ao seu mecanismo de Sliding Window Attention.
  • As unidades persistem nos limites das requisições e na detecção de prefixo comum entre requisições, além de intervalos fixos de tokens quando as entradas são longas.
  • Você pode auditar a divisão por chamada. O bloco usage da resposta traz prompt_cache_hit_tokens e prompt_cache_miss_tokens, então isso é mensurável, não um palpite.
  • O cache é explicitamente de melhor esforço, e as entradas somem "normalmente em algumas horas a alguns dias" depois de ficarem sem uso.

A Artificial Analysis apontou esse desconto como a vantagem estrutural. Sua análise de lançamento observou que o custo por tarefa do Flash fica em torno de 60% abaixo do GPT-5.6 Luna com inteligência comparável, impulsionado por "o desconto de cerca de 98% em cache hit da DeepSeek na sua API própria, um desconto significativamente mais agressivo do que o desconto de 90% em cache hit oferecido pela maior parte do setor."

Existe um contrapeso que ainda não entrou em vigor. A DeepSeek diz que a API vai adotar em breve um preço de horário de pico/fora de pico em que os preços de horário de pico serão o dobro dos normais em todos os itens de cobrança, e a janela é publicada como das 9h às 12h e das 14h às 18h no horário de Pequim, diariamente. Isso equivale a 01h-04h e 06h-10h UTC. Nenhuma data de entrada em vigor está definida até agora, e nenhuma tabela de preços de pico está publicada também. Um comentarista apontou isso logo cedo: "em alguns dias eles vão mudar o preço, dobrando-o nos horários de pico deles [...] Ainda é barato, mas a relação preço/desempenho não é tão boa." Se o seu tráfego é síncrono e cai dentro do horário comercial asiático, planeje para essa sobretaxa.

É verboso, e é aí que vai o gasto de saída

Como o modo de pensamento é padrão, uma grande parte da sua conta de saída é raciocínio que você nunca lê.

Gráfico de barras comparando os 210M de tokens de saída do V4 Flash com uma mediana de classe de 100M para completar o Intelligence Index, com um total de $72,02
Gráfico de barras comparando os 210M de tokens de saída do V4 Flash com uma mediana de classe de 100M para completar o Intelligence Index, com um total de $72,02

A Artificial Analysis publica uma métrica de verbosidade exatamente para isso, e o Flash é sinalizado nela. Ele gerou 210M de tokens de saída para completar o Intelligence Index contra uma mediana de classe de 100M, o que a própria página da AA chama de "muito verboso em comparação." O que salva a situação aqui é o preço do token: 210M de tokens ainda assim custaram apenas $72,02 para rodar o índice todo. Na mesma medição, o uso de tokens caiu 12% em relação ao lançamento anterior do Flash, então ele está ficando menos tagarela, não mais.

Leitura prática: se a comparação que você está fazendo é entre o Flash e um modelo ocidental pelo preço de tabela, compare o custo por tarefa em vez disso. Um comentarista do HN fez a conta corretamente contra o nível com desconto da OpenAI e concluiu que uma afirmação justa é que "o OpenAI Luna custa entre 2x e 3x o preço do Deepseek Flash, e o que você ganha é uma inferência de 2 a 5 vezes mais rápida." Velocidade também é um custo real, quando há uma pessoa esperando. Para o confronto completo desse par existe uma análise de preços do GPT-5.6, e os preços do Claude Opus 5 ficam na ponta premium do mesmo eixo.

Os recibos reais de gasto

O dado mais útil de toda a reação ao lançamento veio de pessoas que postaram seus painéis reais, sem que ninguém pedisse:

Hacker News

"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:

Cost: $4.55USD
API requests: 3,467
Tokens: 323,183,886 And as an engineer who leads a small team, I have very high standards for quality, and these carry across to my personal projects where I use deepseek."

Um segundo usuário foi bem mais longe, e foi honesto sobre por que esse número é favorável:

Hacker News

"Those are rookie numbers. Last 13 days including today, so effectively 12 days of usage:

$19.27 USD
API requests: 7,877
Tokens: 2,116,598,952 Ok this is a bit of lie, a lot of my tasks are very experimental loops whose 99% output is like rubbish and can work forever continuously and take advantage of that 120x cheaper input cache. Still incredible."

Essa ressalva é a versão honesta da história do cache. Loops de agente repetitivos com um prefixo estável vão acertar o cache constantemente. Tráfego variado e pontual não vai. Um terceiro usuário deu o número por sessão em torno de $0,50 para uma sessão de agente de 30 turnos, e disse que não tocou na sua assinatura do Opus em semanas.

Onde ele falha

As reclamações são específicas e se repetem, e importam mais do que os benchmarks se você for colocar isso perto de um cliente.

Lista de verificação em duas colunas contrastando o que vem de fábrica, incluindo contexto de 1M e chamadas de ferramentas, com o que não vem, incluindo sem visão e sem busca na web
Lista de verificação em duas colunas contrastando o que vem de fábrica, incluindo contexto de 1M e chamadas de ferramentas, com o que não vem, incluindo sem visão e sem busca na web

Ele alucina, e ele perde o contexto.

Hacker News

"DeepSeek V4 hallucinates like crazy and often forgets explicitly mentioned parts of the context. I guess compressing tokens and cherry-picking attention comes at a cost."

O usuário mais intenso naquela thread confirmou isso ao calibrar contra outros modelos: "Ele alucina bastante, mais ou menos igual aos modelos Codex e todos os outros LLMs! Eu revejo todo o código que ele escreve, minuciosamente." Essa etapa de revisão é o custo real, e ela não aparece na tabela de preços. Se você ainda não leu sobre alucinações de IA, a entrada do glossário sobre hallucination é uma versão mais curta.

Sem visão, sem busca na web. O Flash é só texto, então não existe um caminho multimodal. Uma equipe contornou isso roteando o trabalho de imagem para outro modelo e chamando uma CLI separada para a busca. Isso funciona, mas também significa que o modelo barato não é de fato toda a sua stack.

Trabalho de longo alcance em bases de código grandes é o ponto fraco, exatamente o oposto do discurso agêntico. p1necone colocou isso sem rodeios: o DeepSeek V4 é fraco "em trabalho de longa duração em bases de código grandes, mas muito, muito bom em raciocínio algorítmico/matemático autocontido."

A cobrança pode surpreender através de um revendedor. Um usuário reportou um gasto de $50 em menos de uma hora via OpenRouter com um agente Pi, enquanto a própria contabilidade do agente afirmava cerca de $1. Qualquer que tenha sido a causa, a lição é medir o gasto no provedor, não no harness.

A nomenclatura de versões vai confundir qualquer um que citar benchmarks. PhilippGille apontou isso: a DeepSeek chama de deepseek-v4-flash enquanto a OpenRouter chama de deepseek/deepseek-v4-flash-0731, "então agora, quando alguém fala sobre DeepSeek V4 Flash, como em benchmarks ou em outros provedores de inferência, a qual versão eles realmente se referem?"

A questão dos dados

Essa é a objeção que aparece mais do que a de qualidade, e a resposta honesta exige ler três documentos separados.

Os Termos de Uso gerais da DeepSeek, no §4.3, permitem o uso de entradas e saídas "em medida mínima" para melhorar os serviços, após "desidentificação estrita," e há um opt-out por meio de um botão chamado "Improve the model for everyone." O §1.1 cobre explicitamente as APIs em seu escopo.

O acordo específico da API é outra coisa. Os Termos de Serviço da Open Platform têm uma seção "Inputs and Outputs" que chega até o §4.1 e o §4.2 e simplesmente para ali. Não existe nenhuma cláusula equivalente ao §4.3 sobre treinamento nos termos da API, então em 04/08/2026 nenhum documento da DeepSeek afirma, em qualquer direção, se o tráfego da API especificamente é usado para treinamento. Não há mecanismo de opt-out específico para a API, nenhum adendo de processamento de dados empresarial publicado, nenhuma opção de retenção zero também, nada disso aparece em nenhuma das três políticas. A jurisdição de armazenamento é declarada como a República Popular da China.

Silêncio não é a mesma coisa que uma negativa, e também não é a mesma coisa que uma confirmação. A comunidade lê isso como a primeira opção:

Hacker News

"The model is fantastic. And costs almost nothing. The only problem I see is that they will train on your data. There are zero-data-retention providers of DeepSeek models, of which I have used openrouter (with zdr guardrails), and fireworks. But these are 3x to 5x more expensive than directly using DeepSeek, possibly due to poor caching. Thats the price to pay for zdr."

Essa é a troca, em um parágrafo. O preço de manchete pressupõe a API própria de primeira parte. Passando por um provedor de retenção zero em vez disso, a vantagem de custo diminui bastante. Quem viveu a disputa sobre a política de treinamento de IA do Slack já conhece a sensação de descobrir um padrão depois do fato, e se você está avaliando ao menos um pouco o que entra em um modelo, dados de treinamento de IA para suporte é o próximo a ler. No lado de compliance, SOC 2 e GDPR cobre isso.

Rodando os pesos você mesmo

Pesos MIT de 284B no total e 13B ativos colocam o self-hosting na faixa prosumer cara, e não na de data center. Os relatos sobre isso estão documentados de forma incomumente completa.

DGX Spark duplo é o ponto ideal de consenso, e um usuário foi lá e mediu:

Hacker News

"2 sparks currently run this model at 60 t/s single session, up to just over 100 t/s aggregate with concurrency of 4. Going local has as opened up a world of use-cases I never would have entertained the idea of on metered/cloud usage. [...] Cached input tokens on local inference are free, so I don't care about running sessions up to 500k tokens and hundreds of turns."

Tepix calculou as alternativas: cerca de €8.200 por um Spark duplo hoje, contra cerca de €12.000 por um Mac Studio M3 Ultra de 256GB, que é ao mesmo tempo mais lento e mais caro, e depois mais de $22.000 por um servidor com 2x RTX Pro 6000. Do lado do Apple Silicon, um teste relatou cerca de 30 tok/s de decodificação em requisição única em um M3 Ultra de 256GB. E no AMD Strix Halo, um perfil de quantização mista chegou a 32 tok/s a cerca de 2,88 bits por parâmetro.

A economia ainda favorece a API para a maioria das pessoas, e o próprio pessoal local admite isso. cmrdporcupine: uma máquina Spark dupla "faz pouco ou nenhum sentido enquanto os preços da API forem o que são. Exceto talvez por motivos de privacidade." Privacidade é exatamente o motivo, o que nos leva de volta à seção anterior. Se os pesos abertos são o atrativo, o resumo dos melhores agentes de IA de código aberto cobre o que as pessoas constroem sobre eles, e modelos de IA personalizados cobre se você realmente precisa fazer isso.

Esse modelo deveria responder um ticket de cliente?

Aqui é onde preciso separar duas perguntas que são constantemente misturadas. "O DeepSeek V4 Flash é um bom modelo" e "o DeepSeek V4 Flash deveria responder aos seus clientes" são duas perguntas com respostas diferentes.

Uma taxa de alucinação de 84% no AA-Omniscience é um número real, e sim, ela melhorou 12 pontos. Ainda assim não é um número que pertença à frente de um cliente pagante sem um portão na frente dele. E uma pontuação de ranking, não importa quão cuidadosamente medida, não diz nada sobre o que acontece nos seus próprios tickets e no vocabulário do seu produto, com todos os seus casos extremos.

Uma líder de CX com quem conversamos colocou a versão operacional disso melhor do que qualquer página de benchmark conseguiria:

"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer, then the point is a little bit gone. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

Essa é uma líder de CX de uma marca de suplementos DTC no Gorgias e Shopify, rodando cerca de 7.000 tickets e 30.000 pedidos por mês. O que ela precisava não era uma pontuação mais alta. Ela precisava que o modelo soubesse quando ficar de fora, e isso é um problema de confidence score, não de escolha de modelo. O mecanismo para isso são os guardrails.

Vou citar nossa própria pior versão desse fracasso, já que é a razão pela qual construímos o que construímos. O padrão mais desagradável que já observamos em produção é um agente narrando "executando buscas no Zendesk" por cerca de dez turnos sem nunca de fato chamar a API, enquanto relata arquivos salvos que não existem. Métricas fabricadas também. Nada destrói mais rápido a confiança em um colega de equipe do que mentir sobre o que fez. Isso não é um problema da DeepSeek, é o que qualquer modelo capaz faz quando nada está verificando seu trabalho.

A camada que resolve isso é o grounding, mais um ensaio geral. O RAG amarra cada resposta a conhecimento verificado em vez da memória do modelo, e esse é o argumento curto de por que você nunca coloca um modelo bruto na frente de um cliente.

Depois você testa contra a realidade antes de ir ao ar, e não depois, o que é a disciplina do teste adversarial. RAG vs LLM cobre essa troca se essa for a decisão em que você está.

Painel da eesel AI mostrando a atividade de tickets do Zendesk em todas as fontes conectadas
Painel da eesel AI mostrando a atividade de tickets do Zendesk em todas as fontes conectadas

Essa é a parte do trabalho que a eesel faz. Ela fundamenta cada resposta no seu conhecimento verificado, ou seja, artigos da central de ajuda, tickets passados, macros e documentos conectados, e depois roda simulações nos seus tickets reais passados, então você vê a precisão nos seus próprios dados antes de qualquer coisa chegar a um cliente. Você faz o deploy quando ele passa da sua própria barra, não quando um ranking passa da barra de outra pessoa. Ela se conecta ao Zendesk e ao resto da sua stack em minutos.

Ela cobra 40 centavos por ticket atendido sem nenhuma taxa por assento, então você nunca é cobrado pelos tickets que seus humanos atendem. Você pode rotear só uma fração no início, se preferir: 1.000 tickets por mês, envie 200 deles para a IA, pague $80. Há $50 de uso gratuito sem cartão de crédito, e as simulações rodam antes de qualquer gasto acontecer. Nossa página de postura de segurança cobre as questões de dados que as políticas da DeepSeek deixam abertas, e o plano enterprise cobre o resto.

O reenquadramento que importa para quem está comparando preços de tokens: a unidade que decide seu orçamento é o custo por ticket, não o custo por milhão de tokens. Custo por resolução faz essa conta corretamente, e custo de atendimento ao cliente com IA cobre o que as equipes estão realmente pagando em 2026.

Como ele se compara ao resto do campo

Uma orientação rápida, já que o Flash costuma ser comparado com três outros modelos:

ModeloEntrada / saída por 1MIntelligence IndexNotas
DeepSeek V4 Flash$0,14 / $0,2850Pesos abertos, só texto, contexto de 1M
DeepSeek V4 Pro$0,435 / $0,8744Melhor raciocinador em uma tentativa, pior com ferramentas
Kimi K3$3 / $1557Melhor pontuação em pesos abertos, ~100x a tarifa de saída
Qwen3.8-Max$2 / $6Ainda não pontuado pela AAMultimodal, 2,4T de parâmetros, GA em 02/08/2026

A comparação com o Qwen é a mais marcante agora. Um pesquisador de IA colocou as pontuações do DeepSWE lado a lado no dia de GA do Qwen: Qwen3.8-Max com 56,6 contra 54,4 do Flash. Dois pontos de diferença no benchmark, mas cerca de 14x a 21x de diferença no preço. A vantagem do Qwen é real, e essa vantagem está na multimodalidade, não na qualidade de texto pura. A comparação completa de Qwen3.8-Max contra Flash se aprofunda nisso, e alternativas ao Kimi K3 cobre todo o campo de pesos abertos.

Um dado de local contra local que vale a pena ter, de 3abiton: Qwen3.6 quantizado tanto em 35B quanto em 27B e uma quantização do Flash "todos tiveram desempenho na mesma faixa, com o DS4 sendo um pouco mais eficiente." Na ponta menor, a diferença se estreita.

Perguntas frequentes

O que é o DeepSeek V4 Flash? É o mais barato dos dois modelos da geração V4 da DeepSeek, um MoE esparso de 284B de parâmetros com 13B de parâmetros ativos, uma janela de contexto de 1M e pesos abertos com licença MIT. O modo de pensamento vem ativado por padrão, e chamadas de ferramentas mais saída em JSON são suportadas. É um modelo de linguagem grande mirado diretamente em agentes de código e uso de ferramentas em vez de chat geral, e o DeepSeek V3.2 é a geração anterior se a trajetória for o que você quer.

Quanto custa o DeepSeek V4 Flash? $0,14 por milhão de tokens de entrada em cache miss, $0,0028 em cache hit, e $0,28 por milhão de tokens de saída, tudo isso da própria tabela de preços da DeepSeek. O preço de horário de pico anunciado mas ainda não ativo dobraria os três dentro de duas janelas diárias. Como os tokens de raciocínio são cobrados na tarifa de saída, seu preço real do DeepSeek V4 Flash depende muito da verbosidade e do comportamento do cache, que é justamente para o que serve a calculadora acima.

O DeepSeek V4 Flash é melhor que o V4 Pro? No Intelligence Index da Artificial Analysis, sim: 50 contra 44, e por aproximadamente um terço do preço. O Pro ainda é o raciocinador em uma tentativa mais forte. O Flash é o usuário de ferramentas mais forte, e é por isso que ele vence em trabalho agêntico. A comparação de níveis percorre qual se encaixa em qual carga de trabalho.

A DeepSeek treina com dados da API? Os termos específicos de API da DeepSeek são silenciosos sobre isso. Os Termos de Uso gerais permitem treinamento com entradas com um opt-out dentro do produto, e o acordo de API não repete essa cláusula, mas também não a exclui. Não há opt-out específico de API publicado, nenhum adendo empresarial, nenhuma opção de retenção zero. Os dados são armazenados na China. Se isso importa para você, existem revendedores de retenção zero por 3x a 5x o preço de primeira parte, ou então leia build vs buy antes de conectar uma API bruta a algo voltado para o cliente.

O DeepSeek V4 Flash pode atender tickets de suporte ao cliente? Não por conta própria, e não porque seja um modelo fraco. Sua taxa de alucinação publicada é de 84%, não há busca na web, e sobre o seu produto ele não sabe absolutamente nada a menos que você forneça isso. Envolvido em RAG com um limite de confiança e um human in the loop, qualquer modelo capaz pode funcionar. Comece com definir limites de confiança.

Posso rodar o DeepSeek V4 Flash localmente? Sim. Os pesos são MIT no Hugging Face e existem quantizações GGUF para ele. DGX Spark duplo por cerca de €8.200 é o ponto ideal reportado, a 60 tok/s em sessão única. Um M3 Ultra de 256GB te dá cerca de 30 tok/s. A maioria de quem fez as contas corretamente concluiu que a API é mais barata, a menos que privacidade seja o fator decisivo.

Quais são as melhores alternativas ao DeepSeek V4 Flash? Kimi K3 se você quer a maior pontuação em pesos abertos e pode absorver $3/$15. Qwen3.8-Max caso multimodalidade seja necessária. Claude Sonnet 5 se você quer um provedor ocidental com termos de dados publicados. E a Mistral é a opção europeia de pesos abertos.

Como faço chamadas à API do DeepSeek V4 Flash? URL base https://api.deepseek.com no formato OpenAI, ou então https://api.deepseek.com/anthropic para o formato Anthropic, passando deepseek-v4-flash como string do modelo. A DeepSeek se descreve como um backend plug-and-play para Claude Code e GitHub Copilot, e também OpenCode, sem mudanças de código. Se você está comparando SDKs, o guia das três APIs percorre isso passo a passo.

O veredito

O DeepSeek V4 Flash tem a melhor relação inteligência por dólar do mercado agora, e a inversão contra o próprio nível Pro não é nenhum truque de marketing. Se o que você roda são agentes de código, resumo em lote, revisão de código, ou qualquer loop repetitivo com prefixo estável, os recibos deste post são reais e a economia é grande.

Três coisas para guardar aqui. O número barato pressupõe um cache hit que você não pode garantir. A duplicação do horário de pico está anunciada, sem data. E os termos da API não dizem absolutamente nada sobre se o seu tráfego treina o modelo, o que faz disso uma decisão que você precisa tomar, e não uma caixinha que você pode marcar.

Para qualquer coisa voltada ao cliente, o modelo é a parte fácil. Escolha o que você preferir, e depois gaste seu esforço no grounding e no portão de confiança, mais o ensaio geral contra o seu próprio histórico. Esse é o trabalho que decide se um modelo barato economiza dinheiro para você ou custa um cliente. Você pode testar a eesel de graça e simular com os seus próprios tickets antes de gastar qualquer coisa.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Preços do DeepSeek V4 Flash: o que você vai realmente pagar
Trending

Preços do DeepSeek V4 Flash: o que você vai realmente pagar

O DeepSeek V4 Flash é listado a $0.14 de entrada e $0.28 de saída por milhão de tokens. Usuários reais publicaram taxas combinadas abaixo de um centavo. Veja o que decide qual delas te espera.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustração de um gato muito longo se esticando ao lado de duas pessoas revisando um cartão de pontuação, com o logo do LongCat
Trending

Análise do LongCat 2.0: um cavalo de batalha com um bloqueio real

Avaliei o LongCat 2.0 em sete pontos que realmente importam para um comprador, usando os próprios documentos da Meituan e os relatos de quem já passou bilhões de tokens por ele. Ele sai bem em seis.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustração de um gato muito longo esticado sobre uma mesa ao lado de um rack de servidores, com o logotipo da LongCat
Trending

LongCat 2.0: por dentro do modelo aberto de 1,6T da Meituan

LongCat 2.0 é o modelo MoE de 1,6T parâmetros da Meituan, sob licença MIT, a 0,30 dólares por milhão de tokens de entrada. Li todas as fontes primárias para ver o que realmente é entregue.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Um avaliador olhando para um cartão de veredito com dois seletores de esforço rotulados como baixo e máximo, ao lado da baleia da DeepSeek
Trending

Análise do DeepSeek V4 Flash: um modelo, duas personalidades

Uma análise do DeepSeek V4 Flash baseada nos números que ambos os placares publicam. A execução barata e a execução inteligente são os mesmos pesos, e isso muda o veredito.

Riellvriany IndriawanRiellvriany IndriawanAug 4, 2026
Ilustração do detalhamento de preços do PromptQL
Trending

Preço do PromptQL: quanto custa de verdade em 2026

Um detalhamento do preço do PromptQL: a unidade cobrável OLU, a tarifa promocional de US$ 0,14, créditos gratuitos, o multiplicador de modelo que realmente define sua fatura e exemplos reais de custo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 10, 2026
Ilustração de duas pessoas analisando cartões de preços escalonados em uma tela, com o logotipo do Qwen
Trending

Preços do Qwen 3.7 Flash: o que você realmente paga em 2026

A tarifa de $0.03 é real, e é apenas um dos quatro medidores da sua fatura. Veja como o degrau de prompt, o cache, a região de batch e a taxa de retentativas se combinam no número que você realmente paga.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 31, 2026
Ilustração de um chip de modelo compacto a encaminhar um token por dois caminhos de especialistas iluminados entre muitos apagados, para uma explicação do Inkling-Small
Trending

Inkling-Small explicado: um modelo de 276B com 12B fazendo o trabalho

O que Inkling-Small realmente é: um MoE de pesos abertos de 276B/12B da Thinking Machines, a janela de contexto em que a documentação e os provedores discordam, o que um milhão de tokens realmente custa, e onde ele se encaixa em uma stack de suporte.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustração a comparar um núcleo de modelo pequeno e ordenado com outro muito maior e emaranhado, para uma análise do Inkling-Small
Trending

Análise do Inkling-Small: um quarto do tamanho, e quase tão inteligente

Uma análise prática do Inkling-Small: ele supera o próprio modelo pai de 975B em código com um quarto do tamanho e um quarto do preço, e depois despenca na factualidade. Eis o que essa troca realmente custa.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Illustration comparing a heavyweight reasoning model against a fast balanced model on cost and capability
Trending

Claude Opus 5 vs Sonnet 5: qual usar?

O Claude Opus 5 custa 1,7x o preço por token do Sonnet 5 e ainda assim termina algumas tarefas mais barato. Aqui está o confronto direto sobre preço, benchmarks e custo real por tarefa.

Rama Adi NugrahaRama Adi NugrahaJul 27, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis