DeepSeek V4 Flash vs V4 Pro: qual plano usar?

Rama Adi Nugraha
Escrito por

Rama Adi Nugraha

Katelin Teen
Revisado por

Katelin Teen

Última edição August 3, 2026

Verificado por especialista
Ilustração comparando os planos de modelo DeepSeek V4 Flash e V4 Pro

The price card, side by side

Os dois modelos estão em uma única página, o que torna a comparação incomumente limpa. Mesmo fornecedor, mesma tabela, mesmo dia.

Página de Modelos e Preços da DeepSeek mostrando deepseek-v4-flash e deepseek-v4-pro em colunas adjacentes, retirada da documentação da API da DeepSeek
Página de Modelos e Preços da DeepSeek mostrando deepseek-v4-flash e deepseek-v4-pro em colunas adjacentes, retirada da documentação da API da DeepSeek
Item de cobrança (por 1M de tokens)deepseek-v4-flashdeepseek-v4-proPro / Flash
Entrada, cache hit$0.0028$0.0036251,29x
Entrada, cache miss$0.14$0.4353,11x
Saída$0.28$0.873,11x

Vale notar duas coisas antes de chegar aos benchmarks. Primeiro, a proporção não é uniforme: o Pro custa 3,11 vezes o Flash nas tarifas que você paga na maior parte do tempo, mas apenas 1,29 vezes em cache hits. Depois há a própria tarifa de cache. O preço de cache hit do Flash é um desconto de 50 vezes em relação ao seu próprio preço de cache miss, e o cache vem ativado por padrão, sem precisar mudar código nenhum. A Artificial Analysis chamou isso de desconto de cache hit de ~98%, mais agressivo que os 90% que a maior parte do setor oferece.

O detalhe é que uma solicitação só é cobrada na tarifa de hit quando ela corresponde totalmente a uma unidade de prefixo de cache persistida. Sobreposição parcial não conta, o que a DeepSeek atribui à sua atenção de janela deslizante. O cache também é documentado como best-effort, e entradas não usadas expiram em horas ou dias, então trate a tarifa barata como um desconto que às vezes você consegue, não uma tarifa com a qual dá para planejar.

Mais uma linha na tabela muda a conta. A DeepSeek diz que a API em breve adotará preços de horário de pico a 2x a tarifa normal, das 9h às 12h e das 14h às 18h no horário de Pequim, todos os dias. Nenhuma data de vigência foi publicada em lugar nenhum. Os números de hoje são as tarifas normais, não uma janela de desconto.

Same window, different brain

As especificações que normalmente separam um plano barato de um caro são idênticas aqui.

EspecificaçãoV4 FlashV4 Pro
Parâmetros totais284B1.6T
Parâmetros ativos13B49B
Comprimento de contexto1M1M
Saída máxima384K384K
Modo de raciocínioAtivado por padrãoAtivado por padrão
Limite de concorrência2.500500
Responses APISimAinda não

Ambos são modelos Mixture-of-Experts pré-treinados com mais de 32T de tokens. Eles compartilham o mesmo design de atenção híbrida (Compressed Sparse Attention mais Heavily Compressed Attention), além dos mesmos Manifold-Constrained Hyper-Connections e do otimizador Muon. A janela de 1M é real na configuração, não só no marketing: max_position_embeddings marca 1048576, alcançado ao estender com YaRN uma janela treinada em 64K, 16 vezes.

Figura de eficiência de contexto longo do V4 da DeepSeek mostrando a redução de FLOPs e de cache KV, publicada na nota de lançamento do V4 da DeepSeek
Figura de eficiência de contexto longo do V4 da DeepSeek mostrando a redução de FLOPs e de cache KV, publicada na nota de lançamento do V4 da DeepSeek

Então comprar o Pro não compra uma janela maior, compra 3,8 vezes os parâmetros ativos. Essa distinção importa aqui, porque parâmetros ativos compram principalmente capacidade de recuperação, e é exatamente aí que esses dois divergem. Se a ideia de um modelo menor se sair bem é nova para você, nosso texto explicativo sobre modelos de linguagem pequenos cobre o caso geral.

Entrada de imagem não está documentada em nenhum dos dois modelos. A tag de pipeline em ambos os repositórios do Hugging Face diz geração de texto, a configuração declara DeepseekV4ForCausalLM sem nenhum codificador de visão em lugar nenhum, e a linha de recursos da tabela de preços lista saída em JSON, chamadas de ferramenta e FIM sem nenhuma linha de visão. O trabalho multimodal da DeepSeek está em uma linha de modelos separada. Um desenvolvedor construindo um agente conectou um segundo modelo especificamente para cobrir visão e busca na web.

Work out what each tier actually costs you

Essa proporção de preço de 3,11x só se sustenta se os dois modelos emitirem o mesmo número de tokens, o que não acontece. A Artificial Analysis aponta o Flash como verboso: ele gerou 210M de tokens de saída para completar o Intelligence Index, contra uma mediana da classe de 100M. Tokens de raciocínio são cobrados na tarifa de saída, então a verbosidade vira um item de custo real.

O que levanta a pergunta útil. Quão mais falante o Flash precisaria ficar antes de o Pro se tornar a opção mais barata? Coloque seus próprios números.

O número para guardar é este. Só nos tokens de saída, o Flash precisa ser mais de 3,11 vezes mais verboso que o Pro antes de o Pro sair mais barato. A diferença medida pela AA em relação à mediana da classe é de cerca de 2,1 vezes. Os tokens de entrada tornam isso ainda mais difícil, já que a maioria das cargas de trabalho é pesada em entrada e a tarifa de entrada do Flash é um terço da do Pro. Na prática, o Flash vence em custo por uma distância que a verbosidade não fecha.

Vale a pena calibrar o que isso significa em termos de negócio, porém. Mesmo a tarifa do Pro é um erro de arredondamento perto de um salário, e a comparação interessante para uma equipe de suporte é IA contra um agente humano, não Flash contra Pro.

The benchmark inversion

Aqui está a parte que surpreendeu as pessoas. Em 2026-07-31, a DeepSeek lançou o DeepSeek-V4-Flash-0731, do qual diz que manteve a mesma arquitetura e tamanho e só recebeu um novo pós-treinamento. Ou seja, mesmos 284B/13B, pós-treinamento novo. A tabela agêntica publicada:

BenchmarkFlash 0731Flash PreviewPro PreviewGLM-5.2Opus 4.8
Terminal Bench 2.182.761.872.181.085.0
NL2Repo54.239.438.548.969.7
Cybergym76.738.752.783.1
DeepSWE54.47.312.846.258.0
Toolathlon-Verified70.349.755.959.976.2
Agents' Last Exam25.215.816.523.825.7
AutomationBench Public25.110.812.812.927.2
DSBench-FullStack †68.737.041.861.871.6
DSBench-Hard †59.625.831.154.571.7

O Flash 0731 supera a build do Pro nas nove linhas, e fica atrás do Claude Opus 4.8 nas nove. A mesma questão de "o plano pequeno vence o grande" também está viva em outros laboratórios, vale destacar, e normalmente se resolve ao contrário: nossa comparação de Opus 5 contra Sonnet 5 encontrou o plano caro vencendo em custo por tarefa, não só em qualidade.

Duas ressalvas que a própria DeepSeek imprime, e vou repeti-las. As linhas com † são conjuntos de teste internos. E as execuções de agente de código usaram o próprio harness da DeepSeek, que não é publicado, então ninguém ainda consegue reproduzi-las de forma independente. Um analista no X resumiu a leitura justa sem rodeios:

"DeepSeek is launching a very cheap, very capable coding-agent Flash model that looks surprisingly close to Claude Opus 4.8, especially considering it's the lightweight model. That said, this is DeepSeek's own benchmark selection, so it's naturally designed to highlight its strengths."

O ranking independente concorda na direção. A Artificial Analysis pontuou o Flash 0731 em 50 no seu Intelligence Index, seis pontos à frente do DeepSeek V4 Pro, que tem 44. Custo por tarefa: $0.03 para o Flash, $0.05 para o Pro.

Um salto do DeepSWE de 7,3 para 54,4 com uma forma de pesos inalterada realmente convida à suspeita, e pelo menos uma conta japonesa de IA de destaque disse isso diretamente. A pontuação anterior era tão fraca que a recuperação parece, para eles, um direcionamento de benchmark. Um ponto justo para manter em mente, e também por isso o número do índice independente importa mais aqui do que a tabela do fornecedor.

Where Pro still wins

A tabela cruzada da era de prévia da DeepSeek é o único lugar onde os dois modelos são medidos com o mesmo esforço de raciocínio, e é onde vive o argumento a favor do Pro.

Benchmark (esforço máximo)FlashProDiferença
SimpleQA-Verified34.157.9+23.8
Chinese-SimpleQA78.984.4+5.5
BrowseComp73.283.4+10.2
MRCR 1M78.783.5+4.8
GDPval-AA (Elo)13951554+159
MMLU-Pro86.287.5+1.3
LiveCodeBench91.693.5+1.9

A diferença de recuperação é a que deveria decidir qualquer coisa. Uma diferença de 23,8 pontos no SimpleQA-Verified não é diferença de arredondamento, é exatamente o que 13B de parâmetros ativos custam. A própria DeepSeek diz isso com suas palavras, descrevendo o Flash como levemente atrás em tarefas de conhecimento puro e nos fluxos de trabalho agênticos mais complexos, e depois limita sua alegação de paridade a tarefas de agente simples.

A busca em contexto longo pende na mesma direção. Os dois modelos anunciam 1M, mas o MRCR 1M dá 83,5 no Pro contra 78,7 no Flash, então a janela tem o mesmo tamanho enquanto encontrar a agulha não é igual. Se a sua carga de trabalho é "colocar um corpus enorme e fazer perguntas precisas sobre ele", esse é o território do Pro. Também é a carga de trabalho em que RAG em vez de contexto bruto costuma vencer de forma clara, e o fine-tuning é a terceira opção à qual as pessoas recorrem, o que nosso artigo sobre modelos de IA personalizados cobre.

Dois asteriscos importam nessa tabela. Esses números são do Flash em build de prévia, de antes da reconstrução 0731, e a DeepSeek não republicou nenhuma tabela de benchmark de conhecimento para o 0731, então não posso dizer se a diferença do SimpleQA sobreviveu a isso. Já na preferência humana, o LMArena ainda classifica o deepseek-v4-pro em 1458±4, acima do deepseek-v4-flash em 1436±4, com cerca de 49.000 votos cada. O índice automatizado e os votos humanos apontam aqui em direções opostas, o que é um bom motivo para não entregar um veredito em um único número.

The reasoning-effort trap

Se eu estivesse prestes a mover gastos entre os dois, esta é a seção que eu leria primeiro. Não é intuitiva, e também não está na tabela de preços. A DeepSeek publica um mapeamento de esforço solicitado para esforço real:

Você solicitaFlash atendePro atende
lowlowhigh
highhighhigh
xhighhighmax
maxmaxmax

Leia a coluna do Pro mais uma vez. Não há configuração barata no Pro, já que uma solicitação low é atendida como high, então você paga 3,11 vezes a tarifa do token e não consegue reduzir o orçamento de raciocínio para compensar isso. O Flash tem a peculiaridade oposta, em que xhigh rebaixa silenciosamente para high, então mexer nesse parâmetro não traz nada além de high. A DeepSeek diz que o mapeamento do Pro será atualizado no início de agosto de 2026.

O raciocínio vem ativado por padrão nos dois, com esforço high, e tokens de raciocínio são cobrados na tarifa de saída. Não existe uma string de modelo -thinking separada, é um parâmetro sobre o mesmo alias. Desligá-lo também não é uma troca pequena. O Flash sem raciocínio pontua 8,1 no HLE e 1,0 no Apex, contra 34,8 e 33,0 em max. Então, se você quer a configuração barata, está escolhendo um modelo materialmente diferente, que é a lição a que nosso guia de otimização de LLM sempre volta.

Duas pegadinhas de amostragem já que estamos nisso. No modo de raciocínio, temperature, top_p, presence_penalty e frequency_penalty não são suportados, e defini-los não gera erro nenhum, simplesmente não faz nada. Além disso, se o modelo fez uma chamada de ferramenta, você precisa devolver reasoning_content em cada turno seguinte.

Operational differences that decide it

Preço e benchmarks levam as manchetes. Estas são as coisas que realmente decidem a escolha em uma implantação real.

  • Concorrência. O Flash permite 2.500 solicitações simultâneas e o Pro permite 500. A DeepSeek não publica nenhum limite de RPM ou TPM, então a concorrência é todo o modelo de limite de taxa, contada por conta independentemente da chave, retornando HTTP 429 acima do teto. Para qualquer coisa em formato fan-out, essa diferença de 5 vezes é decisiva.
  • Responses API. Suportada só no Flash, e a DeepSeek diz que o suporte no Pro chega no início de agosto de 2026. A build 0731 também é adaptada especificamente para o Codex.
  • Pesos abertos. O Flash é lançado sob licença MIT com ~167GB em FP4/FP8 misto, com 8 finetunes e 57 quantizações já publicadas, além de um módulo de decodificação especulativa DSpark embutido no mesmo checkpoint. O Pro não tem checkpoint público próprio. Se licenciamento é o motivo de você estar aqui, plataformas de chatbot open source dá a visão mais ampla.
  • Versionamento. O alias do Flash acompanha automaticamente a build mais recente, o que significa que um benchmark citando "DeepSeek V4 Flash" pode não ser o modelo que você recebe. A reclamação de um desenvolvedor sobre o sufixo vale a pena ouvir aqui: fixe -0731 sempre que citar algo.
Ficha técnica do DeepSeek V4 da nota de lançamento da prévia do V4, publicada pela DeepSeek
Ficha técnica do DeepSeek V4 da nota de lançamento da prévia do V4, publicada pela DeepSeek

What developers actually report

A explicação mais útil de por que o modelo pequeno vence no trabalho agêntico veio de uma equipe que testou os dois e depois foi atrás do motivo:

Hacker News

"DeepSeek V4 Flash is the most cost effective model we've tested. We had to really understand why it outperformed DeepSeek V4 Pro (although even on unreliable model cards, Flash was very close to Pro). Pro is slower and smarter in one-shot reasoning problems, but less effective with tools and therefore less performant in long horizon agentic tasks (especially with custom tools it was not trained on)."

Mais inteligente de primeira, pior com ferramentas. Combina quase exatamente com a divisão dos benchmarks, e é o modelo mental mais claro que já encontrei para escolher entre esses dois.

Sobre o que as pessoas realmente gastam, aqui estão dois recibos espontâneos da thread de lançamento:

Hacker News

"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:

Cost: $4.55USD
API requests: 3,467
Tokens: 323,183,886"

Alguém que rodou os dois planos por quinze dias relatou pagar cerca de $1.50 por dia pelo Pro, e colocou a diferença em "~50% mais caro que o Flash". Isso é visivelmente mais estreito que o 3,11x da tabela, que é o que cache hits fortes somados a uma contagem de tokens do Pro mais baixa fazem a uma conta real. A outra observação dele, porém, é a que eu sublinharia: os dois planos precisam de acompanhamento, tarefas pequenas, sessões novas e verificações manuais de sanidade.

Os pontos negativos são específicos, e se repetem. Alucinação e perda de contexto aparecem com frequência:

Hacker News

"DeepSeek V4 hallucinates like crazy and often forgets explicitly mentioned parts of the context. I guess compressing tokens and cherry-picking attention comes at a cost."

A Artificial Analysis mede a mesma coisa do outro lado. A taxa de alucinação AA-Omniscience do Flash 0731 é 84%, uma melhora de 12 pontos em relação ao antecessor, impulsionada por menos alucinações e não por maior precisão. E a objeção que domina toda thread sobre a DeepSeek não tem nada a ver com qualidade:

Hacker News

"The model is fantastic. And costs almost nothing. The only problem I see is that they will train on your data. There are zero-data-retention providers of DeepSeek models, of which I have used openrouter (with zdr guardrails), and fireworks. But these are 3x to 5x more expensive than directly using DeepSeek, possibly due to poor caching."

Esse último ponto reescreve silenciosamente toda a comparação para quem lida com dados de clientes. Em um provedor de retenção de dados zero, a saída de $0.28 do Flash vira algo em torno de $0.84–1.40, o que fica acima da tarifa de primeira parte do Pro. A diferença de preço entre Flash e Pro só existe na API de primeira parte, e essa API de primeira parte é justamente aquela que você não pode apontar para uma caixa de entrada de suporte. É nesse ponto que a maioria das equipes para de comparar preços de tokens e começa a buscar automação de atendimento ao cliente que resolva a questão da retenção por elas.

What this changes if you point it at a support queue

Eu implanto integrações e a infraestrutura de modelos na eesel, então essa é a pergunta que mais me fazem. Qual modelo deveria ficar por trás do agente de IA? Depois de mais de três anos rodando IA em filas de suporte reais, minha resposta honesta é que a escolha do plano fica em algum lugar por volta do quinto lugar na lista de coisas que decidem se funciona.

Aqui vai uma evidência dos nossos próprios dados em vez de um benchmark. Em um teste com validação cruzada sobre tráfego real do Zendesk, 284 conversas mais uma checagem manual de 100 tickets em uma equipe europeia de e-commerce, a IA atingiu 93% de precisão de triagem e 100% de detecção de spam com zero falsos positivos nos 22% da caixa de entrada que era spam. A qualidade dos rascunhos saiu direcionalmente correta 88% das vezes. Mas apenas 12% dos rascunhos foram enviados como estavam, com uma taxa de erro factual de 7%. Quando investigamos por que os agentes reescreviam o resto: cerca de 65% era extensão e tom, cerca de 20% precisava de dados aos quais a IA não estava conectada, e apenas cerca de 5% era o modelo errando mesmo.

Essa divisão 65/20/5 é o argumento inteiro. Quatro quintos da diferença de qualidade eram resolvíveis conectando mais sistemas e treinando com as próprias respostas já enviadas pela equipe, e um modelo maior não faz nenhuma dessas duas coisas por você. Os piores fracassos que já vimos também não foram falhas de inteligência de forma alguma. Já tivemos clientes pagantes cujo bot fabricou respostas quando a busca na base de conhecimento não retornou nada, um deles inventando detalhes de assinatura para um cliente real. A correção ali foi um fallback rígido em caso de falha na recuperação, o que é uma decisão de pipeline, não um número de parâmetros.

Então, se a escolha entre esses dois é para automação de tickets de suporte: escolha o Flash, gaste o dinheiro economizado conectando suas fontes de dados reais, e depois coloque atrás um caminho de escalonamento adequado.

Algumas coisas movem o número de resolução muito mais do que qualquer upgrade de plano, mais ou menos nesta ordem. Primeiro, acertar a classificação de tickets, para que a IA só responda o que deveria. Depois, construir um caminho real de transferência para um agente para tudo o mais. E treinar com seus próprios dados, especificamente as respostas já enviadas pela sua equipe, o que, segundo os dados do nosso teste, levaria a adoção de rascunhos como estão de 12% para 30–40% sozinho.

Depois há a restrição que fica acima de tudo isso. A API de primeira parte da DeepSeek é onde estão as tarifas baratas, e também é onde seus tickets viram dados de treinamento, então, para conversas com clientes, você está na prática precificando um provedor de retenção de dados zero em vez disso. Isso muda a lista de finalistas, e nosso panorama de soluções de atendimento ao cliente com IA é um ponto de partida melhor do que uma tabela de tarifas por token. Seja qual for o caminho escolhido, melhorar a taxa de resolução continua sendo um problema de dados bem antes de virar um problema de modelo.

Try eesel

Quer a economia do modelo barato sem apostar sua caixa de entrada no benchmark de alguém? A eesel se conecta ao helpdesk que você já usa e aprende com seus tickets passados e sua central de ajuda. A parte que importa para este post: ela permite que você simule o agente contra seus próprios tickets históricos antes que um único cliente o veja. Você recebe de volta uma taxa de resolução real, mais uma lista real do que ele teria errado, com seus dados e no seu tom, seja qual for o modelo que estiver na frente este mês. Grátis para testar, e com preço por ticket resolvido em vez de por assento.

Visualização de execução de uma skill da eesel AI, mostrando um agente de IA executando uma ação configurada em um ticket real
Visualização de execução de uma skill da eesel AI, mostrando um agente de IA executando uma ação configurada em um ticket real

Esse hábito de simulação existe por causa de cicatrizes, não de marketing. Já vimos bots que soam confiantes dar respostas erradas, e rodar o rollout contra tickets históricos primeiro é a única coisa que pega isso antes de um cliente pegar. Se você quer o panorama mais amplo antes de decidir, nosso resumo dos melhores agentes de IA e a lista dos melhores softwares de helpdesk com IA são dois bons pontos de partida.

Which one I would pick

Para trabalho agêntico e de programação em agosto de 2026: Flash, sem hesitar. É 3,11 vezes mais barato nas tarifas que você realmente paga. Supera o Pro em cada linha agêntica publicada pela DeepSeek, pontua seis pontos a mais no índice independente, tem 5 vezes a concorrência, e é o único dos dois com pesos abertos além de suporte a Responses API. Não existe versão dessa comparação em que o Pro vença em trabalho agêntico hoje.

Para recuperação factual, busca precisa em um contexto muito grande, ou qualquer coisa em que errar com confiança sai caro: Pro, e verifique se você deveria estar no Claude Opus 5 ou no GPT-5.6 em vez disso. Essa diferença no SimpleQA é grande o suficiente para que "simplesmente use o barato" seja um mau conselho em trabalho de conhecimento, e a própria vantagem do Pro sobre os modelos de fronteira ocidentais nesse eixo não é óbvia.

O timing é o fator incerto. A DeepSeek diz que a atualização do V4-Pro está a caminho, e o mesmo novo pós-treinamento que levou a pontuação do DeepSWE do Flash de 7,3 para 54,4 ainda não foi aplicado ao Pro. Um comentarista fez a pergunta óbvia em voz alta. Se isso for um compromisso de doze meses em vez de uma decisão deste sprint, esse é o evento a observar.

Vale a pena comparar isso com o resto do campo já que estamos aqui. O Qwen 3.8 Max fica em $2/$6 e o Kimi K3 em $3/$15, então os dois ficam bem acima da DeepSeek em todos os indicadores.

Se você quer os confrontos diretos em vez das tabelas de tarifas, já comparei o Qwen contra o Flash diretamente, além do Qwen contra o Kimi e do Qwen contra o GPT-5.6.

Vindo da geração anterior, nosso texto sobre DeepSeek V3.2 traz o contexto do upgrade, e o Qwen 3.7 Flash é o rival de plano barato mais próximo dele. Para a camada de harness que fica em cima de qualquer modelo escolhido, veja os melhores assistentes de IA para programação.

Perguntas frequentes

Qual é a diferença entre DeepSeek V4 Flash e V4 Pro?
Principalmente tamanho e preço. O Flash tem 284B de parâmetros totais com 13B ativos; o Pro tem 1.6T totais com 49B ativos. Ambos têm uma janela de contexto de 1M e um teto de saída de 384K, então a diferença não é uma troca de contexto. O Flash custa $0.14 por milhão de tokens de entrada em cache miss e $0.28 de saída, contra $0.435 e $0.87 do Pro. Para um panorama mais amplo, veja como escolher um LLM para trabalho de suporte.
O DeepSeek V4 Flash é melhor que o V4 Pro?
Em trabalho agêntico e de programação, em agosto de 2026, sim. A reconstrução 0731 do Flash supera a build atual do Pro em todos os nove benchmarks agênticos publicados pela DeepSeek, e a Artificial Analysis o pontua em 50 contra 44 do Pro. O Pro ainda lidera em recuperação factual e busca em contexto longo. Minha comparação com o Qwen 3.8 Max mostra como o Flash se sai contra um rival fora da DeepSeek.
Quanto custa o DeepSeek V4 Pro comparado ao Flash?
Cerca de 3,1 vezes mais tanto em entrada com cache miss quanto em saída: $0.435 contra $0.14 de entrada, $0.87 contra $0.28 de saída, por milhão de tokens. As taxas de cache hit ficam bem mais próximas, $0.003625 contra $0.0028. Se você está comparando isso com tarifas ocidentais, nossas análises de preços do GPT-5.6 e preços do Claude Opus 5 são as referências mais próximas.
O DeepSeek V4 Flash tem pesos abertos?
Sim, sob licença MIT, com cerca de 167GB em precisão mista FP4 e FP8, com 57 quantizações publicadas. O Hugging Face também lista um checkpoint base e oito finetunes. Se o auto-hospedagem é o motivo de você estar aqui, nosso panorama de agentes de IA open source mostra quanto esse caminho realmente custa.
Qual modelo da DeepSeek é melhor para um agente de atendimento ao cliente?
Nenhum dos dois sozinho. A precisão de um agente de suporte depende muito mais da qualidade da recuperação e do comportamento de fallback do que do plano do modelo, por isso prevenir alucinações é um problema de pipeline. A escolha do modelo importa apenas na margem; veja como um agente de IA para helpdesk é montado antes de escolher um plano.
Posso rodar o DeepSeek V4 Pro com esforço de raciocínio baixo para economizar?
Hoje não. A DeepSeek publica uma tabela de mapeamento de esforço em que uma solicitação low no Pro é atendida como high, então essa configuração econômica simplesmente não existe nesse plano. No Flash, low é realmente baixo e xhigh é atendido como high. A DeepSeek diz que o mapeamento do Pro deve mudar no início de agosto de 2026.
O preço do DeepSeek V4 Flash está prestes a mudar?
A DeepSeek anunciou uma política pendente de horário de pico a 2x o preço normal, das 9h às 12h e das 14h às 18h no horário de Pequim, todos os dias, sem data de início definida. Os $0.14 e $0.28 de hoje são as tarifas normais. Reserve orçamento para essa sobretaxa se o seu tráfego for síncrono, e leia nosso guia sobre custo de atendimento ao cliente com IA para ver como as tarifas por token se traduzem em um número por ticket.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Duas pessoas fazendo queda de braço sobre uma mesa enquanto uma terceira observa, ilustrando um confronto direto entre modelos
Trending

DeepSeek V4 Flash vs GPT-5.6: em qual você deve apostar?

DeepSeek V4 Flash vs GPT-5.6 com os números de agosto de 2026. A verdadeira disputa é Flash contra Luna, a inteligência empata, e o que decide é velocidade, visão e dados.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Preços do DeepSeek V4 Flash: o que você vai realmente pagar
Trending

Preços do DeepSeek V4 Flash: o que você vai realmente pagar

O DeepSeek V4 Flash é listado a $0.14 de entrada e $0.28 de saída por milhão de tokens. Usuários reais publicaram taxas combinadas abaixo de um centavo. Veja o que decide qual delas te espera.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
DeepSeek V4 Flash: specs, preços e para que serve na prática
Trending

DeepSeek V4 Flash: specs, preços e para que serve na prática

DeepSeek V4 Flash custa $0,14 de entrada e $0,28 de saída por milhão de tokens, e supera o próprio nível caro da DeepSeek. Isto é o que a tabela de preços não conta.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustração comparando DeepSeek V4 Flash e Kimi K3 da Moonshot AI
Trending

DeepSeek V4 Flash vs Kimi K3: qual você deveria usar?

Um modelo custa 29 vezes mais por tarefa que o outro. Passei por todos os números publicados dos dois, e a parte interessante é a opção intermediária que ninguém deveria comprar.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustração de um gato muito longo se esticando ao lado de duas pessoas revisando um cartão de pontuação, com o logo do LongCat
Trending

Análise do LongCat 2.0: um cavalo de batalha com um bloqueio real

Avaliei o LongCat 2.0 em sete pontos que realmente importam para um comprador, usando os próprios documentos da Meituan e os relatos de quem já passou bilhões de tokens por ele. Ele sai bem em seis.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustração de um gato muito longo esticado sobre uma mesa ao lado de um rack de servidores, com o logotipo da LongCat
Trending

LongCat 2.0: por dentro do modelo aberto de 1,6T da Meituan

LongCat 2.0 é o modelo MoE de 1,6T parâmetros da Meituan, sob licença MIT, a 0,30 dólares por milhão de tokens de entrada. Li todas as fontes primárias para ver o que realmente é entregue.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Um avaliador olhando para um cartão de veredito com dois seletores de esforço rotulados como baixo e máximo, ao lado da baleia da DeepSeek
Trending

Análise do DeepSeek V4 Flash: um modelo, duas personalidades

Uma análise do DeepSeek V4 Flash baseada nos números que ambos os placares publicam. A execução barata e a execução inteligente são os mesmos pesos, e isso muda o veredito.

Riellvriany IndriawanRiellvriany IndriawanAug 4, 2026
Ilustração comparando o Qwen 3.8 Max da Alibaba com o DeepSeek V4 Flash
Trending

Qwen 3.8 Max vs DeepSeek V4 Flash: preço, specs, veredito real

Um modelo custa 21x mais por token de saída do que o outro. Isso é o menos interessante nessa comparação, e aqui está o que as especificações realmente decidem.

Alicia Kirana UtomoAlicia Kirana UtomoAug 3, 2026
Duas pessoas lendo um grande medidor de uso e ajustando uma pilha de mostradores de cobrança, na cor azul da marca Meta
Trending

Preços do Meta Muse Spark 1.1: a fatura tem quatro medidores

O Muse Spark 1.1 tem preço de tabela de $1,25 de entrada e $4,25 de saída por milhão de tokens. Quatro medidores separados determinam sua fatura real, e o preço de tabela é o menor deles.

Rama Adi NugrahaRama Adi NugrahaAug 5, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis