
O que você realmente está comprando
O produto inteiro cabe em uma linha de uma página de documentação. Dois modelos, uma tabela de especificações, três preços. Refrescantemente honesto, comparado com a maioria das páginas de lançamento.

A versão por trás do alias é DeepSeek-V4-Flash-0731, que se tornou pública em 31/07/2026 como um re-pós-treinamento do lançamento de abril. Arquiteturalmente, é uma mistura esparsa de especialistas: 284B de parâmetros totais, dos quais 13B ficam ativos em qualquer token dado. Os pesos são licenciados sob MIT e têm cerca de 167GB. Se você conhece a geração anterior do DeepSeek V3.2, este é um animal diferente em trabalho agêntico.
| Especificação | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| Entrada, acerto de cache (por 1M) | $0,0028 | $0,003625 |
| Entrada, falha de cache (por 1M) | $0,14 | $0,435 |
| Saída (por 1M) | $0,28 | $0,87 |
| Janela de contexto | 1M | 1M |
| Saída máxima | 384K | 384K |
| Modo de raciocínio | Sem pensar e pensando, pensar por padrão | Sem pensar e pensando, pensar por padrão |
| Chamadas de ferramentas / saída JSON | Sim / Sim | Sim / Sim |
| Responses API | Sim | Não, início de agosto de 2026 |
| Limite de concorrência | 2500 | 500 |
Cada número ali vem da própria tabela de preços da DeepSeek. Dois detalhes são fáceis de deixar passar e valem uma pausa. O modo de raciocínio é o padrão em ambos os níveis, e tokens de raciocínio são cobrados na tarifa de saída. E o Flash, não o Pro, é o único modelo que suporta a Responses API, o que é inusual: o nível econômico recebe a interface mais nova.
O problema da análise: você está avaliando uma configuração
Aqui está a descoberta que reformulou todo este texto para mim. A Artificial Analysis não lista um único DeepSeek V4 Flash. Ela lista dois, porque os mesmos pesos se comportam como dois produtos diferentes dependendo do reasoning_effort.

Execute-o com o pensamento desligado e você obtém um Índice de Inteligência de 29, a uma mediana de 107 tokens de saída por segundo, 1,18s até o primeiro fragmento e 5,86s de ponta a ponta. Agora execute-o em esforço máximo. O índice sobe para 50, e a Artificial Analysis não publica nenhum número de velocidade para essa variante. Tokens de saída por segundo, em branco. Tempo até o primeiro token, em branco. Tempo total de resposta, em branco, com o painel de resumo admitindo "Desconhecido em 4 de 4 unidades para Velocidade".
Então o modelo no topo dos gráficos de valor é um modelo para o qual ninguém publicou uma cifra de latência. Não é um escândalo, apenas uma lacuna de medição. Mas significa que um plano construído sobre "barato e rápido" está apoiado em dois números que nunca foram medidos na mesma execução.
Duas peculiaridades menores agravam isso. A própria tabela de mapeamento de esforço da DeepSeek atende uma solicitação xhigh no Flash como se fosse high, então um botão que você pensa ter girado não faz nada. E no Pro, uma solicitação low é atendida como high, o que significa que não existe execução barata do Pro, e isso é boa parte da razão pela qual a comparação entre Flash e Pro sai como sai.
Se você está configurando isso por conta própria, as armadilhas estão todas no lado discreto da API, e eu as documentei separadamente em como usar a API. Resumindo: quase toda configuração incorreta retorna HTTP 200 e simplesmente ignora você.
Os dois placares não concordam, e ambos estão certos
É aqui que a maioria das análises escolhe o número mais favorável e segue adiante. A postura honesta é que o índice automatizado e o painel de votos humanos contam histórias diferentes sobre o mesmo modelo.

Na Artificial Analysis, a execução do Flash em esforço máximo pontua 50 e ocupa a 21ª posição entre 260 linhas de modelos, 3ª de 101 na sua própria classe de tamanho, e 1ª de 101 em preço com acerto de cache. O custo por tarefa é de $0,03, e executar o índice completo custou $72,02.
No placar de texto da LMArena, o mesmo modelo está em 79º, com um Elo de 1436 mais ou menos 4, em 48.667 votos. A linha -high-preview é quase igual, com 1438. E o V4 Pro, o modelo que o Flash supera no índice automatizado, fica acima dele aqui, com 1458. A preferência humana e o agregado de benchmarks realmente se separam neste caso.
Um ponto positivo nos dados humanos, com uma ressalva: no placar do WebDev, o deepseek-v4-flash-high está em 8º com 1577. Essa linha carrega a etiqueta Preliminary da LMArena sobre 1.319 votos com um intervalo de mais ou menos 18, então é mais um sinal promissor do que um resultado consolidado.
Minha leitura sobre isso: o índice automatizado mede uma execução configurada ao máximo em tarefas que recompensam o uso de ferramentas, enquanto a arena mede como uma resposta parece para uma pessoa sentada em uma caixa de chat. O Flash foi construído para a primeira coisa. Então compre-o para a primeira coisa.
No que ele é realmente bom
Os comprovantes aqui são a parte mais convincente de toda a reação, porque são faturas, não opiniões. É aqui que o enquadramento agêntico se justifica.
"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:
Cost: $4.55USDAPI requests: 3,467Tokens: 323,183,886 And as an engineer who leads a small team, I have very high standards for quality, and these carry across to my personal projects where I use deepseek. It has not disappointed at all for coding or review tasks. For everything else, use another model."
Note a última linha, porque é a frase mais útil do fórum. Os usuários mais intensivos não estão afirmando ter um modelo de fronteira genérico, estão afirmando ter um cavalo de batalha muito bom e muito barato para um conjunto específico de tarefas. Alguém logo apareceu com uma conta maior e a mesma conclusão, com 2,1 bilhões de tokens em 12 dias por $19,27.
Usuários de estruturas de agentes relatam o mesmo padrão:
"Essentially I'm running everything on flash now inside pi. With the correct set of MCP servers, context reducer tooling and skills it can implement any task I throw at it. Some sessions take 30+ turns, but it's fast and cheap; all this in an hour, with ~$0.5 cost. [...] I haven't used our slow opus subscription for weeks."
A explicação mais interessante sobre por que o nível barato vence nesse tipo de trabalho veio de uma equipe que teve que descobrir isso na prática:
"DeepSeek V4 Flash is the most cost effective model we've tested. We had to really understand why it outperformed DeepSeek V4 Pro (although even on unreliable model cards, Flash was very close to Pro). Pro is slower and smarter in one-shot reasoning problems, but less effective with tools and therefore less performant in long horizon agentic tasks (especially with custom tools it was not trained on)."
Isso se aplica igualmente bem ao caso de uso de resumir e revisar. Um usuário relatou quatro dólares em dois meses de trabalho de revisão e resumo, "sem queda dramática de desempenho em relação a outros modelos dos EUA". Para trabalhos em lote que antes eram muito caros para automatizar, o preço realmente muda o que vale a pena construir, que é o mesmo argumento que faço sobre os custos de suporte com IA em outro domínio.
Você deveria usá-lo para esse trabalho?
Onde ele falha
Uma análise que só lista pontos fortes é um comunicado de imprensa. As queixas abaixo são específicas e se repetem em vários fóruns, e algumas delas são todo o motivo pelo qual eu não colocaria esse modelo diante de um cliente.
Ele alucina, e o número publicado é feio. A Artificial Analysis coloca a taxa de alucinação AA-Omniscience em 84%, e sua própria nota diz que a melhoria geracional veio de "menos alucinações, em vez de maior precisão". Isso é uma melhoria de 12 pontos sobre um número que começou pior. Usuários descrevem a mesma coisa sem a métrica:
"DeepSeek V4 hallucinates like crazy and often forgets explicitly mentioned parts of the context. I guess compressing tokens and cherry-picking attention comes at a cost."
Para ser justo, o usuário mais intensivo do fórum calibrou isso em relação a seus pares em vez de tratá-lo como desqualificante, dizendo que ele alucina "mais ou menos o mesmo que os modelos Codex e todos os outros LLMs" e que revisa tudo o que ele escreve e faz outros modelos verificarem o trabalho cruzado. Essa é a postura correta, e também é um custo real que nunca aparece na tabela de preços.
O trabalho de longo horizonte em uma base de código grande é o ponto fraco, o que é desconfortável dado o discurso agêntico do fornecedor.
"If you believe the benchmarks Deepseek v4 is pretty shitty at long running work in large codebases, but really really good at self contained algorithmic/math reasoning - which is basically ideal for a compiler for a language with a relatively complex type system. And with its cache pricing it's very cheap."
É um modelo prolixo, e as palavras são cobradas. A Artificial Analysis aponta isso explicitamente sobre a verbosidade.

Ele consumiu 210M de tokens de saída para completar o índice contra uma mediana de classe de 100M, descrito na página do modelo como "muito prolixo em comparação". A execução inteira ainda custou apenas $72,02, que é o ponto principal, mas 2,1 vezes o volume mediano de saída é o mecanismo que silenciosamente separa o preço de tabela da sua fatura. Eu detalho essa diferença corretamente na análise de preços.
Capacidades que simplesmente estão ausentes. Não há entrada de imagem documentada: nenhuma linha de visão na tabela de preços, nenhum codificador de visão na configuração, e o trabalho multimodal da DeepSeek vive em linhas de modelo separadas. As equipes contornam isso, como descreveu um usuário, mantendo um segundo modelo à mão para visão.
Vale a pena corrigir uma afirmação que se espalhou junto com essa, no entanto. O mesmo relatório diz que a DeepSeek "não suporta busca na web", e isso só é verdade no caminho mais antigo de chat-completions. A Responses API, exclusiva do Flash, traz sim uma ferramenta integrada web_search no lado do servidor, junto com apply_patch. Busca de arquivos, interpretador de código, uso de computador e tipos de ferramenta MCP são todos ignorados ali, então o conjunto de capacidades é estreito, mas a busca na web está na lista.
Um caso real de estouro de faturamento está registrado, e vale a pena saber disso antes de apontar um agente para isso:
"I bought it through OpenRouter and used it with Pi agent. The model was good, but there appeared to be a pricing glitch or something, because it burned through $50 in under an hour on pretty trivial stuff. Pi agent claimed it only used like $1. OpenRouter claimed differently and said I used all $50."
A DeepSeek também não publica nenhum limite de requisições por minuto ou tokens por minuto, apenas um teto de concorrência que é a nível de conta, não de chave. Combinado com um saldo pré-pago que pode retornar um 402 no meio de uma execução, isso é mais um problema de monitoramento do que de preço, e um bom argumento para uma configuração de rastreamento adequada.
Uma reclamação de versionamento que vai pegar qualquer um que cite benchmarks. Um usuário colocou bem: na DeepSeek agora é simplesmente deepseek-v4-flash, enquanto a OpenRouter o chama de deepseek/deepseek-v4-flash-0731, então quando um benchmark diz "DeepSeek V4 Flash" você nem sempre consegue saber qual versão foi executada. Fixe o nome datado quando for anotar algo.
Executando os pesos você mesmo
A licença MIT está fazendo um trabalho real aqui, e os relatos locais são a parte mais bem documentada da reação. Isso é genuinamente um modelo de fundação que você pode hospedar, não um LLM somente hospedado.
| Hardware | Velocidade relatada |
|---|---|
| DGX Spark duplo | 60 tokens/s em sessão única, mais de 100 agregados com concorrência 4 |
| Mac Studio M3 Ultra 256GB | ~30 tokens/s de decodificação em requisição única |
| Ryzen AI MAX+ 395 (Strix Halo) | 32 tokens/s a ~2,88 bits por parâmetro |
| RTX PRO 6000 96GB único | 170 tokens/s relatados com um motor de plano de 2 bits |
Um usuário executando localmente captou bem por que as pessoas se dão ao trabalho, e não é a aritmética:
"2 sparks currently run this model at 60 t/s single session, up to just over 100 t/s aggregate with concurrency of 4. Going local has as opened up a world of use-cases I never would have entertained the idea of on metered/cloud usage. Privacy is a large part of it but, I also no longer think twice about whether to send a prompt or not based on the psychology of it costing money."
Em custo puro, os fóruns estão quase unânimes na direção contrária. Uma estimativa colocou uma máquina Spark dupla entre oito e nove mil dólares e concluiu que "faz pouco ou nenhum sentido enquanto os preços da API forem o que são. Exceto talvez por motivos de privacidade." Outro usuário fez as contas de eletricidade e descobriu que alcançar a tarifa de cache da DeepSeek era mais barato do que executar um modelo de 36B em casa. Então: hospede pelo controle e privacidade, não para economizar dinheiro.
Meu veredito, por tarefa
| Tarefa | Veredito | O fator decisivo |
|---|---|---|
| Resumo e revisão em massa | Use | Entrada com acerto de cache a $0,0028 torna trivial um trabalho em lote antes injustificável |
| Codificação agêntica delimitada | Use, com revisão | Lidera as linhas agênticas, e a vantagem de uso de ferramentas sobre o Pro é real |
| Trabalho de longo horizonte, repositório grande | Tenha cuidado | A queixa mais consistente em todos os fóruns |
| Qualquer coisa visual | Evite | Nenhuma entrada de imagem documentada, então direcione para um segundo modelo |
| Raciocínio único e memorização | Considere o Pro | O Pro ainda vence em memorização e busca de agulha em contexto longo |
| Respostas voltadas ao cliente | Não sem supervisão | Taxa de alucinação de 84%, mais termos de API que silenciam sobre o uso para treinamento |
Frente ao restante do campo, três modelos merecem ser comparados a ele. Com aproximadamente a mesma inteligência, o GPT-5.6 Luna custa duas a três vezes mais e é aquele com o qual as pessoas combinam o Flash para visão, detalhado em Flash vs. GPT-5.6. Se a precisão importa mais do que o preço, o Kimi K3 alucina muito menos e custa muito mais.
Para a opção multimodal na mesma faixa de pesos abertos, o Qwen 3.8 Max é o próximo a ler. Há análises práticas de cada um na análise do Qwen e na análise do Kimi.
Mais dois pontos de referência se você estiver traçando um eixo de preços. Os preços do Claude Opus 5 marcam a extremidade de fronteira. Alternativas ao Mistral cobre a família europeia de pesos abertos, e a análise do GPT-5.6 tem o veredito sobre o modelo do qual a maioria das equipes está realmente migrando.
Ele deveria alguma vez responder a um cliente?
Esta é a seção que realmente me importa, porque é o meu trabalho. E a resposta honesta é que o modelo é o lugar errado para procurar.
Comece por onde os tokens vão. Os termos da Open Platform pagos da DeepSeek silenciam sobre o uso para treinamento, o que não é a mesma coisa que ser permissivo nem a mesma coisa que ser seguro. Os termos para consumidores trazem uma cláusula explícita na seção 4.3 com uma opção de exclusão de "Melhorar o modelo para todos"; a seção equivalente no documento da API se interrompe antes disso. Também não há um acordo de processamento de dados publicado nem opção de retenção zero em nenhuma direção, e a política de privacidade declara que os dados são processados e armazenados na República Popular da China sob a lei chinesa. Provedores com retenção zero existem, e um usuário relatou preços de três a cinco vezes o valor direto, o que apaga a maior parte do desconto.
Se algo disso é novo para você, o episódio da política do Slack é o precedente que os leitores já viveram. SOC 2 e GDPR é a lista de verificação a seguir antes de conectar qualquer coisa voltada ao cliente.
Depois há o número de 84%. Toda equipe de suporte com quem falo escuta um número desses e faz a pergunta errada, que é "quão preciso é o seu modelo". Aqui está um cliente nosso que fez a pergunta certa muito melhor do que eu conseguiria. O bot deles estava confirmando com confiança que a empresa suportava modelos de carro que não estavam no banco de dados deles, porque uma linha na base de conhecimento dizia que eles suportavam todos os modelos. O modelo estava bem. A ancoragem não estava.
O resumo da equipe sobre como acertar isso foi "tentativa e erro no início".
Uma equipe de suporte dinamarquesa B2B de telemática veicular no Zendesk, atendendo cerca de 200 tickets por mês e escalando para mais de 2.000, que se preocupava com a IA confirmando com excesso de confiança modelos de carro não suportados.
Essa é toda a lição. A alucinação no suporte geralmente é um problema de ancoragem e permissões vestindo uma fantasia de modelo, e toda solução real vive acima do modelo, não dentro dele.
A pilha que torna um modelo instável administrável não é exótica. Recuperação sobre fontes que você realmente verificou. Barreiras de proteção sobre o que ele tem permissão para afirmar. Uma pontuação de confiança com um limite que alguém escolheu de propósito, e um humano para tudo abaixo dele.
Nossa pior falha observada em produção foi um agente de IA narrando "executando buscas no Zendesk" por cerca de dez turnos sem nunca tocar a API, e depois relatando arquivos salvos que não existiam. Nada destrói a confiança em um colega de equipe mais rápido do que mentir sobre o que fez, e nenhuma pontuação de benchmark teria detectado isso. O que detecta é a medição de contenção depois do fato e a revisão humana antes.
Então, se você está avaliando modelos brutos para uma fila de suporte, a ordem prática é mais ou menos esta. Teste de forma adversarial antes de confiar em qualquer coisa. Construa um hábito de avaliação em vez de uma data de lançamento. Defina limites de confiança deliberadamente.
Depois leia sobre prevenção de alucinações antes de conectar um único ticket, e pergunte a si mesmo com honestidade a questão de construir versus comprar, porque montar toda essa pilha você mesmo é o verdadeiro projeto. O modelo é a parte barata.
Experimente a eesel
Se você chegou aqui a partir de uma planilha comparando tarifas por token para um caso de uso de suporte, o que eu diria a você em um café é que o preço do token nunca foi a parte difícil. Conectar um modelo à sua central de atendimento, ancorá-lo em suas macros reais e tickets passados, e saber o que ele vai dizer antes que um cliente veja, essa é a parte difícil, e isso é o produto.
Isso é o que a eesel é: um agente de suporte com IA que se conecta ao Zendesk ou à sua central de atendimento existente, ancora cada resposta no seu conhecimento verificado, e permite que você execute simulações nos seus tickets históricos para ver exatamente onde ele teria errado antes de entrar no ar. Você acompanha o volume de tarefas, os gatilhos, e cada aprovação ou rejeição por ferramenta, então "ele está alucinando" se torna um número que você pode consultar em vez de uma preocupação.

O preço é por conversa resolvida em vez de por assento, o que significa que uma implementação gradual é uma opção real: direcione 200 dos seus 1.000 tickets mensais e pague por 200. Há $50 de uso gratuito para começar, sem cartão necessário, e a página de preços tem os números. Execute uma simulação com os tickets do mês passado e você saberá em uma hora se algo disso vale o seu tempo. Esse é um uso muito melhor de uma tarde do que fazer benchmark de uma configuração.
Perguntas frequentes
O DeepSeek V4 Flash é bom?
Quanto custa o DeepSeek V4 Flash?
Por que o DeepSeek V4 Flash pontua melhor que o V4 Pro?
O DeepSeek V4 Flash consegue ler imagens?
O DeepSeek V4 Flash é seguro para dados de clientes?
O DeepSeek V4 Flash deveria responder tickets de suporte?
Posso executar o DeepSeek V4 Flash no meu próprio hardware?
Quais são as melhores alternativas ao DeepSeek V4 Flash?

Article by
Riellvriany Indriawan
Riell is a designer and writer at eesel AI with about two years of experience researching CX platforms, AI chatbots, and helpdesk software. She combines her design background with a sharp eye for how these tools actually look and feel in practice — making her comparisons unusually visual and user-focused.








