As 8 melhores alternativas ao DeepSeek V4 Flash em 2026

Kurnia Kharisma Agung Samiadjie
Escrito por

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Revisado por

Katelin Teen

Última edição August 6, 2026

Verificado por especialista
Um desenvolvedor escolhendo entre cartões de modelos, com o cartão da baleia DeepSeek no centro rodeado por modelos rivais

Por que não estou classificando por pontuação

Escrevo sobre intenção de busca para viver, e "deepseek v4 flash alternatives" é uma consulta de compra com uma suposição escondida: que você está procurando algo melhor. Nos dois painéis que medem esse modelo, na maioria das vezes você não está.

A Artificial Analysis coloca o Flash no esforço máximo em 50 e o descreve como "entre os modelos líderes em inteligência e bem precificado em comparação com outros modelos de peso aberto de tamanho similar." O Luna marca 51. O Gemini 3.6 Flash marca 50. Você estaria trocando lateralmente em inteligência e pagando mais por esse privilégio.

O que você realmente estaria comprando é uma capacidade ou uma resposta de compliance. Então é assim que esta lista está ordenada: pela lacuna que ela resolve, com o custo honesto da troca anexado a cada uma. Se você quer a leitura pura de especificações do modelo que está deixando, o resumo do DeepSeek V4 Flash e a análise do Flash cobrem isso, e Flash vs GPT-5.6 cobre em detalhe o confronto mais próximo.

Os números, em um só lugar

Cada número abaixo vem da Artificial Analysis ou da própria página de preços do fornecedor, verificado em 4 de agosto de 2026. "Index run" é o que custou à AA avaliar aquele modelo em todo o Intelligence Index, que é o mais próximo de um número real de custo por tarefa que qualquer um deles publica.

ModeloAA IndexEntrada /1MSaída /1MIndex runVelocidade de saídaTempo até o primeiro tokenTokens para executar o índiceTipos de entradaContextoPesos
DeepSeek V4 Flash 0731 (max)50$0.14$0.28$72.02113 t/s1,31s210Mtext1MMIT
GPT-5.6 Luna (max)51$0.20$1.20$174.06181 t/s132,75s130Mtext, image1.05Mclosed
Gemini 3.6 Flash (high)50$1.50$7.50$726.70213 t/s15,69s59Mtext, image, speech, video1Mclosed
Gemini 3.5 Flash-Lite36$0.30$2.50$153.08366 t/s8,41s43Mtext, image, speech, video1Mclosed
Claude Haiku 4.5 (non-reasoning)24$1.00$5.00não publicado90 t/s0,96snão publicadotext, image200Kclosed
Kimi K3 (max)57$3.00$15.00$2,437.4136 t/s2,85s130Mtext, image1Mlicença kimi-k3
DeepSeek V4 Pro44$0.435$0.87não publicadonão publicadonão publicadonão publicadotext1Mopen
Qwen3.7-Flashnão listado$0.03–$0.20$0.13–$0.80não publicado59 t/snão publicadonão publicadotext, image, video1Mclosed

Duas coisas se destacam nessa tabela. O Flash tem o primeiro token mais rápido do grupo por um fator de dois sobre tudo, exceto o Haiku, e é o único modelo aqui que é ao mesmo tempo de peso aberto e realmente barato. Tudo o mais é uma troca.

Um gráfico de barras horizontais desenhado à mão do tempo até o primeiro token no esforço máximo, com o DeepSeek V4 Flash em 1,31 segundo e o GPT-5.6 Luna em 132,75 segundos saindo da borda do quadro
Um gráfico de barras horizontais desenhado à mão do tempo até o primeiro token no esforço máximo, com o DeepSeek V4 Flash em 1,31 segundo e o GPT-5.6 Luna em 132,75 segundos saindo da borda do quadro

Escolha pela lacuna, não pela pontuação

Antes da lista: esta é a decisão em cinco cliques. Escolha o que realmente está te bloqueando e você tem a escolha mais o custo real da troca.

Para que você realmente está trocando?

O Flash já é o mais barato e o mais rápido no primeiro token. Então escolha a lacuna.

GPT-5.6 Luna

O Flash não tem entrada de imagem documentada. O Luna aceita texto e imagens, marca um ponto mais alto no índice da AA com 51, e roda a 181 tokens por segundo. Também é o modelo com capacidade de visão mais barato desta comparação, com $0.20 de entrada e $1.20 de saída.

Custo da troca: cerca de 3 vezes a conta real em cenários com muito cache, muito raciocínio e prompts longos, e um tempo até o primeiro token de 132,75s no esforço máximo. Não coloque em um caminho interativo sem reduzir o esforço.

Hospedar os pesos do Flash você mesmo

Você mantém exatamente o mesmo modelo e move apenas a inferência. Os pesos têm licença MIT, e uma configuração de produção pública já roda o checkpoint 0731 em uma única AMD MI300X a 168,6 tokens por segundo em fluxo único, mais rápido que os 113 medidos na API oficial.

Custo da troca: hardware. 156,67 GiB de pesos precisam caber na HBM, e uma única MI300X é difícil de comprar sozinha. Se você preferir não gerenciar GPUs, o plano pago do Gemini afirma explicitamente que seu conteúdo não é usado para melhorar seus produtos.

Gemini 3.5 Flash-Lite

366 tokens por segundo, o mais rápido aqui, e o mais conciso: 43M de tokens de saída para executar o índice da AA contra os 210M do Flash. Aceita texto, imagem, voz e vídeo. Bom para classificação e triagem em grande volume.

Custo da troca: inteligência. Índice 36 contra 50 do Flash, então é uma classe de tarefa diferente. E nenhum uso de computador a qualquer preço.

Kimi K3

A escolha de confiabilidade. Taxa de alucinação AA-Omniscience de 51% contra 84% do Flash, Omniscience Index de 18 contra -16 do Flash, e a maior inteligência bruta aqui, com 57.

Custo da troca: cerca de 29 vezes o custo por tarefa e 36 tokens por segundo. Também não existe um K3 econômico. A linha K3 (low) marca 47, três pontos abaixo do Flash, a 8 vezes o custo. O raciocínio não pode ser desligado.

DeepSeek V4 Pro

Fique na família. O Pro ainda vence claramente em recall e busca em contexto longo: SimpleQA-Verified 57.9 contra 34.1 do Flash, MRCR em contexto de 1M 83.5 contra 78.7, e os votantes humanos do LMArena o classificam em 1458 contra 1436 do Flash.

Custo da troca: 3,11x na entrada e saída com cache-miss, e nenhuma execução barata. A própria tabela de mapeamento de esforço da DeepSeek atende uma solicitação low no Pro como high.

1. GPT-5.6 Luna

A página do modelo GPT-5.6 Luna na plataforma de desenvolvedores da OpenAI mostrando $0.20 de entrada, $0.02 de entrada em cache e $1.20 de saída por milhão de tokens, conforme reproduzido de OpenAI
A página do modelo GPT-5.6 Luna na plataforma de desenvolvedores da OpenAI mostrando $0.20 de entrada, $0.02 de entrada em cache e $1.20 de saída por milhão de tokens, conforme reproduzido de OpenAI

Melhor para: a troca mais equivalente, e a forma mais barata de adicionar entrada de imagem.

O que realmente é

O Luna é o nível econômico da família GPT-5.6, descrito na sua própria página de modelo como "otimizado para cargas de trabalho sensíveis a custo." A razão pela qual a maioria das comparações com o Flash erra é que gpt-5.6 é um alias para o Sol, o nível de fronteira, então as pessoas acabam comparando por acidente um modelo de $0.14 com um de $5. Contra o Luna especificamente, a questão de inteligência é praticamente um empate: 51 contra 50 no índice da AA.

Ele tem uma janela de contexto de 1.050.000 tokens, máximo de saída de 128.000 tokens, corte de conhecimento em 16 de fevereiro de 2026, e suporte a tokens de raciocínio. Entrada de texto e imagem, saída de texto.

Preços

$0.20 de entrada, $0.02 de entrada em cache, $1.20 de saída por milhão. Há uma escala real de descontos por baixo disso que a maioria dos artigos não percebe:

NívelEntrada /1MCache /1MSaída /1M
Standard$0.20$0.02$1.20
Batch$0.10$0.01$0.60
Flex$0.10$0.01$0.60
Fast mode$0.40$0.04$2.40
Long context (>272K)$0.40$0.04$1.80

No Batch ou Flex, a entrada do Luna a $0.10 é na verdade mais barata que a do Flash a $0.14. Se sua carga de trabalho for amigável a processamento noturno e pesada em entrada com saídas curtas, o que descreve boa parte da classificação de tickets, o Luna pode sair na frente. O Flash não tem nenhum desconto de lote.

Onde ele supera o Flash

Entrada de imagem, latência publicada com a qual você pode planejar, e uma história de tratamento de dados que você pode entregar a um revisor de segurança. Também busca na web, o que vale a pena ser preciso: o Flash tem de fato uma ferramenta web_search do lado do servidor, mas apenas na Responses API exclusiva do Flash, não no caminho chat-completions. A afirmação amplamente repetida de que "o DeepSeek não tem busca na web" está desatualizada.

Onde ele não supera

As evidências no Hacker News colocam a diferença real entre 2x e 3x, não os 4,3x que a coluna de saída sugere, porque a entrada em cache do Luna também é barata. Mas 3x ainda é 3x. E o número de latência é brutal:

Hacker News

"2x to 3x the price… 2 to 5 times faster inference"

Esse "faster inference" é throughput, não capacidade de resposta. No esforço máximo, o tempo até o primeiro token do Luna é de 132,75 segundos. Bom para um trabalho em lote, errado para um widget de chat.

Há também um precipício assimétrico a se planejar: prompts acima de 272K de entrada re-precificam toda a solicitação a 2x na entrada e 1,5x na saída, não apenas o excedente. Escritas em cache são cobradas a 1,25x a taxa sem cache.

Veredito

Se a razão para deixar o Flash é entrada de imagem ou uma conversa de compliance, essa é a primeira coisa a tentar, e a taxa de lote a torna mais barata do que as pessoas supõem. Eu não a colocaria em uma superfície interativa no esforço máximo. O detalhamento completo dos níveis está no guia de preços do GPT-5.6, e a análise do GPT-5.6 cobre toda a família.

2. Gemini 3.5 Flash-Lite

O catálogo de modelos da API Gemini com o Gemini 3.5 Flash-Lite destacado como o modelo 3.5 mais rápido e mais econômico para execução de alto throughput, conforme reproduzido de Google
O catálogo de modelos da API Gemini com o Gemini 3.5 Flash-Lite destacado como o modelo 3.5 mais rápido e mais econômico para execução de alto throughput, conforme reproduzido de Google

Melhor para: classificação de alto volume, triagem, e qualquer coisa onde tokens por segundo é o bottleneck.

O que realmente é

O modelo geralmente disponível mais barato do Google na linha 3.5, descrito na sua própria página de modelo como "nosso modelo 3.5 mais rápido e mais econômico para execução de alto throughput." O código do modelo é gemini-3.5-flash-lite, contexto de entrada de 1.048.576, saída de 65.536, e aceita texto, imagem, voz, vídeo e PDF.

Preços

$0.30 de entrada e $2.50 de saída por milhão no Standard. Batch e Flex reduzem ambos à metade, para $0.15/$1.25. Priority é $0.54/$4.50. O cache de contexto custa $0.03.

Onde ele supera o Flash

Dois números. 366 tokens por segundo, o mais rápido aqui, e 43M de tokens de saída para executar o índice da AA contra os 210M do Flash. A AA o chama de "razoavelmente conciso" e chama o Flash de "muito verboso." Essa concisão é o motivo pelo qual um modelo com uma taxa de saída nominalmente 9 vezes maior custou apenas $153,08 para executar o índice contra os $72,02 do Flash, aproximadamente 2 vezes, não 9.

A entrada multimodal é nativa em quatro modalidades. E o nível pago do Google é explícito onde o da DeepSeek fica em silêncio: a página de preços lista "Conteúdo não usado para melhorar nossos produtos" como propriedade do nível pago, contra "Conteúdo usado para melhorar nossos produtos" no nível gratuito.

Onde ele não supera

Intelligence Index 36 contra 50 do Flash. Essa não é uma diferença pequena, é uma classe de peso diferente, e o Flash-Lite vai ser pior em qualquer coisa agêntica ou de múltiplas etapas. Nenhum uso de computador a qualquer preço. O tempo até o primeiro token é de 8,41s, seis vezes o do Flash.

Veredito

Se você está executando classificação de intenção ou análise de sentimento sobre um grande volume, essa é a forma certa e a concisão economiza dinheiro real. Se você está executando um agente, não é. Mais no resumo do Gemini 3.5 Flash-Lite.

3. Gemini 3.6 Flash

A página de preços da API de desenvolvedores Gemini mostrando os níveis Free, Paid e Enterprise, com o nível pago declarando que o conteúdo não é usado para melhorar os produtos do Google, conforme reproduzido de Google
A página de preços da API de desenvolvedores Gemini mostrando os níveis Free, Paid e Enterprise, com o nível pago declarando que o conteúdo não é usado para melhorar os produtos do Google, conforme reproduzido de Google

Melhor para: igualar a inteligência do Flash com um terço dos tokens de saída, mais uso de computador.

O que realmente é

O nível Flash de referência do Google, lançado em 21 de julho de 2026, posicionado como o modelo que "equilibra velocidade e inteligência para entregar forte desempenho em tarefas agênticas e multimodais." O corte de conhecimento foi movido para março de 2026. O uso de computador vem embutido. Contexto de 1M, saída de 65K.

Preços

$1.50 de entrada, $7.50 de saída por milhão. O Batch reduz ambos à metade, para $0.75/$3.75.

Onde ele supera o Flash

Este é o item que mudou como eu leio toda a comparação. O Gemini 3.6 Flash marca exatamente os mesmos 50 pontos do Flash, e chega lá com 59M de tokens de saída contra os 210M do Flash. Na tabela de preços isso é uma diferença de 26,8x na saída. Na conta real de execução do índice da AA é $726,70 contra $72,02, o que dá 10,1x.

10x ainda é 10x, então esse não é um modelo mais barato. Mas a direção importa: toda comparação de verbosidade neste artigo se move contra o Flash, e se você tem orçado com base na coluna por token, você tem superestimado sua economia.

Um diagrama de dois estágios desenhado à mão mostrando como a diferença de preço de tabela de 26,8x na saída se comprime para uma diferença de 10,1x na conta real de execução do índice, porque o Flash usa 210M de tokens de saída contra os 59M do Gemini 3.6 Flash na mesma pontuação de 50
Um diagrama de dois estágios desenhado à mão mostrando como a diferença de preço de tabela de 26,8x na saída se comprime para uma diferença de 10,1x na conta real de execução do índice, porque o Flash usa 210M de tokens de saída contra os 59M do Gemini 3.6 Flash na mesma pontuação de 50

Ele também traz quatro modalidades de entrada, 213 tokens por segundo, e uso de computador, algo que nada mais nesta lista oferece nesse nível.

Onde ele não supera

10x o custo por tarefa em paridade de inteligência. Tempo até o primeiro token de 15,69s. Pesos fechados, então hospedar você mesmo está fora de questão.

Veredito

A escolha quando o modelo está fazendo trabalho agêntico sobre uma base de conhecimento com mídia mista e você quer reduzir a contagem de tokens. Leia o resumo do Gemini 3.6 Flash, ou a análise para o detalhe das avaliações.

4. Claude Haiku 4.5

A visão geral de modelos da documentação da Claude Platform comparando Fable 5, Opus 5, Sonnet 5 e Haiku 4.5, com o Haiku descrito como o modelo mais rápido com inteligência quase de fronteira, conforme reproduzido de Anthropic
A visão geral de modelos da documentação da Claude Platform comparando Fable 5, Opus 5, Sonnet 5 e Haiku 4.5, com o Haiku descrito como o modelo mais rápido com inteligência quase de fronteira, conforme reproduzido de Anthropic

Melhor para: o primeiro token mais rápido do grupo, e a revisão de segurança mais fácil.

O que realmente é

O modelo pequeno da Anthropic, claude-haiku-4-5, descrito na documentação como "o modelo mais rápido com inteligência quase de fronteira." Entrada de texto e imagem, contexto de 200K, conhecimento até julho de 2025. Disponível na API Claude, Amazon Bedrock, Google Cloud e Microsoft Foundry.

Preços

$1.00 de entrada, $5.00 de saída por milhão.

Onde ele supera o Flash

0,96 segundos até o primeiro token, o único número nesta página que supera o 1,31s do Flash, a 90,2 tokens por segundo. A AA chama esse TTFT de "muito competitivo" contra uma mediana de 1,43s na sua faixa de preço.

A outra coisa em que ele supera o Flash é aquisição. A disponibilidade multi-cloud via Bedrock e Google Cloud significa que residência de dados e contratação são um problema já resolvido por outra pessoa, não seu. Na minha experiência esse é o bloqueio real com mais frequência do que qualquer benchmark:

Bloqueado completamente por HIPAA/BAA durante a demonstração, descrito como um bloqueio rígido, não uma preocupação leve.

Uma plataforma de saúde e fisioterapia dos EUA no Zendesk processando cerca de 500 tickets por mês

Aquele negócio não travou por causa de uma taxa de alucinação.

Onde ele não supera

Intelligence Index 24 sem raciocínio, o mais baixo aqui, e a menor janela de contexto com 200K contra o 1M de todos os outros. A AA não publica um custo de execução do índice para ele, então o custo por tarefa é desconhecido. A Anthropic também oferece uma variante com raciocínio, mas o 24 é a linha sem raciocínio, e é isso que os $1/$5 compram nas configurações padrão.

Veredito

Escolha isso quando capacidade de resposta e contratação importarem mais do que capacidade bruta, o que é a maioria do chat voltado ao cliente. Não escolha para trabalho agêntico. OpenAI API vs Anthropic API cobre o lado da experiência do desenvolvedor, e preços do Claude Sonnet 5 cobre o nível acima.

5. Kimi K3

A documentação de preços de inferência de modelos da Kimi Platform mostrando a unidade de cobrança e a lógica de cobrança para o modelo principal Kimi K3, conforme reproduzido de Moonshot AI
A documentação de preços de inferência de modelos da Kimi Platform mostrando a unidade de cobrança e a lógica de cobrança para o modelo principal Kimi K3, conforme reproduzido de Moonshot AI

Melhor para: o único caso em que pagar 29x mais é defensável: respostas que você não pode se dar ao luxo de errar.

O que realmente é

O carro-chefe da Moonshot AI, lançado em 16 de julho de 2026. 2,8T de parâmetros totais com 104B ativos, contexto de 1M, visão nativa para imagens e vídeo. Os pesos abertos foram lançados em 27 de julho como prometido, 1.561 GB em 96 shards, sob uma licença kimi-k3 com cláusulas para grandes operadores de MaaS e produtos muito grandes.

Preços

$3 de entrada, $0.30 de entrada com cache-hit, $15 de saída por milhão. Isso é território do Claude Sonnet, não território econômico.

Onde ele supera o Flash

Confiabilidade, e não por pouco. Taxa de alucinação AA-Omniscience de 51% contra 84% do Flash. Omniscience Index de 18 contra -16 do Flash, onde uma pontuação negativa significa mais respostas incorretas do que corretas. Precisão de 46% contra 37%. A maior inteligência bruta nesta comparação, com 57.

Se seu caso de uso é um setor regulado ou um agente de IA que toca em dinheiro, essa diferença é todo o argumento.

Onde ele não supera

Custo, e não apenas pela margem do preço de tabela. A taxa de saída é 54 vezes a do Flash, mas o custo por tarefa da AA é $0.03 contra $0.86, então a diferença real é de 29x porque o K3 é mais verboso por ponto de inteligência. Execução completa do índice: $72,02 contra $2.437,41.

36 tokens por segundo, o mais lento aqui. E não existe um K3 econômico: a AA lista uma linha K3 (low) separada com um Intelligence Index de 47, três pontos abaixo do Flash, custando $0.24 por tarefa, que é 8x o Flash, e não é mais rápido. O guia de início rápido da Moonshot confirma que o raciocínio não pode ser desligado, então os níveis de esforço são um controle de latência em vez de um nível de custo.

Mais uma coisa que vale mencionar para quem compara políticas de dados: os termos da Moonshot são explícitos e permissivos onde os da DeepSeek ficam em silêncio. A Seção 4 diz que "salvo acordo expresso por escrito em contrário, o Conteúdo do Cliente pode ser usado para os fins mencionados", com opt-out apenas via um acordo empresarial negociado. Os dados ficam em Singapura.

Veredito

Compre quando uma resposta errada custar mais do que 29 vezes a conta de tokens, o que é uma situação real e mais estreita do que a maioria dos compradores pensa. Fora isso, a matemática não fecha. Analisei esse confronto a fundo em Flash vs Kimi K3, e também há uma análise do Kimi K3 e um guia de preços.

6. DeepSeek V4 Pro

O cartão de modelos e preços da API DeepSeek mostrando deepseek-v4-flash e deepseek-v4-pro lado a lado com suas taxas de cache-hit, cache-miss e saída, conforme reproduzido de DeepSeek
O cartão de modelos e preços da API DeepSeek mostrando deepseek-v4-flash e deepseek-v4-pro lado a lado com suas taxas de cache-hit, cache-miss e saída, conforme reproduzido de DeepSeek

Melhor para: ficar na família quando você precisa de recall em vez de raciocínio.

O que realmente é

O nível V4 maior, deepseek-v4-pro, com 49B de parâmetros ativos contra os 13B do Flash. Ainda no build de pré-visualização de abril sem equivalente 0731, que é a razão pela qual esta comparação é estranha.

Preços

$0.435 de entrada com cache-miss, $0.003625 de entrada com cache-hit, $0.87 de saída por milhão. Isso é 3,11x o Flash em entrada com cache-miss e saída, mas apenas 1,29x em cache-hits.

Onde ele supera o Flash

Recall e busca em contexto longo, que é o que os parâmetros ativos adicionais compram. Da própria tabela cross-mode da DeepSeek no esforço máximo: SimpleQA-Verified 57.9 contra 34.1, GDPval-AA Elo 1554 contra 1395, BrowseComp 83.4 contra 73.2, e MRCR em contexto de 1M 83.5 contra 78.7.

E o voto humano concorda com o Pro, não com o índice automatizado. O LMArena Text classifica o Pro em 1458±4 contra o 1436±4 do Flash em cerca de 49.000 votos cada. Dois painéis, ambos corretos, medindo coisas diferentes.

Onde ele não supera

O Flash 0731 supera a pré-visualização do Pro em todas as nove linhas agênticas que a DeepSeek publica, com o DeepSWE 54.4 contra 12.8 sendo a mais larga. A AA coloca o Flash em 50 e $0.03 por tarefa contra o Pro em 44 e $0.05. Vale destacar honestamente que duas dessas nove linhas são conjuntos internos próprios da DeepSeek e o harness não foi divulgado.

Também não há uma execução barata do Pro. A tabela de mapeamento de esforço publicada pela DeepSeek atende uma solicitação low no Pro como high, então você paga 3,11x e não pode reduzir o raciocínio. Esse mapeamento estava previsto para mudar no início de agosto de 2026.

Veredito

Uma escolha estreita, mas real: escolha o Pro para trabalho intensivo em recuperação sobre documentos longos, fique no Flash para trabalho agêntico e de código. Detalhamento completo em Flash vs V4 Pro.

7. Hospedando os pesos do Flash você mesmo

O repositório do GitHub para executar o DeepSeek V4 Flash 0731 em uma única AMD MI300X, mostrando a licença Apache-2.0 e uma tabela de resultados com 168,6 tokens por segundo em decodificação de fluxo único, conforme reproduzido de GitHub
O repositório do GitHub para executar o DeepSeek V4 Flash 0731 em uma única AMD MI300X, mostrando a licença Apache-2.0 e uma tabela de resultados com 168,6 tokens por segundo em decodificação de fluxo único, conforme reproduzido de GitHub

Melhor para: manter o modelo e resolver o problema de residência em um único movimento.

O que realmente é

Não é um modelo diferente. O mesmo checkpoint DeepSeek-V4-Flash-0731 com licença MIT, rodando em hardware que você controla. Este item ganha seu lugar porque uma configuração de produção se tornou pública hoje e chegou à primeira página do Hacker News com 165 pontos.

Preços

Hardware, não tokens. O que é exatamente o ponto se seu bloqueio é uma revisão de segurança em vez de um orçamento.

Onde ele supera a API do Flash

Os números publicados em uma única AMD MI300X, do stack vLLM ROCm fixado no repositório:

MétricaResultado
Decodificação de fluxo único168,6 tok/s
Prefill com kernels ajustados~7,9–8,5K tok/s
8 fluxos concorrentes542 tok/s agregado, 90,3 tok/s mediana por fluxo
Rajada de 64 fluxos830 tok/s agregado, sem OOM
Contexto validado256K (arquitetura suporta 1M)
Pesos em HBM156,67 GiB, sem quantização adicional

168,6 tokens por segundo em uma placa supera os 113 tok/s que a Artificial Analysis mede na própria API da DeepSeek. O repositório é explícito que "o checkpoint roda como enviado, sem quantização de pesos adicional ou offload", então isso não é uma troca de velocidade por qualidade.

Também responde à objeção que mais escuto, que não tem nada a ver com o modelo:

Phil perguntou se ele usa "algum tipo de outro ChatGPT ou algo assim se não sabe a resposta" e se isso pode ser desligado. Gil perguntou se o conhecimento fica fechado dentro da organização deles.

Um avaliador técnico em uma empresa de hardware de semicondutores B2B que precisava de garantia de que a IA responde apenas a partir do conhecimento aprovado pela organização, não de dados de treinamento gerais

Hospedar você mesmo é a única opção nesta página que responde essa pergunta com um diagrama de rede em vez de uma leitura de termos de serviço.

Onde ele não supera

Hardware que você precisa obter, e a comunidade é direta sobre isso:

Hacker News

"I don't think you can buy a single 'MI300X' unit, right? Only the box with x8 of these at a cost of ~250K EUR."

Há uma solução alternativa na mesma thread:

Hacker News

"The MI350P is the one you want: It's a PCIe card, but it has less memory: 144GB. Luckily, DeepSeek V4 Flash will run in 144GB too because it's 256 MoE exports are native MXFP4 quantized."

Mais duas ressalvas honestas. O repositório descreve o checkpoint como 304B de parâmetros, enquanto a AA publica 284B totais, então a contagem de parâmetros na prática é inconsistente. E a DeepSeek supostamente obtém 15K tok/s/gpu em H800 no seu próprio paper DSpark, segundo xorfish na mesma thread, então ainda há margem nessa configuração.

Veredito

Se sua razão para pesquisar é residência de dados, isso deveria estar no topo da sua lista, não no fim. Você não está trocando qualidade de modelo em nada. Leitura relacionada: agentes de IA open source, modelos de IA personalizados, e construir vs comprar.

8. Qwen3.7-Flash

A página do modelo no OpenRouter para o Qwen3.7 Flash mostrando $0.03 de entrada e $0.13 de saída por milhão, um único provedor Alibaba Cloud, e preços efetivos médios ponderados de $0.061 e $0.163, conforme reproduzido de OpenRouter
A página do modelo no OpenRouter para o Qwen3.7 Flash mostrando $0.03 de entrada e $0.13 de saída por milhão, um único provedor Alibaba Cloud, e preços efetivos médios ponderados de $0.061 e $0.163, conforme reproduzido de OpenRouter

Melhor para: o menor preço de tabela, se seus prompts realmente forem pequenos.

O que realmente é

O modelo de raciocínio visão-linguagem da Alibaba, lançado em 27 de julho de 2026, descrito no OpenRouter como adequado para "agentes multimodais, codificação visual, busca e interação com computador." Contexto de 1M, texto mais imagem mais vídeo como entrada.

Preços

Aqui é onde fica interessante, e onde a colisão de nomes com o "Flash" da DeepSeek causa confusão real. Os preços são divididos por faixas de tamanho de prompt, então a taxa de destaque e o contexto de 1M não podem ser verdadeiros na mesma chamada:

Tamanho do promptEntrada /1MSaída /1M
Abaixo de 32K$0.03$0.13
32K–256K$0.10$0.40
256K–1M$0.20$0.80

Uma variação de 6,7x na entrada. E o OpenRouter publica a média móvel de 30 dias do que os clientes realmente pagam: $0.061 de entrada e $0.163 de saída, acima do preço de tabela, o que indica que o tráfego real está caindo nas faixas superiores.

Onde ele supera o Flash

A faixa abaixo de 32K a $0.03/$0.13 é realmente mais barata que o $0.14/$0.28 do Flash, cerca de 4,6x na entrada. Aceita imagens e vídeo, algo que o Flash não aceita nenhum dos dois. A leitura em cache custa $0.006.

Onde ele não supera

Quase nada é verificado de forma independente, e essa é a história em si, não uma nota de rodapé. A Qwen não publicou benchmarks, arquitetura, nem contagem de parâmetros. Não está listado na Artificial Analysis de forma alguma, então não há um score de índice comparável na tabela acima. Os pesos são fechados.

A única avaliação de terceiros em que confio é o benchmark de visão da Roboflow, que o coloca em 22º de 23 no geral com 61,7%, enquanto o classifica em 1º de 23 em custo. Ele identifica muito melhor do que localiza.

"Flash" aqui significa barato, não rápido: 59 tokens por segundo contra os 113 do Flash e os 366 do Flash-Lite. A taxa de erro de chamadas de ferramentas é de 8,88%, a latência ponta a ponta P99 é de 90,19 segundos, e o OpenRouter observa que ele é "hospedado por um único provedor" com "nenhuma decisão de roteamento a tomar", então não há fallback se aquele provedor tiver um dia ruim.

Veredito

Escolha apenas se seus prompts realmente ficam abaixo de 32K e você precisa de visão com orçamento apertado. Acima disso, as faixas apagam a vantagem, e a falta de dados de avaliação significa que você compra na fé. A matemática das faixas é detalhada no guia de preços do Qwen 3.7 Flash, e o resumo do Qwen 3.7 Flash cobre as especificações.

O que nenhuma dessas oito vai fazer

Todo modelo aqui é a camada mais básica. Vale a pena dizer isso claramente, porque a decisão de troca que as pessoas me trazem geralmente é enquadrada como uma escolha de modelo e quase nunca é.

Uma taxa de alucinação de 84% não significa que o modelo erra 84% dos tickets. É um número da AA-Omniscience medido em perguntas sem contexto fornecido, que é exatamente o oposto de como um agente de suporte deveria operar. Conecte o mesmo modelo a um RAG sobre um centro de ajuda verificado e o número que importa muda completamente.

Esse é o argumento por trás de RAG vs LLM e prevenção de alucinação. A solução é grounding e guardrails, não um modelo base melhor.

A objeção do comprador que realmente decide esses negócios não é precisão no abstrato. É controle. Um líder de CX colocou melhor do que qualquer benchmark poderia:

"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer, then the point is a little bit gone. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

Um líder de CX em uma marca DTC de suplementos no Gorgias e Shopify, com cerca de 7.000 tickets e 30.000 pedidos por mês

Nenhum item da tabela acima resolve isso. Pontuações de confiança, regras de escalonamento, exclusão por tipo de ticket e um humano no loop resolvem, e esses vivem na camada acima da API.

Escrevi sobre limites de confiança e taxa de contenção separadamente, porque são a parte que decide se tudo isso funciona.

A segunda coisa que nenhum deles faz é te dizer o número que você realmente está orçando. Taxas de tokens são entradas. O custo por resolução é a saída, e os dois não são proporcionais quando você adiciona recuperação, novas tentativas e o tempo humano gasto limpando depois.

O que eu realmente faria com uma fila de suporte

O painel de relatórios da eesel AI mostrando o volume total de tarefas, eventos de gatilho por tipo, e o uso de aprovação ou rejeição por ferramenta para um agente Zendesk
O painel de relatórios da eesel AI mostrando o volume total de tarefas, eventos de gatilho por tipo, e o uso de aprovação ou rejeição por ferramenta para um agente Zendesk

Comprar modelos para uma fila de suporte é o primeiro passo errado, e digo isso como alguém que passou esta semana lendo oito cartões de modelo. A pergunta não é qual modelo aluciona menos, é como está sua precisão nos seus próprios tickets, e você não consegue isso de um leaderboard.

Isso é exatamente o que a eesel faz e uma API pura não pode fazer. Ela se conecta ao Zendesk, Freshdesk, Gorgias, Front ou Help Scout em poucos minutos, fundamenta cada resposta no seu centro de ajuda, tickets passados e macros, e então executa uma simulação sobre seus tickets históricos reais para você ver a taxa de resolução real antes de um cliente ver. Se não atinge sua barra, você não implanta.

O preço é 40 centavos por ticket atendido, sem taxas por assento, e você nunca é cobrado por tickets que seus humanos atendem. Roteie 200 dos seus 1.000 tickets mensais para começar e você paga $80. Experimente a eesel gratuitamente com $50 de uso e sem cartão de crédito.

Não estou afirmando que a eesel torna um modelo base mais inteligente. Estou afirmando que o que você realmente está buscando, um modelo em que você pode confiar na frente de clientes, não é um modelo de forma alguma. E a razão pela qual estou confiante sobre isso é que vimos nosso próprio agente falhar de formas que nenhum benchmark detecta: o pior padrão que já registramos foi um agente narrando "executando buscas no Zendesk" por cerca de dez turnos sem nunca chegar a tocar na API. Nada destrói a confiança em um colega de equipe mais rápido do que mentir sobre o que fez, e nenhum score de índice teria previsto isso.

Então qual você deveria escolher?

  • Precisa de entrada de imagemGPT-5.6 Luna. A opção com capacidade de visão mais barata aqui, empata com o Flash em inteligência, custa cerca de 3x na prática. Mantenha o esforço baixo se a latência importar.
  • Precisa de residência de dados → hospede os pesos do Flash você mesmo. Mesmo modelo, licença MIT, 168,6 tok/s em uma única MI300X. O fallback gerenciado mais barato é o plano pago do Gemini, que afirma por escrito que seu conteúdo não é usado para treinamento.
  • Precisa de throughputGemini 3.5 Flash-Lite a 366 tok/s e a saída mais concisa do grupo. Aceite o índice 36.
  • Precisa de menos tokens de saída com paridadeGemini 3.6 Flash. Mesma pontuação de 50 com 59M de tokens em vez de 210M, a 10x o custo por tarefa.
  • Precisa de confiabilidadeKimi K3. Alucinação de 51% contra 84%, a 29x o custo por tarefa. Não se preocupe com o K3 (low).
  • Precisa de recall sobre documentos longosDeepSeek V4 Pro. Vence SimpleQA-Verified 57.9 a 34.1, e os votantes do LMArena concordam.
  • Precisa do menor preço de tabelaQwen3.7-Flash, mas apenas com prompts abaixo de 32K, e apenas se você estiver confortável com quase nenhuma avaliação independente.
  • Não precisa de nada disso → fique no Flash. É o mais barato, o mais rápido no primeiro token, e é aberto. Só fique atento a essa sobretaxa pendente de 2x em horário de pico, que vai se aplicar entre 9h00–12h00 e 14h00–18h00 no horário de Pequim assim que a DeepSeek anunciar uma data de início.

Se você está escolhendo um modelo para responder tickets de clientes, o explicativo sobre o melhor agente de suporte de IA e o custo de atendimento ao cliente com IA são leituras mais úteis do que qualquer uma das páginas de modelo acima. Se você está escolhendo um para escrever, melhor LLM para escrever blog é por onde eu começaria.

Sources

Frequently Asked Questions

Qual é a melhor alternativa ao DeepSeek V4 Flash?
Depende de qual lacuna você quer resolver. GPT-5.6 Luna é o equivalente mais próximo em inteligência e adiciona entrada de imagem por cerca de 3 vezes o custo real. Gemini 3.5 Flash-Lite é a escolha para throughput. Kimi K3 é a escolha se a confiabilidade das respostas importar mais do que a conta. Não há um único vencedor porque o Flash já é o mais barato e o mais rápido para o primeiro token.
Existe uma alternativa mais barata ao DeepSeek V4 Flash?
No preço de tabela, sim: o Qwen3.7-Flash começa em $0.03 de entrada e $0.13 de saída por milhão. Mas isso vale apenas para a faixa abaixo de 32K, e a média móvel de 30 dias do OpenRouter do que os clientes realmente pagam é $0.061 de entrada e $0.163 de saída, acima do preço de tabela. Se isso supera o Flash depende totalmente do tamanho dos seus prompts. Detalhei a matemática das faixas no guia de preços do Qwen 3.7 Flash.
Qual alternativa ao DeepSeek V4 Flash suporta entrada de imagem?
Todas, exceto o V4 Pro. O Flash é apenas texto na entrada e na saída, sem entrada de imagem documentada. Se você precisa ler uma captura de tela ou a foto de um pacote danificado, essa é a razão mais clara para trocar. Gemini 3.6 Flash aceita texto, imagem, voz e vídeo. Luna, Kimi K3 e Claude Haiku 4.5 aceitam texto e imagens. Se você está conectando um agente de suporte a uma base de conhecimento que inclui capturas de tela, verifique isso primeiro.
Posso hospedar o DeepSeek V4 Flash eu mesmo em vez de trocar de modelo?
Sim, e essa é a opção mais subestimada desta lista. Os pesos têm licença MIT, com 284B de parâmetros totais e 13B ativos, e uma configuração de produção para uma única AMD MI300X já é pública. Esse caminho mantém o modelo e resolve o problema de residência de dados, que é o que a maioria das pessoas realmente busca. A contrapartida é o hardware que você precisa comprar ou alugar. Veja agentes de IA open source para o ecossistema mais amplo.
O DeepSeek treina com dados de API de clientes pagantes?
Os termos pagos da Open Platform ficam em silêncio sobre isso, o que é diferente de permissivo e diferente de seguro. A cláusula de treinamento presente nos termos para consumidores simplesmente não existe nos termos da API, e também não há um DPA publicado nem uma opção de retenção zero em nenhum dos sentidos. O plano pago do Gemini do Google afirma claramente que o conteúdo não é usado para melhorar seus produtos. Se essa distinção importa para seus compradores, leia SOC 2 e GDPR para chatbots de suporte.
Quanto custa o DeepSeek V4 Flash comparado às alternativas?
O Flash custa $0.14 de entrada com cache-miss e $0.28 de saída por milhão, contra $0.20/$1.20 do Luna e $1.50/$7.50 do Gemini 3.6 Flash. Mas a tabela de preços exagera a diferença porque o Flash é o modelo mais verboso do grupo. Na própria execução do índice da Artificial Analysis, a conta foi de $72 para o Flash e $727 para o Gemini 3.6 Flash com a mesma pontuação, o que é 10 vezes, não as 27 vezes que a coluna de saída sugere. Para trabalho de suporte, o número que importa é o custo por resolução, não por token.
É seguro colocar o DeepSeek V4 Flash na frente dos clientes?
Não por si só, e nenhum modelo desta lista é. A taxa de alucinação AA-Omniscience do Flash é de 84%, o número mais alto do seu placar, mas mesmo os 51% do Kimi K3 seriam inaceitáveis em uma resposta sem supervisão. A solução não é um modelo melhor, é grounding, limites de confiança e testes com seu próprio histórico antes de ir ao ar.
Devo usar o DeepSeek V4 Pro em vez do Flash?
Apenas para necessidades de recall e busca em contexto longo, onde o Pro ainda vence claramente: SimpleQA-Verified 57.9 contra 34.1 do Flash. Nas nove linhas agênticas que a DeepSeek publica, o Flash 0731 supera a versão preliminar do Pro em todas elas, e o Pro não pode ter o esforço reduzido porque uma solicitação low é atendida como high. Detalhamento completo em Flash vs V4 Pro.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Um modelo pequeno posto de lado enquanto cinco modelos alternativos captam a luz
Alternatives

8 melhores alternativas ao Inkling-Small em 2026

O Inkling-Small é barato e rápido, mas sua pontuação de conhecimento medida é negativa. Aqui estão 8 alternativas ao Inkling-Small, com preços reais e a pegadinha de cada uma.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
Ilustração de uma pessoa avaliando vários super-agentes de IA como alternativas ao Skywork AI
Alternatives

7 melhores alternativas ao Skywork AI em 2026

As melhores alternativas ao Skywork AI em 2026, de super-agentes gerais como Manus a ferramentas de pesquisa, criadores de apresentações e uma opção focada apenas em suporte, com preços reais.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Uma pessoa ao telefone diante de três opções diferentes de agente de voz, com o logotipo da Grok à esquerda
Alternatives

As 10 melhores alternativas ao Grok Voice Think Fast 2 em 2026

O Grok Voice Think Fast 2.0 ficou 60% mais caro no alias padrão. Dez alternativas reais, com custo por hora medido e números de benchmark honestos.

Riellvriany IndriawanRiellvriany IndriawanAug 5, 2026
Banner ilustrado de destaque para um guia das melhores alternativas ao Paperclip para agentes de IA
Alternatives

8 melhores alternativas ao Paperclip para agentes de IA (2026)

O Paperclip é uma forma brilhante e open-source de rodar uma empresa inteira de agentes de IA, mas nunca foi feito para responder a uma fila de suporte. Aqui estão 8 alternativas ao Paperclip, e para quem cada uma realmente serve.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Banner ilustrado para um guia das melhores alternativas ao NemoClaw para agentes de IA e atendimento ao cliente
Alternatives

8 melhores alternativas ao NemoClaw para equipes de suporte (2026)

O NemoClaw e o ambiente de execucao governado da NVIDIA para hospedar agentes de IA por conta propria, mas nunca foi feito para tocar uma fila de suporte. Aqui estao 8 alternativas ao NemoClaw, e para quem cada uma serve.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Banner ilustrado de um guia sobre as melhores alternativas ao ZeroClaw para atendimento ao cliente com IA
Alternatives

As 8 melhores alternativas ao ZeroClaw para equipes de suporte (2026)

O ZeroClaw é um runtime de agentes de IA autoalojado brilhantemente construído, mas nunca foi feito para tocar uma fila de suporte. Aqui estão 8 alternativas ao ZeroClaw, e para quem cada uma é indicada.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Ilustração de um agente de IA direcionando conversas com clientes por telefone, chat e e-mail
Alternatives

8 melhores alternativas ao Replicant para suporte com IA em 2026

As melhores alternativas ao Replicant para 2026, comparadas por preço, canais e tempo de implantação, da IA de voz corporativa à automação rápida de helpdesk self-service.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 15, 2026
Ilustração das melhores alternativas ao Espressive para IA de TI corporativa e suporte a funcionários em 2026
Alternatives

As 8 melhores alternativas ao Espressive em 2026

O Espressive foi adquirido pela Resolve e a marca está sendo descontinuada. Aqui estão as 8 melhores alternativas ao Espressive para IA de suporte a funcionários e clientes em 2026.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 15, 2026
Banner ilustrado para um guia das melhores alternativas ao Maven AGI para atendimento ao cliente com IA em 2026
Alternatives

As 7 melhores alternativas ao Maven AGI em 2026

Um olhar prático sobre as melhores alternativas ao Maven AGI para atendimento ao cliente com IA em 2026, de agentes de helpdesk self-service a plataformas de CX empresariais, com preços reais.

Rama Adi NugrahaRama Adi NugrahaJul 15, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis