As 8 melhores alternativas ao DeepSeek V4 Flash em 2026
Kurnia Kharisma Agung Samiadjie
Katelin Teen
Última edição August 6, 2026

Por que não estou classificando por pontuação
Escrevo sobre intenção de busca para viver, e "deepseek v4 flash alternatives" é uma consulta de compra com uma suposição escondida: que você está procurando algo melhor. Nos dois painéis que medem esse modelo, na maioria das vezes você não está.
A Artificial Analysis coloca o Flash no esforço máximo em 50 e o descreve como "entre os modelos líderes em inteligência e bem precificado em comparação com outros modelos de peso aberto de tamanho similar." O Luna marca 51. O Gemini 3.6 Flash marca 50. Você estaria trocando lateralmente em inteligência e pagando mais por esse privilégio.
O que você realmente estaria comprando é uma capacidade ou uma resposta de compliance. Então é assim que esta lista está ordenada: pela lacuna que ela resolve, com o custo honesto da troca anexado a cada uma. Se você quer a leitura pura de especificações do modelo que está deixando, o resumo do DeepSeek V4 Flash e a análise do Flash cobrem isso, e Flash vs GPT-5.6 cobre em detalhe o confronto mais próximo.
Os números, em um só lugar
Cada número abaixo vem da Artificial Analysis ou da própria página de preços do fornecedor, verificado em 4 de agosto de 2026. "Index run" é o que custou à AA avaliar aquele modelo em todo o Intelligence Index, que é o mais próximo de um número real de custo por tarefa que qualquer um deles publica.
| Modelo | AA Index | Entrada /1M | Saída /1M | Index run | Velocidade de saída | Tempo até o primeiro token | Tokens para executar o índice | Tipos de entrada | Contexto | Pesos |
|---|---|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 (max) | 50 | $0.14 | $0.28 | $72.02 | 113 t/s | 1,31s | 210M | text | 1M | MIT |
| GPT-5.6 Luna (max) | 51 | $0.20 | $1.20 | $174.06 | 181 t/s | 132,75s | 130M | text, image | 1.05M | closed |
| Gemini 3.6 Flash (high) | 50 | $1.50 | $7.50 | $726.70 | 213 t/s | 15,69s | 59M | text, image, speech, video | 1M | closed |
| Gemini 3.5 Flash-Lite | 36 | $0.30 | $2.50 | $153.08 | 366 t/s | 8,41s | 43M | text, image, speech, video | 1M | closed |
| Claude Haiku 4.5 (non-reasoning) | 24 | $1.00 | $5.00 | não publicado | 90 t/s | 0,96s | não publicado | text, image | 200K | closed |
| Kimi K3 (max) | 57 | $3.00 | $15.00 | $2,437.41 | 36 t/s | 2,85s | 130M | text, image | 1M | licença kimi-k3 |
| DeepSeek V4 Pro | 44 | $0.435 | $0.87 | não publicado | não publicado | não publicado | não publicado | text | 1M | open |
| Qwen3.7-Flash | não listado | $0.03–$0.20 | $0.13–$0.80 | não publicado | 59 t/s | não publicado | não publicado | text, image, video | 1M | closed |
Duas coisas se destacam nessa tabela. O Flash tem o primeiro token mais rápido do grupo por um fator de dois sobre tudo, exceto o Haiku, e é o único modelo aqui que é ao mesmo tempo de peso aberto e realmente barato. Tudo o mais é uma troca.

Escolha pela lacuna, não pela pontuação
Antes da lista: esta é a decisão em cinco cliques. Escolha o que realmente está te bloqueando e você tem a escolha mais o custo real da troca.
Para que você realmente está trocando?
O Flash já é o mais barato e o mais rápido no primeiro token. Então escolha a lacuna.
O Flash não tem entrada de imagem documentada. O Luna aceita texto e imagens, marca um ponto mais alto no índice da AA com 51, e roda a 181 tokens por segundo. Também é o modelo com capacidade de visão mais barato desta comparação, com $0.20 de entrada e $1.20 de saída.
Custo da troca: cerca de 3 vezes a conta real em cenários com muito cache, muito raciocínio e prompts longos, e um tempo até o primeiro token de 132,75s no esforço máximo. Não coloque em um caminho interativo sem reduzir o esforço.
Você mantém exatamente o mesmo modelo e move apenas a inferência. Os pesos têm licença MIT, e uma configuração de produção pública já roda o checkpoint 0731 em uma única AMD MI300X a 168,6 tokens por segundo em fluxo único, mais rápido que os 113 medidos na API oficial.
Custo da troca: hardware. 156,67 GiB de pesos precisam caber na HBM, e uma única MI300X é difícil de comprar sozinha. Se você preferir não gerenciar GPUs, o plano pago do Gemini afirma explicitamente que seu conteúdo não é usado para melhorar seus produtos.
366 tokens por segundo, o mais rápido aqui, e o mais conciso: 43M de tokens de saída para executar o índice da AA contra os 210M do Flash. Aceita texto, imagem, voz e vídeo. Bom para classificação e triagem em grande volume.
Custo da troca: inteligência. Índice 36 contra 50 do Flash, então é uma classe de tarefa diferente. E nenhum uso de computador a qualquer preço.
A escolha de confiabilidade. Taxa de alucinação AA-Omniscience de 51% contra 84% do Flash, Omniscience Index de 18 contra -16 do Flash, e a maior inteligência bruta aqui, com 57.
Custo da troca: cerca de 29 vezes o custo por tarefa e 36 tokens por segundo. Também não existe um K3 econômico. A linha K3 (low) marca 47, três pontos abaixo do Flash, a 8 vezes o custo. O raciocínio não pode ser desligado.
Fique na família. O Pro ainda vence claramente em recall e busca em contexto longo: SimpleQA-Verified 57.9 contra 34.1 do Flash, MRCR em contexto de 1M 83.5 contra 78.7, e os votantes humanos do LMArena o classificam em 1458 contra 1436 do Flash.
Custo da troca: 3,11x na entrada e saída com cache-miss, e nenhuma execução barata. A própria tabela de mapeamento de esforço da DeepSeek atende uma solicitação low no Pro como high.
1. GPT-5.6 Luna

Melhor para: a troca mais equivalente, e a forma mais barata de adicionar entrada de imagem.
O que realmente é
O Luna é o nível econômico da família GPT-5.6, descrito na sua própria página de modelo como "otimizado para cargas de trabalho sensíveis a custo." A razão pela qual a maioria das comparações com o Flash erra é que gpt-5.6 é um alias para o Sol, o nível de fronteira, então as pessoas acabam comparando por acidente um modelo de $0.14 com um de $5. Contra o Luna especificamente, a questão de inteligência é praticamente um empate: 51 contra 50 no índice da AA.
Ele tem uma janela de contexto de 1.050.000 tokens, máximo de saída de 128.000 tokens, corte de conhecimento em 16 de fevereiro de 2026, e suporte a tokens de raciocínio. Entrada de texto e imagem, saída de texto.
Preços
$0.20 de entrada, $0.02 de entrada em cache, $1.20 de saída por milhão. Há uma escala real de descontos por baixo disso que a maioria dos artigos não percebe:
| Nível | Entrada /1M | Cache /1M | Saída /1M |
|---|---|---|---|
| Standard | $0.20 | $0.02 | $1.20 |
| Batch | $0.10 | $0.01 | $0.60 |
| Flex | $0.10 | $0.01 | $0.60 |
| Fast mode | $0.40 | $0.04 | $2.40 |
| Long context (>272K) | $0.40 | $0.04 | $1.80 |
No Batch ou Flex, a entrada do Luna a $0.10 é na verdade mais barata que a do Flash a $0.14. Se sua carga de trabalho for amigável a processamento noturno e pesada em entrada com saídas curtas, o que descreve boa parte da classificação de tickets, o Luna pode sair na frente. O Flash não tem nenhum desconto de lote.
Onde ele supera o Flash
Entrada de imagem, latência publicada com a qual você pode planejar, e uma história de tratamento de dados que você pode entregar a um revisor de segurança. Também busca na web, o que vale a pena ser preciso: o Flash tem de fato uma ferramenta web_search do lado do servidor, mas apenas na Responses API exclusiva do Flash, não no caminho chat-completions. A afirmação amplamente repetida de que "o DeepSeek não tem busca na web" está desatualizada.
Onde ele não supera
As evidências no Hacker News colocam a diferença real entre 2x e 3x, não os 4,3x que a coluna de saída sugere, porque a entrada em cache do Luna também é barata. Mas 3x ainda é 3x. E o número de latência é brutal:
"2x to 3x the price… 2 to 5 times faster inference"
Esse "faster inference" é throughput, não capacidade de resposta. No esforço máximo, o tempo até o primeiro token do Luna é de 132,75 segundos. Bom para um trabalho em lote, errado para um widget de chat.
Há também um precipício assimétrico a se planejar: prompts acima de 272K de entrada re-precificam toda a solicitação a 2x na entrada e 1,5x na saída, não apenas o excedente. Escritas em cache são cobradas a 1,25x a taxa sem cache.
Veredito
Se a razão para deixar o Flash é entrada de imagem ou uma conversa de compliance, essa é a primeira coisa a tentar, e a taxa de lote a torna mais barata do que as pessoas supõem. Eu não a colocaria em uma superfície interativa no esforço máximo. O detalhamento completo dos níveis está no guia de preços do GPT-5.6, e a análise do GPT-5.6 cobre toda a família.
2. Gemini 3.5 Flash-Lite

Melhor para: classificação de alto volume, triagem, e qualquer coisa onde tokens por segundo é o bottleneck.
O que realmente é
O modelo geralmente disponível mais barato do Google na linha 3.5, descrito na sua própria página de modelo como "nosso modelo 3.5 mais rápido e mais econômico para execução de alto throughput." O código do modelo é gemini-3.5-flash-lite, contexto de entrada de 1.048.576, saída de 65.536, e aceita texto, imagem, voz, vídeo e PDF.
Preços
$0.30 de entrada e $2.50 de saída por milhão no Standard. Batch e Flex reduzem ambos à metade, para $0.15/$1.25. Priority é $0.54/$4.50. O cache de contexto custa $0.03.
Onde ele supera o Flash
Dois números. 366 tokens por segundo, o mais rápido aqui, e 43M de tokens de saída para executar o índice da AA contra os 210M do Flash. A AA o chama de "razoavelmente conciso" e chama o Flash de "muito verboso." Essa concisão é o motivo pelo qual um modelo com uma taxa de saída nominalmente 9 vezes maior custou apenas $153,08 para executar o índice contra os $72,02 do Flash, aproximadamente 2 vezes, não 9.
A entrada multimodal é nativa em quatro modalidades. E o nível pago do Google é explícito onde o da DeepSeek fica em silêncio: a página de preços lista "Conteúdo não usado para melhorar nossos produtos" como propriedade do nível pago, contra "Conteúdo usado para melhorar nossos produtos" no nível gratuito.
Onde ele não supera
Intelligence Index 36 contra 50 do Flash. Essa não é uma diferença pequena, é uma classe de peso diferente, e o Flash-Lite vai ser pior em qualquer coisa agêntica ou de múltiplas etapas. Nenhum uso de computador a qualquer preço. O tempo até o primeiro token é de 8,41s, seis vezes o do Flash.
Veredito
Se você está executando classificação de intenção ou análise de sentimento sobre um grande volume, essa é a forma certa e a concisão economiza dinheiro real. Se você está executando um agente, não é. Mais no resumo do Gemini 3.5 Flash-Lite.
3. Gemini 3.6 Flash

Melhor para: igualar a inteligência do Flash com um terço dos tokens de saída, mais uso de computador.
O que realmente é
O nível Flash de referência do Google, lançado em 21 de julho de 2026, posicionado como o modelo que "equilibra velocidade e inteligência para entregar forte desempenho em tarefas agênticas e multimodais." O corte de conhecimento foi movido para março de 2026. O uso de computador vem embutido. Contexto de 1M, saída de 65K.
Preços
$1.50 de entrada, $7.50 de saída por milhão. O Batch reduz ambos à metade, para $0.75/$3.75.
Onde ele supera o Flash
Este é o item que mudou como eu leio toda a comparação. O Gemini 3.6 Flash marca exatamente os mesmos 50 pontos do Flash, e chega lá com 59M de tokens de saída contra os 210M do Flash. Na tabela de preços isso é uma diferença de 26,8x na saída. Na conta real de execução do índice da AA é $726,70 contra $72,02, o que dá 10,1x.
10x ainda é 10x, então esse não é um modelo mais barato. Mas a direção importa: toda comparação de verbosidade neste artigo se move contra o Flash, e se você tem orçado com base na coluna por token, você tem superestimado sua economia.

Ele também traz quatro modalidades de entrada, 213 tokens por segundo, e uso de computador, algo que nada mais nesta lista oferece nesse nível.
Onde ele não supera
10x o custo por tarefa em paridade de inteligência. Tempo até o primeiro token de 15,69s. Pesos fechados, então hospedar você mesmo está fora de questão.
Veredito
A escolha quando o modelo está fazendo trabalho agêntico sobre uma base de conhecimento com mídia mista e você quer reduzir a contagem de tokens. Leia o resumo do Gemini 3.6 Flash, ou a análise para o detalhe das avaliações.
4. Claude Haiku 4.5

Melhor para: o primeiro token mais rápido do grupo, e a revisão de segurança mais fácil.
O que realmente é
O modelo pequeno da Anthropic, claude-haiku-4-5, descrito na documentação como "o modelo mais rápido com inteligência quase de fronteira." Entrada de texto e imagem, contexto de 200K, conhecimento até julho de 2025. Disponível na API Claude, Amazon Bedrock, Google Cloud e Microsoft Foundry.
Preços
$1.00 de entrada, $5.00 de saída por milhão.
Onde ele supera o Flash
0,96 segundos até o primeiro token, o único número nesta página que supera o 1,31s do Flash, a 90,2 tokens por segundo. A AA chama esse TTFT de "muito competitivo" contra uma mediana de 1,43s na sua faixa de preço.
A outra coisa em que ele supera o Flash é aquisição. A disponibilidade multi-cloud via Bedrock e Google Cloud significa que residência de dados e contratação são um problema já resolvido por outra pessoa, não seu. Na minha experiência esse é o bloqueio real com mais frequência do que qualquer benchmark:
Bloqueado completamente por HIPAA/BAA durante a demonstração, descrito como um bloqueio rígido, não uma preocupação leve.
Uma plataforma de saúde e fisioterapia dos EUA no Zendesk processando cerca de 500 tickets por mês
Aquele negócio não travou por causa de uma taxa de alucinação.
Onde ele não supera
Intelligence Index 24 sem raciocínio, o mais baixo aqui, e a menor janela de contexto com 200K contra o 1M de todos os outros. A AA não publica um custo de execução do índice para ele, então o custo por tarefa é desconhecido. A Anthropic também oferece uma variante com raciocínio, mas o 24 é a linha sem raciocínio, e é isso que os $1/$5 compram nas configurações padrão.
Veredito
Escolha isso quando capacidade de resposta e contratação importarem mais do que capacidade bruta, o que é a maioria do chat voltado ao cliente. Não escolha para trabalho agêntico. OpenAI API vs Anthropic API cobre o lado da experiência do desenvolvedor, e preços do Claude Sonnet 5 cobre o nível acima.
5. Kimi K3

Melhor para: o único caso em que pagar 29x mais é defensável: respostas que você não pode se dar ao luxo de errar.
O que realmente é
O carro-chefe da Moonshot AI, lançado em 16 de julho de 2026. 2,8T de parâmetros totais com 104B ativos, contexto de 1M, visão nativa para imagens e vídeo. Os pesos abertos foram lançados em 27 de julho como prometido, 1.561 GB em 96 shards, sob uma licença kimi-k3 com cláusulas para grandes operadores de MaaS e produtos muito grandes.
Preços
$3 de entrada, $0.30 de entrada com cache-hit, $15 de saída por milhão. Isso é território do Claude Sonnet, não território econômico.
Onde ele supera o Flash
Confiabilidade, e não por pouco. Taxa de alucinação AA-Omniscience de 51% contra 84% do Flash. Omniscience Index de 18 contra -16 do Flash, onde uma pontuação negativa significa mais respostas incorretas do que corretas. Precisão de 46% contra 37%. A maior inteligência bruta nesta comparação, com 57.
Se seu caso de uso é um setor regulado ou um agente de IA que toca em dinheiro, essa diferença é todo o argumento.
Onde ele não supera
Custo, e não apenas pela margem do preço de tabela. A taxa de saída é 54 vezes a do Flash, mas o custo por tarefa da AA é $0.03 contra $0.86, então a diferença real é de 29x porque o K3 é mais verboso por ponto de inteligência. Execução completa do índice: $72,02 contra $2.437,41.
36 tokens por segundo, o mais lento aqui. E não existe um K3 econômico: a AA lista uma linha K3 (low) separada com um Intelligence Index de 47, três pontos abaixo do Flash, custando $0.24 por tarefa, que é 8x o Flash, e não é mais rápido. O guia de início rápido da Moonshot confirma que o raciocínio não pode ser desligado, então os níveis de esforço são um controle de latência em vez de um nível de custo.
Mais uma coisa que vale mencionar para quem compara políticas de dados: os termos da Moonshot são explícitos e permissivos onde os da DeepSeek ficam em silêncio. A Seção 4 diz que "salvo acordo expresso por escrito em contrário, o Conteúdo do Cliente pode ser usado para os fins mencionados", com opt-out apenas via um acordo empresarial negociado. Os dados ficam em Singapura.
Veredito
Compre quando uma resposta errada custar mais do que 29 vezes a conta de tokens, o que é uma situação real e mais estreita do que a maioria dos compradores pensa. Fora isso, a matemática não fecha. Analisei esse confronto a fundo em Flash vs Kimi K3, e também há uma análise do Kimi K3 e um guia de preços.
6. DeepSeek V4 Pro

Melhor para: ficar na família quando você precisa de recall em vez de raciocínio.
O que realmente é
O nível V4 maior, deepseek-v4-pro, com 49B de parâmetros ativos contra os 13B do Flash. Ainda no build de pré-visualização de abril sem equivalente 0731, que é a razão pela qual esta comparação é estranha.
Preços
$0.435 de entrada com cache-miss, $0.003625 de entrada com cache-hit, $0.87 de saída por milhão. Isso é 3,11x o Flash em entrada com cache-miss e saída, mas apenas 1,29x em cache-hits.
Onde ele supera o Flash
Recall e busca em contexto longo, que é o que os parâmetros ativos adicionais compram. Da própria tabela cross-mode da DeepSeek no esforço máximo: SimpleQA-Verified 57.9 contra 34.1, GDPval-AA Elo 1554 contra 1395, BrowseComp 83.4 contra 73.2, e MRCR em contexto de 1M 83.5 contra 78.7.
E o voto humano concorda com o Pro, não com o índice automatizado. O LMArena Text classifica o Pro em 1458±4 contra o 1436±4 do Flash em cerca de 49.000 votos cada. Dois painéis, ambos corretos, medindo coisas diferentes.
Onde ele não supera
O Flash 0731 supera a pré-visualização do Pro em todas as nove linhas agênticas que a DeepSeek publica, com o DeepSWE 54.4 contra 12.8 sendo a mais larga. A AA coloca o Flash em 50 e $0.03 por tarefa contra o Pro em 44 e $0.05. Vale destacar honestamente que duas dessas nove linhas são conjuntos internos próprios da DeepSeek e o harness não foi divulgado.
Também não há uma execução barata do Pro. A tabela de mapeamento de esforço publicada pela DeepSeek atende uma solicitação low no Pro como high, então você paga 3,11x e não pode reduzir o raciocínio. Esse mapeamento estava previsto para mudar no início de agosto de 2026.
Veredito
Uma escolha estreita, mas real: escolha o Pro para trabalho intensivo em recuperação sobre documentos longos, fique no Flash para trabalho agêntico e de código. Detalhamento completo em Flash vs V4 Pro.
7. Hospedando os pesos do Flash você mesmo

Melhor para: manter o modelo e resolver o problema de residência em um único movimento.
O que realmente é
Não é um modelo diferente. O mesmo checkpoint DeepSeek-V4-Flash-0731 com licença MIT, rodando em hardware que você controla. Este item ganha seu lugar porque uma configuração de produção se tornou pública hoje e chegou à primeira página do Hacker News com 165 pontos.
Preços
Hardware, não tokens. O que é exatamente o ponto se seu bloqueio é uma revisão de segurança em vez de um orçamento.
Onde ele supera a API do Flash
Os números publicados em uma única AMD MI300X, do stack vLLM ROCm fixado no repositório:
| Métrica | Resultado |
|---|---|
| Decodificação de fluxo único | 168,6 tok/s |
| Prefill com kernels ajustados | ~7,9–8,5K tok/s |
| 8 fluxos concorrentes | 542 tok/s agregado, 90,3 tok/s mediana por fluxo |
| Rajada de 64 fluxos | 830 tok/s agregado, sem OOM |
| Contexto validado | 256K (arquitetura suporta 1M) |
| Pesos em HBM | 156,67 GiB, sem quantização adicional |
168,6 tokens por segundo em uma placa supera os 113 tok/s que a Artificial Analysis mede na própria API da DeepSeek. O repositório é explícito que "o checkpoint roda como enviado, sem quantização de pesos adicional ou offload", então isso não é uma troca de velocidade por qualidade.
Também responde à objeção que mais escuto, que não tem nada a ver com o modelo:
Phil perguntou se ele usa "algum tipo de outro ChatGPT ou algo assim se não sabe a resposta" e se isso pode ser desligado. Gil perguntou se o conhecimento fica fechado dentro da organização deles.
Um avaliador técnico em uma empresa de hardware de semicondutores B2B que precisava de garantia de que a IA responde apenas a partir do conhecimento aprovado pela organização, não de dados de treinamento gerais
Hospedar você mesmo é a única opção nesta página que responde essa pergunta com um diagrama de rede em vez de uma leitura de termos de serviço.
Onde ele não supera
Hardware que você precisa obter, e a comunidade é direta sobre isso:
"I don't think you can buy a single 'MI300X' unit, right? Only the box with x8 of these at a cost of ~250K EUR."
Há uma solução alternativa na mesma thread:
"The MI350P is the one you want: It's a PCIe card, but it has less memory: 144GB. Luckily, DeepSeek V4 Flash will run in 144GB too because it's 256 MoE exports are native MXFP4 quantized."
Mais duas ressalvas honestas. O repositório descreve o checkpoint como 304B de parâmetros, enquanto a AA publica 284B totais, então a contagem de parâmetros na prática é inconsistente. E a DeepSeek supostamente obtém 15K tok/s/gpu em H800 no seu próprio paper DSpark, segundo xorfish na mesma thread, então ainda há margem nessa configuração.
Veredito
Se sua razão para pesquisar é residência de dados, isso deveria estar no topo da sua lista, não no fim. Você não está trocando qualidade de modelo em nada. Leitura relacionada: agentes de IA open source, modelos de IA personalizados, e construir vs comprar.
8. Qwen3.7-Flash

Melhor para: o menor preço de tabela, se seus prompts realmente forem pequenos.
O que realmente é
O modelo de raciocínio visão-linguagem da Alibaba, lançado em 27 de julho de 2026, descrito no OpenRouter como adequado para "agentes multimodais, codificação visual, busca e interação com computador." Contexto de 1M, texto mais imagem mais vídeo como entrada.
Preços
Aqui é onde fica interessante, e onde a colisão de nomes com o "Flash" da DeepSeek causa confusão real. Os preços são divididos por faixas de tamanho de prompt, então a taxa de destaque e o contexto de 1M não podem ser verdadeiros na mesma chamada:
| Tamanho do prompt | Entrada /1M | Saída /1M |
|---|---|---|
| Abaixo de 32K | $0.03 | $0.13 |
| 32K–256K | $0.10 | $0.40 |
| 256K–1M | $0.20 | $0.80 |
Uma variação de 6,7x na entrada. E o OpenRouter publica a média móvel de 30 dias do que os clientes realmente pagam: $0.061 de entrada e $0.163 de saída, acima do preço de tabela, o que indica que o tráfego real está caindo nas faixas superiores.
Onde ele supera o Flash
A faixa abaixo de 32K a $0.03/$0.13 é realmente mais barata que o $0.14/$0.28 do Flash, cerca de 4,6x na entrada. Aceita imagens e vídeo, algo que o Flash não aceita nenhum dos dois. A leitura em cache custa $0.006.
Onde ele não supera
Quase nada é verificado de forma independente, e essa é a história em si, não uma nota de rodapé. A Qwen não publicou benchmarks, arquitetura, nem contagem de parâmetros. Não está listado na Artificial Analysis de forma alguma, então não há um score de índice comparável na tabela acima. Os pesos são fechados.
A única avaliação de terceiros em que confio é o benchmark de visão da Roboflow, que o coloca em 22º de 23 no geral com 61,7%, enquanto o classifica em 1º de 23 em custo. Ele identifica muito melhor do que localiza.
"Flash" aqui significa barato, não rápido: 59 tokens por segundo contra os 113 do Flash e os 366 do Flash-Lite. A taxa de erro de chamadas de ferramentas é de 8,88%, a latência ponta a ponta P99 é de 90,19 segundos, e o OpenRouter observa que ele é "hospedado por um único provedor" com "nenhuma decisão de roteamento a tomar", então não há fallback se aquele provedor tiver um dia ruim.
Veredito
Escolha apenas se seus prompts realmente ficam abaixo de 32K e você precisa de visão com orçamento apertado. Acima disso, as faixas apagam a vantagem, e a falta de dados de avaliação significa que você compra na fé. A matemática das faixas é detalhada no guia de preços do Qwen 3.7 Flash, e o resumo do Qwen 3.7 Flash cobre as especificações.
O que nenhuma dessas oito vai fazer
Todo modelo aqui é a camada mais básica. Vale a pena dizer isso claramente, porque a decisão de troca que as pessoas me trazem geralmente é enquadrada como uma escolha de modelo e quase nunca é.
Uma taxa de alucinação de 84% não significa que o modelo erra 84% dos tickets. É um número da AA-Omniscience medido em perguntas sem contexto fornecido, que é exatamente o oposto de como um agente de suporte deveria operar. Conecte o mesmo modelo a um RAG sobre um centro de ajuda verificado e o número que importa muda completamente.
Esse é o argumento por trás de RAG vs LLM e prevenção de alucinação. A solução é grounding e guardrails, não um modelo base melhor.
A objeção do comprador que realmente decide esses negócios não é precisão no abstrato. É controle. Um líder de CX colocou melhor do que qualquer benchmark poderia:
"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer, then the point is a little bit gone. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
Um líder de CX em uma marca DTC de suplementos no Gorgias e Shopify, com cerca de 7.000 tickets e 30.000 pedidos por mês
Nenhum item da tabela acima resolve isso. Pontuações de confiança, regras de escalonamento, exclusão por tipo de ticket e um humano no loop resolvem, e esses vivem na camada acima da API.
Escrevi sobre limites de confiança e taxa de contenção separadamente, porque são a parte que decide se tudo isso funciona.
A segunda coisa que nenhum deles faz é te dizer o número que você realmente está orçando. Taxas de tokens são entradas. O custo por resolução é a saída, e os dois não são proporcionais quando você adiciona recuperação, novas tentativas e o tempo humano gasto limpando depois.
O que eu realmente faria com uma fila de suporte

Comprar modelos para uma fila de suporte é o primeiro passo errado, e digo isso como alguém que passou esta semana lendo oito cartões de modelo. A pergunta não é qual modelo aluciona menos, é como está sua precisão nos seus próprios tickets, e você não consegue isso de um leaderboard.
Isso é exatamente o que a eesel faz e uma API pura não pode fazer. Ela se conecta ao Zendesk, Freshdesk, Gorgias, Front ou Help Scout em poucos minutos, fundamenta cada resposta no seu centro de ajuda, tickets passados e macros, e então executa uma simulação sobre seus tickets históricos reais para você ver a taxa de resolução real antes de um cliente ver. Se não atinge sua barra, você não implanta.
O preço é 40 centavos por ticket atendido, sem taxas por assento, e você nunca é cobrado por tickets que seus humanos atendem. Roteie 200 dos seus 1.000 tickets mensais para começar e você paga $80. Experimente a eesel gratuitamente com $50 de uso e sem cartão de crédito.
Não estou afirmando que a eesel torna um modelo base mais inteligente. Estou afirmando que o que você realmente está buscando, um modelo em que você pode confiar na frente de clientes, não é um modelo de forma alguma. E a razão pela qual estou confiante sobre isso é que vimos nosso próprio agente falhar de formas que nenhum benchmark detecta: o pior padrão que já registramos foi um agente narrando "executando buscas no Zendesk" por cerca de dez turnos sem nunca chegar a tocar na API. Nada destrói a confiança em um colega de equipe mais rápido do que mentir sobre o que fez, e nenhum score de índice teria previsto isso.
Então qual você deveria escolher?
- Precisa de entrada de imagem → GPT-5.6 Luna. A opção com capacidade de visão mais barata aqui, empata com o Flash em inteligência, custa cerca de 3x na prática. Mantenha o esforço baixo se a latência importar.
- Precisa de residência de dados → hospede os pesos do Flash você mesmo. Mesmo modelo, licença MIT, 168,6 tok/s em uma única MI300X. O fallback gerenciado mais barato é o plano pago do Gemini, que afirma por escrito que seu conteúdo não é usado para treinamento.
- Precisa de throughput → Gemini 3.5 Flash-Lite a 366 tok/s e a saída mais concisa do grupo. Aceite o índice 36.
- Precisa de menos tokens de saída com paridade → Gemini 3.6 Flash. Mesma pontuação de 50 com 59M de tokens em vez de 210M, a 10x o custo por tarefa.
- Precisa de confiabilidade → Kimi K3. Alucinação de 51% contra 84%, a 29x o custo por tarefa. Não se preocupe com o K3 (low).
- Precisa de recall sobre documentos longos → DeepSeek V4 Pro. Vence SimpleQA-Verified 57.9 a 34.1, e os votantes do LMArena concordam.
- Precisa do menor preço de tabela → Qwen3.7-Flash, mas apenas com prompts abaixo de 32K, e apenas se você estiver confortável com quase nenhuma avaliação independente.
- Não precisa de nada disso → fique no Flash. É o mais barato, o mais rápido no primeiro token, e é aberto. Só fique atento a essa sobretaxa pendente de 2x em horário de pico, que vai se aplicar entre 9h00–12h00 e 14h00–18h00 no horário de Pequim assim que a DeepSeek anunciar uma data de início.
Se você está escolhendo um modelo para responder tickets de clientes, o explicativo sobre o melhor agente de suporte de IA e o custo de atendimento ao cliente com IA são leituras mais úteis do que qualquer uma das páginas de modelo acima. Se você está escolhendo um para escrever, melhor LLM para escrever blog é por onde eu começaria.
Sources
- Páginas de modelos da Artificial Analysis, todos os números verificados em 4 de agosto de 2026: DeepSeek V4 Flash 0731
- GPT-5.6 Luna na Artificial Analysis
- Gemini 3.6 Flash e Gemini 3.5 Flash-Lite na Artificial Analysis
- Kimi K3 e Claude 4.5 Haiku na Artificial Analysis
- Preços da API DeepSeek e o guia da Responses API
- Preços da plataforma OpenAI e a página do modelo GPT-5.6 Luna
- Preços da API de desenvolvedores Gemini e o catálogo de modelos
- Visão geral dos modelos Claude e preços Claude
- Preços de modelos Moonshot AI
- OpenRouter, Qwen3.7 Flash e Roboflow Vision Evals
- DeepSeek V4 Flash em uma única AMD MI300X e sua thread no Hacker News
- Dossiê interno de chamadas com clientes da eesel, citado sob descritores anonimizados
Frequently Asked Questions
Qual é a melhor alternativa ao DeepSeek V4 Flash?
Existe uma alternativa mais barata ao DeepSeek V4 Flash?
Qual alternativa ao DeepSeek V4 Flash suporta entrada de imagem?
Posso hospedar o DeepSeek V4 Flash eu mesmo em vez de trocar de modelo?
O DeepSeek treina com dados de API de clientes pagantes?
Quanto custa o DeepSeek V4 Flash comparado às alternativas?
É seguro colocar o DeepSeek V4 Flash na frente dos clientes?
Devo usar o DeepSeek V4 Pro em vez do Flash?
low é atendida como high. Detalhamento completo em Flash vs V4 Pro.
Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








