
O placar em 60 segundos
| Qwen 3.8 Max | DeepSeek V4 Flash | |
|---|---|---|
| ID do modelo | qwen3.8-max | deepseek-v4-flash |
| Build fixada | Qwen3.8-Max | DeepSeek-V4-Flash-0731 |
| Lançamento | 2 de agosto de 2026 | 31 de julho de 2026 |
| Entrada / 1M | $2.00 | $0.14 |
| Entrada em cache / 1M | $0.25 | $0.0028 |
| Saída / 1M | $6.00 | $0.28 |
| Janela de contexto | 1.000.000 | 1.000.000 |
| Saída máxima | 131.072 | 384.000 |
| Arquitetura | MoE 2,4T total / 95B ativos | MoE 284B total / 13B ativos |
| Pesos | Prometidos, não publicados | Abertos, MIT |
| Entradas | Texto, imagem, vídeo, documentos | Texto |
| Raciocínio padrão | xhigh, preserve_thinking ativado | Pensamento ativado, esforço high |
| Tokens de raciocínio máx. | 262.144 | Não publicado |
| Teto de throughput | 2M TPM, 15K RPM | 2.500 requisições simultâneas |
| Ranking LMArena Text | #5, 1496 | #79, 1436 |
| Índice de Inteligência AA | Ainda não pontuado | 50 |
| Mudança de preço pendente | Nenhuma publicada | 2x em horário de pico |
Duas linhas fazem a maior parte do trabalho aqui. O teto de saída é a discreta: o Flash escreve até 384K tokens em uma única resposta contra os 131.072 do Qwen, o que importa para qualquer coisa que precise gerar um artefato longo em vez de uma resposta de chat. A outra é a mudança de preço pendente no horário de pico, que eu colocaria numa planilha, porque é o único movimento de preço futuro anunciado de qualquer um dos dois lados.
Calcule quanto você realmente pagaria
As proporções acima são por token. O que realmente importa é a fatura, e isso depende mais do formato do seu tráfego do que da própria tabela de preços. Mova os controles.
O que o DeepSeek V4 Flash realmente é
O Flash é o irmão pequeno da família V4 do DeepSeek, e a palavra "pequeno" tem peso real nessa frase. É um modelo Mixture-of-Experts com 284B de parâmetros totais e apenas 13B ativos, contra os 1,6T totais e 49B ativos do V4 Pro, segundo a tabela de downloads de modelos do DeepSeek. Para dar uma escala, a geração anterior do próprio DeepSeek, o V3.2-Base, tinha 671B totais e 37B ativos, então o Flash tem menos da metade do tamanho total do modelo que substitui. Treze bilhões de parâmetros ativos colocam seu custo computacional por token mais perto de um modelo de linguagem pequeno do que de qualquer coisa com "fronteira" no marketing.
A build por trás do alias da API é DeepSeek-V4-Flash-0731, e o DeepSeek é incomumente transparente ao dizer que não se tratou de uma nova arquitetura. O changelog diz que manteve a arquitetura e o tamanho da preview e "só foi re-pós-treinado". Essa admissão importa, porque o salto de benchmark entre a preview e a 0731 é enorme. A tabela publicada pelo DeepSeek mostra o DeepSWE indo de 7.3 para 54.4 com os mesmos pesos, diferindo apenas no pós-treinamento.
Três peças arquiteturais são citadas no model card do V4: um híbrido de Compressed Sparse Attention e Heavily Compressed Attention, Manifold-Constrained Hyper-Connections para estabilidade de sinal entre camadas, e o otimizador Muon. A alegação de eficiência que todo mundo cita, 27% dos FLOPs de inferência de um único token e 10% do cache KV em comparação com o V3.2, foi medida no Pro, não no Flash, então é preciso cuidado ao repeti-la para este modelo.
Dois detalhes me importam, como alguém que entrega esse tipo de coisa profissionalmente. A decodificação especulativa vem embutida no checkpoint em vez de ser um modelo de rascunho separado, então no vLLM se resume a uma única flag, e o DeepSeek avisa explicitamente para não apontá-la para um caminho de rascunho. E os pesos têm licença MIT, cerca de 167GB em precisão mista FP4 e FP8, com 57 quantizações já disponíveis no Hugging Face. Se o seu plano é rodar um modelo próximo da fronteira no seu próprio hardware, esse é o fator decisivo.
O que o Qwen 3.8 Max realmente é
O Qwen seguiu na direção oposta em quase todos os eixos. O carro-chefe da Alibaba é um MoE esparso de 2,4 trilhões de parâmetros com 95B ativos, e seu primeiro modelo multimodal acima de um trilhão de parâmetros, aceitando texto, imagens, vídeo e documentos. A alegação da preview da equipe Qwen era de que ele ficava "atrás apenas do Fable 5", o que na época veio sem tabela de benchmarks, sem model card e também sem licença.
A disponibilidade geral em 2 de agosto resolveu o problema dos números. Não o da abertura. O post de GA trouxe um gráfico completo de benchmarks e uma janela de 1.000.000 de tokens, e a QwenCloud agora tem uma tabela de preços real de $2 e $6, com leituras de cache implícitas a $0.25.
Os pesos foram prometidos no Hugging Face e no ModelScope, reafirmados na GA como previstos para "na próxima semana", e não apareceram. Então o enquadramento honesto, quanto à licença, é que um dos dois é código aberto hoje e o outro é uma promessa. Meu panorama de alternativas ao Qwen 3.8 Max aprofunda o que isso significa se você precisar dos pesos, e o guia de preços do Qwen 3.8 Max acompanha como a tarifa da preview virou esta.
A outra coisa a saber é sobre os padrões, não sobre a capacidade. O Qwen vem com o raciocínio xhigh ativado e preserve_thinking habilitado, e vai gastar até 262.144 tokens de raciocínio. Cada um deles é cobrado na tarifa de saída, então o custo por tarefa e a tarifa por token começam a se distanciar. É a mesma armadilha sobre a qual escrevi na comparação Opus 5 vs Sonnet 5, em que o modelo mais caro vencia no custo por tarefa por terminar com menos tokens. Vale acrescentar uma nota de justiça aqui: a própria configuração do harness de codificação do Qwen declara maxTokens: 65536, então o teto de saída de 131K não é o que sua própria ferramenta lançada realmente pede.
A diferença de preço, e as duas coisas que ela esconde
Aqui está essa diferença desenhada em escala, já que a proporção não se sustenta bem numa única frase.

Então, a primeira coisa que ela esconde. O DeepSeek divide o preço de entrada entre tarifas de cache hit e cache miss, e no Flash a diferença é de $0.0028 contra $0.14, uma faixa de 50x. O cache vem ativado por padrão sem mudança de código, o que soa como dinheiro de graça até você ler como um acerto é decidido.

Uma requisição só é cobrada na tarifa de acerto se corresponder totalmente a uma unidade de prefixo de cache persistida. A sobreposição parcial não conta em nada, o que o DeepSeek atribui à sua atenção de janela deslizante. O DeepSeek chama o cache de "melhor esforço" sem taxa de acerto garantida, e entradas não usadas são limpas "geralmente dentro de algumas horas a alguns dias". Você pode auditar a divisão por chamada através de prompt_cache_hit_tokens na resposta, e deveria fazer isso, porque a tarifa de $0.0028 não é um estado estável no qual você possa basear seu orçamento.
A segunda coisa que ela esconde é para qual direção vai o próximo movimento de preço do DeepSeek. Não existe desconto em horário de baixa demanda hoje. Em vez disso, a tabela de preços anuncia que os preços em horário de pico "serão 2x os preços normais", aplicável a todos os itens de cobrança, entre 9h e 12h e entre 14h e 18h no horário de Pequim. Em UTC isso é das 01:00 às 04:00 e das 06:00 às 10:00, diariamente. A data de vigência não foi anunciada, e também não há tabela de tarifas de pico publicada.
Já vi exatamente essa mesma ansiedade se manifestar em ligações de vendas antes. Um comprador com quem conversamos tinha visto o preço de um fornecedor anterior mais que dobrar e chegou perguntando sobre travas de preço contratuais antes de discutir qualquer outra coisa. Um aumento pendente de 2x sem data de início é exatamente o tipo de frase que faz uma equipe financeira se recusar a padronizar em um fornecedor, por mais boa que a tarifa de hoje pareça.
Benchmarks: a tabela de quem, rodada no harness de quem
Ambos os laboratórios publicaram números. Nenhum rodou o harness do outro, então empilhar as duas tabelas uma sobre a outra dá uma comparação que não é real.
A tabela principal do DeepSeek para a 0731 traz nove benchmarks agênticos, e o Flash supera o V4 Pro Preview em todos os nove enquanto fica atrás do Claude Opus 4.8 em todos os nove. Vale saber que o Opus avançou mais uma geração desde então, o que minha análise do Claude Opus 5 cobre:
| Benchmark | V4-Flash-0731 | V4-Flash Preview | V4-Pro Preview | Opus-4.8 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 69.7 |
| Cybergym | 76.7 | 38.7 | 52.7 | 83.1 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 76.2 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 | 25.7 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 | 27.2 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 | 71.6 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 | 71.7 |
Leia as notas de rodapé, elas mudam o peso que essas linhas carregam. O model card da 0731 do DeepSeek diz que as tarefas de agente de código rodaram no "modo mínimo do DeepSeek Harness (a ser lançado)" com esforço de raciocínio max, então o harness que produziu essas pontuações não é público e os números não podem ser reproduzidos de forma independente hoje. E duas das nove linhas, DSBench-FullStack e DSBench-Hard, são conjuntos de teste internos do próprio DeepSeek.
O gráfico da Alibaba tem o mesmo tipo de problema, só que do outro lado. Seis de seus benchmarks de código são avaliações internas do Qwen, e as pontuações dos concorrentes vieram de harnesses mistos em vez de condições idênticas. Várias linhas também são avaliadas por modelos rivais. Percorri esse gráfico com cuidado na comparação Qwen 3.8 Max contra GPT-5.6.
O único lugar em que existe um número comparável em condições iguais está dentro da própria tabela de modos cruzados do DeepSeek, e honestamente é a coisa mais útil de todo este artigo:
| Benchmark | Flash sem pensar | Flash high | Flash max |
|---|---|---|---|
| HLE (Pass@1) | 8.1 | 29.4 | 34.8 |
| Apex (Pass@1) | 1.0 | 19.1 | 33.0 |
| LiveCodeBench (Pass@1) | 55.2 | 88.4 | 91.6 |
| GPQA Diamond (Pass@1) | 71.2 | 87.4 | 88.1 |
| MRCR 1M (MMR) | 37.5 | 76.9 | 78.7 |
Os mesmos pesos, a mesma tabela de preços. Três configurações. O Flash sem pensar marca 8.1 no HLE e 1.0 no Apex; no esforço máximo marca 34.8 e 33.0. Desligar o pensamento neste modelo não é uma troca pequena, e ligá-lo significa pagar os tokens de raciocínio na tarifa de saída, com um teto de 384K a ser preenchido. Essa é a frase que eu gostaria que qualquer um que citasse o número de $0.28 lesse primeiro.
O DeepSeek também é honesto sobre onde o Flash perde para o Pro, e eu respeito isso. O model card afirma que o Flash-Max alcança um desempenho de raciocínio comparável dado um orçamento de pensamento maior, mas fica "um pouco atrás em tarefas de conhecimento puro e nos fluxos de trabalho agênticos mais complexos". Os números confirmam isso: o SimpleQA-Verified é 34.1 para o Flash Max contra 57.9 para o Pro Max. Treze bilhões de parâmetros ativos é onde o conhecimento de mundo fica caro, e essa diferença foi medida na preview, então ninguém deveria alegar que a 0731 a fechou.
O que dizem os rankings independentes, e onde eles discordam
É aqui que a versão fácil dessa comparação desmorona. Existem dois árbitros independentes. Eles medem coisas diferentes, e agora estão apontando em direções opostas.
A Artificial Analysis pontua o DeepSeek V4 Flash no esforço máximo com um Índice de Inteligência de 50, terceiro entre os modelos de pesos abertos, com um custo por tarefa de $0.03. O mesmo ranking pontua a variante sem raciocínio dos mesmos pesos com 29. Então meu ponto anterior não é só a tabela interna do DeepSeek falando: um laboratório externo mediu uma oscilação de inteligência de 21 pontos entre a configuração barata e a boa.
A Artificial Analysis também aponta algo que vai contra a narrativa do preço. O Flash queimou 210M de tokens de saída para completar o Índice de Inteligência contra uma mediana de classe de 100M, o que o ranking descreve em suas próprias palavras como "muito verboso em comparação". A execução inteira ainda assim custou apenas $72.02, então tokens baratos absorveram a verbosidade aqui. Mas o mecanismo aqui é o mesmo que apontei sobre os padrões do Qwen, e acontece que o modelo com o problema de verbosidade medido é o barato. Esse é o número que eu gostaria de ver mais publicado em comparações de ferramentas de codificação com IA, porque a verbosidade é o que transforma uma tabela de preços em uma fatura.
Quanto ao Qwen nesse ranking: ele não está lá. O Qwen 3.8 Max não tem pontuação da Artificial Analysis até 3 de agosto de 2026, um dia após a GA. A linha mais alta da Alibaba é o Qwen3.7 Max com 46. Quem citar um número de inteligência independente para o Qwen 3.8 Max nesta semana está citando o modelo errado.
O LMArena, que é votação de preferência humana em vez de avaliações automatizadas, conta a história inversa:
| Ranking | Qwen 3.8 Max | DeepSeek V4 Flash |
|---|---|---|
| Texto, ranking geral | #5 | #79 |
| Elo de Texto | 1496 ± 10 | 1436 ± 4 (48.667 votos) |
| WebDev | #4, 1668 | #8, 1577 (como -high) |
| Vision | #2, 1305 | Não elegível |
Sessenta pontos de Elo e setenta e quatro posições de ranking, a favor do modelo que custa 21x mais. Duas ressalvas antes de alguém tirar um print dessa tabela. As linhas de WebDev e Texto do Qwen estão marcadas como Preliminares com os intervalos de confiança mais amplos do ranking, ±18 com apenas 1.563 votos, contra os ±4 do Flash com 48.667. E o deepseek-v4-flash puro está totalmente ausente do WebDev, então essa linha compara o Qwen com a variante -high do Flash.
Então o placar se lê assim: o composto automatizado prefere o Flash e não mediu o Qwen, enquanto humanos preferem o Qwen por uma margem larga sobre dados escassos. Essa mesma divisão entre automatizado e humano apareceu na minha comparação GPT-5.6 contra Claude, e é por isso que eu não confio num veredito de número único para nenhum desses lançamentos.
Onde esses dois na verdade não competem
Tire o preço do meio e uma imagem diferente aparece. Esses dois ocupam quadrantes diferentes, e a busca que trouxe você até aqui achata essa diferença.

O DeepSeek não publica entrada de imagem, vídeo, áudio ou documento para o V4 Flash. Sua configuração declara um modelo de linguagem causal sem bloco de encoder de visão, e a tag de pipeline no Hugging Face é geração de texto. A linha de recursos na tabela de preços lista saída JSON, chamadas de ferramentas e FIM, sem nenhuma linha de entrada de arquivo em lugar nenhum. O trabalho multimodal do DeepSeek vive em linhas de modelos separadas na mesma organização. Para ser preciso, não há entrada de imagem documentada, e isso não é o mesmo que uma afirmação de que não é possível.
Então, se suas entradas incluem capturas de tela, isso já decide por você. Uma fila de suporte em que clientes anexam fotos de um produto quebrado, um agente de IA lendo páginas do Confluence com diagramas embutidos, um fluxo de trabalho processando notas fiscais escaneadas. No próprio gráfico da Alibaba, toda linha de visão é uma vitória clara para o Qwen, e essa capacidade não está no ranking do Flash a preço nenhum. É a mesma divisão em que eu sempre esbarro quando equipes avaliam o melhor LLM para atendimento ao cliente: o token mais barato raramente lê o anexo.
Se suas entradas são texto e você quer os pesos, o Flash decide isso com a mesma rapidez. Licença MIT, 167GB, 57 quantizações da comunidade, e as próprias receitas de vLLM e SGLang do DeepSeek publicadas. O Qwen 3.8 Max não pode ser auto-hospedado de jeito nenhum agora, o que é todo o argumento do meu panorama de agentes de IA de código aberto, e a razão pela qual eu não trataria esses dois como backends intercambiáveis para o mesmo agente de suporte de IA sem código.
O que a reação realmente diz
Ninguém ainda publicou um teste prático lado a lado com o mesmo prompt para esses dois, o que não surpreende quando um deles tem apenas algumas horas de vida. O que existe é aritmética, e a versão mais afiada veio de uma conta japonesa de IA no dia da GA, colocando as pontuações do DeepSWE lado a lado em um post no X: Qwen 3.8 Max em 56.6, DeepSeek V4 Flash em 54.4, Kimi K3 em 69, GLM 5.2 em 44. Dois pontos de DeepSWE, com um preço de entrada 14x maior e um preço de saída 21x maior.
Os comprovantes que as pessoas postaram sem pedir no tópico de lançamento do DeepSeek são os dados de custo mais concretos de toda a reação:
"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:
Uma resposta superou isso com 2,1 bilhões de tokens em 12 dias por $19.27, atribuindo isso ao que chamaram de "cache de entrada 120x mais barato" e admitindo que a maior parte desse tráfego eram loops experimentais produzindo lixo.
Do lado do Qwen, o relato prático mais forte não é sobre qualidade de jeito nenhum. É sobre conseguir fazer a coisa terminar:
"Claude finished in around 16 min, but I spent close to 2 hours shepherding the Qwen build. For the implementation, there were signs it had good vision, but the timeouts make this very hard to use in a production setting."
O teste do pelicano de Simon Willison chegou ao mesmo lugar, com um preço junto: segundo seu comentário no HN, levou 11 minutos, esqueceu as rodas, e custou 17 centavos. Vale notar também a resposta contestando que os timeouts eram do harness e não do modelo, uma correção justa que não foi resolvida em nenhuma direção.
O ceticismo vai nas duas direções, e a mesma conta que fez a conta do DeepSWE foi direta sobre o salto do Flash doze dias antes: o DeepSWE ir de 7.3 para 54.4 com pesos inalterados gerou suspeita de benchmaxxing, dado quão mal o modelo tinha pontuado quando esse benchmark era novo. Vale a pena guardar isso, porque um re-pós-treinamento que produz uma oscilação de 47 pontos é ou um resultado de treinamento real ou um ajustado, e não há harness público para dizer qual dos dois.
Duas reclamações sobre o Flash se repetem o suficiente para contar como achados. A primeira é confiabilidade sob compressão:
"DeepSeek V4 hallucinates like crazy and often forgets explicitly mentioned parts of the context. I guess compressing tokens and cherry-picking attention comes at a cost."
A Artificial Analysis coloca um número ao lado disso: a taxa de alucinação AA-Omniscience do Flash é de 84%, o que é uma melhora de 12 pontos em relação ao antecessor e ainda um número alto em termos absolutos.
A segunda é sobre para onde vão os dados, e para quem está no suporte essa é a que realmente decide:
"The model is fantastic. And costs almost nothing. The only problem I see is that they will train on your data. There are zero-data-retention providers of DeepSeek models [...] But these are 3x to 5x more expensive than directly using DeepSeek."
Se você está roteando tickets de clientes, então a tarifa de primeira parte não é a tarifa que você pode usar. Pagar de 3x a 5x mais por retenção zero de dados move o Flash de $0.28 na saída para algo entre $0.84 e $1.40, o que é uma conversa bem diferente daquela com que a tabela de preços começa.
Em qual eu construiria
Para trabalho de texto de alto volume onde você mesmo consegue medir a qualidade de saída, DeepSeek V4 Flash. O preço é real, os pesos são MIT, o teto de concorrência de 2.500 é cinco vezes o do Pro, e o limite de saída de 384K é a especificação menos discutida em qualquer uma das duas tabelas. Rode com esforço high em vez de low, e orce para os tokens de raciocínio em vez da tarifa de vitrine. Trate a taxa de acerto de cache como uma esperança, não como um item de orçamento.
Para qualquer coisa em que a entrada não seja texto puro, Qwen 3.8 Max, e sem relutância. Multimodalidade em escala de fronteira é uma categoria em que o Flash não está, e $6 por milhão de tokens de saída é um preço normal para isso. Sua vantagem em preferência humana é o argumento mais forte para pagar 21x mais, e a ressalva honesta é que essa vantagem hoje se apoia em 1.563 votos, sem nenhuma pontuação de inteligência independente por trás ainda.
O que me faria mudar entre os dois é um número que nenhum dos dois laboratórios publica: quantas tentativas cada modelo precisa no seu trabalho. O Flash a $0.28 que tenta de novo três vezes custa mais que o Qwen a $6.00 que acerta de primeira. Antes de escolher, eu passaria algumas centenas das minhas próprias entradas reais por ambos, com o mesmo esforço de raciocínio, e depois contaria as repetições. Isso é um fim de semana de trabalho, e supera qualquer leaderboard deste artigo.
Para uma fila de suporte especificamente, minha resposta honesta é que essa comparação é o eixo errado. Ambos os modelos conseguem produzir uma resposta fluente para um ticket. Nenhum conhece sua janela de reembolso, e nenhum vai escalar quando estiver inseguro. Nenhum dos dois também leu os 4.000 tickets que sua equipe já respondeu. Essa última parte é um problema de recuperação de informação, não um problema de escolha de modelo, e é por isso que a prevenção de alucinação de IA é um recurso de produto, não uma especificação de modelo.
Eu ouço a versão posterior disso o tempo todo: um comprador consumiu 200 interações em um único dia de teste e imediatamente começou a se preocupar com o custo por interação num ritmo de 9.000 por mês. O problema dele nunca foi realmente a tarifa por token. Era que nada na configuração dizia se as respostas estavam certas, que é a variável real em qualquer modelo de custo de IA no atendimento ao cliente, e a razão pela qual eu acompanho, em vez disso, a taxa de resolução de tickets por IA.
Experimente a eesel para trabalho de suporte
A eesel AI é deliberadamente agnóstica em relação ao modelo, porque o modelo vencedor muda a cada três semanas e a camada ao redor dele é o que você realmente possui. Ela treina com seus tickets passados e sua central de ajuda em vez de um rastreamento genérico, e mantém um limiar de confiança para que uma resposta insegura vire um encaminhamento para o helpdesk em vez de um chute. E ela simula contra seus tickets históricos antes de responder a um cliente real.

Essa etapa de simulação existe por causa da história da marca de veículo no início deste artigo. Se você está avaliando o Qwen ou o DeepSeek para um trabalho real de automação de tickets de suporte, a primeira pergunta que vale a pena responder não é qual token é mais barato. É como está a sua taxa de resolução nos seus próprios tickets, antes de um cliente ver qualquer um deles.
Ela se conecta diretamente ao helpdesk que você já usa, incluindo o Zendesk, e é grátis para testar na sua própria fila.
Perguntas frequentes
O DeepSeek V4 Flash é mais barato que o Qwen 3.8 Max?
Qual é melhor, Qwen 3.8 Max ou DeepSeek V4 Flash?
O DeepSeek V4 Flash tem pesos abertos?
Qual é a janela de contexto do Qwen 3.8 Max em comparação com o DeepSeek V4 Flash?
O DeepSeek V4 Flash consegue ler imagens como o Qwen 3.8 Max?
Quanto custa rodar o DeepSeek V4 Flash em grande escala?
Posso usar o Qwen 3.8 Max ou o DeepSeek V4 Flash para atendimento ao cliente?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








