Qwen 3.8 Max vs DeepSeek V4 Flash: preço, specs, veredito real

Alicia Kirana Utomo
Escrito por

Alicia Kirana Utomo

Katelin Teen
Revisado por

Katelin Teen

Última edição August 3, 2026

Verificado por especialista
Ilustração comparando o Qwen 3.8 Max da Alibaba com o DeepSeek V4 Flash

O placar em 60 segundos

Qwen 3.8 MaxDeepSeek V4 Flash
ID do modeloqwen3.8-maxdeepseek-v4-flash
Build fixadaQwen3.8-MaxDeepSeek-V4-Flash-0731
Lançamento2 de agosto de 202631 de julho de 2026
Entrada / 1M$2.00$0.14
Entrada em cache / 1M$0.25$0.0028
Saída / 1M$6.00$0.28
Janela de contexto1.000.0001.000.000
Saída máxima131.072384.000
ArquiteturaMoE 2,4T total / 95B ativosMoE 284B total / 13B ativos
PesosPrometidos, não publicadosAbertos, MIT
EntradasTexto, imagem, vídeo, documentosTexto
Raciocínio padrãoxhigh, preserve_thinking ativadoPensamento ativado, esforço high
Tokens de raciocínio máx.262.144Não publicado
Teto de throughput2M TPM, 15K RPM2.500 requisições simultâneas
Ranking LMArena Text#5, 1496#79, 1436
Índice de Inteligência AAAinda não pontuado50
Mudança de preço pendenteNenhuma publicada2x em horário de pico

Duas linhas fazem a maior parte do trabalho aqui. O teto de saída é a discreta: o Flash escreve até 384K tokens em uma única resposta contra os 131.072 do Qwen, o que importa para qualquer coisa que precise gerar um artefato longo em vez de uma resposta de chat. A outra é a mudança de preço pendente no horário de pico, que eu colocaria numa planilha, porque é o único movimento de preço futuro anunciado de qualquer um dos dois lados.

Calcule quanto você realmente pagaria

As proporções acima são por token. O que realmente importa é a fatura, e isso depende mais do formato do seu tráfego do que da própria tabela de preços. Mova os controles.

O que o DeepSeek V4 Flash realmente é

O Flash é o irmão pequeno da família V4 do DeepSeek, e a palavra "pequeno" tem peso real nessa frase. É um modelo Mixture-of-Experts com 284B de parâmetros totais e apenas 13B ativos, contra os 1,6T totais e 49B ativos do V4 Pro, segundo a tabela de downloads de modelos do DeepSeek. Para dar uma escala, a geração anterior do próprio DeepSeek, o V3.2-Base, tinha 671B totais e 37B ativos, então o Flash tem menos da metade do tamanho total do modelo que substitui. Treze bilhões de parâmetros ativos colocam seu custo computacional por token mais perto de um modelo de linguagem pequeno do que de qualquer coisa com "fronteira" no marketing.

A build por trás do alias da API é DeepSeek-V4-Flash-0731, e o DeepSeek é incomumente transparente ao dizer que não se tratou de uma nova arquitetura. O changelog diz que manteve a arquitetura e o tamanho da preview e "só foi re-pós-treinado". Essa admissão importa, porque o salto de benchmark entre a preview e a 0731 é enorme. A tabela publicada pelo DeepSeek mostra o DeepSWE indo de 7.3 para 54.4 com os mesmos pesos, diferindo apenas no pós-treinamento.

Três peças arquiteturais são citadas no model card do V4: um híbrido de Compressed Sparse Attention e Heavily Compressed Attention, Manifold-Constrained Hyper-Connections para estabilidade de sinal entre camadas, e o otimizador Muon. A alegação de eficiência que todo mundo cita, 27% dos FLOPs de inferência de um único token e 10% do cache KV em comparação com o V3.2, foi medida no Pro, não no Flash, então é preciso cuidado ao repeti-la para este modelo.

Dois detalhes me importam, como alguém que entrega esse tipo de coisa profissionalmente. A decodificação especulativa vem embutida no checkpoint em vez de ser um modelo de rascunho separado, então no vLLM se resume a uma única flag, e o DeepSeek avisa explicitamente para não apontá-la para um caminho de rascunho. E os pesos têm licença MIT, cerca de 167GB em precisão mista FP4 e FP8, com 57 quantizações já disponíveis no Hugging Face. Se o seu plano é rodar um modelo próximo da fronteira no seu próprio hardware, esse é o fator decisivo.

O que o Qwen 3.8 Max realmente é

O Qwen seguiu na direção oposta em quase todos os eixos. O carro-chefe da Alibaba é um MoE esparso de 2,4 trilhões de parâmetros com 95B ativos, e seu primeiro modelo multimodal acima de um trilhão de parâmetros, aceitando texto, imagens, vídeo e documentos. A alegação da preview da equipe Qwen era de que ele ficava "atrás apenas do Fable 5", o que na época veio sem tabela de benchmarks, sem model card e também sem licença.

A disponibilidade geral em 2 de agosto resolveu o problema dos números. Não o da abertura. O post de GA trouxe um gráfico completo de benchmarks e uma janela de 1.000.000 de tokens, e a QwenCloud agora tem uma tabela de preços real de $2 e $6, com leituras de cache implícitas a $0.25.

Os pesos foram prometidos no Hugging Face e no ModelScope, reafirmados na GA como previstos para "na próxima semana", e não apareceram. Então o enquadramento honesto, quanto à licença, é que um dos dois é código aberto hoje e o outro é uma promessa. Meu panorama de alternativas ao Qwen 3.8 Max aprofunda o que isso significa se você precisar dos pesos, e o guia de preços do Qwen 3.8 Max acompanha como a tarifa da preview virou esta.

A outra coisa a saber é sobre os padrões, não sobre a capacidade. O Qwen vem com o raciocínio xhigh ativado e preserve_thinking habilitado, e vai gastar até 262.144 tokens de raciocínio. Cada um deles é cobrado na tarifa de saída, então o custo por tarefa e a tarifa por token começam a se distanciar. É a mesma armadilha sobre a qual escrevi na comparação Opus 5 vs Sonnet 5, em que o modelo mais caro vencia no custo por tarefa por terminar com menos tokens. Vale acrescentar uma nota de justiça aqui: a própria configuração do harness de codificação do Qwen declara maxTokens: 65536, então o teto de saída de 131K não é o que sua própria ferramenta lançada realmente pede.

A diferença de preço, e as duas coisas que ela esconde

Aqui está essa diferença desenhada em escala, já que a proporção não se sustenta bem numa única frase.

Gráfico de barras comparando o preço de saída por milhão de tokens para Qwen 3.8 Max, DeepSeek V4 Pro e DeepSeek V4 Flash
Gráfico de barras comparando o preço de saída por milhão de tokens para Qwen 3.8 Max, DeepSeek V4 Pro e DeepSeek V4 Flash

Então, a primeira coisa que ela esconde. O DeepSeek divide o preço de entrada entre tarifas de cache hit e cache miss, e no Flash a diferença é de $0.0028 contra $0.14, uma faixa de 50x. O cache vem ativado por padrão sem mudança de código, o que soa como dinheiro de graça até você ler como um acerto é decidido.

Diagrama de decisão mostrando quando uma requisição do DeepSeek é cobrada na tarifa de cache hit em vez da tarifa de cache miss
Diagrama de decisão mostrando quando uma requisição do DeepSeek é cobrada na tarifa de cache hit em vez da tarifa de cache miss

Uma requisição só é cobrada na tarifa de acerto se corresponder totalmente a uma unidade de prefixo de cache persistida. A sobreposição parcial não conta em nada, o que o DeepSeek atribui à sua atenção de janela deslizante. O DeepSeek chama o cache de "melhor esforço" sem taxa de acerto garantida, e entradas não usadas são limpas "geralmente dentro de algumas horas a alguns dias". Você pode auditar a divisão por chamada através de prompt_cache_hit_tokens na resposta, e deveria fazer isso, porque a tarifa de $0.0028 não é um estado estável no qual você possa basear seu orçamento.

A segunda coisa que ela esconde é para qual direção vai o próximo movimento de preço do DeepSeek. Não existe desconto em horário de baixa demanda hoje. Em vez disso, a tabela de preços anuncia que os preços em horário de pico "serão 2x os preços normais", aplicável a todos os itens de cobrança, entre 9h e 12h e entre 14h e 18h no horário de Pequim. Em UTC isso é das 01:00 às 04:00 e das 06:00 às 10:00, diariamente. A data de vigência não foi anunciada, e também não há tabela de tarifas de pico publicada.

Já vi exatamente essa mesma ansiedade se manifestar em ligações de vendas antes. Um comprador com quem conversamos tinha visto o preço de um fornecedor anterior mais que dobrar e chegou perguntando sobre travas de preço contratuais antes de discutir qualquer outra coisa. Um aumento pendente de 2x sem data de início é exatamente o tipo de frase que faz uma equipe financeira se recusar a padronizar em um fornecedor, por mais boa que a tarifa de hoje pareça.

Benchmarks: a tabela de quem, rodada no harness de quem

Ambos os laboratórios publicaram números. Nenhum rodou o harness do outro, então empilhar as duas tabelas uma sobre a outra dá uma comparação que não é real.

A tabela principal do DeepSeek para a 0731 traz nove benchmarks agênticos, e o Flash supera o V4 Pro Preview em todos os nove enquanto fica atrás do Claude Opus 4.8 em todos os nove. Vale saber que o Opus avançou mais uma geração desde então, o que minha análise do Claude Opus 5 cobre:

BenchmarkV4-Flash-0731V4-Flash PreviewV4-Pro PreviewOpus-4.8
Terminal Bench 2.182.761.872.185.0
NL2Repo54.239.438.569.7
Cybergym76.738.752.783.1
DeepSWE54.47.312.858.0
Toolathlon-Verified70.349.755.976.2
Agents' Last Exam25.215.816.525.7
AutomationBench Public25.110.812.827.2
DSBench-FullStack68.737.041.871.6
DSBench-Hard59.625.831.171.7

Leia as notas de rodapé, elas mudam o peso que essas linhas carregam. O model card da 0731 do DeepSeek diz que as tarefas de agente de código rodaram no "modo mínimo do DeepSeek Harness (a ser lançado)" com esforço de raciocínio max, então o harness que produziu essas pontuações não é público e os números não podem ser reproduzidos de forma independente hoje. E duas das nove linhas, DSBench-FullStack e DSBench-Hard, são conjuntos de teste internos do próprio DeepSeek.

O gráfico da Alibaba tem o mesmo tipo de problema, só que do outro lado. Seis de seus benchmarks de código são avaliações internas do Qwen, e as pontuações dos concorrentes vieram de harnesses mistos em vez de condições idênticas. Várias linhas também são avaliadas por modelos rivais. Percorri esse gráfico com cuidado na comparação Qwen 3.8 Max contra GPT-5.6.

O único lugar em que existe um número comparável em condições iguais está dentro da própria tabela de modos cruzados do DeepSeek, e honestamente é a coisa mais útil de todo este artigo:

BenchmarkFlash sem pensarFlash highFlash max
HLE (Pass@1)8.129.434.8
Apex (Pass@1)1.019.133.0
LiveCodeBench (Pass@1)55.288.491.6
GPQA Diamond (Pass@1)71.287.488.1
MRCR 1M (MMR)37.576.978.7

Os mesmos pesos, a mesma tabela de preços. Três configurações. O Flash sem pensar marca 8.1 no HLE e 1.0 no Apex; no esforço máximo marca 34.8 e 33.0. Desligar o pensamento neste modelo não é uma troca pequena, e ligá-lo significa pagar os tokens de raciocínio na tarifa de saída, com um teto de 384K a ser preenchido. Essa é a frase que eu gostaria que qualquer um que citasse o número de $0.28 lesse primeiro.

O DeepSeek também é honesto sobre onde o Flash perde para o Pro, e eu respeito isso. O model card afirma que o Flash-Max alcança um desempenho de raciocínio comparável dado um orçamento de pensamento maior, mas fica "um pouco atrás em tarefas de conhecimento puro e nos fluxos de trabalho agênticos mais complexos". Os números confirmam isso: o SimpleQA-Verified é 34.1 para o Flash Max contra 57.9 para o Pro Max. Treze bilhões de parâmetros ativos é onde o conhecimento de mundo fica caro, e essa diferença foi medida na preview, então ninguém deveria alegar que a 0731 a fechou.

O que dizem os rankings independentes, e onde eles discordam

É aqui que a versão fácil dessa comparação desmorona. Existem dois árbitros independentes. Eles medem coisas diferentes, e agora estão apontando em direções opostas.

A Artificial Analysis pontua o DeepSeek V4 Flash no esforço máximo com um Índice de Inteligência de 50, terceiro entre os modelos de pesos abertos, com um custo por tarefa de $0.03. O mesmo ranking pontua a variante sem raciocínio dos mesmos pesos com 29. Então meu ponto anterior não é só a tabela interna do DeepSeek falando: um laboratório externo mediu uma oscilação de inteligência de 21 pontos entre a configuração barata e a boa.

A Artificial Analysis também aponta algo que vai contra a narrativa do preço. O Flash queimou 210M de tokens de saída para completar o Índice de Inteligência contra uma mediana de classe de 100M, o que o ranking descreve em suas próprias palavras como "muito verboso em comparação". A execução inteira ainda assim custou apenas $72.02, então tokens baratos absorveram a verbosidade aqui. Mas o mecanismo aqui é o mesmo que apontei sobre os padrões do Qwen, e acontece que o modelo com o problema de verbosidade medido é o barato. Esse é o número que eu gostaria de ver mais publicado em comparações de ferramentas de codificação com IA, porque a verbosidade é o que transforma uma tabela de preços em uma fatura.

Quanto ao Qwen nesse ranking: ele não está lá. O Qwen 3.8 Max não tem pontuação da Artificial Analysis até 3 de agosto de 2026, um dia após a GA. A linha mais alta da Alibaba é o Qwen3.7 Max com 46. Quem citar um número de inteligência independente para o Qwen 3.8 Max nesta semana está citando o modelo errado.

O LMArena, que é votação de preferência humana em vez de avaliações automatizadas, conta a história inversa:

RankingQwen 3.8 MaxDeepSeek V4 Flash
Texto, ranking geral#5#79
Elo de Texto1496 ± 101436 ± 4 (48.667 votos)
WebDev#4, 1668#8, 1577 (como -high)
Vision#2, 1305Não elegível

Sessenta pontos de Elo e setenta e quatro posições de ranking, a favor do modelo que custa 21x mais. Duas ressalvas antes de alguém tirar um print dessa tabela. As linhas de WebDev e Texto do Qwen estão marcadas como Preliminares com os intervalos de confiança mais amplos do ranking, ±18 com apenas 1.563 votos, contra os ±4 do Flash com 48.667. E o deepseek-v4-flash puro está totalmente ausente do WebDev, então essa linha compara o Qwen com a variante -high do Flash.

Então o placar se lê assim: o composto automatizado prefere o Flash e não mediu o Qwen, enquanto humanos preferem o Qwen por uma margem larga sobre dados escassos. Essa mesma divisão entre automatizado e humano apareceu na minha comparação GPT-5.6 contra Claude, e é por isso que eu não confio num veredito de número único para nenhum desses lançamentos.

Onde esses dois na verdade não competem

Tire o preço do meio e uma imagem diferente aparece. Esses dois ocupam quadrantes diferentes, e a busca que trouxe você até aqui achata essa diferença.

Quadrante de posicionamento colocando Qwen 3.8 Max e DeepSeek V4 Flash por preço por token contra entrada multimodal
Quadrante de posicionamento colocando Qwen 3.8 Max e DeepSeek V4 Flash por preço por token contra entrada multimodal

O DeepSeek não publica entrada de imagem, vídeo, áudio ou documento para o V4 Flash. Sua configuração declara um modelo de linguagem causal sem bloco de encoder de visão, e a tag de pipeline no Hugging Face é geração de texto. A linha de recursos na tabela de preços lista saída JSON, chamadas de ferramentas e FIM, sem nenhuma linha de entrada de arquivo em lugar nenhum. O trabalho multimodal do DeepSeek vive em linhas de modelos separadas na mesma organização. Para ser preciso, não há entrada de imagem documentada, e isso não é o mesmo que uma afirmação de que não é possível.

Então, se suas entradas incluem capturas de tela, isso já decide por você. Uma fila de suporte em que clientes anexam fotos de um produto quebrado, um agente de IA lendo páginas do Confluence com diagramas embutidos, um fluxo de trabalho processando notas fiscais escaneadas. No próprio gráfico da Alibaba, toda linha de visão é uma vitória clara para o Qwen, e essa capacidade não está no ranking do Flash a preço nenhum. É a mesma divisão em que eu sempre esbarro quando equipes avaliam o melhor LLM para atendimento ao cliente: o token mais barato raramente lê o anexo.

Se suas entradas são texto e você quer os pesos, o Flash decide isso com a mesma rapidez. Licença MIT, 167GB, 57 quantizações da comunidade, e as próprias receitas de vLLM e SGLang do DeepSeek publicadas. O Qwen 3.8 Max não pode ser auto-hospedado de jeito nenhum agora, o que é todo o argumento do meu panorama de agentes de IA de código aberto, e a razão pela qual eu não trataria esses dois como backends intercambiáveis para o mesmo agente de suporte de IA sem código.

O que a reação realmente diz

Ninguém ainda publicou um teste prático lado a lado com o mesmo prompt para esses dois, o que não surpreende quando um deles tem apenas algumas horas de vida. O que existe é aritmética, e a versão mais afiada veio de uma conta japonesa de IA no dia da GA, colocando as pontuações do DeepSWE lado a lado em um post no X: Qwen 3.8 Max em 56.6, DeepSeek V4 Flash em 54.4, Kimi K3 em 69, GLM 5.2 em 44. Dois pontos de DeepSWE, com um preço de entrada 14x maior e um preço de saída 21x maior.

Os comprovantes que as pessoas postaram sem pedir no tópico de lançamento do DeepSeek são os dados de custo mais concretos de toda a reação:

Hacker News

"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:

Cost: $4.55USD
API requests: 3,467
Tokens: 323,183,886" -- lionkor, Hacker News

Uma resposta superou isso com 2,1 bilhões de tokens em 12 dias por $19.27, atribuindo isso ao que chamaram de "cache de entrada 120x mais barato" e admitindo que a maior parte desse tráfego eram loops experimentais produzindo lixo.

Do lado do Qwen, o relato prático mais forte não é sobre qualidade de jeito nenhum. É sobre conseguir fazer a coisa terminar:

Hacker News

"Claude finished in around 16 min, but I spent close to 2 hours shepherding the Qwen build. For the implementation, there were signs it had good vision, but the timeouts make this very hard to use in a production setting."

O teste do pelicano de Simon Willison chegou ao mesmo lugar, com um preço junto: segundo seu comentário no HN, levou 11 minutos, esqueceu as rodas, e custou 17 centavos. Vale notar também a resposta contestando que os timeouts eram do harness e não do modelo, uma correção justa que não foi resolvida em nenhuma direção.

O ceticismo vai nas duas direções, e a mesma conta que fez a conta do DeepSWE foi direta sobre o salto do Flash doze dias antes: o DeepSWE ir de 7.3 para 54.4 com pesos inalterados gerou suspeita de benchmaxxing, dado quão mal o modelo tinha pontuado quando esse benchmark era novo. Vale a pena guardar isso, porque um re-pós-treinamento que produz uma oscilação de 47 pontos é ou um resultado de treinamento real ou um ajustado, e não há harness público para dizer qual dos dois.

Duas reclamações sobre o Flash se repetem o suficiente para contar como achados. A primeira é confiabilidade sob compressão:

Hacker News

"DeepSeek V4 hallucinates like crazy and often forgets explicitly mentioned parts of the context. I guess compressing tokens and cherry-picking attention comes at a cost."

A Artificial Analysis coloca um número ao lado disso: a taxa de alucinação AA-Omniscience do Flash é de 84%, o que é uma melhora de 12 pontos em relação ao antecessor e ainda um número alto em termos absolutos.

A segunda é sobre para onde vão os dados, e para quem está no suporte essa é a que realmente decide:

Hacker News

"The model is fantastic. And costs almost nothing. The only problem I see is that they will train on your data. There are zero-data-retention providers of DeepSeek models [...] But these are 3x to 5x more expensive than directly using DeepSeek."

Se você está roteando tickets de clientes, então a tarifa de primeira parte não é a tarifa que você pode usar. Pagar de 3x a 5x mais por retenção zero de dados move o Flash de $0.28 na saída para algo entre $0.84 e $1.40, o que é uma conversa bem diferente daquela com que a tabela de preços começa.

Em qual eu construiria

Para trabalho de texto de alto volume onde você mesmo consegue medir a qualidade de saída, DeepSeek V4 Flash. O preço é real, os pesos são MIT, o teto de concorrência de 2.500 é cinco vezes o do Pro, e o limite de saída de 384K é a especificação menos discutida em qualquer uma das duas tabelas. Rode com esforço high em vez de low, e orce para os tokens de raciocínio em vez da tarifa de vitrine. Trate a taxa de acerto de cache como uma esperança, não como um item de orçamento.

Para qualquer coisa em que a entrada não seja texto puro, Qwen 3.8 Max, e sem relutância. Multimodalidade em escala de fronteira é uma categoria em que o Flash não está, e $6 por milhão de tokens de saída é um preço normal para isso. Sua vantagem em preferência humana é o argumento mais forte para pagar 21x mais, e a ressalva honesta é que essa vantagem hoje se apoia em 1.563 votos, sem nenhuma pontuação de inteligência independente por trás ainda.

O que me faria mudar entre os dois é um número que nenhum dos dois laboratórios publica: quantas tentativas cada modelo precisa no seu trabalho. O Flash a $0.28 que tenta de novo três vezes custa mais que o Qwen a $6.00 que acerta de primeira. Antes de escolher, eu passaria algumas centenas das minhas próprias entradas reais por ambos, com o mesmo esforço de raciocínio, e depois contaria as repetições. Isso é um fim de semana de trabalho, e supera qualquer leaderboard deste artigo.

Para uma fila de suporte especificamente, minha resposta honesta é que essa comparação é o eixo errado. Ambos os modelos conseguem produzir uma resposta fluente para um ticket. Nenhum conhece sua janela de reembolso, e nenhum vai escalar quando estiver inseguro. Nenhum dos dois também leu os 4.000 tickets que sua equipe já respondeu. Essa última parte é um problema de recuperação de informação, não um problema de escolha de modelo, e é por isso que a prevenção de alucinação de IA é um recurso de produto, não uma especificação de modelo.

Eu ouço a versão posterior disso o tempo todo: um comprador consumiu 200 interações em um único dia de teste e imediatamente começou a se preocupar com o custo por interação num ritmo de 9.000 por mês. O problema dele nunca foi realmente a tarifa por token. Era que nada na configuração dizia se as respostas estavam certas, que é a variável real em qualquer modelo de custo de IA no atendimento ao cliente, e a razão pela qual eu acompanho, em vez disso, a taxa de resolução de tickets por IA.

Experimente a eesel para trabalho de suporte

A eesel AI é deliberadamente agnóstica em relação ao modelo, porque o modelo vencedor muda a cada três semanas e a camada ao redor dele é o que você realmente possui. Ela treina com seus tickets passados e sua central de ajuda em vez de um rastreamento genérico, e mantém um limiar de confiança para que uma resposta insegura vire um encaminhamento para o helpdesk em vez de um chute. E ela simula contra seus tickets históricos antes de responder a um cliente real.

A visão de atividade da eesel AI mostrando conversas resolvidas e pendentes do Zendesk junto com execuções de skills
A visão de atividade da eesel AI mostrando conversas resolvidas e pendentes do Zendesk junto com execuções de skills

Essa etapa de simulação existe por causa da história da marca de veículo no início deste artigo. Se você está avaliando o Qwen ou o DeepSeek para um trabalho real de automação de tickets de suporte, a primeira pergunta que vale a pena responder não é qual token é mais barato. É como está a sua taxa de resolução nos seus próprios tickets, antes de um cliente ver qualquer um deles.

Ela se conecta diretamente ao helpdesk que você já usa, incluindo o Zendesk, e é grátis para testar na sua própria fila.

Perguntas frequentes

O DeepSeek V4 Flash é mais barato que o Qwen 3.8 Max?
Sim, e por uma margem ampla nas tarifas publicadas. O DeepSeek V4 Flash custa $0.14 por milhão de tokens de entrada em caso de cache miss e $0.28 por milhão de saída. O Qwen 3.8 Max custa $2.00 e $6.00. Isso é aproximadamente 14x a mais na entrada e 21x na saída, antes mesmo de considerar quantos tokens cada modelo realmente emite para concluir uma tarefa.
Qual é melhor, Qwen 3.8 Max ou DeepSeek V4 Flash?
Depende se suas entradas são texto. O Qwen aceita imagens, vídeo e documentos; o DeepSeek não documenta entrada de imagem para o V4 Flash. No raciocínio com texto os dois estão mais próximos do que o preço sugere, e nenhum dos dois laboratórios rodou o harness do outro. Minha análise completa do Qwen 3.8 Max detalha melhor o problema dos gráficos criados pelo próprio fornecedor.
O DeepSeek V4 Flash tem pesos abertos?
Sim, sob licença MIT, que permite uso comercial e modificação. O checkpoint tem cerca de 167GB em precisão mista FP4 e FP8. O Qwen 3.8 Max não é comparável aqui: os pesos foram prometidos na preview e ainda não haviam sido publicados na disponibilidade geral. Veja nosso panorama de agentes de IA de código aberto para saber quanto custa realmente o auto-hospedagem.
Qual é a janela de contexto do Qwen 3.8 Max em comparação com o DeepSeek V4 Flash?
Ambos têm 1.000.000 de tokens de entrada. A diferença está na saída: o DeepSeek V4 Flash tem um teto de 384K tokens de saída contra os 131.072 do Qwen. Nenhum dos dois publica uma sobretaxa para contexto longo, algo a se observar ao comparar com o preço do GPT-5.6.
O DeepSeek V4 Flash consegue ler imagens como o Qwen 3.8 Max?
Não há entrada de imagem documentada para o DeepSeek V4 Flash. Sua configuração declara um modelo de linguagem causal sem encoder de visão, e o DeepSeek mantém seu trabalho multimodal em linhas de modelos separadas. O Qwen 3.8 Max aceita texto, imagens, vídeo e documentos, o que é a razão mais clara para pagar sua tarifa. Nosso guia de modelos de linguagem pequenos cobre a mesma troca em contagens de parâmetros menores.
Quanto custa rodar o DeepSeek V4 Flash em grande escala?
Com 500M de tokens de entrada e 200M de saída por mês e uma taxa de acerto de cache de 40%, as tarifas publicadas resultam em cerca de $99, contra aproximadamente $1.850 pelo mesmo tráfego no Qwen. Duas coisas alteram esse número: o DeepSeek anunciou um aumento de preço pendente de 2x em horários de pico, e os tokens de raciocínio são cobrados na tarifa de saída. Nosso detalhamento do custo de IA no atendimento ao cliente percorre a mesma conta para o trabalho de suporte.
Posso usar o Qwen 3.8 Max ou o DeepSeek V4 Flash para atendimento ao cliente?
Você pode apontar qualquer um dos dois para um ticket, mas um modelo bruto não tem memória dos seus tickets passados, nenhuma barreira de confiança e nenhum encaminhamento para o helpdesk. A eesel AI fornece essa camada e se conecta ao Zendesk e ao Freshdesk, então você compra uma IA para atendimento ao cliente em vez de uma tarifa por token.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
DeepSeek V4 Flash: specs, preços e para que serve na prática
Trending

DeepSeek V4 Flash: specs, preços e para que serve na prática

DeepSeek V4 Flash custa $0,14 de entrada e $0,28 de saída por milhão de tokens, e supera o próprio nível caro da DeepSeek. Isto é o que a tabela de preços não conta.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustração comparando as famílias de modelos Qwen 3.8 Max da Alibaba e GPT-5.6 da OpenAI
Trending

Qwen 3.8 Max vs GPT-5.6: preço, benchmarks e a diferença real

Os dois modelos finalmente têm preços e benchmarks publicados. Aqui está o que os números realmente dizem, o que não podem dizer, e qual eu escolheria para construir.

Rama Adi NugrahaRama Adi NugrahaAug 3, 2026
Preços do DeepSeek V4 Flash: o que você vai realmente pagar
Trending

Preços do DeepSeek V4 Flash: o que você vai realmente pagar

O DeepSeek V4 Flash é listado a $0.14 de entrada e $0.28 de saída por milhão de tokens. Usuários reais publicaram taxas combinadas abaixo de um centavo. Veja o que decide qual delas te espera.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustração comparando DeepSeek V4 Flash e Kimi K3 da Moonshot AI
Trending

DeepSeek V4 Flash vs Kimi K3: qual você deveria usar?

Um modelo custa 29 vezes mais por tarefa que o outro. Passei por todos os números publicados dos dois, e a parte interessante é a opção intermediária que ninguém deveria comprar.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Duas pessoas fazendo queda de braço sobre uma mesa enquanto uma terceira observa, ilustrando um confronto direto entre modelos
Trending

DeepSeek V4 Flash vs GPT-5.6: em qual você deve apostar?

DeepSeek V4 Flash vs GPT-5.6 com os números de agosto de 2026. A verdadeira disputa é Flash contra Luna, a inteligência empata, e o que decide é velocidade, visão e dados.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustração de um desenvolvedor acessando o Qwen 3.8 Max da Alibaba por meio de chat, multimodal e superfícies de API
Trending

Como acessar o Qwen 3.8 Max: 5 caminhos e o que cada um cobra

Cinco formas reais de chegar ao carro-chefe de 2,4 trilhões de parâmetros da Alibaba, do chat gratuito à API de $2/$6, além das armadilhas de cobrança que pegam as pessoas no caminho.

Rama Adi NugrahaRama Adi NugrahaAug 3, 2026
Ilustração comparando os planos de modelo DeepSeek V4 Flash e V4 Pro
Trending

DeepSeek V4 Flash vs V4 Pro: qual plano usar?

O plano barato da DeepSeek agora pontua mais alto que o caro no ranking independente. Veja exatamente onde isso se confirma, e os dois pontos em que não.

Rama Adi NugrahaRama Adi NugrahaAug 3, 2026
Ilustração comparando o Qwen 3.8 Max da Alibaba e o Kimi K3 da Moonshot AI
Trending

Qwen 3.8 Max vs Kimi K3: os números que nenhum laboratório publicou

Dois laboratórios chineses lançaram um modelo principal com mais de 2 trilhões de parâmetros com dezessete dias de diferença, e nenhum colocou o outro em seu gráfico de benchmarks. Aqui está o que realmente se compara, quanto a conta realmente custa, e qual eu escolheria.

Alicia Kirana UtomoAlicia Kirana UtomoAug 3, 2026
Ilustração de duas pessoas analisando cartões de preços escalonados em uma tela, com o logotipo do Qwen
Trending

Preços do Qwen 3.7 Flash: o que você realmente paga em 2026

A tarifa de $0.03 é real, e é apenas um dos quatro medidores da sua fatura. Veja como o degrau de prompt, o cache, a região de batch e a taxa de retentativas se combinam no número que você realmente paga.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 31, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis