DeepSeek V4 Flash vs GPT-5.6: em qual você deve apostar?

Rama Adi Nugraha
Escrito por

Rama Adi Nugraha

Katelin Teen
Revisado por

Katelin Teen

Última edição August 4, 2026

Verificado por especialista
Duas pessoas fazendo queda de braço sobre uma mesa enquanto uma terceira observa, ilustrando um confronto direto entre modelos

A disputa é Flash contra Luna, não contra Sol

O GPT-5.6 são três modelos, não um só, e o alias gpt-5.6 simplesmente redireciona para o Sol. Por isso muitos confrontos soam estranhos. Colocam o nível barato do DeepSeek contra o nível mais caro da OpenAI e depois concluem que modelos baratos são baratos.

Aqui está a tabela de preços completa como está hoje, nível padrão, contexto curto, por milhão de tokens.

ModeloEntradaEntrada em cacheSaídaAA Intelligence Index
deepseek-v4-flash$0,14$0,0028$0,2850
gpt-5.6-luna$0,20$0,02$1,2051
gpt-5.6-terra$2,00$0,20$12,0055
gpt-5.6-sol$5,00$0,50$30,0059
deepseek-v4-pro$0,435$0,003625$0,8744

Preços da tabela de preços do DeepSeek e da página de preços da OpenAI; notas de índice da Artificial Analysis. Repare na última linha, que é uma história à parte: o nível caro do DeepSeek agora pontua abaixo do seu nível barato, e eu investiguei o motivo em Flash contra Pro.

A página de Modelos e Preços do DeepSeek mostrando deepseek-v4-flash e deepseek-v4-pro em colunas adjacentes, retirada da documentação da API do DeepSeek
A página de Modelos e Preços do DeepSeek mostrando deepseek-v4-flash e deepseek-v4-pro em colunas adjacentes, retirada da documentação da API do DeepSeek

O corte de preço de 30 de julho é o motivo deste post existir. A OpenAI baixou o Terra em 20% e o Luna em 80% em um único anúncio: "Starting July 30, API pricing is $2 per million input tokens and $12 per million output tokens for Terra, and $0.20 per million input tokens and $1.20 per million output tokens for Luna. Sol pricing remains unchanged." Qualquer comparação que ainda cite o Luna a $1,00 e $6,00 está desatualizada em 5x. Se você quiser a análise nível por nível, cobri o GPT-5.6 Sol e o GPT-5.6 Terra separadamente.

Preço de saída por milhão de tokens entre DeepSeek V4 Flash, GPT-5.6 Luna, Terra e Sol
Preço de saída por milhão de tokens entre DeepSeek V4 Flash, GPT-5.6 Luna, Terra e Sol

O que cada modelo realmente é

O Flash é um modelo esparso de mistura de especialistas, 284B de parâmetros totais e 13B ativos, distribuído sob licença MIT, o que significa que os pesos ficam no Hugging Face e você é livre para rodá-los você mesmo. A equipe do vLLM descreveu a arquitetura no dia do lançamento: "A sparse MoE with 256 routed experts and six active per token, a 1M-token context window, and three reasoning-effort levels. Built for code agents and tool use." Ignore o número "304B" que aparece em alguns widgets de modelos; a configuração diz 284B.

O GPT-5.6 tem pesos fechados, três níveis, uma única ficha técnica compartilhada. Os três trazem 1.050.000 de contexto, 128.000 de saída máxima, e um corte de conhecimento em 16 de fevereiro de 2026, com entrada de texto e imagem.

DeepSeek V4 FlashGPT-5.6 (todos os níveis)
PesosMIT, aberto, ~167GBFechado
Parâmetros284B totais / 13B ativosNão publicado
Contexto1M1.050.000
Saída máxima384K128.000
Entrada de imagemNão documentadoSim
Busca na webNão documentadoSim
Corte de conhecimentoNão publicado16 fev. 2026
Modo de raciocínioAtivo por padrão, três níveis de esforçoTokens de raciocínio suportados
Desconto de cache~98%90%
Concorrência2.500Conforme o nível, 500 a 30.000 RPM

Duas peculiaridades que valem a pena conhecer antes de escrever a configuração. No Flash, xhigh funciona silenciosamente como high, então a partir de certo ponto não dá para aumentar mais o raciocínio. No GPT-5.6, o modo Fast substituiu o Priority Processing nessa mesma data de 30 de julho, e dobra a tarifa por "up to 2.5x faster speeds than Standard processing at twice the price, with no change in intelligence."

Para quem está avaliando pesos abertos de forma mais ampla, modelos de linguagem pequenos e agentes open source são as duas comparações que mais me perguntam ao lado desta.

O que os benchmarks mostram: empate embaixo, diferença real em cima

No Artificial Analysis Intelligence Index v4.1, o Flash fica em 50, terceiro entre os modelos de peso aberto, atrás do Kimi K3 com 57 e do GLM 5.2 com 51. O Luna está em 51, o Terra em 55, o Sol em 59, e o Sol fica em terceiro lugar geral no ranking completo, atrás de dois modelos Claude. A Artificial Analysis resumiu o lado do custo no dia do lançamento:

"DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence Index, a 10-point jump over DeepSeek V4 Flash (released April 2026) that puts it 6 points ahead of DeepSeek V4 Pro. [...] DeepSeek V4 Flash 0731's Cost per Task on DeepSeek's first-party API comes in at ~60% lower than GPT-5.6 Luna (max), a model with comparable intelligence."

A preferência humana conta uma história diferente do índice composto. No ranking de texto do LMArena, o deepseek-v4-flash pontua 1436 ±4 em 48.667 votos, na posição 79, enquanto o gpt-5.6-sol-xhigh é 15º no geral. No WebDev, o deepseek-v4-flash-high é 8º com 1577 e o Sol é 6º com 1620. Ou seja, o modelo aberto barato é competitivo no índice automatizado e claramente atrás na comparação humana às cegas, o que é mais ou menos esperado e vale a pena dizer em voz alta.

Três ressalvas sem as quais eu não publicaria este post.

  • O próprio gráfico do DeepSeek é uma seleção. Como colocou uma análise ponderada, a comparação "is also almost entirely focused on agentic coding and tool use, not general reasoning or broad knowledge" (Dr. Tomislav Marinovic, X).
  • O salto gerou desconfiança. O DeepSWE foi de 7,3 para 54,4 com o mesmo número de parâmetros, e uma conta de IA disse claramente que um salto de pontuação isolado logo após uma atualização soa como benchmaxxing, já que a pontuação baixa anterior do DeepSWE foi justamente o que expôs a versão anterior.
  • O Flash é verboso e ainda alucina. A Artificial Analysis mediu 210M de tokens de saída para rodar o índice, contra uma mediana de 100M na categoria, e coloca sua taxa de alucinação AA-Omniscience em 84%, 12 pontos abaixo do antecessor. O Luna também é verboso, com 130M de tokens contra uma mediana de 62M. Se algum desses números importa para você, minhas notas sobre como prevenir alucinações trazem a versão prática.

O que isso custa de verdade na sua carga de trabalho

Tabelas de preços enganam, porque a proporção entre dois modelos muda com a forma do seu tráfego, não só com o volume dele. Entrada em cache muda isso, raciocínio pesado em saída muda isso, e prompts longos também mudam. Escolha o perfil que mais se parece com o seu.

Fatura mensal de API com 100M de tokens

Mesmo volume total, três formatos de tráfego diferentes, preços de tabela em 4 de agosto de 2026.

80M de entrada em cache, 15M de entrada nova, 5M de saída. O formato que você obtém com um prompt de sistema longo acionado milhares de vezes.

V4 Flash, API direta$3.72
GPT-5.6 Luna$10.60
V4 Flash, host de retenção zero$11.17
GPT-5.6 Sol$265.00

Aqui o Flash é 2,8x mais barato que o Luna, e a vantagem desaparece assim que você precisa de retenção zero.

10M de entrada em cache, 20M de entrada nova, 30M de saída. O modo de raciocínio vem ativo por padrão nos dois modelos e os tokens de raciocínio são cobrados como saída.

V4 Flash, API direta$11.23
V4 Flash, host de retenção zero$33.68
GPT-5.6 Luna$40.20
GPT-5.6 Sol$1,005.00

É no trabalho intensivo em saída que aparece a diferença de 4,3x na tarifa de saída: o Flash é 3,6x mais barato, e continua na frente mesmo num host privado.

50M de entrada nova, 5M de saída, todo prompt acima de 272K tokens. O GPT-5.6 recalcula o preço da solicitação inteira a partir daí.

V4 Flash, API direta$8.40
V4 Flash, host de retenção zero$25.20
GPT-5.6 Luna, contexto longo$29.00
GPT-5.6 Sol, contexto longo$725.00

O nível de contexto longo é uma duplicação, não uma sobretaxa apenas no excedente, então esse é o perfil onde o preço fixo do Flash realmente compensa.

O número que eu levaria comigo é o mais chato. Em todos os formatos, o Flash fica cerca de 3x mais barato que o Luna, e não os 4x que a coluna de saída sugere. Um comentarista no Hacker News calculou a mesma troca a partir da coluna de custo por tarefa e resumiu bem: "OpenAI Luna between 2x and 3x the price of Deepseek Flash, what you get is 2 to 5 times faster inference" (spwa4, Hacker News). Outro colocou as tabelas de preços lado a lado e chegou à mesma conclusão resignada:

Hacker News

"The thing is, even if Luna is better in DeepSWE and has the 80% discount. DeepSeek is still cheaper. [...] Both Luna and Flash are heavy on the reasoning > output. And the cache hitrate + prices also matter. Reality is, you can not go wrong with Luna or Flash at those prices."

Onde o preço de tabela deixa de ser o preço

Quatro coisas mexem na conta real, e entre os dois fornecedores elas não são nada simétricas.

O GPT-5.6 tem um penhasco em 272K tokens de entrada. Toda página de modelo do GPT-5.6 diz o mesmo: "Prompts with >272K input tokens are priced at 2x input and 1.5x output for the full request." Cruzar esse limite recalcula o preço da chamada inteira, então uma solicitação ao Sol vai de $5 e $30 para $10 e $45. A janela de 1M do Flash não tem equivalente publicado, o que o torna a opção mais estável para prompts com repositórios ou históricos inteiros. Isso também é um bom argumento para preferir busca de informações em vez de lotar o prompt em qualquer um dos dois modelos.

Como o preço se comporta conforme os prompts ficam mais longos, com o GPT-5.6 subindo em degraus em 272K tokens de entrada e o DeepSeek V4 Flash se mantendo estável até 1M
Como o preço se comporta conforme os prompts ficam mais longos, com o GPT-5.6 subindo em degraus em 272K tokens de entrada e o DeepSeek V4 Flash se mantendo estável até 1M

O DeepSeek tem uma sobretaxa pendente de 2x em horários de pico. A tabela de preços diz que a API "will soon adopt a peak/off-peak pricing policy" em que "during peak hours, prices will be 2x the regular prices, applicable to all billing items", com a janela fixada entre 9h e 12h e entre 14h e 18h no horário de Pequim, ou seja, de 01h a 04h e de 06h a 10h UTC. Nenhuma data de início foi anunciada e nenhuma tabela de preço de pico foi publicada, então trate isso como um risco sobre o tráfego síncrono, não como um número fechado.

O cache é onde a vantagem do DeepSeek é maior e menos confiável. Seu desconto de ~98% por acerto de cache supera os 90% que a OpenAI e a maior parte do setor oferecem, e vem ativo por padrão sem mudança de código. A pegadinha está na mecânica: uma solicitação só é cobrada na tarifa de acerto se corresponder totalmente a uma unidade de prefixo de cache persistida, o cache é explicitamente de melhor esforço, e as entradas são apagadas "usually within a few hours to a few days" quando ficam sem uso. Não trate $0,0028 como um estado permanente.

A cobrança de terceiros pode surpreender. Um usuário relatou a versão mais extrema disso: "The model was good, but there appeared to be a pricing glitch or something, because it burned through $50 in under an hour on pretty trivial stuff" (onlyrealcuzzo, Hacker News). Existem 11 provedores servindo o Flash no OpenRouter e o DeepSeek não é o mais barato entre eles, então vale checar a medição por provedor antes de escalar um loop.

O que as pessoas realmente relatam pagar

Essa é minha parte favorita da reação ao DeepSeek, porque ali as pessoas postam recibos em vez de opiniões. Dois exemplos apareceram sem serem pedidos no tópico de lançamento.

Hacker News

"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:

Cost: $4.55USD
API requests: 3,467
Tokens: 323,183,886"
Hacker News

"Those are rookie numbers. Last 13 days including today, so effectively 12 days of usage:

$19.27 USD
API requests: 7,877
Tokens: 2,116,598,952 Ok this is a bit of lie, a lot of my tasks are very experimental loops whose 99% output is like rubbish and can work forever continuously and take advantage of that 120x cheaper input cache."

Repare no que o segundo admite: a contagem impressionante de tokens é barata porque é intensiva em cache, exatamente o primeiro perfil do widget acima. Um terceiro usuário, rodando um harness de agente de 30 turnos, colocou uma sessão em "~$0.5 cost" e disse que não tocava na assinatura do Opus havia semanas (kmarc, Hacker News).

Do outro lado, o corte de preço do GPT-5.6 veio acompanhado de números de clientes divulgados, o mais próximo que a OpenAI tem de um recibo assim. O líder de produto de IA da Notion disse que o modelo mais novo "delivered comparable quality to GPT-5.5 at half the cost per task and in 60% less time", e o CTO da Blitzy relatou que o Luna "handles 2.2x more context with 8.5x fewer output tokens - at 87% lower cost than GPT-5.4 mini" depois de migrar de uma única chamada de saída estruturada para um loop de agente completo. Os dois são publicados pelos próprios fornecedores, então leia como indicativo, não como verificação independente.

As lacunas de capacidade que realmente decidem

Se você chegou até aqui esperando que o preço resolvesse tudo, aqui vem a virada. As duas coisas que decidem essa comparação para a maioria das equipes não estão na página de preços.

O Flash não consegue ver nem buscar. Não há entrada de imagem documentada, e a busca na web não faz parte da API. As pessoas contornam isso combinando modelos em vez de escolher um só, um padrão que eu copiaria: "Since DeepSeek V4 doesn't have vision so he got OMP to use GPT 5.6 Luna using the Codex sub. DeepSeek also doesn't support web search so he wired up OMP to call agy (Antigravity CLI) directly" (theturtletalks, Hacker News). Se sua fila de suporte está cheia de capturas de tela, essa lacuna encerra a discussão sozinha.

A velocidade não é medida de um lado e é publicada do outro. A Artificial Analysis lista a variante de raciocínio do Flash sem velocidade de saída, sem tempo até o primeiro token e sem tempo total de resposta, marcando a velocidade como "Unknown out of 4 units". A variante sem raciocínio tem números, a 107 tokens por segundo. O Luna roda a 177,8 tokens por segundo e o Terra a 138. O Sol é o caso estranho: 67,7 tokens por segundo e 137,84s de tempo até o primeiro token, abaixo da mediana do seu próprio nível de preço, algo bom de saber antes de colocá-lo por trás de qualquer coisa interativa.

Um diagrama de roteamento enviando texto em massa e trabalho em cache para o DeepSeek V4 Flash, e imagem, busca e trabalho de baixa latência para o GPT-5.6 Luna
Um diagrama de roteamento enviando texto em massa e trabalho em cache para o DeepSeek V4 Flash, e imagem, busca e trabalho de baixa latência para o GPT-5.6 Luna

Pesos abertos são uma opção real aqui, e a conta em geral diz que não vale a pena. O Flash roda localmente, e os relatos são detalhados: 60 tokens por segundo em sessão única em dois DGX Spark, ~30 num M3 Ultra com 256GB, 32 num Ryzen AI MAX+ 395 a cerca de 2,88 bits por parâmetro. O problema é a conta do hardware, cerca de €8.200 para a configuração com dois Spark. O veredito de consenso de alguém que fez as contas: "it makes little to no sense as long as API prices are what they are. Except for maybe privacy reasons" (cmrdporcupine, Hacker News). Privacidade, porém, não é uma exceção pequena, o que nos leva ao último ponto.

A retenção de dados é a objeção que sempre vence. A reclamação mais repetida sobre o Flash não é sobre qualidade:

Hacker News

"The model is fantastic. And costs almost nothing. The only problem I see is that they will train on your data. There are zero-data-retention providers of DeepSeek models, of which I have used openrouter (with zdr guardrails), and fireworks. But these are 3x to 5x more expensive than directly using DeepSeek, possibly due to poor caching. Thats the price to pay for zdr."

Passe isso pela tabela de tarifas e a vantagem principal evapora. Os $0,28 de saída do Flash viram $0,84 a $1,40, a mesma faixa dos $1,20 do Luna, e o Luna vem com visão, busca e um perfil de latência documentado. Se seus tokens contêm dados de clientes, a história do modelo barato e a história do modelo seguro viram a mesma história.

Três etapas mostrando a saída do DeepSeek V4 Flash a 28 centavos subindo para entre 84 centavos e 1,40 dólar por meio de um host de retenção zero, chegando à faixa de preço do GPT-5.6 Luna
Três etapas mostrando a saída do DeepSeek V4 Flash a 28 centavos subindo para entre 84 centavos e 1,40 dólar por meio de um host de retenção zero, chegando à faixa de preço do GPT-5.6 Luna

Meu veredito

Escolha o DeepSeek V4 Flash para trabalho de texto em massa em que você é dono dos dados: agentes de código, revisão de código, resumo, classificação, prefixos longos em cache, qualquer coisa que você rodaria de bom grado por 30 turnos. Hoje é a melhor inteligência por dólar do ranking, e os recibos acima confirmam isso. Também é a escolha certa se pesos abertos importam para você, já que a licença e os pesos no Hugging Face são reais, não apenas prometidos.

Escolha o GPT-5.6 Luna se precisar de imagens ou busca, se a latência for visível para o usuário, ou se você já fosse rotear por um host de retenção zero de qualquer forma, porque nesse ponto você paga o preço do Luna por menos capacidade. Escolha o Sol apenas quando a tarefa realmente precisar do topo do ranking, e confira seu tempo até o primeiro token antes de colocá-lo perto de uma janela de chat. Se nenhum dos dois servir, as alternativas ao GPT-5.6 cobrem o resto do campo, e minha análise do GPT-5.6 traz o detalhe nível por nível.

Ou use os dois, que é o que a maioria das equipes que escreve sobre isso realmente faz. Roteie o texto em massa para o Flash, capturas de tela e busca para o Luna, e mantenha a lógica de roteamento no seu próprio código para que o próximo corte de preço seja só uma mudança de configuração. Isso está bem mais perto de como eu construiria do que apostar em um único modelo, e é o mesmo instinto por trás de rodar a classificação de tickets num modelo mais barato do que aquele que redige a resposta.

Experimente a eesel

Aqui está o que essa comparação não consegue responder por você: o modelo é cerca de 2% de um ticket de suporte resolvido. Eu desenvolvo integrações na eesel, e o que realmente decide se um agente de IA resolve um ticket ou só irrita o cliente é a busca de informações sobre sua própria central de ajuda, mais regras de escalonamento que sabem quando parar, e depois um lançamento testado contra o seu próprio histórico de tickets antes que qualquer cliente o veja. Já vimos bots com voz confiante darem respostas erradas, por isso simulamos cada lançamento com tickets passados antes de colocá-lo no ar, em vez de lançar com base numa pontuação de benchmark.

A economia também não é economia de tokens. O custo bruto em tokens de uma resposta de suporte no Flash é praticamente zero; o que aparece na sua fatura é o custo por resolução, e a eesel cobra por ticket sem taxa por assento, então um bom mês para a sua IA não é um castigo. Um líder da Gridwise resumiu o resultado sem rodeios: "In the first month, eesel is resolving 73% of our tier 1 requests... results quickly during our 7-day trial." Uma líder de experiência do cliente numa marca de suplementos vendida direto ao consumidor colocou o lado da confiança exatamente como eu colocaria: "I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

Se você quer um agente de IA no Zendesk ou no Freshdesk que já conhece sua central de ajuda, se conecta durante uma pausa para o café, e pode ser testado a seco nos tickets do trimestre passado antes de responder a qualquer cliente, foi isso que construímos. Grátis para experimentar, e a simulação é a parte que eu usaria primeiro.

O painel da eesel AI, onde um colega de equipe de IA redige e resolve tickets de suporte
O painel da eesel AI, onde um colega de equipe de IA redige e resolve tickets de suporte

Vale a pena ler a seguir se você está escolhendo um modelo especificamente para suporte: qual LLM combina melhor com suporte, LLMs específicos de domínio, e a versão honesta do custo de um agente de suporte com IA.

Perguntas frequentes

O DeepSeek V4 Flash é melhor que o GPT-5.6?
Depende de qual nível do GPT-5.6 você quer dizer, e esse é justamente o truque desta comparação. Contra o GPT-5.6 Luna os dois estão empatados: a Artificial Analysis dá 50 ao Flash e 51 ao Luna. Contra o GPT-5.6 Sol, com 59, o Flash perde em inteligência mas ganha em preço por cerca de 107x nos tokens de saída. Para o panorama mais amplo, veja minhas notas sobre como escolher um LLM para suporte.
Quanto mais barato é o DeepSeek V4 Flash em relação ao GPT-5.6?
O Flash custa $0,14 por milhão de tokens de entrada sem cache e $0,28 na saída. O GPT-5.6 Luna custa $0,20 e $1,20, o Terra $2 e $12, e o Sol $5 e $30. Em cargas de trabalho reais a diferença em relação ao Luna fica mais perto de 3x, não dos 4x que a tarifa de saída sugere, porque a entrada em cache do Luna também é barata. Meu detalhamento dos preços do GPT-5.6 traz a tabela completa.
O DeepSeek V4 Flash suporta imagens como o GPT-5.6?
Não há entrada de imagem documentada para o V4 Flash, e sua configuração não traz um encoder de visão, então é apenas texto na entrada e na saída. O GPT-5.6 aceita texto e imagens nos três níveis. Essa única diferença é o motivo de várias equipes usarem os dois, com o Flash no trabalho de texto em massa e o Luna em capturas de tela. Veja GPT-5.6 Luna para o que o nível econômico da OpenAI cobre.
Como é a janela de contexto do DeepSeek V4 Flash comparada ao GPT-5.6?
O Flash tem 1M de contexto com um teto de saída de 384K. O GPT-5.6 tem 1.050.000 de contexto e 128K de saída máxima nos três níveis. A pegadinha é que qualquer prompt do GPT-5.6 acima de 272K tokens de entrada é cobrado a 2x na entrada e 1,5x na saída para a solicitação inteira, o que torna o Flash a opção mais estável para prompts longos. RAG em vez de um prompt longo costuma ser a resposta mais barata de qualquer forma.
O DeepSeek V4 Flash é seguro para dados de clientes?
Não pela API própria, e essa é a objeção que domina qualquer discussão sobre ele, porque o DeepSeek treina com o que você envia. Provedores de retenção zero rodam os mesmos pesos com licença MIT por cerca de 3x a 5x o preço, o que apaga a maior parte do desconto em relação ao GPT-5.6 Luna. Se os dados forem tickets de clientes, veja como a automação de suporte trata a retenção antes de escolher um modelo.
Qual modelo é mais rápido, o DeepSeek V4 Flash ou o GPT-5.6?
O GPT-5.6, pelos números que existem. A Artificial Analysis não publica nenhum dado de velocidade para a variante de raciocínio do Flash, enquanto o Luna roda a 177,8 tokens por segundo e o Terra a 138. Um comentarista no Hacker News resumiu essa troca assim: o Luna custa de 2x a 3x mais por uma inferência de 2 a 5 vezes mais rápida. Se a latência é sua restrição, meu guia de transferência cobre o que os usuários notam primeiro.
Devo usar DeepSeek V4 Flash ou GPT-5.6 para atendimento ao cliente?
Para a resposta em si, qualquer um dos dois serve, já que o modelo é a menor parte de um ticket resolvido. O que decide o resultado é a qualidade da busca de informações, as regras de escalonamento e os testes contra o seu próprio histórico, por isso simulamos cada lançamento com tickets passados antes de colocá-lo no ar. Comece pela taxa de resolução em vez da ficha do modelo, e compare o custo real por resolução.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Preços do DeepSeek V4 Flash: o que você vai realmente pagar
Trending

Preços do DeepSeek V4 Flash: o que você vai realmente pagar

O DeepSeek V4 Flash é listado a $0.14 de entrada e $0.28 de saída por milhão de tokens. Usuários reais publicaram taxas combinadas abaixo de um centavo. Veja o que decide qual delas te espera.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustração comparando os planos de modelo DeepSeek V4 Flash e V4 Pro
Trending

DeepSeek V4 Flash vs V4 Pro: qual plano usar?

O plano barato da DeepSeek agora pontua mais alto que o caro no ranking independente. Veja exatamente onde isso se confirma, e os dois pontos em que não.

Rama Adi NugrahaRama Adi NugrahaAug 3, 2026
DeepSeek V4 Flash: specs, preços e para que serve na prática
Trending

DeepSeek V4 Flash: specs, preços e para que serve na prática

DeepSeek V4 Flash custa $0,14 de entrada e $0,28 de saída por milhão de tokens, e supera o próprio nível caro da DeepSeek. Isto é o que a tabela de preços não conta.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustração comparando DeepSeek V4 Flash e Kimi K3 da Moonshot AI
Trending

DeepSeek V4 Flash vs Kimi K3: qual você deveria usar?

Um modelo custa 29 vezes mais por tarefa que o outro. Passei por todos os números publicados dos dois, e a parte interessante é a opção intermediária que ninguém deveria comprar.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustração de um gato muito longo se esticando ao lado de duas pessoas revisando um cartão de pontuação, com o logo do LongCat
Trending

Análise do LongCat 2.0: um cavalo de batalha com um bloqueio real

Avaliei o LongCat 2.0 em sete pontos que realmente importam para um comprador, usando os próprios documentos da Meituan e os relatos de quem já passou bilhões de tokens por ele. Ele sai bem em seis.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustração de um gato muito longo esticado sobre uma mesa ao lado de um rack de servidores, com o logotipo da LongCat
Trending

LongCat 2.0: por dentro do modelo aberto de 1,6T da Meituan

LongCat 2.0 é o modelo MoE de 1,6T parâmetros da Meituan, sob licença MIT, a 0,30 dólares por milhão de tokens de entrada. Li todas as fontes primárias para ver o que realmente é entregue.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Um avaliador olhando para um cartão de veredito com dois seletores de esforço rotulados como baixo e máximo, ao lado da baleia da DeepSeek
Trending

Análise do DeepSeek V4 Flash: um modelo, duas personalidades

Uma análise do DeepSeek V4 Flash baseada nos números que ambos os placares publicam. A execução barata e a execução inteligente são os mesmos pesos, e isso muda o veredito.

Riellvriany IndriawanRiellvriany IndriawanAug 4, 2026
Ilustração comparando o Qwen 3.8 Max da Alibaba com o DeepSeek V4 Flash
Trending

Qwen 3.8 Max vs DeepSeek V4 Flash: preço, specs, veredito real

Um modelo custa 21x mais por token de saída do que o outro. Isso é o menos interessante nessa comparação, e aqui está o que as especificações realmente decidem.

Alicia Kirana UtomoAlicia Kirana UtomoAug 3, 2026
Duas pessoas lendo um grande medidor de uso e ajustando uma pilha de mostradores de cobrança, na cor azul da marca Meta
Trending

Preços do Meta Muse Spark 1.1: a fatura tem quatro medidores

O Muse Spark 1.1 tem preço de tabela de $1,25 de entrada e $4,25 de saída por milhão de tokens. Quatro medidores separados determinam sua fatura real, e o preço de tabela é o menor deles.

Rama Adi NugrahaRama Adi NugrahaAug 5, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis