
A disputa é Flash contra Luna, não contra Sol
O GPT-5.6 são três modelos, não um só, e o alias gpt-5.6 simplesmente redireciona para o Sol. Por isso muitos confrontos soam estranhos. Colocam o nível barato do DeepSeek contra o nível mais caro da OpenAI e depois concluem que modelos baratos são baratos.
Aqui está a tabela de preços completa como está hoje, nível padrão, contexto curto, por milhão de tokens.
| Modelo | Entrada | Entrada em cache | Saída | AA Intelligence Index |
|---|---|---|---|---|
deepseek-v4-flash | $0,14 | $0,0028 | $0,28 | 50 |
gpt-5.6-luna | $0,20 | $0,02 | $1,20 | 51 |
gpt-5.6-terra | $2,00 | $0,20 | $12,00 | 55 |
gpt-5.6-sol | $5,00 | $0,50 | $30,00 | 59 |
deepseek-v4-pro | $0,435 | $0,003625 | $0,87 | 44 |
Preços da tabela de preços do DeepSeek e da página de preços da OpenAI; notas de índice da Artificial Analysis. Repare na última linha, que é uma história à parte: o nível caro do DeepSeek agora pontua abaixo do seu nível barato, e eu investiguei o motivo em Flash contra Pro.

O corte de preço de 30 de julho é o motivo deste post existir. A OpenAI baixou o Terra em 20% e o Luna em 80% em um único anúncio: "Starting July 30, API pricing is $2 per million input tokens and $12 per million output tokens for Terra, and $0.20 per million input tokens and $1.20 per million output tokens for Luna. Sol pricing remains unchanged." Qualquer comparação que ainda cite o Luna a $1,00 e $6,00 está desatualizada em 5x. Se você quiser a análise nível por nível, cobri o GPT-5.6 Sol e o GPT-5.6 Terra separadamente.

O que cada modelo realmente é
O Flash é um modelo esparso de mistura de especialistas, 284B de parâmetros totais e 13B ativos, distribuído sob licença MIT, o que significa que os pesos ficam no Hugging Face e você é livre para rodá-los você mesmo. A equipe do vLLM descreveu a arquitetura no dia do lançamento: "A sparse MoE with 256 routed experts and six active per token, a 1M-token context window, and three reasoning-effort levels. Built for code agents and tool use." Ignore o número "304B" que aparece em alguns widgets de modelos; a configuração diz 284B.
O GPT-5.6 tem pesos fechados, três níveis, uma única ficha técnica compartilhada. Os três trazem 1.050.000 de contexto, 128.000 de saída máxima, e um corte de conhecimento em 16 de fevereiro de 2026, com entrada de texto e imagem.
| DeepSeek V4 Flash | GPT-5.6 (todos os níveis) | |
|---|---|---|
| Pesos | MIT, aberto, ~167GB | Fechado |
| Parâmetros | 284B totais / 13B ativos | Não publicado |
| Contexto | 1M | 1.050.000 |
| Saída máxima | 384K | 128.000 |
| Entrada de imagem | Não documentado | Sim |
| Busca na web | Não documentado | Sim |
| Corte de conhecimento | Não publicado | 16 fev. 2026 |
| Modo de raciocínio | Ativo por padrão, três níveis de esforço | Tokens de raciocínio suportados |
| Desconto de cache | ~98% | 90% |
| Concorrência | 2.500 | Conforme o nível, 500 a 30.000 RPM |
Duas peculiaridades que valem a pena conhecer antes de escrever a configuração. No Flash, xhigh funciona silenciosamente como high, então a partir de certo ponto não dá para aumentar mais o raciocínio. No GPT-5.6, o modo Fast substituiu o Priority Processing nessa mesma data de 30 de julho, e dobra a tarifa por "up to 2.5x faster speeds than Standard processing at twice the price, with no change in intelligence."
Para quem está avaliando pesos abertos de forma mais ampla, modelos de linguagem pequenos e agentes open source são as duas comparações que mais me perguntam ao lado desta.
O que os benchmarks mostram: empate embaixo, diferença real em cima
No Artificial Analysis Intelligence Index v4.1, o Flash fica em 50, terceiro entre os modelos de peso aberto, atrás do Kimi K3 com 57 e do GLM 5.2 com 51. O Luna está em 51, o Terra em 55, o Sol em 59, e o Sol fica em terceiro lugar geral no ranking completo, atrás de dois modelos Claude. A Artificial Analysis resumiu o lado do custo no dia do lançamento:
"DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence Index, a 10-point jump over DeepSeek V4 Flash (released April 2026) that puts it 6 points ahead of DeepSeek V4 Pro. [...] DeepSeek V4 Flash 0731's Cost per Task on DeepSeek's first-party API comes in at ~60% lower than GPT-5.6 Luna (max), a model with comparable intelligence."
A preferência humana conta uma história diferente do índice composto. No ranking de texto do LMArena, o deepseek-v4-flash pontua 1436 ±4 em 48.667 votos, na posição 79, enquanto o gpt-5.6-sol-xhigh é 15º no geral. No WebDev, o deepseek-v4-flash-high é 8º com 1577 e o Sol é 6º com 1620. Ou seja, o modelo aberto barato é competitivo no índice automatizado e claramente atrás na comparação humana às cegas, o que é mais ou menos esperado e vale a pena dizer em voz alta.
Três ressalvas sem as quais eu não publicaria este post.
- O próprio gráfico do DeepSeek é uma seleção. Como colocou uma análise ponderada, a comparação "is also almost entirely focused on agentic coding and tool use, not general reasoning or broad knowledge" (Dr. Tomislav Marinovic, X).
- O salto gerou desconfiança. O DeepSWE foi de 7,3 para 54,4 com o mesmo número de parâmetros, e uma conta de IA disse claramente que um salto de pontuação isolado logo após uma atualização soa como benchmaxxing, já que a pontuação baixa anterior do DeepSWE foi justamente o que expôs a versão anterior.
- O Flash é verboso e ainda alucina. A Artificial Analysis mediu 210M de tokens de saída para rodar o índice, contra uma mediana de 100M na categoria, e coloca sua taxa de alucinação AA-Omniscience em 84%, 12 pontos abaixo do antecessor. O Luna também é verboso, com 130M de tokens contra uma mediana de 62M. Se algum desses números importa para você, minhas notas sobre como prevenir alucinações trazem a versão prática.
O que isso custa de verdade na sua carga de trabalho
Tabelas de preços enganam, porque a proporção entre dois modelos muda com a forma do seu tráfego, não só com o volume dele. Entrada em cache muda isso, raciocínio pesado em saída muda isso, e prompts longos também mudam. Escolha o perfil que mais se parece com o seu.
O número que eu levaria comigo é o mais chato. Em todos os formatos, o Flash fica cerca de 3x mais barato que o Luna, e não os 4x que a coluna de saída sugere. Um comentarista no Hacker News calculou a mesma troca a partir da coluna de custo por tarefa e resumiu bem: "OpenAI Luna between 2x and 3x the price of Deepseek Flash, what you get is 2 to 5 times faster inference" (spwa4, Hacker News). Outro colocou as tabelas de preços lado a lado e chegou à mesma conclusão resignada:
"The thing is, even if Luna is better in DeepSWE and has the 80% discount. DeepSeek is still cheaper. [...] Both Luna and Flash are heavy on the reasoning > output. And the cache hitrate + prices also matter. Reality is, you can not go wrong with Luna or Flash at those prices."
Onde o preço de tabela deixa de ser o preço
Quatro coisas mexem na conta real, e entre os dois fornecedores elas não são nada simétricas.
O GPT-5.6 tem um penhasco em 272K tokens de entrada. Toda página de modelo do GPT-5.6 diz o mesmo: "Prompts with >272K input tokens are priced at 2x input and 1.5x output for the full request." Cruzar esse limite recalcula o preço da chamada inteira, então uma solicitação ao Sol vai de $5 e $30 para $10 e $45. A janela de 1M do Flash não tem equivalente publicado, o que o torna a opção mais estável para prompts com repositórios ou históricos inteiros. Isso também é um bom argumento para preferir busca de informações em vez de lotar o prompt em qualquer um dos dois modelos.

O DeepSeek tem uma sobretaxa pendente de 2x em horários de pico. A tabela de preços diz que a API "will soon adopt a peak/off-peak pricing policy" em que "during peak hours, prices will be 2x the regular prices, applicable to all billing items", com a janela fixada entre 9h e 12h e entre 14h e 18h no horário de Pequim, ou seja, de 01h a 04h e de 06h a 10h UTC. Nenhuma data de início foi anunciada e nenhuma tabela de preço de pico foi publicada, então trate isso como um risco sobre o tráfego síncrono, não como um número fechado.
O cache é onde a vantagem do DeepSeek é maior e menos confiável. Seu desconto de ~98% por acerto de cache supera os 90% que a OpenAI e a maior parte do setor oferecem, e vem ativo por padrão sem mudança de código. A pegadinha está na mecânica: uma solicitação só é cobrada na tarifa de acerto se corresponder totalmente a uma unidade de prefixo de cache persistida, o cache é explicitamente de melhor esforço, e as entradas são apagadas "usually within a few hours to a few days" quando ficam sem uso. Não trate $0,0028 como um estado permanente.
A cobrança de terceiros pode surpreender. Um usuário relatou a versão mais extrema disso: "The model was good, but there appeared to be a pricing glitch or something, because it burned through $50 in under an hour on pretty trivial stuff" (onlyrealcuzzo, Hacker News). Existem 11 provedores servindo o Flash no OpenRouter e o DeepSeek não é o mais barato entre eles, então vale checar a medição por provedor antes de escalar um loop.
O que as pessoas realmente relatam pagar
Essa é minha parte favorita da reação ao DeepSeek, porque ali as pessoas postam recibos em vez de opiniões. Dois exemplos apareceram sem serem pedidos no tópico de lançamento.
"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:
"Those are rookie numbers. Last 13 days including today, so effectively 12 days of usage:
$19.27 USDAPI requests: 7,877Tokens: 2,116,598,952 Ok this is a bit of lie, a lot of my tasks are very experimental loops whose 99% output is like rubbish and can work forever continuously and take advantage of that 120x cheaper input cache."
Repare no que o segundo admite: a contagem impressionante de tokens é barata porque é intensiva em cache, exatamente o primeiro perfil do widget acima. Um terceiro usuário, rodando um harness de agente de 30 turnos, colocou uma sessão em "~$0.5 cost" e disse que não tocava na assinatura do Opus havia semanas (kmarc, Hacker News).
Do outro lado, o corte de preço do GPT-5.6 veio acompanhado de números de clientes divulgados, o mais próximo que a OpenAI tem de um recibo assim. O líder de produto de IA da Notion disse que o modelo mais novo "delivered comparable quality to GPT-5.5 at half the cost per task and in 60% less time", e o CTO da Blitzy relatou que o Luna "handles 2.2x more context with 8.5x fewer output tokens - at 87% lower cost than GPT-5.4 mini" depois de migrar de uma única chamada de saída estruturada para um loop de agente completo. Os dois são publicados pelos próprios fornecedores, então leia como indicativo, não como verificação independente.
As lacunas de capacidade que realmente decidem
Se você chegou até aqui esperando que o preço resolvesse tudo, aqui vem a virada. As duas coisas que decidem essa comparação para a maioria das equipes não estão na página de preços.
O Flash não consegue ver nem buscar. Não há entrada de imagem documentada, e a busca na web não faz parte da API. As pessoas contornam isso combinando modelos em vez de escolher um só, um padrão que eu copiaria: "Since DeepSeek V4 doesn't have vision so he got OMP to use GPT 5.6 Luna using the Codex sub. DeepSeek also doesn't support web search so he wired up OMP to call agy (Antigravity CLI) directly" (theturtletalks, Hacker News). Se sua fila de suporte está cheia de capturas de tela, essa lacuna encerra a discussão sozinha.
A velocidade não é medida de um lado e é publicada do outro. A Artificial Analysis lista a variante de raciocínio do Flash sem velocidade de saída, sem tempo até o primeiro token e sem tempo total de resposta, marcando a velocidade como "Unknown out of 4 units". A variante sem raciocínio tem números, a 107 tokens por segundo. O Luna roda a 177,8 tokens por segundo e o Terra a 138. O Sol é o caso estranho: 67,7 tokens por segundo e 137,84s de tempo até o primeiro token, abaixo da mediana do seu próprio nível de preço, algo bom de saber antes de colocá-lo por trás de qualquer coisa interativa.

Pesos abertos são uma opção real aqui, e a conta em geral diz que não vale a pena. O Flash roda localmente, e os relatos são detalhados: 60 tokens por segundo em sessão única em dois DGX Spark, ~30 num M3 Ultra com 256GB, 32 num Ryzen AI MAX+ 395 a cerca de 2,88 bits por parâmetro. O problema é a conta do hardware, cerca de €8.200 para a configuração com dois Spark. O veredito de consenso de alguém que fez as contas: "it makes little to no sense as long as API prices are what they are. Except for maybe privacy reasons" (cmrdporcupine, Hacker News). Privacidade, porém, não é uma exceção pequena, o que nos leva ao último ponto.
A retenção de dados é a objeção que sempre vence. A reclamação mais repetida sobre o Flash não é sobre qualidade:
"The model is fantastic. And costs almost nothing. The only problem I see is that they will train on your data. There are zero-data-retention providers of DeepSeek models, of which I have used openrouter (with zdr guardrails), and fireworks. But these are 3x to 5x more expensive than directly using DeepSeek, possibly due to poor caching. Thats the price to pay for zdr."
Passe isso pela tabela de tarifas e a vantagem principal evapora. Os $0,28 de saída do Flash viram $0,84 a $1,40, a mesma faixa dos $1,20 do Luna, e o Luna vem com visão, busca e um perfil de latência documentado. Se seus tokens contêm dados de clientes, a história do modelo barato e a história do modelo seguro viram a mesma história.

Meu veredito
Escolha o DeepSeek V4 Flash para trabalho de texto em massa em que você é dono dos dados: agentes de código, revisão de código, resumo, classificação, prefixos longos em cache, qualquer coisa que você rodaria de bom grado por 30 turnos. Hoje é a melhor inteligência por dólar do ranking, e os recibos acima confirmam isso. Também é a escolha certa se pesos abertos importam para você, já que a licença e os pesos no Hugging Face são reais, não apenas prometidos.
Escolha o GPT-5.6 Luna se precisar de imagens ou busca, se a latência for visível para o usuário, ou se você já fosse rotear por um host de retenção zero de qualquer forma, porque nesse ponto você paga o preço do Luna por menos capacidade. Escolha o Sol apenas quando a tarefa realmente precisar do topo do ranking, e confira seu tempo até o primeiro token antes de colocá-lo perto de uma janela de chat. Se nenhum dos dois servir, as alternativas ao GPT-5.6 cobrem o resto do campo, e minha análise do GPT-5.6 traz o detalhe nível por nível.
Ou use os dois, que é o que a maioria das equipes que escreve sobre isso realmente faz. Roteie o texto em massa para o Flash, capturas de tela e busca para o Luna, e mantenha a lógica de roteamento no seu próprio código para que o próximo corte de preço seja só uma mudança de configuração. Isso está bem mais perto de como eu construiria do que apostar em um único modelo, e é o mesmo instinto por trás de rodar a classificação de tickets num modelo mais barato do que aquele que redige a resposta.
Experimente a eesel
Aqui está o que essa comparação não consegue responder por você: o modelo é cerca de 2% de um ticket de suporte resolvido. Eu desenvolvo integrações na eesel, e o que realmente decide se um agente de IA resolve um ticket ou só irrita o cliente é a busca de informações sobre sua própria central de ajuda, mais regras de escalonamento que sabem quando parar, e depois um lançamento testado contra o seu próprio histórico de tickets antes que qualquer cliente o veja. Já vimos bots com voz confiante darem respostas erradas, por isso simulamos cada lançamento com tickets passados antes de colocá-lo no ar, em vez de lançar com base numa pontuação de benchmark.
A economia também não é economia de tokens. O custo bruto em tokens de uma resposta de suporte no Flash é praticamente zero; o que aparece na sua fatura é o custo por resolução, e a eesel cobra por ticket sem taxa por assento, então um bom mês para a sua IA não é um castigo. Um líder da Gridwise resumiu o resultado sem rodeios: "In the first month, eesel is resolving 73% of our tier 1 requests... results quickly during our 7-day trial." Uma líder de experiência do cliente numa marca de suplementos vendida direto ao consumidor colocou o lado da confiança exatamente como eu colocaria: "I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
Se você quer um agente de IA no Zendesk ou no Freshdesk que já conhece sua central de ajuda, se conecta durante uma pausa para o café, e pode ser testado a seco nos tickets do trimestre passado antes de responder a qualquer cliente, foi isso que construímos. Grátis para experimentar, e a simulação é a parte que eu usaria primeiro.

Vale a pena ler a seguir se você está escolhendo um modelo especificamente para suporte: qual LLM combina melhor com suporte, LLMs específicos de domínio, e a versão honesta do custo de um agente de suporte com IA.
Perguntas frequentes
O DeepSeek V4 Flash é melhor que o GPT-5.6?
Quanto mais barato é o DeepSeek V4 Flash em relação ao GPT-5.6?
O DeepSeek V4 Flash suporta imagens como o GPT-5.6?
Como é a janela de contexto do DeepSeek V4 Flash comparada ao GPT-5.6?
O DeepSeek V4 Flash é seguro para dados de clientes?
Qual modelo é mais rápido, o DeepSeek V4 Flash ou o GPT-5.6?
Devo usar DeepSeek V4 Flash ou GPT-5.6 para atendimento ao cliente?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








