
A tabela de 60 segundos
Tudo abaixo vem das próprias páginas publicadas por cada fornecedor, em 3 de agosto de 2026. Onde os dois fornecedores medem a mesma coisa de forma diferente, eu deixei isso explícito em vez de suavizar.
| Qwen 3.8 Max | GPT-5.6 Sol | GPT-5.6 Terra | GPT-5.6 Luna | |
|---|---|---|---|---|
| ID do modelo | qwen3.8-max | gpt-5.6-sol | gpt-5.6-terra | gpt-5.6-luna |
| Lançamento | 2 de ago. de 2026 | 9 de jul. de 2026 | 9 de jul. de 2026 | 9 de jul. de 2026 |
| Entrada / 1M | $2,00 | $5,00 | $2,00 | $0,20 |
| Saída / 1M | $6,00 | $30,00 | $12,00 | $1,20 |
| Entrada em cache / 1M | $0,25 | $0,50 | $0,20 | $0,02 |
| Sobretaxa de contexto longo | Não publicada | 2x entrada, 1,5x saída acima de 272K | Igual | Igual |
| Janela de contexto | 1.000.000 | 1.050.000 | 1.050.000 | 1.050.000 |
| Saída máxima | 131.072 | 128.000 | 128.000 | 128.000 |
| Tokens de raciocínio máximos | 262.144 | Não publicado | Não publicado | Não publicado |
| Modalidades de entrada | Texto, imagem, vídeo | Texto, imagem | Texto, imagem | Texto, imagem |
| Parâmetros | 2,4T no total, 95B ativos | Não publicado | Não publicado | Não publicado |
| Data de corte do conhecimento | Não publicada | 16 de fev. de 2026 | 16 de fev. de 2026 | 16 de fev. de 2026 |
| Ficha do modelo | Nenhuma | Sim | Sim | Sim |
| Pesos abertos | Prometido, não entregue | Não | Não | Não |
| Limite de taxa (nível máximo) | 15K RPM / 2M TPM | 15K RPM / 40M TPM | Igual ao Sol | 30K RPM / 180M TPM |
| Disponível em chat de consumidor | Qwen Studio | ChatGPT | Apenas Codex e Work | Apenas Codex e Work |
| Controle de raciocínio | reasoning_effort: low / medium / xhigh | Esforço de raciocínio incl. max | Igual | Igual |
Duas linhas merecem um segundo olhar. O Qwen é o único dos quatro que aceita vídeo como entrada, o que é uma lacuna real de capacidade e não apenas um floreio de ficha técnica. E o Qwen é o único sem data de corte de conhecimento publicada, sem ficha de modelo e sem ficha de sistema, o que é uma lacuna real de evidências.
O que o Qwen 3.8 Max realmente é
O Qwen é a família de modelos da Alibaba Cloud, e o Max é a linha principal proprietária que fica acima dos níveis mais baratos Plus e Turbo. O Qwen 3.8 Max é o mais novo, e foi lançado em dois atos.
Se você quiser conhecer primeiro a família mais ampla, minha análise do Qwen cobre os níveis anteriores, e a análise independente do Qwen 3.8 Max aprofunda apenas neste modelo.
O primeiro ato foi em 19 de julho, na World AI Conference em Xangai: um endpoint de prévia, duas publicações no X, e uma afirmação verbal de ranking de ponta sem nenhuma tabela. O segundo ato foi em 2 de agosto, quando a Alibaba publicou um texto de lançamento de 5.000 palavras com tudo que faltava na prévia.
A arquitetura, conforme descrita pela Alibaba: 2,4 trilhões de parâmetros totais com 95 bilhões ativos, um modelo esparso do tipo mistura de especialistas construído sobre a base do Qwen 3.5. Esse número de 95B de parâmetros ativos é o que importa, e o que a prévia havia omitido. Os parâmetros totais definem a manchete; os parâmetros ativos definem sua latência e sua fatura.
A alegação multimodal é a verdadeira novidade da linha Max. A página do modelo da Alibaba lista imagem, texto e vídeo como entrada, e o texto de lançamento traz números concretos: relatórios financeiros e PDFs com mais de 200 páginas, e vídeos "com mais de 100 horas" organizados no que a Alibaba chama de grafo de memória de vídeo. Vale destacar com honestidade: as duas configurações de harness que a Alibaba publica nesse mesmo texto declaram apenas texto e imagem. O vídeo parece ser um caminho nativo do DashScope, e não algo acessível pelo endpoint compatível com a OpenAI.

O raciocínio é controlado por reasoning_effort, que aceita low, medium e xhigh, sendo xhigh o padrão. A Alibaba também ativa o preserve_thinking por padrão "para a melhor experiência pronta para uso", uma forma educada de dizer que o modelo é ajustado para pensar bastante antes de responder. Guarde essa informação, porque ela reaparece mais adiante como um problema de custo.
O que o GPT-5.6 realmente é
O GPT-5.6 não é um único modelo. São três níveis de capacidade que se tornaram disponíveis ao público em 9 de julho: o Sol como carro-chefe, o Terra como o meio-termo equilibrado, e o Luna como o rápido e barato. Eu detalhei cada um deles em uma análise completa do GPT-5.6. Os três compartilham a mesma janela de contexto de 1.050.000 tokens, o mesmo teto de saída de 128.000 tokens, e a mesma data de corte de conhecimento de 16 de fevereiro de 2026.
Depois, em 30 de julho, a OpenAI fez algo que resetou silenciosamente toda essa comparação. Ela cortou os preços em dois dos três níveis:
"A partir de 30 de julho, o preço da API é de $2 por milhão de tokens de entrada e $12 por milhão de tokens de saída para o Terra, e $0,20 por milhão de tokens de entrada e $1,20 por milhão de tokens de saída para o Luna. O preço do Sol permanece inalterado."
Isso é 20% de desconto no Terra e 80% no Luna. O Sol se manteve em $5 e $30. Se você ler uma comparação de preços do GPT-5.6 escrita em meados de julho, ela está errada em até 5 vezes no caso do Luna.
A mesma atualização renomeou o Priority Processing para modo Fast, que dobra o preço em troca de até 2,5 vezes a velocidade no Sol. E a OpenAI adicionou algo que o Qwen não tem: uma sobretaxa de contexto longo. Prompts com mais de 272 mil tokens de entrada são cobrados a 2x na entrada e 1,5x na saída para a requisição inteira, não apenas para o excedente. Ultrapassar esse limite transforma uma chamada de $5/$30 no Sol em uma de $10/$45. Então a janela real de um milhão de tokens do Sol é uma janela de um milhão de tokens pela qual você paga o dobro.
Benchmarks: duas tabelas, nenhum árbitro
É aqui que a maioria das comparações direta a direta erra. Os dois laboratórios agora publicam uma tabela. Nenhuma das tabelas foi feita por alguém independente, e as duas não podem ser sobrepostas.

Comecemos pelo que a Alibaba publicou, porque é incomumente direto: sua tabela traz o GPT-5.6 Sol (max) como coluna de comparação. Direto dessa tabela:
| Benchmark | Qwen 3.8 Max | GPT-5.6 Sol (max) | Vencedor |
|---|---|---|---|
| SWE-Pro | 67,7 | 64,6 | Qwen |
| TerminalBench-2.1 | 86,6 | 88,8 | Sol |
| PaperBench | 93,0 | 90,5 | Qwen |
| FrontierSWE | 73,5 | 88,8 | Sol, por 15,3 |
| CoWorkBench | 74,8 | 71,5 | Qwen |
| JobBench | 53,4 | 45,4 | Qwen |
| Agents' Last Exam | 52,4 | 53,6 | Sol |
| CharXiv (RQ) | 93,5 | 89,1 | Qwen |
| ERQA | 77,8 | 70,0 | Qwen |
| PerceptionBench | 63,5 | 59,7 | Qwen |
| LVBench | 81,8 | 78,8 | Qwen |
| Vision2Web | 69,0 | 62,1 | Qwen |
| OSWorld-Verified | 86,1 | 83,2 | Qwen |
Treze de dezesseis para o Qwen, e todas as linhas de visão são uma vitória limpa do Qwen. Esse é um resultado real e eu não vou menosprezá-lo.
Mas leia as notas de rodapé, algo que quase ninguém faz. A Alibaba revela que seis dos benchmarks de programação são avaliações internas próprias (QwenSWEBench, QwenQoderBench, QwenReactBench, QwenSVGBench, CoWorkBench, RecreationBench), que as pontuações dos concorrentes foram tiradas de ambientes de teste mistos em vez de condições idênticas, e que várias linhas são avaliadas por modelos rivais: o gemini-3.1-pro-preview avalia o PLawBench, o Claude Opus 4.6 avalia o PaperBench. Também há uma linha admitindo que os resultados do Fable 5 "podem envolver soluções alternativas".
Agora os terceiros, que dividem o veredito exatamente ao meio. No Artificial Analysis, cujo Intelligence Index v4.1 é um composto automatizado de nove avaliações, o GPT-5.6 Sol pontua 59 e fica em terceiro lugar geral, atrás do Claude Opus 5 e do Claude Fable 5, com o Terra em 55 e o Luna em 51.
No LMArena, que é votação por preferência humana, o qwen3.8-max fica em 5º lugar em Texto com 1496 e 4º em WebDev com 1668, ambos à frente do gpt-5.6-sol-xhigh, em 15º e 6º lugares. A mesma divisão entre automatizado e humano aparece na minha comparação GPT-5.6 vs Claude.
Então: o composto automatizado diz Sol, a preferência humana diz Qwen. Quem cita apenas um dos dois está tentando vender alguma coisa para você.
A leitura da comunidade é mais direta. Do tópico no Hacker News sobre a prévia:
"The few tests I ran were by no means comprehensive, but while kimi felt like the real deal qwen seems a bit of a benchmark princess."
A comparação de preços que todo mundo entende ao contrário
A história que se escreveu sozinha em julho foi a de que um laboratório chinês havia derrubado os preços da OpenAI. A $2 e $6 contra os $5 e $30 do Sol, isso é verdade. Contra o restante da família, não é.

O Qwen 3.8 Max iguala o preço de entrada do Terra centavo a centavo e reduz seu preço de saída pela metade. Isso é uma vitória genuína. Mas o Luna supera o Qwen em 10 vezes na entrada e 5 vezes na saída, e ele não existia a esse preço quando a narrativa de "modelos chineses são mais baratos" se firmou.
Também existe um problema de segunda ordem, e é esse que determina as faturas reais. O Qwen vem com o raciocínio xhigh ativado por padrão e o preserve_thinking habilitado. Modelos verbosos custam mais do que a tarifa anunciada sugere, porque você paga por cada token de raciocínio. A Artificial Analysis mediu que o Luna consumiu 130 milhões de tokens de saída para rodar seu índice, contra uma mediana de 62 milhões, então isso corta dos dois lados. O ponto é que a tarifa por token e o custo por tarefa são números diferentes, e apenas um deles aparece na página de preços.
Insira seus próprios volumes:
Mais um detalhe se você estiver olhando para a assinatura mensal barata em vez da API. O endpoint qwen3.8-max-preview nunca foi vendido por token de forma alguma: ele só estava disponível pelo Token Plan da Alibaba, a $6, $18 ou $68 por mês nos níveis Personal. Esses planos funcionam com créditos em janelas fixas de 5 horas e 7 dias, os créditos não usados não são acumulados, e atingir qualquer um dos dois limites pausa o uso até a janela ser reiniciada. A Alibaba também se recusa a publicar o coeficiente de créditos por token, então não dá para calcular seu custo com antecedência. A oferta principal da prévia, 10% das tarifas normais somados a mais 80% de desconto entre 22h e 8h, o que resulta em 2% do consumo padrão, se aplica apenas aos planos Personal e desaparece junto com a prévia. O modelo GA recebe, em vez disso, um desconto noturno fixo de 50%.
O que realmente decide na prática
Benchmarks medem capacidade. Produção mede capacidade dividida por paciência. Todo relato de uso prático que encontrei chega à mesma reclamação, e ela não tem nada a ver com inteligência.
Um desenvolvedor que rodou a mesma conversão de design elaborado nos dois modelos no dia do lançamento:
"Same prompt for both for the conversion. I used OpenCode for the qwen version, but I encountered a significant amount of errors / timeouts while it was running. Claude finished in around 16 min, but I spent close to 2 hours shepherding the Qwen build."
Outro, depois de testar quatro modelos de ponta lado a lado ao longo de vários dias:
"Don't trust the benchmarks, and the Chinese models really are slow and token-inefficient. However they do seem very close to SOTA."
Esse mesmo desenvolvedor publicou a contabilidade de tokens de uma tarefa de aplicativo web, o dado de custo real mais útil já publicado até agora: Kimi K3 a $5,50, Qwen 3.8 Max a $6,30, Fable 5 a $30. A tarifa barata do Qwen é real, e mesmo assim ele precisou de 18 milhões de tokens de entrada contra os 9,5 milhões do Kimi para o mesmo trabalho.
Os veredictos sobre o modelo em si estão divididos, o que vale a pena dizer claramente em vez de suavizar na média. Um usuário cancelou sua assinatura da Anthropic por causa disso. Outro o chamou de "desastrosamente ruim", descrevendo um modelo que "fica preso em longos loops de segunda adivinhação sem progresso algum". Ambos estavam testando a mesma versão de prévia na mesma quinzena. Se essa disparidade te incomoda, as listas mais seguras são meus comparativos de alternativas ao Qwen e alternativas ao GPT-5.6, além da análise do Kimi K3 para o terceiro concorrente dessa categoria.
E algumas coisas simplesmente não são publicadas. Não existe data de corte de conhecimento para o Qwen 3.8 Max em lugar nenhum, nem ficha de modelo, nem ficha de sistema, nem avaliação de segurança. Os pesos abertos prometidos para "a próxima semana" a partir de 2 de agosto não têm licença, nem data, nem repositório. Se o seu processo de compras exigir qualquer um desses itens, a resposta hoje é que eles não existem.
Onde um modelo de ponta termina e o trabalho de suporte começa
Essa é a parte com que mais me importo, porque é onde vejo equipes perderem um trimestre inteiro.

Nenhum desses modelos conhece sua política de reembolso. Nenhum leu seus últimos 7.000 tickets. Nenhum tem a menor noção de que o cliente que está te escrevendo está em um plano empresarial e já foi escalado duas vezes. Uma pontuação de benchmark não é um agente de suporte, e a lacuna entre os dois é onde a maioria dos projetos de automação de suporte com IA morre em silêncio.
Essa mesma lacuna explica por que escolher um helpdesk de IA é um exercício diferente de escolher um modelo, e por que a automação de tickets depende da recuperação de informações, e não do raciocínio bruto.
Passamos anos rodando IA em filas de suporte reais, e o modo de falha específico é pior do que "a IA não sabe". É a invenção com confiança. Tivemos clientes pagantes cujos bots fabricaram respostas para clientes reais quando a busca na base de conhecimento voltava vazia: o bot de uma empresa de energia solar inventou condições de assinatura que não existiam, e outro enviou a um cliente "Oxigênio", da tabela periódica, como resposta. Nada em um modelo de 2,4 trilhões de parâmetros impede isso. Um modelo maior apenas diz a coisa errada com mais fluência.
O controle que realmente resolve isso surgiu em uma ligação com um líder de suporte que gerencia 7.000 tickets por mês, e não tem nada a ver com a escolha do modelo:
"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
a CX lead at a 7,000-ticket-a-month DTC brand
Essa é uma decisão de produto, não uma decisão de modelo. É por isso que o eesel AI executa uma simulação em tickets históricos antes de qualquer coisa entrar em produção, para que você veja primeiro a taxa de resolução e as respostas reais em conversas passadas de verdade.
Também é por isso que as respostas são roteadas por confiança, redigindo para um humano ou escalando em vez de simplesmente adivinhar. Operando dessa forma, o Gridwise atingiu 73% de resolução no primeiro nível já no primeiro mês.
A leitura estratégica sobre Qwen 3.8 Max contra GPT-5.6 é, portanto, um pouco anticlimática: construa de forma que você consiga trocar o motor. A camada de modelo melhora e fica mais barata a cada poucas semanas. O Kimi K3 chegou dias antes do Qwen, o preço do Luna caiu 80% em uma única tarde, e o que liderar a tabela em setembro ainda nem está nela hoje. Uma equipe que se prendeu rigidamente a uma API em julho já está tendo que refazer toda a fiação.
Essa também é a resposta honesta para "devo usar Gemini, Grok ou Mistral em vez disso". Provavelmente, eventualmente, para alguma tarefa. O que é justamente o argumento para não se importar tanto com o vencedor deste mês.
Então, qual você deveria escolher?
Se você está lançando um produto e quer uma única resposta:
- Trabalho intenso em visão, vídeo ou documentos: Qwen 3.8 Max, com folga. Todas as linhas de visão na tabela da Alibaba são uma vitória do Qwen, e ele é o único dos quatro que aceita vídeo.
- Engenharia de software difícil: GPT-5.6 Sol. Um FrontierSWE de 88,8 contra 73,5 não é margem de erro, e é o próprio número da Alibaba.
- Alto volume, sensível a latência e a custo: GPT-5.6 Luna, e não há nem comparação no preço. Fique de olho na verbosidade.
- Um cavalo de batalha geral onde você quer a melhor relação tarifa/capacidade: Terra e Qwen 3.8 Max travam a disputa de verdade. O Qwen tem metade do preço de saída; o Terra é mais rápido e vem com ficha de modelo, data de corte de conhecimento e um endpoint estável.
- Qualquer coisa voltada ao cliente: nenhum dos dois sozinho. Escolha primeiro a camada e deixe que ela escolha o modelo. As contas estão na minha análise de custos de agentes, e a lista de candidatos em melhores agentes de IA.
O que eu não faria é tratar a tabela de 2 de agosto como algo definitivo. Seis desses benchmarks de programação são da própria Alibaba, nenhum terceiro os reexecutou, e o veredito da comunidade sobre a mesma versão vai de "cancelei minha assinatura da Anthropic" a "desastrosamente ruim". Dê um mês e espere por números independentes.
Experimente o eesel
Se você chegou até aqui porque quer um modelo que resolva tickets em vez de vencer tabelas, esse é exatamente o propósito do eesel AI. Ele se conecta ao Zendesk, ao Freshdesk e a mais de 100 outras ferramentas, aprende com sua central de ajuda e tickets passados, e começa a redigir respostas em minutos.

O diferencial é a rampa de confiança, não o motor. Simule com seu histórico real de tickets, leia os números, comece no modo rascunho, e só vá para o modo autônomo quando estiver satisfeito. Você herda cada avanço de ponta, seja ele o Qwen, o GPT-5.6 ou o que for lançado no mês que vem, sem precisar refazer nada. Experimente o eesel gratuitamente, sem cartão de crédito.
Perguntas frequentes
O Qwen 3.8 Max é mais barato que o GPT-5.6?
Qual é melhor para programação, Qwen 3.8 Max ou GPT-5.6 Sol?
Qual é a janela de contexto do Qwen 3.8 Max em comparação com o GPT-5.6?
O Qwen 3.8 Max é open source?
Posso usar o Qwen 3.8 Max ou o GPT-5.6 para atendimento ao cliente?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








