Qwen 3.8 Max review: um preview de 2,4T testado com honestidade

Alicia Kirana Utomo
Escrito por

Alicia Kirana Utomo

Katelin Teen
Revisado por

Katelin Teen

Última edição July 20, 2026

Verificado por especialista
Qwen 3.8 Max review: um preview de 2,4T testado com honestidade

Por que sou eu quem está pedindo para você desacelerar

Eu construo agentes de IA na eesel, e o meu dia a dia é a parte chata que ninguém coloca em print: o que acontece depois que o modelo dá uma resposta. Já vimos um modelo com tom confiante entregar tranquilamente a política de reembolso errada para um cliente, e é exatamente por isso que todo rollout da eesel agora é simulado contra tickets históricos antes de sequer tocar numa caixa de entrada real.

Então, quando um modelo de 2,4T aparece com uma faixa "só atrás do Fable 5", meu primeiro instinto não é empolgação, e sim: me mostre a avaliação, me mostre os parâmetros ativos, e me mostre o que ele faz no ticket número 200, não no da demonstração. Esta review é escrita a partir desse lugar. Se você quiser a ficha técnica crua, o resumo do Qwen tem isso. Se quiser saber se o Qwen 3.8 Max muda algo para uma equipe real nesta semana, continue lendo.

O que o Qwen 3.8 Max realmente é

O Qwen 3.8 Max é o carro-chefe da família Qwen da Alibaba, e o primeiro modelo multimodal da equipe acima de 1 trilhão de parâmetros. A composição confirmada, segundo o próprio anúncio da Alibaba:

  • 2,4 trilhões de parâmetros no total, construído como um modelo esparso de Mixture-of-Experts (MoE), então só uma fração desses parâmetros é ativada a cada token.
  • Multimodal: processa texto, imagens, vídeo e documentos em um único modelo.
  • Janela de contexto de 1M de tokens, herdada do Qwen 3.7 Max.
  • Compatível com API tanto do protocolo da OpenAI quanto da Anthropic, então dá para apontar ferramentas já existentes para ele sem reescrever nada.
  • A Alibaba afirma que ele supera o Qwen 3.7 Max em codificação, desenvolvimento full-stack, análise de dados e fluxos de trabalho de escritório.
Qwen's multimodal understanding capability, as shown on the Qwen product page
Qwen's multimodal understanding capability, as shown on the Qwen product page

A palavra que carrega todo o peso aqui é Preview. O nome público é Qwen3.8-Max-Preview. O desenvolvedor Shuai Bai o descreveu como um modelo "em evolução contínua", o que, em bom português, significa: este é um alvo inicial e em movimento, não um lançamento fechado.

O número que a Alibaba não publicou

O total de parâmetros faz uma ótima manchete. O número que realmente determina seu custo e velocidade são os parâmetros ativos, quantos desses 2,4T disparam por token. A Alibaba não divulgou esse número. Isso não é uma nota de rodapé. Para um modelo MoE, os parâmetros ativos são a maior parte do que determina o custo de servir o modelo, a latência, e se você algum dia rodaria isso sozinho. Um modelo de 2,4T com, digamos, 40B de parâmetros ativos se comporta de forma muito diferente na sua fatura do que um com 200B ativos. Até esse número ser público, qualquer opinião do tipo "é barato de rodar" ou "é caro de rodar" é apenas um chute.

A afirmação "só atrás do Fable 5", desmontada

Essa é a frase que todo mundo repetiu, então vamos ser precisos sobre o que ela é e o que não é.

Em sua conta oficial, a Qwen posiciona o modelo como "um dos modelos mais poderosos disponíveis hoje... só atrás do Fable 5". As ações da Alibaba até subiram com o anúncio.

Aqui está o problema: não existe uma tabela de benchmarks publicada. Nenhum número mostra que ele vence o Fable 5, que fica atrás dele, que vence o GPT-5.1 ou que vence o Claude Opus. O ranking se apoia inteiramente na avaliação interna da Alibaba, e nenhum terceiro (Artificial Analysis, LMArena) ainda deu uma nota a ele. No Hacker News, os céticos logo notaram que a Qwen tem fama de ser especialista em benchmarks, e "confie em nós, somos o número 2" é exatamente o tipo de afirmação que uma tabela de benchmarks existe para resolver.

A 2.4T-parameter multimodal preview shipped before any benchmark, model card, or license.

Esse é o estado honesto das coisas. Não estou dizendo que a afirmação é falsa, eu não sei, e ninguém fora da equipe de avaliação da Alibaba sabe também. O que estou dizendo é que você deveria tratar "só atrás do Fable 5" como marketing até que um terceiro dê uma nota, do mesmo jeito que faria com qualquer outro lançamento de modelo.

Preços e acesso: o que dá para realmente testar hoje

O Qwen3.8-Max-Preview está disponível por três caminhos: a assinatura Token Plan da Alibaba, e as plataformas agênticas Qoder e QoderWork. Durante o preview, ele roda a 10% do preço padrão.

O Token Plan funciona por créditos, renovados em uma janela de 7 dias:

PlanoPreçoCréditos (a cada 7 dias)Observação
LiteUS$ 62.500Nível de entrada para testar o preview
ProUS$ 6840.000Roda de 6 a 8 agentes simultaneamente

Algumas coisas para observar antes de tirar o cartão da carteira:

  • Nenhuma tarifa por token foi publicada especificamente para o 3.8 Max. Se você precisa de preços por token previsíveis hoje, os níveis mais antigos do Qwen são a aposta mais segura.
  • Créditos, não tokens. Sistemas de crédito tornam o custo difícil de prever, especialmente quando o modelo por trás é um preview "em evolução contínua" cujo consumo pode mudar sem aviso.
  • O desconto de 10% do preview é temporário por definição. Faça o orçamento com o valor sem desconto, não com o promocional.
Qwen's API key and console access, as shown on qwen.ai
Qwen's API key and console access, as shown on qwen.ai

A prova de realidade do self-hosting

"Open-weight em breve" é a frase que empolgou o r/LocalLLaMA, e depois todo mundo fez as contas.

Um modelo de 2,4T em precisão de 4 bits precisa de aproximadamente 1,2 terabyte só para os pesos. Uma única Nvidia H200 tem 141GB. Mesmo uma máquina com 8 placas deixa você com uma aritmética incômoda e uma lista bem curta de gente que consegue de fato carregá-lo. A leitura prática: fazer self-hosting do Qwen 3.8 Max não é algo que equipes normais vão fazer, com ou sem pesos, até que uma variante destilada ou menor apareça. A promessa de open-weight importa para a comunidade de pesquisa e para um punhado de laboratórios bem financiados, não para o comprador médio escolhendo um helpdesk de IA.

E "em breve" ainda não tem data, licença nem repositório no Hugging Face. Se o seu plano depende de rodar isso internamente, esse plano hoje é só fumaça.

Então, vale a pena usar? (um widget de decisão honesto)

A resposta realmente depende do que você está tentando fazer. Aqui está a decisão que eu tomaria em cada situação:

Onde isso se encaixa para uma equipe de suporte

Aqui está a parte que mais me importa, porque é onde já vi equipes queimarem meses.

Um modelo de fronteira é um motor cru. Para responder a um cliente com segurança, você ainda precisa de tudo ao redor: retrieval sobre sua central de ajuda e tickets passados, guardrails para que ele só responda ao que tem certeza, uma transferência limpa para um humano, relatórios, e uma forma de testar mudanças antes que cheguem a pessoas reais. O Qwen 3.8 Max não entrega nada disso. Ele entrega um motor de texto e visão muito grande e muito capaz, e uma chave de API.

O instinto de "vamos simplesmente construir isso em cima do modelo mais novo" é forte, e quase sempre subestima essa camada ao redor. Um cliente da eesel resumiu bem a decisão entre construir e comprar:

"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."

Karel, GENERAL BYTES

Essa é a troca. Você pode conectar o Qwen 3.8 Max sozinho ao seu helpdesk e ficar com a manutenção para sempre, ou pode usar uma camada que já fez isso. A eesel é propositalmente agnóstica em relação ao modelo: ela roda sobre modelos de fronteira por baixo dos panos, se conecta ao seu helpdesk existente e à sua base de conhecimento em minutos, e permite simular sobre tickets históricos reais para que você veja a taxa de resolução antes de ir ao ar, não depois que um cliente reclamar.

eesel AI helpdesk dashboard overview
eesel AI helpdesk dashboard overview

E há um ponto de controle que as pessoas esquecem: a líder de CX de uma marca de suplementos DTC que sempre cito resumiu bem: "Eu preciso de uma IA que só lide com os tickets nos quais ela está confiante e deixe todos os outros em paz." Nenhum modelo, por maior que seja, dá esse controle sozinho. A camada dá.

Como o Qwen 3.8 Max se compara ao resto

Se você está pesquisando modelos em julho de 2026, o Qwen 3.8 Max é um de três grandes lançamentos semiabertos em uma janela de duas semanas:

  • Kimi K3 (Moonshot) foi lançado como um release realmente open-weight, o que faz o "em breve" da Qwen parecer reativo.
  • GPT-5.6 e Claude continuam sendo a fronteira fechada com a qual a Qwen se compara.
  • Grok, Gemini e Mistral completam o campo de modelos que você realmente avaliaria.

O diferencial em que a Qwen está apostando é escala mais a promessa de open-weight. Mas para quem está comparando agentes de IA para um caso de uso empresarial, o ranking cru do modelo é o eixo errado. O que importa é o produto construído em cima, e nesse eixo um preview de 2,4T ainda não compete com nada, porque não há produto, só um motor. Se você está construindo agentes para trabalho real, o guia dos melhores agentes de IA é um ponto de partida melhor do que a afirmação de benchmark de um único modelo.

Meu veredito

O Qwen 3.8 Max é um preview interessante e um sinal claro de que os laboratórios chineses estão correndo forte na corrida por escala. Mas como algo em que apostar nesta semana, ainda é cedo: sem benchmarks, sem número de parâmetros ativos, sem licença, sem self-hosting realista, e com preços de preview baseados em créditos que ainda vão mudar. Experimente por US$ 6 se estiver curioso. Não construa seu roadmap em cima dele ainda.

E se o seu objetivo real é menos tickets e respostas mais rápidas, o modelo nunca foi a parte difícil. A camada ao redor dele é.

Perguntas frequentes

O que é o Qwen 3.8 Max?

O Qwen 3.8 Max é o modelo de IA carro-chefe da Alibaba, apresentado em preview em 19 de julho de 2026 como Qwen3.8-Max-Preview. É um modelo multimodal Mixture-of-Experts esparso de 2,4 trilhões de parâmetros (texto, imagens, vídeo, documentos) com uma janela de contexto de 1M de tokens. Veja a review completa do Qwen para o contexto de toda a família.

Quanto custa o Qwen 3.8 Max?

Durante o preview, ele roda a 10% do preço padrão através do Token Plan da Alibaba, que funciona por créditos: de um plano Lite de US$ 6 (2.500 créditos a cada 7 dias) até um plano Pro de US$ 68 (40.000 créditos, 6 a 8 agentes simultâneos). Ainda não foi publicada uma tarifa dedicada por token para o 3.8 Max; para isso, confira os preços atuais do Qwen.

O Qwen 3.8 Max está mesmo "só atrás do Fable 5"?

Essa é uma afirmação da própria Alibaba, baseada em avaliações internas. Nenhum terceiro (Artificial Analysis, LMArena) ainda deu uma nota a ele, e nenhuma tabela de benchmarks foi publicada, então trate isso como uma afirmação de posicionamento, e não como um ranking verificado, do mesmo jeito que faria com qualquer outro lançamento de fronteira.

Dá para fazer self-hosting do Qwen 3.8 Max?

Hoje, não de forma realista. A Alibaba prometeu pesos abertos "em breve", mas sem data, licença ou repositório. E com cerca de 1,2TB de pesos (em 4 bits) contra 141GB por GPU H200, não existe uma implantação prática em uma única máquina para equipes normais até que uma variante menor ou destilada seja lançada. A maioria dos compradores está mais bem atendida por um helpdesk de IA gerenciado.

Qual a diferença entre o Qwen 3.8 Max e o Qwen 3.7 Max?

A Alibaba afirma que o 3.8 Max supera o 3.7 Max em codificação, desenvolvimento full-stack, análise de dados e fluxos de trabalho de escritório, e é o primeiro modelo multimodal da equipe acima de 1 trilhão de parâmetros. A janela de contexto de 1M é mantida. Para detalhes da geração anterior, veja o resumo do Qwen.

O Qwen 3.8 Max é bom para atendimento ao cliente?

Como modelo cru, ele não tem recursos de suporte, retrieval, guardrails, escalonamento ou analytics. Você teria que construir essa camada sozinho. Especificamente para suporte, uma ferramenta feita sob medida como a eesel, que roda sobre modelos de fronteira e se conecta ao seu helpdesk, é um caminho mais rápido e seguro do que conectar você mesmo uma API em preview. Compare as opções no comparativo da melhor IA de atendimento ao cliente.

Quais são as melhores alternativas ao Qwen 3.8 Max?

Para modelos crus, Kimi K3, GPT-5.x, Claude e Gemini são as comparações diretas. Para um caso de uso de suporte, veja os agentes de IA para atendimento ao cliente em vez de um único modelo. Também há uma lista mais completa de alternativas ao Qwen.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Ilustração de um desenvolvedor trabalhando com painéis de imagem, vídeo e documentos, com o logo da Qwen
Trending

Análise do Qwen 3.7 Flash: um modelo de visão de $0,03 com uma pegadinha

Qwen 3.7 Flash é o modelo de visão mais barato que você pode comprar. Investiguei as faixas de preço, o único benchmark independente, e o que ninguém está contando.

Rama Adi NugrahaRama Adi NugrahaJul 31, 2026
Ilustração de um desenvolvedor acessando o Qwen 3.8 Max da Alibaba por meio de chat, multimodal e superfícies de API
Trending

Como acessar o Qwen 3.8 Max: 5 caminhos e o que cada um cobra

Cinco formas reais de chegar ao carro-chefe de 2,4 trilhões de parâmetros da Alibaba, do chat gratuito à API de $2/$6, além das armadilhas de cobrança que pegam as pessoas no caminho.

Rama Adi NugrahaRama Adi NugrahaAug 3, 2026
Ilustração comparando o Qwen 3.8 Max da Alibaba e o Kimi K3 da Moonshot AI
Trending

Qwen 3.8 Max vs Kimi K3: os números que nenhum laboratório publicou

Dois laboratórios chineses lançaram um modelo principal com mais de 2 trilhões de parâmetros com dezessete dias de diferença, e nenhum colocou o outro em seu gráfico de benchmarks. Aqui está o que realmente se compara, quanto a conta realmente custa, e qual eu escolheria.

Alicia Kirana UtomoAlicia Kirana UtomoAug 3, 2026
Ilustração representando o preço de preview do Qwen3.8-Max da Alibaba
Trending

Preço do Qwen3.8-Max: a oferta de preview e seus custos ocultos

Um guia direto do preço do Qwen3.8-Max: a tarifa de preview de 10%, os níveis do Token Plan, o desconto noturno e o custo de consumo de créditos que ninguém coloca na página de preços.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Ilustração comparando a prévia do Qwen3.8-Max da Alibaba com o Claude Fable 5 da Anthropic
Trending

Qwen3.8-Max vs Claude Fable 5: a comparação que ninguém consegue fazer

A Alibaba chamou o Qwen3.8-Max de "atrás apenas do Fable 5". Comparei os dois modelos em preço, contexto, disponibilidade e evidências publicadas para ver se isso se sustenta.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 3, 2026
Ilustração de duas pessoas analisando cartões de preços escalonados em uma tela, com o logotipo do Qwen
Trending

Preços do Qwen 3.7 Flash: o que você realmente paga em 2026

A tarifa de $0.03 é real, e é apenas um dos quatro medidores da sua fatura. Veja como o degrau de prompt, o cache, a região de batch e a taxa de retentativas se combinam no número que você realmente paga.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 31, 2026
Ilustração de painéis de imagem, vídeo e documentos alimentando um modelo de visão e linguagem, com o logotipo da Qwen
Trending

Qwen 3.7 Flash: especificações, preços e o que ele realmente faz

O Qwen 3.7 Flash foi lançado sem post no blog, sem benchmarks e sem pesos. Aqui está a folha de especificações completa, os preços em faixas e o que a Qwen nunca afirmou.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
Ilustração editorial de um modelo de linguagem grande raciocinando sobre um longo fluxo de documentos
Trending

Análise do Kimi K3: o modelo de fronteira aberto da Moonshot, testado

Uma análise prática do Kimi K3: a arquitetura do modelo aberto de 2,8T, os benchmarks, os preços reais e o que a comunidade realmente pensa na semana de lançamento.

Alicia Kirana UtomoAlicia Kirana UtomoJul 21, 2026
Ilustração comparando o Qwen3.8-Max com modelos de IA de ponta rivais
Trending

As 6 melhores alternativas ao Qwen3.8-Max em 2026

As melhores alternativas ao Qwen3.8-Max em 2026, comparadas com honestidade: Kimi K3, Claude, GPT-5.6, Gemini 3.5 Pro, Grok 4.5 e a camada de suporte que realmente resolve tickets.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis