
O que o Qwen3.8-Max realmente é
O Qwen (Tongyi Qianwen) é a família de modelos da Alibaba Cloud, abrangendo texto, visão, áudio, código e agentes. O nível "Max" é a linha de ponta proprietária, acima dos níveis mais baratos Plus e Turbo e acima dos checkpoints de pesos abertos do Qwen3. O Qwen3.8-Max é o mais novo deles, e a Alibaba o apresentou em prévia como "Qwen3.8-Max-Preview" em 19 de julho de 2026.
Aqui vai a versão honesta, porque o próprio lançamento foi incomumente enxuto. Não houve post oficial de blog, ficha técnica do modelo nem tabela de benchmarks na prévia, apenas duas publicações no X da equipe do Qwen e um endpoint de prévia funcional e pago. Então, a maior parte do que vem a seguir é o próprio relato da Alibaba, que ninguém fora do laboratório havia verificado de forma independente ainda.
As especificações que a Alibaba declara:
- 2,4 trilhões de parâmetros totais, um design esparso de Mixture-of-Experts (Qwen no X).
- Primeiro Qwen multimodal acima de 1T de parâmetros, lidando com texto, imagens, vídeo e documentos, segundo o pesquisador-líder Shuai Bai.
- Uma janela de contexto de 1 milhão de tokens, herdada do antecessor Qwen3.7-Max.
- Voltado para codificação, fluxos de trabalho agênticos e tarefas de "colaboração profissional" de longo horizonte, onde a Alibaba diz superar o Qwen3.7-Max.
A contagem de parâmetros ativos por token, o conjunto completo de benchmarks e a licença estavam todos ausentes na prévia. A Alibaba disse que viriam. Até lá, trate os detalhes internos como marketing, não como medição.
Por baixo do capô: como funciona o Qwen3.8-Max
É aqui que uma contagem gigantesca de parâmetros deixa de ser a manchete. Um modelo denso de 2,4T seria caro demais para operar, então o Qwen3.8-Max é um modelo de Mixture-of-Experts: a maioria desses parâmetros fica ociosa em qualquer token dado, e apenas uma pequena fração é ativada. Esse é o mesmo truque que permite que os níveis mais baratos do Qwen fiquem mais baratos que os rivais, só que em escala maior.

A parte multimodal é o verdadeiro salto para a linha Max. Modelos Max anteriores eram voltados primeiro para texto; aqui a Alibaba diz que o modelo absorve nativamente imagens, vídeo e documentos junto com texto, o que Shuai Bai apontou como o detalhe inédito:
"Qwen3.8-Max Preview is now available for early access! This is our first trillion-parameter multimodal model."
A pegadinha que vale repetir: a taxa de esparsidade, o número de especialistas e a receita de treinamento não foram publicados. Então sabemos a forma que a Alibaba descreve (enorme, esparsa, multimodal), mas não os números que permitiriam reproduzi-la ou classificá-la. Essa é uma lacuna real para um modelo que reivindica um lugar entre os dois melhores.
O que a Alibaba afirma sobre desempenho
Aqui está a frase que todo mundo citou. O próprio post de lançamento da equipe do Qwen a coloca contra o topo do setor:
"Qwen3.8 is launching and going open-weight soon! With a massive 2.4T parameters, this model is continuously evolving. We believe it's one of the most powerful models available today... second only to Fable 5."
"Atrás apenas do Fable 5" é uma aposta e tanto, sendo o Fable 5 o atual modelo Claude de ponta. O problema é que não há nada por trás disso ainda: nenhum gráfico de benchmark, nenhuma pontuação de índice independente, nenhuma ficha técnica do modelo. Para contexto, o carro-chefe anterior, Qwen3.7-Max, foi lançado em maio de 2026 com números reais, 80,4% no SWE-bench Verified e o modelo chinês mais bem colocado no índice de inteligência da Artificial Analysis na época. O Qwen3.8-Max chegou com a confiança, mas sem os comprovantes.
Há também um padrão que vale a pena nomear, com cautela. O Qwen tem um longo histórico de liderar as tabelas de downloads de modelos abertos e de publicar resultados fortes em benchmarks, e uma crítica recorrente é que ele pode parecer mais forte em avaliações do que no uso real e confuso. Então, uma autodeclaração de "top dois" antes de qualquer teste independente é exatamente o tipo de afirmação para se manter com reservas.
Quanto custa o Qwen3.8-Max
Essa é a parte que realmente chamou a atenção dos desenvolvedores. Durante a prévia, o Qwen3.8-Max é vendido a 10% do preço padrão por três vias: a assinatura Token Plan da Alibaba, e seus produtos de codificação agêntica Qoder e QoderWork. Ainda não há uma tarifa de API por token avulsa publicada, o que é incomum para um modelo Max.
Os planos Personal do Token Plan ficam assim:
| Plano | Mensal | Cota de créditos em 7 dias | Cota de créditos em 5 horas |
|---|---|---|---|
| Lite | ~US$ 6 (39 CNY) | 2.500 créditos | 700 créditos |
| Standard | ~US$ 20 (139 CNY) | 10.000 créditos | 3.000 créditos |
| Pro | ~US$ 70 (499 CNY) | 40.000 créditos | 12.000 créditos |
Fonte: Alibaba Cloud Token Plan (edição Personal). Além da tarifa de prévia de 10%, a Alibaba soma um desconto noturno, mais 80% de desconto no consumo de créditos entre 22h00 e 08h00 (UTC+8), o que resulta em cerca de 0,2% da tarifa padrão para execuções fora do horário. Isso é agressivo, e claramente feito para levar as pessoas a testar a prévia por pouco dinheiro.
O modelo de créditos por assinatura também é exatamente do que os usuários do Qwen já reclamaram antes. Na geração anterior, usuários do Reddit relataram que os créditos se esgotavam muito mais rápido do que o esperado, e os modelos do Qwen tendem a gerar mais tokens de saída por tarefa do que os concorrentes, o que infla silenciosamente o custo real mesmo quando a tarifa anunciada parece baixa. O desconto de prévia disfarça isso por enquanto. Quando ele acabar, planeje o orçamento.
Um detalhe útil: o endpoint do Token Plan fala tanto o protocolo de API da OpenAI quanto o da Anthropic, então clientes de terceiros como Claude Code, Cursor, Cline e Codex funcionam de imediato assim que você emite uma chave. Se você já vive em uma dessas ferramentas, testar a prévia é coisa de cinco minutos.
Vale a pena entrar no Qwen3.8-Max agora?
A prévia é barata e fácil de testar, o que torna "devo migrar para isso" a pergunta errada e "o que estou realmente testando" a certa. Percorra a decisão abaixo antes de reconstruir qualquer coisa importante em torno de uma prévia.
O panorama geral: uma corrida de pesos abertos entre laboratórios chineses
Tirando os detalhes, esse é o motivo pelo qual o Qwen3.8-Max viralizou: ele apareceu dias depois do modelo de 2,8 trilhões de parâmetros Kimi K3 da Moonshot AI, e a Alibaba detém cerca de 36% de participação na Moonshot. Então, dois laboratórios da mesma órbita estão agora competindo para definir o teto de tamanho dos modelos quase de ponta, e ambos prometem pesos abertos. No Hacker News, o comentário mais votado leu esse momento exatamente assim:
"I assume that this announcement has been prompted by that of Moonshot AI... I wonder if Alibaba has always planned to make this big LLM open weights, or they have chosen to do this now, to better compete with Moonshot AI."
A leitura à qual muita gente chegou é que comoditizar a inteligência de ponta é, em si, a estratégia, e que isso é bom para todos rio abaixo, independentemente do motivo:
"The Chinese firms seem to be working hard to commoditize intelligence which may be the most effective way to debase American frontier labs. And yeah: it also happens to be really good for humanity."
Para um comprador, o que importa não é qual laboratório vence. É que a camada de modelo está ficando mais barata e melhor a cada poucas semanas, e a jogada inteligente é construir de forma a poder trocar o motor sem ter que reencanar tudo ao redor dele.
Onde um modelo de ponta para, e onde o trabalho de suporte começa
Agora a parte com que mais me importo, porque construo agentes de IA para viver. É tentador ler um lançamento assim e pensar "ótimo, conecto o melhor modelo e minha fila de suporte se resolve sozinha." Não funciona assim, e essa lacuna é exatamente onde a maioria dos projetos de suporte com IA fracassa silenciosamente.

Um modelo como o Qwen3.8-Max dá a você raciocínio bruto. O que ele não dá é qualquer ideia sobre sua política de reembolso, os casos extremos do seu produto, ou o fato de que o ticket #4021 é um VIP que já mandou e-mail duas vezes. Ele não tem memória dos seus tickets passados, nenhuma barreira de segurança para impedi-lo de inventar uma resposta com confiança, e nenhuma conexão com o helpdesk onde o trabalho realmente acontece. Uma contagem maior de parâmetros não resolve nada disso.
Passamos anos colocando IA em filas de suporte ao vivo, e a lição que ficou é que um modelo que soa confiante dando uma resposta errada é pior do que nenhuma resposta. O bot de um cliente pagante confirmou alegremente que suportava modelos de produto que nem estavam no banco de dados dele, porque a central de ajuda dizia "suportamos todos os modelos." Esse é exatamente o modo de falha que um modelo bruto de prévia torna mais provável, não menos, justamente por soar tão confiante. Como um líder de suporte me disse:
"The AI will never be able to answer 100% of the questions, but if it tries and just answers wrong, I cannot go check all my 7,000 tickets to see if it made a good answer. I need an AI that only handles the tickets it's confident about, and leaves the rest alone."
a DTC brand CX lead handling 7,000 tickets a month
É por isso que a eesel AI executa uma simulação sobre o seu histórico de tickets antes de qualquer coisa entrar no ar, para que você veja a taxa de resolução e as respostas exatas em conversas passadas reais primeiro, não depois que um cliente sair frustrado. É também por isso que as respostas são roteadas por confiança: se o agente não tem certeza, ele redige um rascunho para um humano ou escala em vez de adivinhar. Fazendo dessa forma, a Gridwise atingiu 73% de resolução de tickets de nível 1 já no primeiro mês.
E você poderia conectar um modelo como o Qwen3.8-Max à sua stack por conta própria. A maioria das equipes descobre que a manutenção é o custo real, que é exatamente a decisão de construir versus comprar que um cliente resumiu bem: "Poderíamos tentar escrever nossa própria aplicação de LLM, mas não queríamos investir nosso tempo nisso. Queríamos algo que não precisássemos manter." O modelo por baixo importa bem menos do que esse invólucro, que é a boa notícia discreta sobre o Qwen3.8-Max, o Kimi K3, ou o que quer que vença no mês que vem: uma IA para atendimento ao cliente bem construída herda todo avanço de ponta sem que você precise reencanar nada.
Experimente a eesel AI
Se você chegou até aqui porque quer um modelo de IA que realmente resolva tickets e não apenas converse, esse é exatamente o propósito da eesel AI. Ela se conecta ao Zendesk, ao Freshdesk, ao Slack e a mais de 100 outras ferramentas, aprende com sua central de ajuda e tickets passados, e começa a redigir ou resolver em minutos, não em semanas.

O diferencial é a rampa de confiança: simule com base no seu histórico real de tickets, veja os números, comece no modo rascunho e vá para totalmente autônomo só quando estiver satisfeito. Você ganha a inteligência do modelo de ponta com barreiras de segurança feitas para suporte. Experimente a eesel de graça, sem cartão de crédito.
Perguntas frequentes
O que é o Qwen3.8-Max?
Quanto custa o Qwen3.8-Max?
O Qwen3.8-Max é open source?
O Qwen3.8-Max é melhor que o Kimi K3 ou o Claude?
Posso usar o Qwen3.8-Max com o Claude Code ou o Cursor?
Posso usar o Qwen3.8-Max para atendimento ao cliente?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








