O que é Qwen3.8-Max: a prévia do carro-chefe de 2,4T da Alibaba

Alicia Kirana Utomo
Escrito por

Alicia Kirana Utomo

Katelin Teen
Revisado por

Katelin Teen

Última edição July 20, 2026

Verificado por especialista
Ilustração representando a prévia do modelo de linguagem Qwen3.8-Max da Alibaba

O que o Qwen3.8-Max realmente é

O Qwen (Tongyi Qianwen) é a família de modelos da Alibaba Cloud, abrangendo texto, visão, áudio, código e agentes. O nível "Max" é a linha de ponta proprietária, acima dos níveis mais baratos Plus e Turbo e acima dos checkpoints de pesos abertos do Qwen3. O Qwen3.8-Max é o mais novo deles, e a Alibaba o apresentou em prévia como "Qwen3.8-Max-Preview" em 19 de julho de 2026.

Aqui vai a versão honesta, porque o próprio lançamento foi incomumente enxuto. Não houve post oficial de blog, ficha técnica do modelo nem tabela de benchmarks na prévia, apenas duas publicações no X da equipe do Qwen e um endpoint de prévia funcional e pago. Então, a maior parte do que vem a seguir é o próprio relato da Alibaba, que ninguém fora do laboratório havia verificado de forma independente ainda.

As especificações que a Alibaba declara:

  • 2,4 trilhões de parâmetros totais, um design esparso de Mixture-of-Experts (Qwen no X).
  • Primeiro Qwen multimodal acima de 1T de parâmetros, lidando com texto, imagens, vídeo e documentos, segundo o pesquisador-líder Shuai Bai.
  • Uma janela de contexto de 1 milhão de tokens, herdada do antecessor Qwen3.7-Max.
  • Voltado para codificação, fluxos de trabalho agênticos e tarefas de "colaboração profissional" de longo horizonte, onde a Alibaba diz superar o Qwen3.7-Max.

A contagem de parâmetros ativos por token, o conjunto completo de benchmarks e a licença estavam todos ausentes na prévia. A Alibaba disse que viriam. Até lá, trate os detalhes internos como marketing, não como medição.

Por baixo do capô: como funciona o Qwen3.8-Max

É aqui que uma contagem gigantesca de parâmetros deixa de ser a manchete. Um modelo denso de 2,4T seria caro demais para operar, então o Qwen3.8-Max é um modelo de Mixture-of-Experts: a maioria desses parâmetros fica ociosa em qualquer token dado, e apenas uma pequena fração é ativada. Esse é o mesmo truque que permite que os níveis mais baratos do Qwen fiquem mais baratos que os rivais, só que em escala maior.

Como o Qwen3.8-Max funciona, da entrada multimodal passando pelo roteamento Mixture-of-Experts até a resposta
Como o Qwen3.8-Max funciona, da entrada multimodal passando pelo roteamento Mixture-of-Experts até a resposta

A parte multimodal é o verdadeiro salto para a linha Max. Modelos Max anteriores eram voltados primeiro para texto; aqui a Alibaba diz que o modelo absorve nativamente imagens, vídeo e documentos junto com texto, o que Shuai Bai apontou como o detalhe inédito:

"Qwen3.8-Max Preview is now available for early access! This is our first trillion-parameter multimodal model."

A pegadinha que vale repetir: a taxa de esparsidade, o número de especialistas e a receita de treinamento não foram publicados. Então sabemos a forma que a Alibaba descreve (enorme, esparsa, multimodal), mas não os números que permitiriam reproduzi-la ou classificá-la. Essa é uma lacuna real para um modelo que reivindica um lugar entre os dois melhores.

O que a Alibaba afirma sobre desempenho

Aqui está a frase que todo mundo citou. O próprio post de lançamento da equipe do Qwen a coloca contra o topo do setor:

"Qwen3.8 is launching and going open-weight soon! With a massive 2.4T parameters, this model is continuously evolving. We believe it's one of the most powerful models available today... second only to Fable 5."

"Atrás apenas do Fable 5" é uma aposta e tanto, sendo o Fable 5 o atual modelo Claude de ponta. O problema é que não há nada por trás disso ainda: nenhum gráfico de benchmark, nenhuma pontuação de índice independente, nenhuma ficha técnica do modelo. Para contexto, o carro-chefe anterior, Qwen3.7-Max, foi lançado em maio de 2026 com números reais, 80,4% no SWE-bench Verified e o modelo chinês mais bem colocado no índice de inteligência da Artificial Analysis na época. O Qwen3.8-Max chegou com a confiança, mas sem os comprovantes.

Há também um padrão que vale a pena nomear, com cautela. O Qwen tem um longo histórico de liderar as tabelas de downloads de modelos abertos e de publicar resultados fortes em benchmarks, e uma crítica recorrente é que ele pode parecer mais forte em avaliações do que no uso real e confuso. Então, uma autodeclaração de "top dois" antes de qualquer teste independente é exatamente o tipo de afirmação para se manter com reservas.

Quanto custa o Qwen3.8-Max

Essa é a parte que realmente chamou a atenção dos desenvolvedores. Durante a prévia, o Qwen3.8-Max é vendido a 10% do preço padrão por três vias: a assinatura Token Plan da Alibaba, e seus produtos de codificação agêntica Qoder e QoderWork. Ainda não há uma tarifa de API por token avulsa publicada, o que é incomum para um modelo Max.

Os planos Personal do Token Plan ficam assim:

PlanoMensalCota de créditos em 7 diasCota de créditos em 5 horas
Lite~US$ 6 (39 CNY)2.500 créditos700 créditos
Standard~US$ 20 (139 CNY)10.000 créditos3.000 créditos
Pro~US$ 70 (499 CNY)40.000 créditos12.000 créditos

Fonte: Alibaba Cloud Token Plan (edição Personal). Além da tarifa de prévia de 10%, a Alibaba soma um desconto noturno, mais 80% de desconto no consumo de créditos entre 22h00 e 08h00 (UTC+8), o que resulta em cerca de 0,2% da tarifa padrão para execuções fora do horário. Isso é agressivo, e claramente feito para levar as pessoas a testar a prévia por pouco dinheiro.

O modelo de créditos por assinatura também é exatamente do que os usuários do Qwen já reclamaram antes. Na geração anterior, usuários do Reddit relataram que os créditos se esgotavam muito mais rápido do que o esperado, e os modelos do Qwen tendem a gerar mais tokens de saída por tarefa do que os concorrentes, o que infla silenciosamente o custo real mesmo quando a tarifa anunciada parece baixa. O desconto de prévia disfarça isso por enquanto. Quando ele acabar, planeje o orçamento.

Um detalhe útil: o endpoint do Token Plan fala tanto o protocolo de API da OpenAI quanto o da Anthropic, então clientes de terceiros como Claude Code, Cursor, Cline e Codex funcionam de imediato assim que você emite uma chave. Se você já vive em uma dessas ferramentas, testar a prévia é coisa de cinco minutos.

Vale a pena entrar no Qwen3.8-Max agora?

A prévia é barata e fácil de testar, o que torna "devo migrar para isso" a pergunta errada e "o que estou realmente testando" a certa. Percorra a decisão abaixo antes de reconstruir qualquer coisa importante em torno de uma prévia.

O panorama geral: uma corrida de pesos abertos entre laboratórios chineses

Tirando os detalhes, esse é o motivo pelo qual o Qwen3.8-Max viralizou: ele apareceu dias depois do modelo de 2,8 trilhões de parâmetros Kimi K3 da Moonshot AI, e a Alibaba detém cerca de 36% de participação na Moonshot. Então, dois laboratórios da mesma órbita estão agora competindo para definir o teto de tamanho dos modelos quase de ponta, e ambos prometem pesos abertos. No Hacker News, o comentário mais votado leu esse momento exatamente assim:

Hacker News

"I assume that this announcement has been prompted by that of Moonshot AI... I wonder if Alibaba has always planned to make this big LLM open weights, or they have chosen to do this now, to better compete with Moonshot AI."

A leitura à qual muita gente chegou é que comoditizar a inteligência de ponta é, em si, a estratégia, e que isso é bom para todos rio abaixo, independentemente do motivo:

Hacker News

"The Chinese firms seem to be working hard to commoditize intelligence which may be the most effective way to debase American frontier labs. And yeah: it also happens to be really good for humanity."

Para um comprador, o que importa não é qual laboratório vence. É que a camada de modelo está ficando mais barata e melhor a cada poucas semanas, e a jogada inteligente é construir de forma a poder trocar o motor sem ter que reencanar tudo ao redor dele.

Onde um modelo de ponta para, e onde o trabalho de suporte começa

Agora a parte com que mais me importo, porque construo agentes de IA para viver. É tentador ler um lançamento assim e pensar "ótimo, conecto o melhor modelo e minha fila de suporte se resolve sozinha." Não funciona assim, e essa lacuna é exatamente onde a maioria dos projetos de suporte com IA fracassa silenciosamente.

Uma afirmação de benchmark não é um agente de suporte: o que um modelo bruto entrega comparado ao que um colega de equipe pronto para suporte precisa
Uma afirmação de benchmark não é um agente de suporte: o que um modelo bruto entrega comparado ao que um colega de equipe pronto para suporte precisa

Um modelo como o Qwen3.8-Max dá a você raciocínio bruto. O que ele não dá é qualquer ideia sobre sua política de reembolso, os casos extremos do seu produto, ou o fato de que o ticket #4021 é um VIP que já mandou e-mail duas vezes. Ele não tem memória dos seus tickets passados, nenhuma barreira de segurança para impedi-lo de inventar uma resposta com confiança, e nenhuma conexão com o helpdesk onde o trabalho realmente acontece. Uma contagem maior de parâmetros não resolve nada disso.

Passamos anos colocando IA em filas de suporte ao vivo, e a lição que ficou é que um modelo que soa confiante dando uma resposta errada é pior do que nenhuma resposta. O bot de um cliente pagante confirmou alegremente que suportava modelos de produto que nem estavam no banco de dados dele, porque a central de ajuda dizia "suportamos todos os modelos." Esse é exatamente o modo de falha que um modelo bruto de prévia torna mais provável, não menos, justamente por soar tão confiante. Como um líder de suporte me disse:

"The AI will never be able to answer 100% of the questions, but if it tries and just answers wrong, I cannot go check all my 7,000 tickets to see if it made a good answer. I need an AI that only handles the tickets it's confident about, and leaves the rest alone."

a DTC brand CX lead handling 7,000 tickets a month

É por isso que a eesel AI executa uma simulação sobre o seu histórico de tickets antes de qualquer coisa entrar no ar, para que você veja a taxa de resolução e as respostas exatas em conversas passadas reais primeiro, não depois que um cliente sair frustrado. É também por isso que as respostas são roteadas por confiança: se o agente não tem certeza, ele redige um rascunho para um humano ou escala em vez de adivinhar. Fazendo dessa forma, a Gridwise atingiu 73% de resolução de tickets de nível 1 já no primeiro mês.

E você poderia conectar um modelo como o Qwen3.8-Max à sua stack por conta própria. A maioria das equipes descobre que a manutenção é o custo real, que é exatamente a decisão de construir versus comprar que um cliente resumiu bem: "Poderíamos tentar escrever nossa própria aplicação de LLM, mas não queríamos investir nosso tempo nisso. Queríamos algo que não precisássemos manter." O modelo por baixo importa bem menos do que esse invólucro, que é a boa notícia discreta sobre o Qwen3.8-Max, o Kimi K3, ou o que quer que vença no mês que vem: uma IA para atendimento ao cliente bem construída herda todo avanço de ponta sem que você precise reencanar nada.

Experimente a eesel AI

Se você chegou até aqui porque quer um modelo de IA que realmente resolva tickets e não apenas converse, esse é exatamente o propósito da eesel AI. Ela se conecta ao Zendesk, ao Freshdesk, ao Slack e a mais de 100 outras ferramentas, aprende com sua central de ajuda e tickets passados, e começa a redigir ou resolver em minutos, não em semanas.

O painel do helpdesk da eesel AI, onde um colega de equipe de IA resolve e redige tickets de suporte
O painel do helpdesk da eesel AI, onde um colega de equipe de IA resolve e redige tickets de suporte

O diferencial é a rampa de confiança: simule com base no seu histórico real de tickets, veja os números, comece no modo rascunho e vá para totalmente autônomo só quando estiver satisfeito. Você ganha a inteligência do modelo de ponta com barreiras de segurança feitas para suporte. Experimente a eesel de graça, sem cartão de crédito.

Perguntas frequentes

O que é o Qwen3.8-Max?
O Qwen3.8-Max é o mais novo modelo de ponta da Alibaba, apresentado em prévia em 19 de julho de 2026. A Alibaba o descreve como um modelo esparso de Mixture-of-Experts com 2,4 trilhões de parâmetros e seu primeiro modelo multimodal acima de 1 trilhão de parâmetros, aceitando texto, imagens, vídeo e documentos como entrada. Para saber mais sobre toda a família, veja nossa análise do Qwen.
Quanto custa o Qwen3.8-Max?
Durante a prévia, o Qwen3.8-Max funciona a 10% do preço padrão pelo Token Plan da Alibaba, Qoder e QoderWork. Os planos Personal do Token Plan começam em cerca de US$ 6/mês (39 CNY) no Lite, ~US$ 20 no Standard e ~US$ 70 no Pro. Ainda não há um preço por token avulso publicado. Nosso guia completo de preços do Qwen cobre o restante da linha.
O Qwen3.8-Max é open source?
Ainda não. A Alibaba diz que o Qwen3.8 terá pesos abertos "em breve", mas na prévia não havia data, licença nem repositório no Hugging Face. Isso quebraria o padrão fechado que a Alibaba costuma manter em seu nível Max mais alto, então convém tratar a promessa de pesos abertos como um plano, não um fato.
O Qwen3.8-Max é melhor que o Kimi K3 ou o Claude?
A Alibaba o chama de "atrás apenas do Fable 5", mas não publicou nenhuma tabela de benchmarks, ficha técnica do modelo ou números independentes na prévia, então essa afirmação não está verificada. Ele chegou dias depois do Kimi K3, o modelo de 2,8 trilhões da Moonshot. Veja nossos guias de comparação de modelos para saber como avaliar afirmações como essa.
Posso usar o Qwen3.8-Max com o Claude Code ou o Cursor?
Sim. O endpoint do Token Plan fala tanto o protocolo de API da OpenAI quanto o da Anthropic, então ferramentas como Claude Code, Cursor e Cline funcionam assim que você tem uma chave. Se quiser aplicar esse tipo de modelo a tickets de suporte reais, nossa lista de ferramentas de codificação com IA e nosso guia de IA para atendimento ao cliente são boas leituras complementares.
Posso usar o Qwen3.8-Max para atendimento ao cliente?
Pode, mas um modelo bruto é apenas o motor. Para responder tickets reais, ele precisa do seu conhecimento, das suas barreiras de segurança e das suas conexões de helpdesk. A eesel AI envolve um modelo de ponta exatamente dessa forma e se conecta ao Zendesk, ao Freshdesk e mais, entregando uma verdadeira IA para atendimento ao cliente em vez de apenas uma janela de chat.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Ilustração representando o preço de preview do Qwen3.8-Max da Alibaba
Trending

Preço do Qwen3.8-Max: a oferta de preview e seus custos ocultos

Um guia direto do preço do Qwen3.8-Max: a tarifa de preview de 10%, os níveis do Token Plan, o desconto noturno e o custo de consumo de créditos que ninguém coloca na página de preços.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Ilustração comparando o Qwen3.8-Max com modelos de IA de ponta rivais
Trending

As 6 melhores alternativas ao Qwen3.8-Max em 2026

As melhores alternativas ao Qwen3.8-Max em 2026, comparadas com honestidade: Kimi K3, Claude, GPT-5.6, Gemini 3.5 Pro, Grok 4.5 e a camada de suporte que realmente resolve tickets.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Ilustração comparando a prévia do Qwen3.8-Max da Alibaba com o Claude Fable 5 da Anthropic
Trending

Qwen3.8-Max vs Claude Fable 5: a comparação que ninguém consegue fazer

A Alibaba chamou o Qwen3.8-Max de "atrás apenas do Fable 5". Comparei os dois modelos em preço, contexto, disponibilidade e evidências publicadas para ver se isso se sustenta.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 3, 2026
Ilustração de um desenvolvedor acessando o Qwen 3.8 Max da Alibaba por meio de chat, multimodal e superfícies de API
Trending

Como acessar o Qwen 3.8 Max: 5 caminhos e o que cada um cobra

Cinco formas reais de chegar ao carro-chefe de 2,4 trilhões de parâmetros da Alibaba, do chat gratuito à API de $2/$6, além das armadilhas de cobrança que pegam as pessoas no caminho.

Rama Adi NugrahaRama Adi NugrahaAug 3, 2026
Ilustração comparando o Qwen 3.8 Max da Alibaba e o Kimi K3 da Moonshot AI
Trending

Qwen 3.8 Max vs Kimi K3: os números que nenhum laboratório publicou

Dois laboratórios chineses lançaram um modelo principal com mais de 2 trilhões de parâmetros com dezessete dias de diferença, e nenhum colocou o outro em seu gráfico de benchmarks. Aqui está o que realmente se compara, quanto a conta realmente custa, e qual eu escolheria.

Alicia Kirana UtomoAlicia Kirana UtomoAug 3, 2026
Qwen 3.8 Max review: um preview de 2,4T testado com honestidade
Trending

Qwen 3.8 Max review: um preview de 2,4T testado com honestidade

Uma review honesta do Qwen 3.8 Max: o que é de fato o carro-chefe de 2,4 trilhões de parâmetros da Alibaba, por que 'só atrás do Fable 5' é uma afirmação e não um benchmark, e quem deveria esperar.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Ilustração de duas pessoas analisando cartões de preços escalonados em uma tela, com o logotipo do Qwen
Trending

Preços do Qwen 3.7 Flash: o que você realmente paga em 2026

A tarifa de $0.03 é real, e é apenas um dos quatro medidores da sua fatura. Veja como o degrau de prompt, o cache, a região de batch e a taxa de retentativas se combinam no número que você realmente paga.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 31, 2026
Ilustração de painéis de imagem, vídeo e documentos alimentando um modelo de visão e linguagem, com o logotipo da Qwen
Trending

Qwen 3.7 Flash: especificações, preços e o que ele realmente faz

O Qwen 3.7 Flash foi lançado sem post no blog, sem benchmarks e sem pesos. Aqui está a folha de especificações completa, os preços em faixas e o que a Qwen nunca afirmou.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
Ilustração de um desenvolvedor trabalhando com painéis de imagem, vídeo e documentos, com o logo da Qwen
Trending

Análise do Qwen 3.7 Flash: um modelo de visão de $0,03 com uma pegadinha

Qwen 3.7 Flash é o modelo de visão mais barato que você pode comprar. Investiguei as faixas de preço, o único benchmark independente, e o que ninguém está contando.

Rama Adi NugrahaRama Adi NugrahaJul 31, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis