
Por que sou eu quem está pedindo para você desacelerar
Eu construo agentes de IA na eesel, e o meu dia a dia é a parte chata que ninguém coloca em print: o que acontece depois que o modelo dá uma resposta. Já vimos um modelo com tom confiante entregar tranquilamente a política de reembolso errada para um cliente, e é exatamente por isso que todo rollout da eesel agora é simulado contra tickets históricos antes de sequer tocar numa caixa de entrada real.
Então, quando um modelo de 2,4T aparece com uma faixa "só atrás do Fable 5", meu primeiro instinto não é empolgação, e sim: me mostre a avaliação, me mostre os parâmetros ativos, e me mostre o que ele faz no ticket número 200, não no da demonstração. Esta review é escrita a partir desse lugar. Se você quiser a ficha técnica crua, o resumo do Qwen tem isso. Se quiser saber se o Qwen 3.8 Max muda algo para uma equipe real nesta semana, continue lendo.
O que o Qwen 3.8 Max realmente é
O Qwen 3.8 Max é o carro-chefe da família Qwen da Alibaba, e o primeiro modelo multimodal da equipe acima de 1 trilhão de parâmetros. A composição confirmada, segundo o próprio anúncio da Alibaba:
- 2,4 trilhões de parâmetros no total, construído como um modelo esparso de Mixture-of-Experts (MoE), então só uma fração desses parâmetros é ativada a cada token.
- Multimodal: processa texto, imagens, vídeo e documentos em um único modelo.
- Janela de contexto de 1M de tokens, herdada do Qwen 3.7 Max.
- Compatível com API tanto do protocolo da OpenAI quanto da Anthropic, então dá para apontar ferramentas já existentes para ele sem reescrever nada.
- A Alibaba afirma que ele supera o Qwen 3.7 Max em codificação, desenvolvimento full-stack, análise de dados e fluxos de trabalho de escritório.

A palavra que carrega todo o peso aqui é Preview. O nome público é Qwen3.8-Max-Preview. O desenvolvedor Shuai Bai o descreveu como um modelo "em evolução contínua", o que, em bom português, significa: este é um alvo inicial e em movimento, não um lançamento fechado.
O número que a Alibaba não publicou
O total de parâmetros faz uma ótima manchete. O número que realmente determina seu custo e velocidade são os parâmetros ativos, quantos desses 2,4T disparam por token. A Alibaba não divulgou esse número. Isso não é uma nota de rodapé. Para um modelo MoE, os parâmetros ativos são a maior parte do que determina o custo de servir o modelo, a latência, e se você algum dia rodaria isso sozinho. Um modelo de 2,4T com, digamos, 40B de parâmetros ativos se comporta de forma muito diferente na sua fatura do que um com 200B ativos. Até esse número ser público, qualquer opinião do tipo "é barato de rodar" ou "é caro de rodar" é apenas um chute.
A afirmação "só atrás do Fable 5", desmontada
Essa é a frase que todo mundo repetiu, então vamos ser precisos sobre o que ela é e o que não é.
Em sua conta oficial, a Qwen posiciona o modelo como "um dos modelos mais poderosos disponíveis hoje... só atrás do Fable 5". As ações da Alibaba até subiram com o anúncio.
Aqui está o problema: não existe uma tabela de benchmarks publicada. Nenhum número mostra que ele vence o Fable 5, que fica atrás dele, que vence o GPT-5.1 ou que vence o Claude Opus. O ranking se apoia inteiramente na avaliação interna da Alibaba, e nenhum terceiro (Artificial Analysis, LMArena) ainda deu uma nota a ele. No Hacker News, os céticos logo notaram que a Qwen tem fama de ser especialista em benchmarks, e "confie em nós, somos o número 2" é exatamente o tipo de afirmação que uma tabela de benchmarks existe para resolver.
A 2.4T-parameter multimodal preview shipped before any benchmark, model card, or license.
Esse é o estado honesto das coisas. Não estou dizendo que a afirmação é falsa, eu não sei, e ninguém fora da equipe de avaliação da Alibaba sabe também. O que estou dizendo é que você deveria tratar "só atrás do Fable 5" como marketing até que um terceiro dê uma nota, do mesmo jeito que faria com qualquer outro lançamento de modelo.
Preços e acesso: o que dá para realmente testar hoje
O Qwen3.8-Max-Preview está disponível por três caminhos: a assinatura Token Plan da Alibaba, e as plataformas agênticas Qoder e QoderWork. Durante o preview, ele roda a 10% do preço padrão.
O Token Plan funciona por créditos, renovados em uma janela de 7 dias:
| Plano | Preço | Créditos (a cada 7 dias) | Observação |
|---|---|---|---|
| Lite | US$ 6 | 2.500 | Nível de entrada para testar o preview |
| Pro | US$ 68 | 40.000 | Roda de 6 a 8 agentes simultaneamente |
Algumas coisas para observar antes de tirar o cartão da carteira:
- Nenhuma tarifa por token foi publicada especificamente para o 3.8 Max. Se você precisa de preços por token previsíveis hoje, os níveis mais antigos do Qwen são a aposta mais segura.
- Créditos, não tokens. Sistemas de crédito tornam o custo difícil de prever, especialmente quando o modelo por trás é um preview "em evolução contínua" cujo consumo pode mudar sem aviso.
- O desconto de 10% do preview é temporário por definição. Faça o orçamento com o valor sem desconto, não com o promocional.

A prova de realidade do self-hosting
"Open-weight em breve" é a frase que empolgou o r/LocalLLaMA, e depois todo mundo fez as contas.
Um modelo de 2,4T em precisão de 4 bits precisa de aproximadamente 1,2 terabyte só para os pesos. Uma única Nvidia H200 tem 141GB. Mesmo uma máquina com 8 placas deixa você com uma aritmética incômoda e uma lista bem curta de gente que consegue de fato carregá-lo. A leitura prática: fazer self-hosting do Qwen 3.8 Max não é algo que equipes normais vão fazer, com ou sem pesos, até que uma variante destilada ou menor apareça. A promessa de open-weight importa para a comunidade de pesquisa e para um punhado de laboratórios bem financiados, não para o comprador médio escolhendo um helpdesk de IA.
E "em breve" ainda não tem data, licença nem repositório no Hugging Face. Se o seu plano depende de rodar isso internamente, esse plano hoje é só fumaça.
Então, vale a pena usar? (um widget de decisão honesto)
A resposta realmente depende do que você está tentando fazer. Aqui está a decisão que eu tomaria em cada situação:
Onde isso se encaixa para uma equipe de suporte
Aqui está a parte que mais me importa, porque é onde já vi equipes queimarem meses.
Um modelo de fronteira é um motor cru. Para responder a um cliente com segurança, você ainda precisa de tudo ao redor: retrieval sobre sua central de ajuda e tickets passados, guardrails para que ele só responda ao que tem certeza, uma transferência limpa para um humano, relatórios, e uma forma de testar mudanças antes que cheguem a pessoas reais. O Qwen 3.8 Max não entrega nada disso. Ele entrega um motor de texto e visão muito grande e muito capaz, e uma chave de API.
O instinto de "vamos simplesmente construir isso em cima do modelo mais novo" é forte, e quase sempre subestima essa camada ao redor. Um cliente da eesel resumiu bem a decisão entre construir e comprar:
"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."
Karel, GENERAL BYTES
Essa é a troca. Você pode conectar o Qwen 3.8 Max sozinho ao seu helpdesk e ficar com a manutenção para sempre, ou pode usar uma camada que já fez isso. A eesel é propositalmente agnóstica em relação ao modelo: ela roda sobre modelos de fronteira por baixo dos panos, se conecta ao seu helpdesk existente e à sua base de conhecimento em minutos, e permite simular sobre tickets históricos reais para que você veja a taxa de resolução antes de ir ao ar, não depois que um cliente reclamar.

E há um ponto de controle que as pessoas esquecem: a líder de CX de uma marca de suplementos DTC que sempre cito resumiu bem: "Eu preciso de uma IA que só lide com os tickets nos quais ela está confiante e deixe todos os outros em paz." Nenhum modelo, por maior que seja, dá esse controle sozinho. A camada dá.
Como o Qwen 3.8 Max se compara ao resto
Se você está pesquisando modelos em julho de 2026, o Qwen 3.8 Max é um de três grandes lançamentos semiabertos em uma janela de duas semanas:
- Kimi K3 (Moonshot) foi lançado como um release realmente open-weight, o que faz o "em breve" da Qwen parecer reativo.
- GPT-5.6 e Claude continuam sendo a fronteira fechada com a qual a Qwen se compara.
- Grok, Gemini e Mistral completam o campo de modelos que você realmente avaliaria.
O diferencial em que a Qwen está apostando é escala mais a promessa de open-weight. Mas para quem está comparando agentes de IA para um caso de uso empresarial, o ranking cru do modelo é o eixo errado. O que importa é o produto construído em cima, e nesse eixo um preview de 2,4T ainda não compete com nada, porque não há produto, só um motor. Se você está construindo agentes para trabalho real, o guia dos melhores agentes de IA é um ponto de partida melhor do que a afirmação de benchmark de um único modelo.
Meu veredito
O Qwen 3.8 Max é um preview interessante e um sinal claro de que os laboratórios chineses estão correndo forte na corrida por escala. Mas como algo em que apostar nesta semana, ainda é cedo: sem benchmarks, sem número de parâmetros ativos, sem licença, sem self-hosting realista, e com preços de preview baseados em créditos que ainda vão mudar. Experimente por US$ 6 se estiver curioso. Não construa seu roadmap em cima dele ainda.
E se o seu objetivo real é menos tickets e respostas mais rápidas, o modelo nunca foi a parte difícil. A camada ao redor dele é.
Perguntas frequentes
O que é o Qwen 3.8 Max?
O Qwen 3.8 Max é o modelo de IA carro-chefe da Alibaba, apresentado em preview em 19 de julho de 2026 como Qwen3.8-Max-Preview. É um modelo multimodal Mixture-of-Experts esparso de 2,4 trilhões de parâmetros (texto, imagens, vídeo, documentos) com uma janela de contexto de 1M de tokens. Veja a review completa do Qwen para o contexto de toda a família.
Quanto custa o Qwen 3.8 Max?
Durante o preview, ele roda a 10% do preço padrão através do Token Plan da Alibaba, que funciona por créditos: de um plano Lite de US$ 6 (2.500 créditos a cada 7 dias) até um plano Pro de US$ 68 (40.000 créditos, 6 a 8 agentes simultâneos). Ainda não foi publicada uma tarifa dedicada por token para o 3.8 Max; para isso, confira os preços atuais do Qwen.
O Qwen 3.8 Max está mesmo "só atrás do Fable 5"?
Essa é uma afirmação da própria Alibaba, baseada em avaliações internas. Nenhum terceiro (Artificial Analysis, LMArena) ainda deu uma nota a ele, e nenhuma tabela de benchmarks foi publicada, então trate isso como uma afirmação de posicionamento, e não como um ranking verificado, do mesmo jeito que faria com qualquer outro lançamento de fronteira.
Dá para fazer self-hosting do Qwen 3.8 Max?
Hoje, não de forma realista. A Alibaba prometeu pesos abertos "em breve", mas sem data, licença ou repositório. E com cerca de 1,2TB de pesos (em 4 bits) contra 141GB por GPU H200, não existe uma implantação prática em uma única máquina para equipes normais até que uma variante menor ou destilada seja lançada. A maioria dos compradores está mais bem atendida por um helpdesk de IA gerenciado.
Qual a diferença entre o Qwen 3.8 Max e o Qwen 3.7 Max?
A Alibaba afirma que o 3.8 Max supera o 3.7 Max em codificação, desenvolvimento full-stack, análise de dados e fluxos de trabalho de escritório, e é o primeiro modelo multimodal da equipe acima de 1 trilhão de parâmetros. A janela de contexto de 1M é mantida. Para detalhes da geração anterior, veja o resumo do Qwen.
O Qwen 3.8 Max é bom para atendimento ao cliente?
Como modelo cru, ele não tem recursos de suporte, retrieval, guardrails, escalonamento ou analytics. Você teria que construir essa camada sozinho. Especificamente para suporte, uma ferramenta feita sob medida como a eesel, que roda sobre modelos de fronteira e se conecta ao seu helpdesk, é um caminho mais rápido e seguro do que conectar você mesmo uma API em preview. Compare as opções no comparativo da melhor IA de atendimento ao cliente.
Quais são as melhores alternativas ao Qwen 3.8 Max?
Para modelos crus, Kimi K3, GPT-5.x, Claude e Gemini são as comparações diretas. Para um caso de uso de suporte, veja os agentes de IA para atendimento ao cliente em vez de um único modelo. Também há uma lista mais completa de alternativas ao Qwen.

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








