
Ao que você realmente está tendo acesso
Eu construo integrações na eesel, o que significa que a maior parte da minha semana vai em apontar a stack da eesel para o modelo que acabou de sair e depois descobrir onde está a burocracia. O Qwen 3.8 Max carrega mais burocracia que a maioria, porque existem dois produtos diferentes usando quase o mesmo nome.
A Alibaba anunciou o modelo duas vezes. Em 19 de julho de 2026, o qwen3.8-max-preview apareceu na World AI Conference em Xangai sem post de blog, sem ficha de modelo, nem mesmo tabela de benchmarks. Depois, em 2 de agosto, veio o lançamento de verdade: um post técnico de 5.068 palavras, duas tabelas completas de benchmarks, preços por token, além de uma promessa de pesos abertos. O ID da versão GA é qwen3.8-max.
Esses dois IDs não são duas versões de uma mesma compra. A preview era vendida apenas pela assinatura do Token Plan e não tem ficha de modelo alguma, enquanto https://www.qwencloud.com/models/qwen3.8-max-preview retorna 404. O modelo GA é vendido por uso, e também está incluído no Token Plan. Então, quando alguém te disser que está "no preço da preview", o que essa pessoa está descrevendo é uma bolsa de créditos, não uma tarifa.
As especificações às quais você está comprando acesso, de acordo com a ficha de modelo da QwenCloud: 2,4 trilhões de parâmetros no total, com 95 bilhões ativos em um MoE esparso, uma janela de contexto de 1.000.000 de tokens, 131.072 de saída máxima, e até 262.144 tokens de raciocínio. reasoning_effort vem com três níveis e usa xhigh por padrão, com preserve_thinking ativado de fábrica. Se o que você quer é a leitura de capacidade em vez da leitura de acesso, a análise do Qwen 3.8 Max da eesel investiga o que esses números realmente compram, e o confronto direto com o Kimi K3 é onde a questão da eficiência de tokens fica feia.
Um pequeno aviso que me custou dez minutos. O post de lançamento está em ?id=qwen3.8, não em ?id=qwen3.8-max. O ID errado renderiza uma página vazia em vez de um 404, então parece que o anúncio foi retirado.
Escolha seu caminho
Cinco superfícies, e cinco contas diferentes. Descubra qual é a sua antes de criar a conta, porque trocar depois significa refazer toda a fiação.
Descubra seu caminho
Qual porta do Qwen 3.8 Max é a sua?
Escolha a frase que mais parece com a sua semana.
Caminho 1
Chat do Qwen Studio
CustoGrátis. Web, iOS, Android, macOS, Windows.
ConfiguraçãoFaça login. Sem chave, sem conta de cobrança.
A pegadinha: a escolha do modelo fica atrás do login, então você não consegue confirmar de fora que é o 3.8-Max quem está respondendo.
Caminho 2
API da QwenCloud, por token
Custo$2 por 1M de entrada, $6 por 1M de saída, $0,25 leitura em cache.
ConfiguraçãoCrie uma chave, defina uma URL base, modelo qwen3.8-max.
A pegadinha: nada escondido aqui, e é exatamente por isso que esse é o caminho a escolher se você precisa prever uma conta.
Caminho 3
Créditos do Token Plan
CustoPersonal $6 / $18 / $68 por mês. Assentos de equipe de $20 a $200.
ConfiguraçãoAssine e depois chame pela mesma superfície de API.
A pegadinha: o coeficiente de créditos por chamada não é publicado, e as cotas pessoais se reiniciam em janelas fixas de 5 horas e 7 dias em vez de acumular.
Caminho 4
Qoder e harnesses de terceiros
CustoO que a chave subjacente cobrar. O Qoder é um produto à parte.
ConfiguraçãoAponte Claude Code, Codex, Qwen Code ou OpenClaw para uma URL base trocada.
A pegadinha: a configuração do OpenClaw que a Alibaba publica limita a saída em 65.536 tokens, metade do teto real do modelo.
Caminho 5
Pesos abertos, autoalojado
CustoNão compra. Não publicado.
ConfiguraçãoNenhuma disponível em 3 de agosto de 2026.
A pegadinha: prometido para "a próxima semana" desde 2 de agosto, sem licença, data ou repositório. E 2,4 trilhões de parâmetros passam de 500GB mesmo a 1,5 bit por peso.
Aqui está a mesma coisa em forma de tabela, já que alguém vai querer tirar um print dela.
| Caminho | O que você ganha | Preço | Melhor para | Principal pegadinha |
|---|---|---|---|---|
| Qwen Studio | Chat para consumidor, todas as plataformas | Grátis | Testar por curiosidade | O seletor de modelo fica atrás do login |
| QwenCloud API | Pagamento por uso por token | $2 / $6 por 1M | Apps em produção | Nenhuma no preço, várias na verbosidade |
| Token Plan | Assinatura de créditos | A partir de $6/mês | Loops de agentes pesados | Coeficiente de créditos não publicado |
| Qoder e harnesses | IDE e CLIs de código agêntico | Depende da chave | Trabalho de código | Tetos de saída conflitantes |
| Pesos abertos | Autoalojamento | Indisponível | Ninguém, ainda | Não publicado |
Caminho 1: o chat gratuito
O Qwen Studio é a porta mais rápida e não custa nada. Segundo o qwen.ai, existem clientes para web, iOS, Android, macOS e Windows.
Um alerta honesto, porque eu conferi. A página sem login é um fluxo de onboarding de geração de imagens, e não menciona o Qwen 3.8 Max em lugar nenhum do seu HTML público. A seleção de modelo fica atrás da autenticação. Então o chat é real e é grátis, só que você precisa fazer login primeiro antes de conseguir verificar qual modelo está te respondendo.
Vale saber para que esse caminho serve e para que não serve. Como forma de checar rapidamente se o modelo dá conta do seu domínio, está bom. Como forma de avaliar latência ou custo, ou como o modelo se comporta sob um system prompt que você controla, é ruim. Para isso você precisa do caminho 2.
Caminho 2: a API, por token
Esse é o que eu escolheria para qualquer coisa séria. Você cria uma chave no console da QwenCloud, e depois disso a tabela de preços conta toda a história.

Repare no contador ao lado desse botão: dez chaves por conta, e cada chave fica limitada a um único workspace. Se seu plano é uma chave por ambiente ou uma chave por cliente, planeje esse teto agora e não na hora de colocar em produção.
Os medidores publicados, segundo a ficha de modelo:
| Medidor | Preço por 1M de tokens |
|---|---|
| Entrada | $2 |
| Saída | $6 |
| Entrada, cache implícito | $0,25 |
| Criação de cache explícito | $2,50 |
| Leitura de cache explícito | $0,17 |
Dois detalhes dessa tabela importam mais que o título. Primeiro, não existe faixa por tamanho de contexto: um único par fixo de $2/$6 em toda a janela de 1M, sem nenhum seletor de preço escalonado. O que é incomum, e é uma boa notícia, porque preço de contexto escalonado é exatamente onde sessões longas de agentes ficam caras silenciosamente. Segundo, esse cache implícito a $0,25 faz um trabalho de verdade se seus prompts compartilham um prefixo estável, e a maioria das cargas de suporte e código faz isso.
Os limites de taxa ficam em 15.000 RPM e 2M TPM na mesma ficha. Como referência contra o resto do campo, o post da eesel sobre preços do Qwen 3.8 Max faz essa mesma conta ao lado dos preços do GPT-5.6 e dos preços do Kimi K3. A comparação com o DeepSeek V4 Flash é a que vale a pena ler se preço baixo por token é o seu único critério.
A parte que te poupa uma reescrita
Você quase certamente não precisa de uma nova biblioteca cliente para isso. A Alibaba expõe o mesmo modelo por três protocolos em cada uma de seis regiões, segundo a lista do Model Studio: compatível com OpenAI em /compatible-mode/v1, compatível com Anthropic em /apps/anthropic, e DashScope nativo em /api/v1. As regiões são Pequim, Hong Kong, Singapura, Tóquio, Frankfurt e EUA (Virgínia).

Na prática, isso significa que uma integração já existente do SDK da OpenAI chega a esse modelo trocando apenas uma URL base e uma string de modelo. Nada mais. A QwenCloud suporta chat-completions e a Responses API, e a lista de recursos na ficha de modelo confirma function calling, saídas JSON estruturadas, conclusão de prefixo, cache de contexto, lotes, busca na web e fine-tuning. As ferramentas embutidas do lado do servidor (code_interpreter, web_extractor, web_search, t2i_search, i2i_search) ficam especificamente na Responses API.
Caminho 3: créditos do Token Plan
No caminho da assinatura eu diminuiria o ritmo. É a única forma de chegar ao modelo preview mais antigo, e como produto econômico é um bicho completamente diferente da API.

Internacionalmente, a documentação do Token Plan precifica o Personal em $6, $18 e $68 por mês (preço de tabela $8, $25, $80). Isso concede 2.500, 10.000 e 40.000 créditos por janela rotativa de 7 dias, e além disso 700, 3.000 e 12.000 por janela de 5 horas. Os assentos de equipe custam $20 Standard, $75 Pro e $200 Max por assento por mês, para 25.000, 100.000 e 250.000 créditos mensais. A China continental usa as mesmas cotas, mas em yuans: ¥39, ¥139 e ¥499 no Personal, depois de ¥150 a ¥1.398 por assento de equipe.
Agora a parte que ninguém coloca no material de marketing. A Alibaba não publica o que um crédito compra. A documentação da Personal Edition diz que o custo em créditos de uma chamada é definido dinamicamente pelo tipo de modelo, volume de tokens, modo de raciocínio e chamadas de ferramentas, e depois deduzido em coeficientes escalonados que não aparecem publicados em lugar nenhum. O único exemplo calculado no site é para um modelo diferente, o qwen3.6-plus, com cerca de 3,18 créditos para uma entrada de 8.349 tokens e uma saída de 573 tokens.

Mais três mecânicas que mordem:
- Cotas são janelas, não saldos. Bater no teto de 5 horas ou de 7 dias pausa o serviço até essa janela reiniciar, e créditos não usados não são acumulados. Renovar estende o prazo, mas não recarrega o ciclo atual.
- Assentos de equipe são de um membro por chave, não compartilháveis, sem limites de janela mas com um bloqueio mensal rígido quando o pool de assentos esgota.
- Sessões longas custam mais por requisição. A documentação do Team afirma claramente que alguns modelos cobram em faixas por tamanho de contexto, e avisa que acumular contexto dentro de loops de agentes empurra requisições para faixas mais altas.
Existe um desconto real aqui que vale citar. Durante a preview, o consumo de créditos rodava a 10% do normal, e entre 22h e 8h um desconto adicional de 80% se somava a isso, chegando a 2% do consumo padrão. Duas ressalvas, porém. O desconto noturno é só para a Personal Edition, e a versão GA qwen3.8-max recebe uma tarifa noturna fixa de 50% em vez do 2% acumulado. Ambos são explicitamente revogáveis, e a Alibaba também nunca menciona o fuso horário.
Já vi exatamente essa forma de precificação pegar gente no meu próprio lado do balcão. Um comprador com quem trabalhei, uma empresa europeia de segurança de e-mail no Freshdesk, queimou 200 interações em um único dia de teste e imediatamente começou a se preocupar com o que isso significaria no volume esperado deles. O número em si estava tranquilo. Não conseguir prever o número é o que faz um time financeiro dizer não. Um coeficiente não publicado faz isso em uma escala bem maior, e esse é todo o argumento para escolher o caminho 2 em vez disso.
Caminho 4: Qoder e os harnesses de código
Se sua pergunta de acesso é realmente "isso consegue pilotar meu repositório", a Alibaba já fez esse trabalho por você. O Qoder é sua IDE e CLI de código agêntico, instalável com curl -fsSL https://qoder.com/install | bash, e o post de lançamento o descreve como coevoluindo com o modelo.
A parte mais útil é que o mesmo post também traz configurações prontas para copiar e colar para quatro harnesses que você talvez já use: Claude Code (via um ANTHROPIC_BASE_URL apontando para https://dashscope-intl.aliyuncs.com/apps/anthropic), Codex no protocolo Responses, Qwen Code (@qwen-code/qwen-code), e OpenClaw. Se você já tem um fluxo de trabalho com assistente de código, isso é uma troca de URL base, não uma migração.
Repare em uma inconsistência aqui. A ficha de modelo diz 131.072 de saída máxima. A configuração do OpenClaw que a Alibaba publica nesse mesmo post de lançamento define "maxTokens": 65536, exatamente a metade, e a diferença nunca é explicada. Ou seja, a própria ferramenta lançada pela Alibaba nunca pede o teto que ela mesma anuncia. Se você bater em truncamento numa geração longa, esse valor de configuração é a primeira coisa a checar.
Como amostra de como é o acesso de longo horizonte na prática, a Alibaba cita uma execução autônoma de código de 16 dias que produziu 265 commits, 127 PRs e 151 issues no repositório público oh-my-cli, em 30 de julho de 2026. Trate isso como uma demo, não como um benchmark. Mas isso mostra em que direção a Alibaba está investindo.
Caminho 5: os pesos, que você ainda não pode ter
Esse é o caminho que a maioria das pessoas que pergunta sobre acesso está realmente perguntando. Também é o que não existe.

O post de lançamento se compromete com isso três vezes separadas, chamando-o de primeiro modelo de pesos abertos em escala Max, com os pesos indo para o Hugging Face e o ModelScope "na próxima semana". Em 3 de agosto de 2026 não há repositório, nem licença, nem tampouco uma data firme. E a página inicial do qwen.ai marca a entrada como "Open-Source" para um lançamento cujos pesos não saíram.
A reação da comunidade foi menos sobre a promessa e mais sobre a aritmética:
At 1.5 bits per weight it'll still be over 500gb - that's still not running on consumer hardware.
Best case they release smaller models. 120b class of qwen 3.8 would be incredible - it fits on device for those serious about AI, but without millions of dollars in hardware for terabytes of VRAM
Essa é a leitura honesta. Mesmo um checkpoint de 2,4T já lançado é um artefato de data center, não de notebook. O lançamento irmão que as pessoas realmente estão esperando é o Qwen3.8-27B, anunciado como pesos abertos junto com o carro-chefe:
They've also announced Qwen3.8-27B being released open-weight next week. Qwen3.6-27B is widely regarded as one of the best local models, especially since nothing else comes close to it, that isn't benchmaxxed, without being significantly larger. If 3.8 truly improves upon it that would be awesome.
Se inferência local é um requisito obrigatório para você, esse é o lançamento a acompanhar, e o texto da eesel sobre modelos de linguagem pequenos cobre por que o lado pequeno costuma ser o certo para produção de qualquer forma. Para opções de pesos abertos comparáveis hoje, veja as alternativas ao Qwen 3.8 Max e o explicador do Kimi K3, que de fato lançou seus pesos na data prometida.
Cinco erros dos quais eu te pouparia
Problemas de acesso com esse modelo quase nunca são problemas de capacidade. Na maioria das vezes é burocracia.
- Chamar
qwen3.8-max-previewesperando uma tarifa. Ele não tem ficha de modelo nem preço por token. Se você quer um número, precisa do ID da versão GA. - Ler um artigo da era preview como se fosse o preço da GA. Circula amplamente um conjunto de faixas em CNY por 1K que afirma um contexto de 256K, o que contradiz o 1M da ficha da GA. Qualquer tabela de faixas encontrada fora das propriedades da própria Alibaba deve ser tratada como não verificada.
- Supor que a tarifa noturna de 2% se aplica a você. Ela era só para a preview e só para a Personal. A GA recebe um desconto noturno fixo de 50%, e a Team não tem desconto noturno algum.
- Orçar o nível Lite sem checar o estoque. O plano Lite mostrava "temporariamente esgotado, reabastecido diariamente às 9h30" quando conferi em 3 de agosto de 2026. Uma frase que eu não esperava escrever sobre uma assinatura de API.
- Confiar em um veredito de qualidade baseado em um único número. O modelo não aparece de forma alguma no ranking da Artificial Analysis, então qualquer "pontuação de inteligência independente" citada para ele pertence a algum outro Qwen. Compare, em vez disso, nos confrontos diretos com Fable 5 e GPT-5.6.
O que o acesso não te dá
Todo caminho acima chega ao mesmo lugar: um modelo que responde prompts. Se você veio aqui para colocar IA em uma fila de suporte, isso é talvez um quinto do trabalho.
Os outros quatro quintos são as partes que ninguém te vende com uma chave. Busca sobre sua própria central de ajuda e seus tickets passados, para que as respostas saiam fundamentadas em vez de apenas plausíveis. Ações, para que o agente possa marcar, encaminhar e encerrar em vez de só falar. Regras de escalonamento, com uma transferência limpa para um humano. E depois uma forma de testar tudo isso em tickets históricos antes de tocar em um cliente, que é a etapa que separa um lançamento bem-sucedido de um incidente.
Digo isso a partir de cicatrizes, não de teoria. Já vi um bot de tom confiante confirmar alegremente suporte para produtos que não estavam de jeito nenhum no banco de dados do cliente, só porque a base de conhecimento dizia "damos suporte a todos os modelos". Uma equipe de suporte técnico B2B com quem trabalhei sinalizou exatamente esse medo antes de ir ao ar, e eles estavam certos. É por isso que todo lançamento da eesel simula primeiro contra tickets passados reais, e isso não é um recurso que se ganha de uma URL base. Os guias da eesel sobre prevenção de alucinações e sobre taxa de resolução aprofundam as duas metades disso.
A escolha do modelo também importa bem menos do que as pessoas esperam. Seja você roteando pelo Qwen, GLM 5.2, Gemini 3.5 Pro ou Fable 5, o que move sua taxa de desvio é a camada de busca e teste construída ao redor dele. Eu desenvolvo esse argumento em detalhes em agentes de IA contra chatbots e em RAG contra fine-tuning.
Experimente a eesel para suporte em vez de fiar você mesmo
Se o motivo de você ler um guia de acesso a modelo era "quero que a IA responda tickets", então você pode pular todos os caminhos acima. A eesel é a camada que transforma um modelo em um colega de suporte, e leva minutos em vez de um ciclo de compras.

Conecte Zendesk, Freshdesk, Gorgias, Front ou HubSpot, aponte para sua central de ajuda, e ela aprende com seus tickets passados em vez de um prompt que você escreveu à meia-noite. Depois você simula tudo isso em conversas históricas, vê a taxa de resolução antes de se comprometer com qualquer coisa, e liga quando o número é um que você consegue defender. Sem chaves de API para girar, sem coeficientes de créditos para fazer engenharia reversa, e sem região para escolher. Se você quer ver o panorama mais amplo primeiro, o panorama da eesel sobre o melhor software de helpdesk com IA e o guia de automação de tickets de suporte são bons pontos de partida, e classificação de tickets cobre a metade da triagem.
Experimente a eesel de graça, ou agende uma demo se preferir que eu dirija.
Perguntas frequentes
Como acesso o Qwen 3.8 Max de graça?
Qual é o preço por token da API do Qwen 3.8 Max?
Qual é o ID do modelo Qwen 3.8 Max?
qwen3.8-max, impresso na ficha de modelo da QwenCloud. A preview anterior era qwen3.8-max-preview, um produto comercial diferente vendido apenas pelo Token Plan. Confundir os dois é o motivo mais comum de uma primeira chamada de API dar 404.Posso baixar os pesos do Qwen 3.8 Max e hospedá-lo eu mesmo?
A assinatura do Token Plan é mais barata que a API do Qwen 3.8 Max?
Posso usar o Qwen 3.8 Max dentro do Claude Code ou do Codex?
De quais regiões posso chamar o Qwen 3.8 Max?
O acesso ao Qwen 3.8 Max é bom o suficiente para responder tickets de clientes?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








