
The comparison everyone wants does not exist yet
Vamos começar pela parte incômoda, porque todos os outros artigos sobre esse confronto simplesmente pulam essa etapa.
Uma comparação de modelos precisa de dois conjuntos de números. A Anthropic publicou o dela: uma ficha de sistema, uma tabela de preços, além de todo um painel de parceiros de lançamento nomeados apresentando números oficiais. A Alibaba publicou dois posts no X e um endpoint pago em funcionamento. Essa é toda a base de evidências para um modelo que ela chama de segundo melhor do mundo.

Para dar contexto sobre o quanto isso se distancia do próprio padrão da Alibaba: o carro-chefe anterior, o Qwen3.7-Max, foi lançado em maio de 2026 com números reais, 80,4% no SWE-bench Verified, e a posição mais alta entre modelos chineses no índice da Artificial Analysis naquele momento. O Qwen3.8-Max chegou com a confiança, mas sem nenhum dos comprovantes.
Então trate o que vem a seguir como uma comparação entre dois produtos, e não entre duas inteligências. É a única comparação que a evidência realmente sustenta.
What Qwen3.8-Max actually is
Qwen é a família de modelos da Alibaba Cloud, e "Max" é a linha carro-chefe proprietária, acima dos níveis mais baratos Plus e Turbo. O Qwen3.8-Max foi apresentado em prévia em 19 de julho de 2026.
As especificações declaradas pela Alibaba:
- 2,4 trilhões de parâmetros no total, em um design esparso de Mixture-of-Experts, segundo o Qwen no X.
- O primeiro Qwen multimodal acima de 1T de parâmetros, processando texto, imagens, vídeo e documentos, segundo o pesquisador principal Shuai Bai.
- Uma janela de contexto de 1 milhão de tokens, herdada do Qwen3.7-Max.
- Voltado para codificação e trabalho agêntico, área em que a Alibaba diz superar o antecessor.
O número de parâmetros ativos, a proporção de esparsidade e a licença estavam todos ausentes. Um modelo denso de 2,4T seria caro demais para operar, então o roteamento MoE é o que torna esse número viável, e é justamente esse número que ninguém publicou.
"Qwen3.8-Max Preview is now available for early access! This is our first trillion-parameter multimodal model."
What Claude Fable 5 actually is
A Anthropic apresenta o Fable 5 como seu modelo geralmente disponível mais capaz, construído para "trabalho ambicioso, de longa duração e assíncrono". O posicionamento é incomumente estreito para um carro-chefe. A própria visão geral de modelos da Anthropic recomenda começar pelo Claude Opus 5, e subir para o Fable 5 apenas nas cargas de trabalho que exigem a maior capacidade disponível.
Algumas características fazem dele um animal genuinamente diferente de um lançamento de modelo comum.
O raciocínio está sempre ativo. O Fable 5 não aceita o parâmetro legado de pensamento estendido, e não tem nenhum interruptor de desligamento publicado. A profundidade é controlada pelo nível de esforço em vez disso.
Ele redireciona o próprio tráfego. O Fable 5 vem com salvaguardas para cibersegurança e biologia, e as consultas sinalizadas são automaticamente roteadas para modelos menos capazes. Consultas de segurança cibernética caem para o Opus 4.8, biologia para o Opus 5. Uma resposta do Opus é literalmente o que uma requisição bloqueada do Fable devolve, algo estranho de descobrir no meio de um fluxo de trabalho.
Usá-lo exige retenção de dados por 30 dias para monitoramento de segurança. Para um comprador regulado, isso é uma conversa de compras, não apenas uma caixinha para marcar.
Os números dos parceiros de lançamento são a evidência mais forte de toda essa comparação, e vale a pena lê-los como alegações de custo, não de inteligência. Um parceiro relata que o Fable 5 supera o Opus 4.8 em uma suíte de planilhas do dia a dia em todos os níveis de esforço, enquanto conclui execuções 25-30% mais rápido. Outro afirma ter alcançado resultados de física de ponta usando um terço dos tokens de raciocínio.
Head to head on what is actually published
Aqui está cada dimensão em que ambos os lados disseram algo concreto. As células em branco estão vazias porque o fornecedor não publicou, não porque eu não tenha encontrado.
| Qwen3.8-Max | Claude Fable 5 | |
|---|---|---|
| Vendor | Alibaba Cloud | Anthropic |
| Status | Prévia (Qwen3.8-Max-Preview) | Disponibilidade geral |
| Launched | 19 de julho de 2026 | 9 de junho de 2026 |
| Model ID | não publicado | claude-fable-5 |
| Architecture | Mixture-of-Experts esparso de 2,4T | não publicado |
| Multimodal input | Texto, imagens, vídeo, documentos | Texto, imagens, diagramas, gráficos, PDF |
| Context window | 1M tokens | 1M tokens |
| Max output | não publicado | 128k tokens |
| Input price | tarifa por token não publicada | US$ 10 / MTok |
| Output price | tarifa por token não publicada | US$ 50 / MTok |
| How you buy it | Assinatura Token Plan, Qoder, QoderWork | Claude API, Bedrock, Google Cloud, Microsoft Foundry |
| Prompt caching discount | não publicado | 90% nos tokens de entrada |
| Benchmark table | nenhuma na prévia | benchmarks de parceiros, sem tabela numérica pública |
| Model / system card | nenhuma | ficha de sistema publicada |
| Open weights | prometido para "em breve", sem data nem licença | não |
| API protocols | compatível com OpenAI e Anthropic | Anthropic |
| Data retention | não publicado | 30 dias, obrigatório |
| Documented outage | n/a (prévia) | 12 de junho a 1º de julho de 2026 |
| Knowledge cutoff | não publicado | janeiro de 2026 |
Duas dessas linhas merecem um segundo olhar.
A linha API protocol é a vantagem escondida. O endpoint Token Plan da Alibaba fala tanto o protocolo da OpenAI quanto o da Anthropic, então o Claude Code, o Cursor e o Cline funcionam com o Qwen3.8-Max assim que você tem uma chave. Testar leva cinco minutos, e essa acessibilidade faz boa parte do trabalho por trás do burburinho.
A linha knowledge cutoff é a esquisitice silenciosa do Fable 5. Janeiro de 2026 é quatro meses mais antigo que o corte de maio de 2026 do Opus 5, apesar de o Fable ser o modelo mais novo e mais caro. Então, se o seu trabalho depende de fatos recentes, o modelo caro sabe menos.
Price: two sheets that do not line up
Este é o ponto onde a comparação desmorona por completo, em vez de apenas ficar confusa.

A Anthropic vende tokens. O Fable 5 custa 10$ na entrada e 50$ na saída por milhão, exatamente o dobro do Claude Opus 5 nas duas linhas, com o desconto de 90% por cache de prompt ainda válido, e inferência exclusiva dos EUA disponível a 1,1x.
A Alibaba vende uma assinatura em vez disso. Durante a prévia, o Qwen3.8-Max roda a 10% do preço padrão pelo Token Plan, com níveis Personal a cerca de US$ 6, US$ 20 e US$ 70 por mês para Lite, Standard e Pro. Depois some o desconto noturno, mais 80% de desconto no consumo de créditos entre 22h e 8h (UTC+8), e as execuções fora do horário chegam a cerca de 0,2% da tarifa padrão.
Não dá para dividir esses dois valores um pelo outro. Um deles é uma tarifa, o outro é uma cota, e o denominador dessa cota são créditos cuja conversão em tokens nunca foi publicada.
Também há uma segunda armadilha no modelo de assinatura, e não é hipotética. Na geração anterior, usuários do Qwen relataram que os créditos se esgotavam muito mais rápido do que o esperado, e os modelos Qwen realmente tendem a gerar mais tokens de saída por tarefa do que os concorrentes. O que infla silenciosamente o custo real, mesmo quando o preço na etiqueta parece imbatível. O desconto da prévia disfarça isso por enquanto. Reserve orçamento para o dia em que ele acabar, e leia nossa análise de preços do Qwen3.8-Max antes de comprometer qualquer carga de trabalho.
Enquanto isso, as alegações dos parceiros do Fable 5 apontam na direção oposta quanto ao custo total. Menos turnos, e um terço dos tokens de raciocínio em tarefas difíceis, significam que o preço na etiqueta de 2x não vira uma conta de 2x. É a mesma lógica que percorremos na nossa comparação Opus 5 vs Sonnet 5, em que o modelo mais barato não é automaticamente também o trabalho mais barato.
Where each one actually breaks
Pergunte "qual é melhor" e você recebe de ombros. Pergunte "qual eu posso colocar em produção na segunda-feira", e os dois respondem não, por motivos completamente diferentes.

O Qwen3.8-Max é uma prévia. Sem licença e sem preço por token, também sem ficha técnica de modelo, além de um endpoint que pode mudar debaixo dos seus pés. Bom para experimentos, e desqualificante para qualquer coisa com um cliente atrelado.
O Fable 5 tem um histórico público de disponibilidade com um buraco bem no meio. A Anthropic lançou em 9 de junho, retirou o acesso em 12 de junho, e depois restaurou em 1º de julho. Dezenove dias, reconhecidos pelo próprio fornecedor em seu site. Some a retenção obrigatória de 30 dias e o redirecionamento de salvaguarda, e você tem três perguntas de compras para responder antes que um único ticket seja tratado.
Nenhum dos dois pontos é uma crítica ao modelo subjacente. Ambos são motivos pelos quais a escolha importa menos do que a arquitetura que você constrói ao redor.
So which one should you actually test?
A prévia é barata e o carro-chefe é rápido, o que torna "devo trocar" a pergunta errada. Primeiro, descubra o que você está realmente testando.
Qwen3.8-Max ou Claude Fable 5?
Escolha a tarefa que você realmente tem.
What this actually means if you are buying for support
Agora chega a parte que realmente me importa, porque construir agentes de IA para filas de suporte é o meu trabalho do dia a dia.
A cada poucas semanas, um lançamento como esse faz as pessoas pensarem que o modelo é o gargalo. Não é, e essa lacuna é exatamente o lugar onde a maioria dos projetos de IA para suporte morre em silêncio. Tanto o Qwen3.8-Max quanto o Fable 5 entregam raciocínio bruto. Nenhum dos dois conhece sua política de reembolso, os casos extremos do seu produto, ou o fato de que o ticket #4021 é um cliente VIP que já escreveu duas vezes. Nenhum tem uma barreira de segurança que o impeça de inventar uma resposta com confiança, e nenhum se conecta ao helpdesk onde o trabalho realmente acontece.
Passamos anos colocando IA em filas de suporte reais, e a lição que ficou é que uma resposta confiante e errada é pior do que nenhuma resposta. O bot de um cliente confirmou alegremente que dava suporte a modelos de produtos que não estavam no banco de dados, porque a central de ajuda dizia "damos suporte a todos os modelos". Um número maior de parâmetros torna essa falha mais provável, não menos, porque o modelo soa ainda mais confiante. Um líder de suporte resumiu esse requisito melhor do que eu conseguiria:
"The AI will never be able to answer 100% of the questions, but if it tries and just answers wrong, I cannot go check all my 7,000 tickets to see if it made a good answer. I need an AI that only handles the tickets it's confident about, and leaves the rest alone."
a DTC brand CX lead handling 7,000 tickets a month
Isso é uma declaração sobre arquitetura, não sobre escolha de modelo. É por isso que a eesel AI simula sobre seus tickets históricos antes de qualquer coisa ir ao ar, para que você veja a taxa de resolução e as respostas exatas em conversas passadas reais, em vez de descobrir isso por meio de um cliente. É também por isso que as respostas são roteadas por confiança: incerteza significa rascunho ou escalonamento, nunca adivinhação. Operando dessa forma, a Gridwise atingiu 73% de resolução em nível 1 já no primeiro mês.
O ponto mais amplo que vale a pena tirar de todo esse confronto é este. Dois laboratórios acabaram de mover o teto de tamanho em uma quinzena, o Kimi K3 a 2,8T e o Qwen3.8-Max a 2,4T, e depois a Anthropic lançou um modelo que trabalha sem supervisão por dias. A camada de modelo está ficando melhor e mais barata mais rápido do que qualquer ciclo de compras consegue acompanhar. Então construa de um jeito em que você possa trocar o motor sem precisar refazer toda a fiação ao redor, e cada um desses ganhos cairá no seu colo de graça.
Try eesel AI
Se você veio até aqui tentando descobrir qual modelo apontar para sua fila de suporte, a resposta honesta é que essa escolha importa muito menos do que a camada que fica acima dela. Essa camada é o que a eesel AI é.

Ela se conecta ao Zendesk, ao Freshdesk, ao Slack e a mais de 100 outras ferramentas, aprende com sua central de ajuda e tickets anteriores, e começa a redigir em minutos. O diferencial é a rampa de confiança: simule sobre seu histórico real de tickets, leia os números, comece no modo rascunho, e só vá para o modo autônomo quando estiver satisfeito. Você ganha a inteligência do modelo de fronteira com barreiras de segurança construídas para suporte, e nunca mais precisará fazer essa comparação sozinho. Experimente a eesel grátis, sem cartão de crédito.
Perguntas frequentes
O Qwen3.8-Max é melhor que o Claude Fable 5?
Como o preço do Qwen3.8-Max se compara ao do Claude Fable 5?
Qual é a janela de contexto do Qwen3.8-Max em comparação com o Claude Fable 5?
O Qwen3.8-Max é open source e o Claude Fable 5 não é?
Posso usar o Qwen3.8-Max ou o Claude Fable 5 para atendimento ao cliente?
Qual modelo devo escolher se preciso de disponibilidade confiável?
Quais são as melhores alternativas ao Qwen3.8-Max?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.







