
O que o Qwen 3.7 Flash realmente é
Eu construo integrações e APIs para viver. Então meu primeiro instinto diante de qualquer lançamento é ignorar o anúncio e ir direto ler a ficha do modelo, e com o Qwen 3.7 Flash isso foi fácil, porque não havia anúncio nenhum para ignorar.
Não existe post de blog da Qwen para esse modelo. O feed de artigos do qwen.ai traz posts de lançamento para o Qwen 3.7 Max e o Qwen 3.7 Plus, e nada para o Flash. Uma única linha no changelog do QwenCloud, datada de 25 de julho de 2026, é o único aviso oficial que existe.
Ele foi ao ar na OpenRouter em 27 de julho de 2026, sob o slug canônico qwen/qwen3.7-flash-20260727, com um snapshot fixado chamado qwen3.7-flash-2026-07-15.
Aqui está a declaração de posicionamento completa, tirada literalmente da ficha do modelo da Alibaba Cloud:
"The Qwen3.7 native vision-language series Flash models comprehensively enhance multimodal understanding and Agent execution capabilities compared to 3.6-Flash. Key improvements include strengthened foundational multimodal abilities, enhanced object recognition, improved real-world perception and spatial intelligence."
Esse é o discurso inteiro. Sem tabela de benchmark, sem nome de avaliação, sem porcentagem, sem arquitetura. A Qwen não publicou a contagem de parâmetros. Nem se é denso ou uma mistura de especialistas, nem quantos tokens ele viu. Para uma empresa que construiu sua reputação em lançamentos abertos, essa é uma postura diferente, e a comunidade percebeu.
Os fatos mecânicos são mais úteis. Texto, imagem e vídeo na entrada, texto na saída. O contexto é de 1.000.000 de tokens, com entrada utilizável limitada a 991.808 e saída a 65.536, metade do que Plus e Max permitem. O orçamento de cadeia de raciocínio chega a 262.144 tokens e o raciocínio vem ativado por padrão. A chamada de funções funciona. Também há ferramentas embutidas para interpretação de código e extração web, além de busca de imagem e texto.

O mapa da família guarda uma surpresa real. O Flash é o mais barato dos três e o mais rápido dos três, 59 tokens por segundo contra 12 do Plus, e também é o único que aceita vídeo. O Qwen 3.7 Max, o carro-chefe, é somente texto. Normalmente é o nível de entrada que sai mutilado; aqui é o nível de entrada que vê mais.
O preço, e a parte que a etiqueta não conta
Se eu fosse ler apenas uma seção deste post, seria esta. O número de $0,03 que todo mundo está citando é real. Também é o melhor cenário dentre três.
| Tamanho do prompt | Entrada / 1M | Saída / 1M | Leitura de cache / 1M | Escrita de cache / 1M |
|---|---|---|---|---|
| Abaixo de 32K tokens | $0,03 | $0,13 | $0,006 | $0,038 |
| 32K a 256K | $0,10 | $0,40 | $0,02 | $0,125 |
| 256K a 1M | $0,20 | $0,80 | $0,04 | $0,25 |
Essas tarifas vêm da API de modelos da OpenRouter, e a mesma estrutura de três faixas aparece em yuans na própria ficha da Alibaba: 0,2, 0,6 e 1,2 CNY por 1M de entrada em Pequim, Frankfurt e Tóquio. São duas visões de um mesmo esquema de preços, então não há contradição a resolver.

Então o marketing junta "modelo de visão mais barato" com "contexto de 1M" e deixa você supor que consegue os dois ao mesmo tempo. Não consegue. O contexto de 1M e o preço de $0,03 são mutuamente exclusivos. Qualquer coisa que realmente precise de uma janela longa cai na faixa mais alta, a 6,7 vezes a tarifa que você orçou, seja uma base de código grande, um vídeo ou uma pilha de documentos.
Nada disso é teórico. A OpenRouter publica o que seus clientes pagam depois do cache como uma média móvel de 30 dias, e para esse modelo é $0,044 na entrada e $0,149 na saída com taxa de acerto de cache de 51,0%. Essa média ficar acima do preço de tabela só é possível se uma parcela significativa do tráfego real já estiver pagando as faixas de 32K e 256K. O desconto do cache também não te salva.
Coloque seus próprios números aqui.
Vale a pena conhecer algumas peculiaridades regionais antes de escolher um endpoint. No mesmo modelo, Singapura custa cerca de 22% a mais que Pequim, Frankfurt e Tóquio. A busca web só funciona em Pequim e Singapura. A inferência em lote só funciona em Pequim, e o fine-tuning não está disponível em lugar nenhum.
Como ele se compara ao resto do nível econômico
Mesmo considerando as faixas, o preço continua sendo a história principal. Este é o cenário atual de modelos econômicos com capacidade de visão, com todos os números tirados das próprias páginas de preços de cada fornecedor. Lançamentos com preço de fronteira como o Kimi K3 ficam fora deste escopo.
| Modelo | Entrada $/1M | Saída $/1M | Contexto | Visão | Lançamento |
|---|---|---|---|---|---|
| Qwen 3.7 Flash | $0,03 | $0,13 | 1M | Texto, imagem, vídeo | 27 jul 2026 |
| Mistral Small 4 | $0,15 | $0,60 | 256K | Texto, imagem | 16 mar 2026 |
| GPT-5.6 Luna | $0,20 | $1,20 | 1,05M | Texto, imagem | 9 jul 2026 |
| Gemini 3.1 Flash-Lite | $0,25 | $1,50 | Não publicado | Texto, imagem | Não publicado |
| Gemini 3.5 Flash-Lite | $0,30 | $2,50 | 1.048.576 | Texto, imagem, vídeo | 21 jul 2026 |
| Claude Haiku 4.5 | $1,00 | $5,00 | 200K | Texto, imagem | 15 out 2025 |
| Gemini 3.6 Flash | $1,50 | $7,50 | 1.048.576 | Texto, imagem, vídeo | 21 jul 2026 |
Algumas coisas chamam atenção. A Qwen é uma ordem de grandeza mais barata aqui, 5x abaixo do Mistral Small 4 e 10x abaixo do Gemini 3.5 Flash-Lite na entrada. Também é o único modelo do grupo que aceita vídeo a uma tarifa de entrada abaixo de $0,10, enquanto o GPT-5.6 Luna e o Mistral Small 4 são apenas para imagem.
Há uma armadilha a evitar se você comparar por conta própria. O Gemini 3.1 Flash-Lite ainda é mais barato que o 3.5 Flash-Lite, a $0,25/$1,50 contra $0,30/$2,50. Mais novo não é automaticamente mais barato na linha do Google, onde o Gemini 3.6 Flash fica na ponta superior. E o GPT-5.6 Luna cortou seu preço em 80% em 30 de julho de 2026, um dia antes de eu escrever isso, o que o torna um concorrente bem mais próximo do que era há uma semana.
O modelo que ele realmente derrota, no entanto, é seu próprio antecessor. Frente ao Qwen 3.6-Flash a $0,1875/$1,125, o novo nível base é 6,25x mais barato na entrada e 8,65x mais barato na saída. A Alibaba acabou de cortar seu próprio piso de preço em visão em uma ordem de grandeza em um único lançamento, seja o que for verdade sobre o resto deste lançamento.
"Flash" aqui significa barato, não rápido
É aqui que o nome engana. Flash significa baixa latência na linha do Google. Aqui significa preço baixo. São produtos bem diferentes.
A OpenRouter mede o único provedor em 59 tokens de saída por segundo no P50, com 1,20s de tempo até o primeiro token. A Artificial Analysis mede o Gemini 3.5 Flash-Lite em 382 tokens por segundo e o GPT-5.4 mini em 177. São bancos de teste e condições diferentes, então trate essa proporção com cautela. Ainda assim, uma diferença de 6x é grande demais para ser ruído de medição, e o raciocínio vindo ativado por padrão puxa esse número ainda mais para baixo.
Há um dado dissonante. Um desenvolvedor que testou o modelo em uma ferramenta de codificação relatou uma taxa de transferência bem melhor do que a telemetria da OpenRouter mostra:
"Qwen 3.7 flash is already available in Command Code. Cheap tiered pricing, super fast 150 TPS. // Capabilities include. 💬 Text input ✓ 👁️ Vision ✓ 🧠 Reasoning ✓ Testing it out. It's gonna be a fun competitor to DeepSeek V4 Flash."
Os 150 TPS dele são cerca de 2,5x o P50 medido pela OpenRouter, e prompts curtos com um cache aquecido podem chegar lá. Eu ainda planejaria com base em 59, não em 150, porque é o tráfego de produção que a OpenRouter está amostrando.
A cauda é a parte que me tiraria o sono. A latência ponta a ponta é de 3,56s no P50 e 8,54s no P75, o que é tranquilo. Depois vai para 17,96s no P90, 29,03s no P95, e 90,19s no P99.

Para um trabalho em lote, essa cauda é invisível. Para qualquer coisa que uma pessoa esteja esperando, uma em cada cem requisições demorando um minuto e meio deixa de ser uma métrica e vira uma decisão de produto. E isso se acumula dentro de um loop de agente de IA, onde uma única chamada de ferramenta lenta trava cada etapa atrás dela.
Mais dois números do mesmo painel. A taxa de erro em chamadas de ferramenta é de 8,88%, contra 6,45% do Plus, o que significa que cerca de uma em onze chamadas de ferramenta falha em um modelo explicitamente vendido para trabalho de agente. E exatamente um provedor o serve. Sem roteamento de contingência, portanto, se a Alibaba Cloud tiver uma tarde ruim.
Também há um pequeno conflito de documentação que não consegui resolver. A ficha do modelo da Alibaba lista saídas estruturadas como suportadas. A lista de parâmetros da OpenRouter não expõe a flag de saídas estruturadas para o Flash, apenas response_format, mesmo expondo para Plus e Max. Se o cumprimento estrito de esquema importa para seu pipeline, teste antes de se comprometer em vez de confiar em nenhuma das duas páginas.
O único benchmark independente que existe
A Qwen não publicou nada, então fui atrás de alguém que realmente tivesse pontuado o modelo. Existe exatamente um.
A Artificial Analysis não lista esse modelo. A página do modelo retorna 404, e um grep no sitemap do site confirma que as únicas páginas Qwen 3.7 são Max e Plus. O LMArena também não tem entrada para o Flash. Nenhum índice de inteligência das fontes de costume, então, nenhum Elo, e nenhuma pontuação de qualidade publicada de nenhum tipo.
As avaliações de visão da Roboflow são a exceção, e não são lisonjeiras:
| Tarefa | Pontuação | Posição |
|---|---|---|
| Geral | 61,7% | #22 de 23 |
| Identificação | 84,4% | #10 de 23 |
| Transcrição OCR | 84,1% | #23 de 23 |
| Extração de dados | 78,4% | Sem classificação |
| Detecção de objetos | 42,8% mAP@50 | #16 de 23 |
| Contagem de objetos | 46% correspondência exata | Sem classificação |
| Custo por amostra | ~$0,0001 | #1 de 23 |
Ele fica em 22º de 23 no geral, com 61,7%, logo atrás do GPT-5.4 mini com 63,5%, e primeiro de 23 em custo. Para ser justo: o resultado de OCR é o último lugar em um grupo bem equilibrado e não é uma falha, já que 84,1% de correspondência média é respeitável em termos absolutos. E a Qwen nunca afirmou OCR ou controle de GUI como pontos fortes do Flash. Isso pertence ao Plus. Então "último em OCR" é consistente com o que a Alibaba disse, e não uma promessa quebrada.
Mas isso deixa claro o que você está comprando. Identificação é o forte dele, com 84,4%; localização é o fraco, com 42,8%. Ele consegue dizer o que há na imagem muito melhor do que consegue dizer onde está. Se sua carga de trabalho é "etiquetar dez milhões de imagens por categoria", isso encaixa perfeitamente a um décimo de centavo por mil amostras. Se é "ler esta fatura e extrair os itens", busque outra coisa.
O que a comunidade diz, e por que há tão pouco
Essa é a coisa mais estranha sobre o lançamento, e acho que é a mais reveladora.
Um modelo de visão a $0,03 por milhão de tokens foi lançado há quatro dias e não há um único comentário sobre ele no Hacker News. Uma busca de texto completo no HN por qwen3.7-flash retorna zero resultados em artigos e comentários, em todo o histórico. Nenhuma thread de lançamento jamais foi enviada. A única matéria com título Qwen nesse período, "Qwen 3.7 or 3.8 30B – 100B. QWhen?", não gerou nenhum comentário.
Fica melhor ainda. A conversa viva do HN sobre a Qwen na semana do lançamento estava acontecendo dentro de uma thread do DeepSeek, onde as pessoas perguntavam se a Qwen algum dia lançaria visão, quatro dias depois de a Qwen ter lançado um modelo de visão.
"You have to remember DeepSeek v4 flash even though a bit cheaper, does not have vision abilities, which is a big draw for agentic tasks."
"Most interesting part IMO is whatever Qwen open weight will include image / video capabilities since its where they are strongest."
Esse segundo comentário aponta direto para o motivo. O público que costumava acompanhar os lançamentos da Qwen é a turma dos pesos locais, e a Qwen parou de atendê-los. O mesmo ponto surgiu em uma thread sobre o GLM 5.2:
"That's because Qwen's flagship models are not, in fact, open weight. Qwen3.7 Max, Qwen3.7 Plus and others are closed weight."
O Flash também é fechado. O Hugging Face retorna um array vazio para ele, e a Roboflow lista a licença como proprietária. Alguém ainda tinha esperança do contrário no dia do lançamento:
"Qwen3.7 Flash vient de faire son apparition sur OpenRouteur, il y a une petite chance que Qwen3.7 soit bientôt dispo pour de l'IA locale !"
Isso se traduz numa esperança de que o Qwen 3.7 logo estivesse disponível para IA local. Não vai estar.
Devo ser direto sobre o que esta seção é. Nenhuma dessas citações é sobre o Flash, porque tais citações ainda não existem. Elas são sobre a família 3.7 e o vazio que o Flash foi criado para preencher. Os veredictos sobre a família vão em ambas as direções, de um comentarista do HN que relata um mês de uso diário e chama o 3.7 Pro de "totalmente inutilizável", até o chewz, que classifica o 3.7 Max acima do nível do Opus em velocidade. Uma frase daquela thread ficou comigo, dado que a Qwen não publicou benchmark nenhum para o Flash:
"Another thing I experience with the Qwen models is that I do not trust their benchmark scores at all."
Há uma certa simetria em lançar um modelo sem nenhuma pontuação de benchmark para um público que já tinha parado de acreditar nelas.
Enquanto isso, as pessoas estão usando o modelo em silêncio. O painel de atividade da OpenRouter mostra o Hermes Agent como o maior consumidor, à frente do Claude Code e de um punhado de ferramentas de codificação. O uso é real; o discurso simplesmente nunca aconteceu.
Quem realmente deveria usá-lo
Minha opinião, sem rodeios.
Recorra a ele se você faz trabalho de visão de alto volume e baixo risco, onde errar ocasionalmente sai barato e ser caro é fatal. Etiquetagem em massa de imagens. Classificação de conteúdo em primeira passagem, triagem de miniaturas, "há uma pessoa neste quadro", pré-filtragem antes de um modelo melhor fazer a passagem cuidadosa. A cerca de um centésimo de centavo por amostra, isso muda o que vale a pena economicamente processar, e isso é um baita diferencial.
Evite se você precisa de OCR ou extração de documentos, localização precisa de objetos, latência previsível, pesos que você possa hospedar, ou qualquer sinal de qualidade publicado para mostrar a um stakeholder. Evite também se seus prompts costumam ser longos, porque nesse ponto o GPT-5.6 Luna, depois do corte de preço de 80%, começa a parecer razoável, assim como o Gemini 3.5 Flash-Lite. Os dois também são bem mais rápidos.
Se você quer especificamente a família Qwen mas precisa de mais capacidade, o Qwen 3.8 Max é a outra ponta da faixa, e nosso panorama de alternativas ao Qwen cobre o resto.
O fator decisivo é se uma resposta errada custa algo para você. Essa é uma questão de produto, não de benchmark, e é a pergunta que eu resolveria antes de escrever qualquer código de integração.
Se isso vai chegar perto de uma fila de suporte, leia isto primeiro
Aqui eu tenho que ser direto, porque essa é a parte em que eu realmente tenho cicatriz.
Eu construo integrações na eesel, e passamos anos rodando IA em filas de suporte reais, ao longo de milhares de tickets de verdade. O mal-entendido mais caro que vejo é exatamente o que a tabela de preços deste post incentiva: achar que o modelo é o produto. Um modelo de $0,03 faz parecer que construir seu próprio bot de suporte é quase de graça. A conta de custo por ticket também fica ótima numa planilha. Mas o modelo nunca foi a parte cara.
As partes caras são a recuperação de informação sobre uma central de ajuda que se contradiz, a classificação de tickets que roteia para o lugar certo, e saber quando ficar quieto. O escalonamento que não deixa o cliente na mão. Uma forma de descobrir que você está errado antes que o cliente descubra. Nada disso vem no preço do token. Aprendemos isso da forma mais difícil, vendo bots de fala confiante darem respostas erradas com toda a confiança, e é por isso que hoje todo lançamento que fazemos é simulado contra tickets históricos antes de tocar uma fila real.
Não vou fingir que ninguém consegue fazer o caminho de construir por conta própria funcionar. Parte da nossa própria evasão de clientes é exatamente isso: clientes que saíram para construir direto sobre uma API de LLM, incluindo uma empresa de RA/tecnologia de construção e uma marca de beleza DTC. É uma opção real, e às vezes é a certa. Mas as equipes que olharam mais de perto para isso, em geral, foram parar em outro lugar. Um líder de engenharia numa empresa de hardware de caixas eletrônicos de Bitcoin, gerenciando uma base de conhecimento de 300 artigos entre Confluence e Telegram, colocou assim:
"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."
E o que realmente decide se a IA de suporte funciona é a contenção, algo que nenhuma pontuação de modelo captura. Um líder de CX numa marca que lida com 7.000 tickets por mês colocou isso melhor do que qualquer benchmark conseguiria:
"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer, then the point is a little bit gone. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
Agora meça o Qwen 3.7 Flash contra esse padrão. Uma taxa de erro em chamadas de ferramenta de 8,88%, um P99 que se estende a 90 segundos, e nenhuma pontuação de qualidade publicada, além de nenhuma avaliação independente exceto a que o classifica em 22º de 23. Esses são números perfeitamente aceitáveis para etiquetar um milhão de imagens. Não são os números que eu gostaria de ter entre minha marca e um cliente irritado. O guia de desvio de tickets e nossas notas sobre taxa de resolução de IA aprofundam por que o limiar de confiança importa mais que o modelo cru.
Se ainda assim você quiser seguir o caminho de construir por conta própria, eu começaria com RAG versus fine-tuning, depois leria sobre treinamento de IA na base de conhecimento. Depois, dedique tempo de verdade a prevenir alucinações. Nenhum desses problemas fica mais barato quando os tokens ficam.
Experimente a eesel
Se o que você realmente queria de um modelo de $0,03 era automação de suporte mais barata, você pode pular a etapa de montagem. A eesel se conecta ao helpdesk que você já usa e aprende com seus tickets passados e sua central de ajuda, depois responde às perguntas das quais está confiante, deixando o resto em paz.
A parte que vale a pena copiar independentemente do que você construir: antes de qualquer coisa ir ao ar, você roda o modelo contra seu histórico real de tickets e recebe um relatório pontuado do que ele teria respondido. É assim que você descobre que um modelo está errado antes que um cliente descubra primeiro. É a verificação que nenhum preço de token pode comprar para você.

Você pode experimentar a eesel de graça, ou agendar uma demonstração se preferir ver o modelo rodando primeiro contra a sua própria fila.
Perguntas frequentes
Quanto custa o Qwen 3.7 Flash?
O Qwen 3.7 Flash é bom para OCR?
Os pesos do Qwen 3.7 Flash são de código aberto?
Qwen 3.7 Flash vs. Gemini 3.5 Flash-Lite: qual é mais rápido?
Posso usar o Qwen 3.7 Flash para atendimento ao cliente?
O que acontece se o Qwen 3.7 Flash sair do ar?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.








