Análise do Qwen 3.7 Flash: um modelo de visão de $0,03 com uma pegadinha

Rama Adi Nugraha
Escrito por

Rama Adi Nugraha

Katelin Teen
Revisado por

Katelin Teen

Última edição July 31, 2026

Verificado por especialista
Ilustração de um desenvolvedor trabalhando com painéis de imagem, vídeo e documentos, com o logo da Qwen

O que o Qwen 3.7 Flash realmente é

Eu construo integrações e APIs para viver. Então meu primeiro instinto diante de qualquer lançamento é ignorar o anúncio e ir direto ler a ficha do modelo, e com o Qwen 3.7 Flash isso foi fácil, porque não havia anúncio nenhum para ignorar.

Não existe post de blog da Qwen para esse modelo. O feed de artigos do qwen.ai traz posts de lançamento para o Qwen 3.7 Max e o Qwen 3.7 Plus, e nada para o Flash. Uma única linha no changelog do QwenCloud, datada de 25 de julho de 2026, é o único aviso oficial que existe.

Ele foi ao ar na OpenRouter em 27 de julho de 2026, sob o slug canônico qwen/qwen3.7-flash-20260727, com um snapshot fixado chamado qwen3.7-flash-2026-07-15.

Aqui está a declaração de posicionamento completa, tirada literalmente da ficha do modelo da Alibaba Cloud:

"The Qwen3.7 native vision-language series Flash models comprehensively enhance multimodal understanding and Agent execution capabilities compared to 3.6-Flash. Key improvements include strengthened foundational multimodal abilities, enhanced object recognition, improved real-world perception and spatial intelligence."

Esse é o discurso inteiro. Sem tabela de benchmark, sem nome de avaliação, sem porcentagem, sem arquitetura. A Qwen não publicou a contagem de parâmetros. Nem se é denso ou uma mistura de especialistas, nem quantos tokens ele viu. Para uma empresa que construiu sua reputação em lançamentos abertos, essa é uma postura diferente, e a comunidade percebeu.

Os fatos mecânicos são mais úteis. Texto, imagem e vídeo na entrada, texto na saída. O contexto é de 1.000.000 de tokens, com entrada utilizável limitada a 991.808 e saída a 65.536, metade do que Plus e Max permitem. O orçamento de cadeia de raciocínio chega a 262.144 tokens e o raciocínio vem ativado por padrão. A chamada de funções funciona. Também há ferramentas embutidas para interpretação de código e extração web, além de busca de imagem e texto.

Três cartões comparando Qwen 3.7 Flash, Plus e Max em preço, taxa de transferência e modalidade de entrada
Três cartões comparando Qwen 3.7 Flash, Plus e Max em preço, taxa de transferência e modalidade de entrada

O mapa da família guarda uma surpresa real. O Flash é o mais barato dos três e o mais rápido dos três, 59 tokens por segundo contra 12 do Plus, e também é o único que aceita vídeo. O Qwen 3.7 Max, o carro-chefe, é somente texto. Normalmente é o nível de entrada que sai mutilado; aqui é o nível de entrada que vê mais.

O preço, e a parte que a etiqueta não conta

Se eu fosse ler apenas uma seção deste post, seria esta. O número de $0,03 que todo mundo está citando é real. Também é o melhor cenário dentre três.

Tamanho do promptEntrada / 1MSaída / 1MLeitura de cache / 1MEscrita de cache / 1M
Abaixo de 32K tokens$0,03$0,13$0,006$0,038
32K a 256K$0,10$0,40$0,02$0,125
256K a 1M$0,20$0,80$0,04$0,25

Essas tarifas vêm da API de modelos da OpenRouter, e a mesma estrutura de três faixas aparece em yuans na própria ficha da Alibaba: 0,2, 0,6 e 1,2 CNY por 1M de entrada em Pequim, Frankfurt e Tóquio. São duas visões de um mesmo esquema de preços, então não há contradição a resolver.

Três degraus ascendentes mostrando o preço subindo de $0,03 para $0,20 por milhão de tokens de entrada à medida que o tamanho do prompt cresce
Três degraus ascendentes mostrando o preço subindo de $0,03 para $0,20 por milhão de tokens de entrada à medida que o tamanho do prompt cresce

Então o marketing junta "modelo de visão mais barato" com "contexto de 1M" e deixa você supor que consegue os dois ao mesmo tempo. Não consegue. O contexto de 1M e o preço de $0,03 são mutuamente exclusivos. Qualquer coisa que realmente precise de uma janela longa cai na faixa mais alta, a 6,7 vezes a tarifa que você orçou, seja uma base de código grande, um vídeo ou uma pilha de documentos.

Nada disso é teórico. A OpenRouter publica o que seus clientes pagam depois do cache como uma média móvel de 30 dias, e para esse modelo é $0,044 na entrada e $0,149 na saída com taxa de acerto de cache de 51,0%. Essa média ficar acima do preço de tabela só é possível se uma parcela significativa do tráfego real já estiver pagando as faixas de 32K e 256K. O desconto do cache também não te salva.

Coloque seus próprios números aqui.

Calculadora de faixa de contexto
O que 10M de tokens de entrada + 2M de saída por mês realmente custam
Escolha o tamanho típico de prompt para sua carga de trabalho.
$0,56 / mês
$0,03 na entrada, $0,13 na saída. Essa é a tarifa em toda manchete sobre esse modelo, e só vale para prompts curtos.
$1,80 / mês
$0,10 na entrada, $0,40 na saída. Um único documento longo ou um histórico de chat modesto já te coloca aqui. Isso é 3,2 vezes a conta da manchete.
$3,60 / mês
$0,20 na entrada, $0,80 na saída. É isso que o contexto de 1M anunciado custa: 6,4 vezes a conta total, no mesmo volume de tokens.

Vale a pena conhecer algumas peculiaridades regionais antes de escolher um endpoint. No mesmo modelo, Singapura custa cerca de 22% a mais que Pequim, Frankfurt e Tóquio. A busca web só funciona em Pequim e Singapura. A inferência em lote só funciona em Pequim, e o fine-tuning não está disponível em lugar nenhum.

Como ele se compara ao resto do nível econômico

Mesmo considerando as faixas, o preço continua sendo a história principal. Este é o cenário atual de modelos econômicos com capacidade de visão, com todos os números tirados das próprias páginas de preços de cada fornecedor. Lançamentos com preço de fronteira como o Kimi K3 ficam fora deste escopo.

ModeloEntrada $/1MSaída $/1MContextoVisãoLançamento
Qwen 3.7 Flash$0,03$0,131MTexto, imagem, vídeo27 jul 2026
Mistral Small 4$0,15$0,60256KTexto, imagem16 mar 2026
GPT-5.6 Luna$0,20$1,201,05MTexto, imagem9 jul 2026
Gemini 3.1 Flash-Lite$0,25$1,50Não publicadoTexto, imagemNão publicado
Gemini 3.5 Flash-Lite$0,30$2,501.048.576Texto, imagem, vídeo21 jul 2026
Claude Haiku 4.5$1,00$5,00200KTexto, imagem15 out 2025
Gemini 3.6 Flash$1,50$7,501.048.576Texto, imagem, vídeo21 jul 2026

Algumas coisas chamam atenção. A Qwen é uma ordem de grandeza mais barata aqui, 5x abaixo do Mistral Small 4 e 10x abaixo do Gemini 3.5 Flash-Lite na entrada. Também é o único modelo do grupo que aceita vídeo a uma tarifa de entrada abaixo de $0,10, enquanto o GPT-5.6 Luna e o Mistral Small 4 são apenas para imagem.

Há uma armadilha a evitar se você comparar por conta própria. O Gemini 3.1 Flash-Lite ainda é mais barato que o 3.5 Flash-Lite, a $0,25/$1,50 contra $0,30/$2,50. Mais novo não é automaticamente mais barato na linha do Google, onde o Gemini 3.6 Flash fica na ponta superior. E o GPT-5.6 Luna cortou seu preço em 80% em 30 de julho de 2026, um dia antes de eu escrever isso, o que o torna um concorrente bem mais próximo do que era há uma semana.

O modelo que ele realmente derrota, no entanto, é seu próprio antecessor. Frente ao Qwen 3.6-Flash a $0,1875/$1,125, o novo nível base é 6,25x mais barato na entrada e 8,65x mais barato na saída. A Alibaba acabou de cortar seu próprio piso de preço em visão em uma ordem de grandeza em um único lançamento, seja o que for verdade sobre o resto deste lançamento.

"Flash" aqui significa barato, não rápido

É aqui que o nome engana. Flash significa baixa latência na linha do Google. Aqui significa preço baixo. São produtos bem diferentes.

A OpenRouter mede o único provedor em 59 tokens de saída por segundo no P50, com 1,20s de tempo até o primeiro token. A Artificial Analysis mede o Gemini 3.5 Flash-Lite em 382 tokens por segundo e o GPT-5.4 mini em 177. São bancos de teste e condições diferentes, então trate essa proporção com cautela. Ainda assim, uma diferença de 6x é grande demais para ser ruído de medição, e o raciocínio vindo ativado por padrão puxa esse número ainda mais para baixo.

Há um dado dissonante. Um desenvolvedor que testou o modelo em uma ferramenta de codificação relatou uma taxa de transferência bem melhor do que a telemetria da OpenRouter mostra:

"Qwen 3.7 flash is already available in Command Code. Cheap tiered pricing, super fast 150 TPS. // Capabilities include. 💬 Text input ✓ 👁️ Vision ✓ 🧠 Reasoning ✓ Testing it out. It's gonna be a fun competitor to DeepSeek V4 Flash."

Os 150 TPS dele são cerca de 2,5x o P50 medido pela OpenRouter, e prompts curtos com um cache aquecido podem chegar lá. Eu ainda planejaria com base em 59, não em 150, porque é o tráfego de produção que a OpenRouter está amostrando.

A cauda é a parte que me tiraria o sono. A latência ponta a ponta é de 3,56s no P50 e 8,54s no P75, o que é tranquilo. Depois vai para 17,96s no P90, 29,03s no P95, e 90,19s no P99.

Gráfico de barras horizontal mostrando a latência ponta a ponta subindo de 3,6 segundos no P50 para 90,2 segundos no P99
Gráfico de barras horizontal mostrando a latência ponta a ponta subindo de 3,6 segundos no P50 para 90,2 segundos no P99

Para um trabalho em lote, essa cauda é invisível. Para qualquer coisa que uma pessoa esteja esperando, uma em cada cem requisições demorando um minuto e meio deixa de ser uma métrica e vira uma decisão de produto. E isso se acumula dentro de um loop de agente de IA, onde uma única chamada de ferramenta lenta trava cada etapa atrás dela.

Mais dois números do mesmo painel. A taxa de erro em chamadas de ferramenta é de 8,88%, contra 6,45% do Plus, o que significa que cerca de uma em onze chamadas de ferramenta falha em um modelo explicitamente vendido para trabalho de agente. E exatamente um provedor o serve. Sem roteamento de contingência, portanto, se a Alibaba Cloud tiver uma tarde ruim.

Também há um pequeno conflito de documentação que não consegui resolver. A ficha do modelo da Alibaba lista saídas estruturadas como suportadas. A lista de parâmetros da OpenRouter não expõe a flag de saídas estruturadas para o Flash, apenas response_format, mesmo expondo para Plus e Max. Se o cumprimento estrito de esquema importa para seu pipeline, teste antes de se comprometer em vez de confiar em nenhuma das duas páginas.

O único benchmark independente que existe

A Qwen não publicou nada, então fui atrás de alguém que realmente tivesse pontuado o modelo. Existe exatamente um.

A Artificial Analysis não lista esse modelo. A página do modelo retorna 404, e um grep no sitemap do site confirma que as únicas páginas Qwen 3.7 são Max e Plus. O LMArena também não tem entrada para o Flash. Nenhum índice de inteligência das fontes de costume, então, nenhum Elo, e nenhuma pontuação de qualidade publicada de nenhum tipo.

As avaliações de visão da Roboflow são a exceção, e não são lisonjeiras:

TarefaPontuaçãoPosição
Geral61,7%#22 de 23
Identificação84,4%#10 de 23
Transcrição OCR84,1%#23 de 23
Extração de dados78,4%Sem classificação
Detecção de objetos42,8% mAP@50#16 de 23
Contagem de objetos46% correspondência exataSem classificação
Custo por amostra~$0,0001#1 de 23

Ele fica em 22º de 23 no geral, com 61,7%, logo atrás do GPT-5.4 mini com 63,5%, e primeiro de 23 em custo. Para ser justo: o resultado de OCR é o último lugar em um grupo bem equilibrado e não é uma falha, já que 84,1% de correspondência média é respeitável em termos absolutos. E a Qwen nunca afirmou OCR ou controle de GUI como pontos fortes do Flash. Isso pertence ao Plus. Então "último em OCR" é consistente com o que a Alibaba disse, e não uma promessa quebrada.

Mas isso deixa claro o que você está comprando. Identificação é o forte dele, com 84,4%; localização é o fraco, com 42,8%. Ele consegue dizer o que há na imagem muito melhor do que consegue dizer onde está. Se sua carga de trabalho é "etiquetar dez milhões de imagens por categoria", isso encaixa perfeitamente a um décimo de centavo por mil amostras. Se é "ler esta fatura e extrair os itens", busque outra coisa.

O que a comunidade diz, e por que há tão pouco

Essa é a coisa mais estranha sobre o lançamento, e acho que é a mais reveladora.

Um modelo de visão a $0,03 por milhão de tokens foi lançado há quatro dias e não há um único comentário sobre ele no Hacker News. Uma busca de texto completo no HN por qwen3.7-flash retorna zero resultados em artigos e comentários, em todo o histórico. Nenhuma thread de lançamento jamais foi enviada. A única matéria com título Qwen nesse período, "Qwen 3.7 or 3.8 30B – 100B. QWhen?", não gerou nenhum comentário.

Fica melhor ainda. A conversa viva do HN sobre a Qwen na semana do lançamento estava acontecendo dentro de uma thread do DeepSeek, onde as pessoas perguntavam se a Qwen algum dia lançaria visão, quatro dias depois de a Qwen ter lançado um modelo de visão.

Hacker News

"You have to remember DeepSeek v4 flash even though a bit cheaper, does not have vision abilities, which is a big draw for agentic tasks."

Hacker News

"Most interesting part IMO is whatever Qwen open weight will include image / video capabilities since its where they are strongest."

Esse segundo comentário aponta direto para o motivo. O público que costumava acompanhar os lançamentos da Qwen é a turma dos pesos locais, e a Qwen parou de atendê-los. O mesmo ponto surgiu em uma thread sobre o GLM 5.2:

Hacker News

"That's because Qwen's flagship models are not, in fact, open weight. Qwen3.7 Max, Qwen3.7 Plus and others are closed weight."

O Flash também é fechado. O Hugging Face retorna um array vazio para ele, e a Roboflow lista a licença como proprietária. Alguém ainda tinha esperança do contrário no dia do lançamento:

"Qwen3.7 Flash vient de faire son apparition sur OpenRouteur, il y a une petite chance que Qwen3.7 soit bientôt dispo pour de l'IA locale !"

Isso se traduz numa esperança de que o Qwen 3.7 logo estivesse disponível para IA local. Não vai estar.

Devo ser direto sobre o que esta seção é. Nenhuma dessas citações é sobre o Flash, porque tais citações ainda não existem. Elas são sobre a família 3.7 e o vazio que o Flash foi criado para preencher. Os veredictos sobre a família vão em ambas as direções, de um comentarista do HN que relata um mês de uso diário e chama o 3.7 Pro de "totalmente inutilizável", até o chewz, que classifica o 3.7 Max acima do nível do Opus em velocidade. Uma frase daquela thread ficou comigo, dado que a Qwen não publicou benchmark nenhum para o Flash:

Hacker News

"Another thing I experience with the Qwen models is that I do not trust their benchmark scores at all."

Há uma certa simetria em lançar um modelo sem nenhuma pontuação de benchmark para um público que já tinha parado de acreditar nelas.

Enquanto isso, as pessoas estão usando o modelo em silêncio. O painel de atividade da OpenRouter mostra o Hermes Agent como o maior consumidor, à frente do Claude Code e de um punhado de ferramentas de codificação. O uso é real; o discurso simplesmente nunca aconteceu.

Quem realmente deveria usá-lo

Minha opinião, sem rodeios.

Recorra a ele se você faz trabalho de visão de alto volume e baixo risco, onde errar ocasionalmente sai barato e ser caro é fatal. Etiquetagem em massa de imagens. Classificação de conteúdo em primeira passagem, triagem de miniaturas, "há uma pessoa neste quadro", pré-filtragem antes de um modelo melhor fazer a passagem cuidadosa. A cerca de um centésimo de centavo por amostra, isso muda o que vale a pena economicamente processar, e isso é um baita diferencial.

Evite se você precisa de OCR ou extração de documentos, localização precisa de objetos, latência previsível, pesos que você possa hospedar, ou qualquer sinal de qualidade publicado para mostrar a um stakeholder. Evite também se seus prompts costumam ser longos, porque nesse ponto o GPT-5.6 Luna, depois do corte de preço de 80%, começa a parecer razoável, assim como o Gemini 3.5 Flash-Lite. Os dois também são bem mais rápidos.

Se você quer especificamente a família Qwen mas precisa de mais capacidade, o Qwen 3.8 Max é a outra ponta da faixa, e nosso panorama de alternativas ao Qwen cobre o resto.

O fator decisivo é se uma resposta errada custa algo para você. Essa é uma questão de produto, não de benchmark, e é a pergunta que eu resolveria antes de escrever qualquer código de integração.

Se isso vai chegar perto de uma fila de suporte, leia isto primeiro

Aqui eu tenho que ser direto, porque essa é a parte em que eu realmente tenho cicatriz.

Eu construo integrações na eesel, e passamos anos rodando IA em filas de suporte reais, ao longo de milhares de tickets de verdade. O mal-entendido mais caro que vejo é exatamente o que a tabela de preços deste post incentiva: achar que o modelo é o produto. Um modelo de $0,03 faz parecer que construir seu próprio bot de suporte é quase de graça. A conta de custo por ticket também fica ótima numa planilha. Mas o modelo nunca foi a parte cara.

As partes caras são a recuperação de informação sobre uma central de ajuda que se contradiz, a classificação de tickets que roteia para o lugar certo, e saber quando ficar quieto. O escalonamento que não deixa o cliente na mão. Uma forma de descobrir que você está errado antes que o cliente descubra. Nada disso vem no preço do token. Aprendemos isso da forma mais difícil, vendo bots de fala confiante darem respostas erradas com toda a confiança, e é por isso que hoje todo lançamento que fazemos é simulado contra tickets históricos antes de tocar uma fila real.

Não vou fingir que ninguém consegue fazer o caminho de construir por conta própria funcionar. Parte da nossa própria evasão de clientes é exatamente isso: clientes que saíram para construir direto sobre uma API de LLM, incluindo uma empresa de RA/tecnologia de construção e uma marca de beleza DTC. É uma opção real, e às vezes é a certa. Mas as equipes que olharam mais de perto para isso, em geral, foram parar em outro lugar. Um líder de engenharia numa empresa de hardware de caixas eletrônicos de Bitcoin, gerenciando uma base de conhecimento de 300 artigos entre Confluence e Telegram, colocou assim:

"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."

E o que realmente decide se a IA de suporte funciona é a contenção, algo que nenhuma pontuação de modelo captura. Um líder de CX numa marca que lida com 7.000 tickets por mês colocou isso melhor do que qualquer benchmark conseguiria:

"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer, then the point is a little bit gone. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

Agora meça o Qwen 3.7 Flash contra esse padrão. Uma taxa de erro em chamadas de ferramenta de 8,88%, um P99 que se estende a 90 segundos, e nenhuma pontuação de qualidade publicada, além de nenhuma avaliação independente exceto a que o classifica em 22º de 23. Esses são números perfeitamente aceitáveis para etiquetar um milhão de imagens. Não são os números que eu gostaria de ter entre minha marca e um cliente irritado. O guia de desvio de tickets e nossas notas sobre taxa de resolução de IA aprofundam por que o limiar de confiança importa mais que o modelo cru.

Se ainda assim você quiser seguir o caminho de construir por conta própria, eu começaria com RAG versus fine-tuning, depois leria sobre treinamento de IA na base de conhecimento. Depois, dedique tempo de verdade a prevenir alucinações. Nenhum desses problemas fica mais barato quando os tokens ficam.

Experimente a eesel

Se o que você realmente queria de um modelo de $0,03 era automação de suporte mais barata, você pode pular a etapa de montagem. A eesel se conecta ao helpdesk que você já usa e aprende com seus tickets passados e sua central de ajuda, depois responde às perguntas das quais está confiante, deixando o resto em paz.

A parte que vale a pena copiar independentemente do que você construir: antes de qualquer coisa ir ao ar, você roda o modelo contra seu histórico real de tickets e recebe um relatório pontuado do que ele teria respondido. É assim que você descobre que um modelo está errado antes que um cliente descubra primeiro. É a verificação que nenhum preço de token pode comprar para você.

O painel de relatórios da eesel mostrando volume de tarefas, eventos de gatilho por tipo, e uso de aprovação ou rejeição por ferramenta
O painel de relatórios da eesel mostrando volume de tarefas, eventos de gatilho por tipo, e uso de aprovação ou rejeição por ferramenta

Você pode experimentar a eesel de graça, ou agendar uma demonstração se preferir ver o modelo rodando primeiro contra a sua própria fila.

Perguntas frequentes

Quanto custa o Qwen 3.7 Flash?
Começa em $0,03 por 1M de tokens de entrada e $0,13 por 1M de tokens de saída, mas apenas para prompts com menos de 32K tokens. Acima de 32K, passa para $0,10/$0,40, e acima de 256K passa para $0,20/$0,80. A média móvel de 30 dias da própria OpenRouter sobre o que os clientes realmente pagam é de $0,044 na entrada e $0,149 na saída, acima do preço de tabela. Para contexto sobre o resto da família, veja nosso detalhamento dos preços da Qwen.
O Qwen 3.7 Flash é bom para OCR?
As avaliações de visão da Roboflow o colocam em último entre 23 modelos em transcrição de OCR, embora com 84,1% de correspondência média em um grupo bastante equilibrado. A Qwen nunca afirmou que o OCR era um ponto forte do Flash, então isso é consistente, não uma promessa quebrada. Se a tarefa é leitura de documentos, este não é o modelo a escolher.
Os pesos do Qwen 3.7 Flash são de código aberto?
Não. O Hugging Face não retorna nenhum repositório para ele e a Roboflow lista a licença como proprietária, então é apenas via API. Toda a linha 3.7 da Qwen tem pesos fechados, uma mudança em relação à reputação anterior da empresa. Se você precisa de pesos que possa hospedar, nosso panorama dos melhores agentes de IA de código aberto é um ponto de partida melhor.
Qwen 3.7 Flash vs. Gemini 3.5 Flash-Lite: qual é mais rápido?
O Gemini, por larga margem. A Artificial Analysis mede o Flash-Lite em 382 tokens de saída por segundo, enquanto a OpenRouter mede o Qwen 3.7 Flash em 59. A Qwen vence com folga em preço e perde com folga em velocidade. Os números completos estão em nosso artigo sobre os preços do Gemini 3.5 Flash-Lite.
Posso usar o Qwen 3.7 Flash para atendimento ao cliente?
Você pode chamá-lo, mas um modelo puro não é um agente de suporte. Você ainda precisa de recuperação de informações sobre sua central de ajuda, regras de escalonamento e uma forma de testar antes de colocar no ar. Nosso guia para escolher um LLM para suporte cobre as trocas envolvidas, e a prevenção de alucinações cobre a parte que realmente machuca.
O que acontece se o Qwen 3.7 Flash sair do ar?
Exatamente um provedor o serve, então não há roteamento de contingência. A OpenRouter reporta 99,99% de tempo ativo em três dias, uma janela curta para um modelo tão novo. Sua latência ponta a ponta P99 de 90,2 segundos é o risco prático maior, especialmente dentro de um loop de agente, onde uma chamada de ferramenta lenta trava tudo o que vem depois. Veja gestão de escalonamento de IA para saber como lidar com esse caminho de falha.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Ilustração de duas pessoas analisando cartões de preços escalonados em uma tela, com o logotipo do Qwen
Trending

Preços do Qwen 3.7 Flash: o que você realmente paga em 2026

A tarifa de $0.03 é real, e é apenas um dos quatro medidores da sua fatura. Veja como o degrau de prompt, o cache, a região de batch e a taxa de retentativas se combinam no número que você realmente paga.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 31, 2026
Ilustração de painéis de imagem, vídeo e documentos alimentando um modelo de visão e linguagem, com o logotipo da Qwen
Trending

Qwen 3.7 Flash: especificações, preços e o que ele realmente faz

O Qwen 3.7 Flash foi lançado sem post no blog, sem benchmarks e sem pesos. Aqui está a folha de especificações completa, os preços em faixas e o que a Qwen nunca afirmou.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
Ilustração editorial de um modelo de linguagem grande raciocinando sobre um longo fluxo de documentos
Trending

Análise do Kimi K3: o modelo de fronteira aberto da Moonshot, testado

Uma análise prática do Kimi K3: a arquitetura do modelo aberto de 2,8T, os benchmarks, os preços reais e o que a comunidade realmente pensa na semana de lançamento.

Alicia Kirana UtomoAlicia Kirana UtomoJul 21, 2026
Ilustração do Inkling, o modelo de IA de pesos abertos da Thinking Machines Lab em análise
Trending

Análise do Inkling: o modelo aberto da Thinking Machines vale a pena?

Uma análise honesta do Inkling: no que o primeiro modelo de pesos abertos da Thinking Machines Lab é realmente bom, onde o preço e os benchmarks decepcionam, e quem deveria realmente usá-lo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Uma bancada de desenvolvedor onde um modelo de IA termina uma tarefa com perfeição e trava na tarefa ao lado, na cor azul da marca da Meta
Trending

Meta Muse Spark 1.1 em análise: um teto alto e um piso baixo

Muse Spark 1.1 é o modelo mais rápido do painel e um dos piores em tarefas agênticas. Uma análise sobre em quais trabalhos esses tokens baratos realmente valem a pena.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
Ilustração de um chip de modelo compacto a encaminhar um token por dois caminhos de especialistas iluminados entre muitos apagados, para uma explicação do Inkling-Small
Trending

Inkling-Small explicado: um modelo de 276B com 12B fazendo o trabalho

O que Inkling-Small realmente é: um MoE de pesos abertos de 276B/12B da Thinking Machines, a janela de contexto em que a documentação e os provedores discordam, o que um milhão de tokens realmente custa, e onde ele se encaixa em uma stack de suporte.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustração a comparar um núcleo de modelo pequeno e ordenado com outro muito maior e emaranhado, para uma análise do Inkling-Small
Trending

Análise do Inkling-Small: um quarto do tamanho, e quase tão inteligente

Uma análise prática do Inkling-Small: ele supera o próprio modelo pai de 975B em código com um quarto do tamanho e um quarto do preço, e depois despenca na factualidade. Eis o que essa troca realmente custa.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Illustration of a developer at a laptop watching an agentic coding loop run through code, checks and a bot
Trending

Análise do Claude Opus 5: programação quase de ponta pela metade do preço

Uma análise prática do Claude Opus 5: o que os benchmarks realmente mostram, a taxa de alucinação que subiu, e se ele tem lugar numa fila de suporte em produção.

Alicia Kirana UtomoAlicia Kirana UtomoJul 27, 2026
Banner principal da análise do Gemini 3.5 Pro em azul Google
Trending

Análise do Gemini 3.5 Pro: o estado honesto do carro-chefe do Google

Uma análise honesta do Gemini 3.5 Pro: ele ainda não foi lançado. Veja o que o Google confirmou, por que está atrasado, os benchmarks que realmente existem e o que usar hoje.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 21, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis