Preços do Qwen 3.7 Flash: o que você realmente paga em 2026

Kurnia Kharisma Agung Samiadjie
Escrito por

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Revisado por

Katelin Teen

Última edição July 31, 2026

Verificado por especialista
Ilustração de duas pessoas analisando cartões de preços escalonados em uma tela, com o logotipo do Qwen

A tabela de preços, e os quatro medidores por trás dela

Aqui está o preço publicado, na íntegra, tal como ele realmente se aplica.

Tamanho do promptEntrada / 1MSaída / 1MLeitura de cache / 1MEscrita de cache / 1M
Abaixo de 32K tokens$0.03$0.13$0.006$0.038
32K a 256K$0.10$0.40$0.02$0.125
256K a 1M$0.20$0.80$0.04$0.25

Essas tarifas vêm da API de modelos da OpenRouter, o mesmo feed do qual se alimenta a página do modelo Qwen3.7 Flash. O cartão de modelo no Alibaba Cloud Model Studio exibe a mesma estrutura de três degraus em CNY.

Quatro coisas movem o número que é cobrado de você, e apenas uma delas está nessa tabela.

Quatro medidores identificados como degrau de tamanho do prompt, acertos e erros de cache, batch ou não, e retentativas, todos alimentando uma única fatura
Quatro medidores identificados como degrau de tamanho do prompt, acertos e erros de cache, batch ou não, e retentativas, todos alimentando uma única fatura

Insira sua própria carga de trabalho nos quatro:

O restante deste post é sobre o que cada uma dessas quatro entradas realmente faz.

Medidor 1: o degrau de tamanho do prompt, e como os loops de agentes vão deslizando para dentro dele

O preço é escalonado pelo tamanho do prompt, não por quantos tokens você compra em um mês. Uma chamada com 32,001 tokens de prompt é cobrada a $0.10 por milhão em cada um deles, não só nos que passam do limite. Ao cruzar 256K, toda a requisição é reprecificada de novo a $0.20.

Isso faz do degrau mais alto 6.7x a tarifa de entrada anunciada e 6.2x a tarifa de saída anunciada. Também significa que os dois números em toda manchete sobre este modelo, "modelo de visão mais barato" e "1M de contexto", não podem ser verdadeiros ao mesmo tempo na mesma chamada. Meu colega Rama detalhou essa troca no review do Qwen 3.7 Flash; a versão de ficha técnica está na visão geral do Qwen 3.7 Flash.

O que é menos óbvio é como se chega lá sem querer. Os loops de agentes deslizam entre degraus por conta própria:

  • Um prompt de sistema com esquemas de ferramentas geralmente já tem de 3K a 8K tokens antes de o usuário dizer qualquer coisa.
  • Os documentos recuperados se somam a isso. Quatro artigos da central de ajuda de 2K cada são outros 8K.
  • Cada turno reenvia toda a conversa, então o turno 1 pode ter 12K e o turno 6 já tem 40K.

O turno 1 é cobrado a $0.03. O turno 6 é cobrado a $0.10, retroativamente sobre todo o prompt. Nada mudou no seu código. É o mesmo tipo de problema que escolher um modelo pela tarifa anunciada em outros contextos, e é por isso que Opus 5 vs. Sonnet 5 acaba sendo uma discussão sobre custo por tarefa concluída em vez de custo por token.

A prova de que isso está acontecendo com usuários reais está na própria página do fornecedor. A OpenRouter publica uma média ponderada móvel de 30 dias do que os clientes pagam depois do caching, e para este modelo é de $0.044 na entrada e $0.149 na saída com taxa de acerto de cache de 51.0%. O preço efetivo está acima do preço de tabela, o que só é aritmeticamente possível se uma parcela relevante do tráfego estiver pagando os degraus superiores.

Se você está comparando modelos pelas tabelas de preços, a mesma armadilha existe em outros lugares, com outra roupagem. Os preços do GPT-5.6 dobram a entrada e adicionam 50% à saída acima de 272K tokens, e os preços do Claude cobram um prêmio pelas escritas de cache. Só o Qwen3.7 Max mantém preço fixo em toda a janela, e isso custa 49x mais por token de entrada.

Medidor 2: caching, onde escrever no cache custa mais do que não usar cache

Este é o medidor em que as pessoas erram mais o cálculo, e vale a pena fazer as contas uma vez.

O Qwen 3.7 Flash expõe dois tipos de cache. O caching implícito lê a 20% da tarifa de entrada padrão e não custa nada para criar. O caching explícito é dividido: você paga uma tarifa de criação e depois uma tarifa de leitura muito menor. Na listagem em USD da OpenRouter, o cache explícito de cinco minutos é criado a $0.038 e lido a $0.003, contra uma tarifa de entrada padrão de $0.03.

Leia de novo. Escrever uma entrada de cache custa 1.27x o que teria custado apenas enviar os tokens.

Dois caminhos após escrever um cache: ler de novo dentro de cinco minutos e pagar $0.003, ou deixá-lo expirar sem ser lido e pagar 1.27x
Dois caminhos após escrever um cache: ler de novo dentro de cinco minutos e pagar $0.003, ou deixá-lo expirar sem ser lido e pagar 1.27x

A conta vira a seu favor rápido. Escreva uma vez e leia uma vez, e você gastou $0.041 por milhão contra $0.060 sem cache, então o cache já está se pagando. Cada leitura depois disso é quase gratuita. A coisa toda só dá errado em um caso específico: o cache expira antes de alguém lê-lo, e você pagou um prêmio de 27% por nada.

O que é exatamente a forma de uma fila de suporte. Os tickets não chegam em uma rajada concentrada contra o mesmo contexto, eles entram aos poucos ao longo do dia. Um tempo de vida de cinco minutos é generoso para uma sessão de chat e inútil para uma caixa de entrada. A taxa de acerto de cache de 51% que a OpenRouter mede em todo o tráfego deste modelo é uma suposição de planejamento razoável, não os 90% que você obtém em um script de benchmark.

Duas regras práticas surgem disso. Use o caching implícito por padrão, já que não tem custo de criação e ainda lê a 20%. Reserve o caching explícito para prefixos em que você tem confiança de que serão atingidos repetidamente dentro da janela, como um prompt de sistema longo em um endpoint de alto throughput. Se você está construindo retrieval por cima, a troca RAG vs. LLM também importa aqui, porque um contexto recuperado menor é ao mesmo tempo mais barato por chamada e menos propenso a te empurrar para o próximo degrau.

Medidor 3: o desconto de batch existe em exatamente uma região

O próprio cartão de modelo da Alibaba precifica este modelo em CNY, em quatro tabelas regionais separadas, e as diferenças não são cosméticas.

Item de cobrança (por 1M, degrau base)PequimSingapuraFrankfurtTóquio
Entrada0.2 CNY0.225 CNY0.2 CNY0.2 CNY
Saída0.8 CNY0.974 CNY0.8 CNY0.8 CNY
Leitura de cache implícita0.04 CNY0.045 CNY0.04 CNY0.04 CNY
Entrada (Batch File)0.1 CNY
Saída (Batch File)0.4 CNY

Três descobertas nessa tabela.

Os preços do Batch File reduzem ambos os medidores à metade, e isso só existe em Pequim. O Batch Inference está marcado como Não suportado nas grades de capacidade de Singapura, Frankfurt e Tóquio, então o desconto de 50% que todo outro fornecedor oferece globalmente é, aqui, uma função de onde você implanta. Observe também a armadilha dentro da armadilha: as linhas de Batch Chat têm preço de 0.2 e 0.8, idêntico ao padrão. Só o caminho de batch baseado em arquivo recebe o desconto.

Singapura custa mais pelo mesmo modelo. A entrada fica 12.5% acima da tarifa base e a saída cerca de 22% acima. Nada na grade de capacidade explica isso; é simplesmente uma lista de preços diferente.

A busca na web também é restrita por região, suportada em Pequim e Singapura e não suportada em Frankfurt e Tóquio. Isso é uma questão de recurso, não de preço, até você precisar acoplar uma API de busca separada e pagar por ela duas vezes.

Quatro cartões de região mostrando Pequim com busca na web e desconto de batch, Singapura apenas com busca na web, e Frankfurt e Tóquio sem nenhum dos dois
Quatro cartões de região mostrando Pequim com busca na web e desconto de batch, Singapura apenas com busca na web, e Frankfurt e Tóquio sem nenhum dos dois

Mais uma coisa sobre moeda. O cartão de modelo exibe CNY em cada aba e não mostra nenhum valor em USD em lugar nenhum; as taxas em dólar que todos citam vêm da listagem de revenda da OpenRouter. São duas vitrines para um único esquema de preços, não uma contradição a resolver, e converter entre elas vai te dar um número que não corresponde a nenhuma das duas faturas. Precifique de acordo com a vitrine pela qual você realmente compra. Qualquer pessoa comparando entre fornecedores vai enfrentar o mesmo problema, que é parte do motivo pelo qual a comparação OpenAI vs. Anthropic vs. Gemini é mais difícil do que ler três páginas de preços.

Medidor 4: retentativas, a linha que ninguém orça

A OpenRouter mede uma taxa de erro de chamadas de ferramenta de 8.88% para este modelo, contra 6.45% no Qwen3.7 Plus. Em um loop de agente, uma chamada de ferramenta que falha não é gratuita. Você pagou pelo prompt que a produziu, e vai pagar de novo pela retentativa que inclui a falha em seu contexto, com um tamanho de prompt levemente maior.

Nove por cento não é catastrófico, mas pertence ao modelo, e é por isso que a calculadora acima o adiciona como multiplicador em vez de deixá-lo como nota de rodapé.

A cauda de latência conta a mesma história em tempo em vez de dinheiro. O P50 de ponta a ponta é de confortáveis 3.56 segundos. O P99 é de 90.19 segundos. Se seu timeout está abaixo disso, você está cancelando e reemitindo aproximadamente uma em cada cem chamadas, e pagando pelas duas. E como exatamente um fornecedor atende este modelo, não há rota alternativa para a qual migrar quando ele fica lento.

"Flash" é uma promessa sobre preço, não sobre velocidade. A 59 tokens de saída por segundo, este modelo tem aproximadamente um sexto da velocidade do Gemini 3.5 Flash-Lite, o que é uma consideração real se algo estiver esperando a resposta. Também é, curiosamente, cerca de cinco vezes mais rápido que seu próprio irmão Plus.

Como ele se compara ao resto do nível barato com visão

Todo número abaixo vem da própria página de preços do fornecedor, no nível síncrono padrão.

ModeloEntrada $/1MSaída $/1MContextoVisãoA pegadinha na tabela de preços
Qwen 3.7 Flash$0.03$0.131MTexto, imagem, vídeoTrês degraus; batch só em Pequim
Mistral Small 4$0.15$0.60256KTexto, imagemFixo, mas a menor janela aqui
GPT-5.6 Luna$0.20$1.201.05MTexto, imagem2x na entrada acima de 272K; batch reduz à metade
Gemini 3.1 Flash-Lite$0.25$1.50Não publicadoTexto, imagemMais barato que o mais novo 3.5 Flash-Lite
Gemini 3.5 Flash-Lite$0.30$2.501,048,576Texto, imagem, vídeoArmazenamento de cache cobrado por hora
Claude Haiku 4.5$1.00$5.00200KTexto, imagemEscritas de cache a 1.25x a entrada
Gemini 3.6 Flash$1.50$7.501,048,576Texto, imagem, vídeoPrecificado 5x acima do nível Lite

O Qwen vence a linha do topo por uma ordem de magnitude, e é o único modelo aqui que aceita entrada de vídeo por menos de $0.10. Mas a comparação é mais próxima do que os números brutos sugerem depois que você aplica os descontos próprios de cada fornecedor. Os preços da Mistral são fixos, então o que você vê é o que você paga. O modo batch reduz à metade ambos os níveis do Google no mundo todo, sem restrição regional, como detalha o resumo de preços do Gemini 3.5 Flash-Lite.

E o GPT-5.6 cortou o preço do Luna em 80% em 30 de julho de 2026, o que reorganizou esta tabela dias antes de eu escrever isto. O mapa completo de níveis está no post de preços do GPT-5.6, e o topo da faixa do Google está em preços do Gemini 3.6 Flash.

Duas linhas merecem atenção. Mais novo não significa mais barato dentro da própria linha do Google, onde o 3.1 Flash-Lite ainda fica abaixo do 3.5. E pesos abertos não significam barato, o que os preços do Kimi K3 demonstram com $3 na entrada e $15 na saída. Se pesos abertos são o que você busca aqui, note que o Qwen 3.7 é fechado, e o compilado de melhores agentes de IA de código aberto é o melhor ponto de partida.

Dentro da família Qwen, a escada de preços é íngreme:

ModeloEntrada $/1MSaída $/1MSobretaxa de contexto longoModalidade
Qwen3.7 Flash$0.03$0.13Sim, a 32K e 256KTexto, imagem, vídeo
Qwen3.7 Plus$0.32$1.28Sim, a 256KTexto, imagem
Qwen3.7 Max$1.475$4.425Nenhuma publicadaSomente texto

O Flash é 10.7x mais barato na entrada que o Plus e 49x mais barato que o Max, e é o único dos três que aceita vídeo. O Max, o carro-chefe, não tem visão alguma. Um contexto mais amplo sobre a linha está no detalhamento de preços do Qwen, e o nível de preview mais recente está em preços do Qwen3.8-Max.

Se nenhum dos três encaixar, alternativas ao Qwen cobre o que mais está na disputa, e a visão geral da família Qwen é a versão simples e direta dessa escada.

O que a comunidade está dizendo, que é quase nada

Vale dizer claramente, porque isso muda o quanto o preço por si só deveria pesar: não há dados independentes de custo-benefício sobre este modelo. Ele não está listado na Artificial Analysis, não tem entrada no LMArena, e a Qwen não publicou nenhum benchmark com ele. Uma busca no Hacker News pelo nome do modelo retorna zero resultados entre posts e comentários, de todos os tempos.

O mais próximo de uma explicação veio de uma thread não relacionada na mesma semana:

Hacker News

"Qwen/Alibaba pararam de fazer lançamentos de pesos abertos por um tempo. Sem rancor ou nada assim, eu certamente não vou olhar os dentes de um cavalo dado, mas tanto a DeepSeek quanto a Moonshot têm sido muito consistentes com pesos abertos, além de compartilhar pesquisa realmente detalhada."

A comunidade que normalmente testa a fundo um lançamento da Qwen parou de prestar atenção quando a linha passou a ser de pesos fechados, então um lançamento apenas via API chegou sem ninguém para fazer benchmark. Na mesma thread, outro comentarista observou que o modelo barato rival "não tem capacidades de visão, o que é um grande atrativo para tarefas agênticas" — que é exatamente o discurso de venda deste modelo, escrito por alguém que não sabia que ele havia sido lançado quatro dias antes.

Na prática: você pode confiar no preço, porque o fornecedor o publicou. Ainda não pode confiar em nenhuma afirmação de ninguém sobre o que você recebe por ele. Reserve orçamento para sua própria avaliação antes de comprometer uma carga de trabalho, do jeito que faria com qualquer modelo na conversa sobre os melhores agentes de IA.

O que isso realmente custa em uma fila de suporte

Aqui é onde preciso sair da tabela de preços, porque essa é a pergunta com que a maioria das pessoas chega.

Execute a calculadora em uma carga de trabalho de suporte plausível: 200,000 conversas por mês, 12K tokens de prompt cada uma vez que você inclui um prompt de sistema e alguns artigos recuperados, 700 tokens de saída, metade com acerto de cache, com o adicional de retentativas ativado. Isso dá cerca de $67 por mês — abaixo da estimativa de referência, porque o cache está fazendo seu trabalho em um tamanho de prompt que nunca sai do degrau base. É um número pequeno o suficiente para parecer um erro de arredondamento, e é o número que faz construir a sua própria solução parecer obviamente correto.

Na eesel, vemos essa decisão se repetir regularmente, e o padrão é consistente. De uma revisão interna de churn, vários clientes técnicos — incluindo uma empresa de tecnologia de construção com RA e uma marca de beleza DTC — saíram para construir diretamente sobre uma API de LLM. O que empurra as equipes na outra direção é o que os tokens não cobrem. Do lado de quem compra, um líder de engenharia de uma empresa de hardware de caixas eletrônicos de Bitcoin, que roda uma base de conhecimento no Confluence e Telegram com mais de 300 artigos, colocou assim:

"Poderíamos tentar escrever nossa própria aplicação de LLM, mas não queríamos investir nosso tempo nisso. Queríamos algo que não precisássemos manter."

A manutenção é o custo real. Uma chamada bruta a um modelo não tem ideia de qual dos seus artigos da central de ajuda está atualizado, nenhuma regra sobre quando transferir para um humano, nenhuma forma de se testar contra o seu histórico antes de responder a um cliente real. Errar nisso é mais caro do que qualquer degrau de tokens: já vimos um bot com tom confiante dar respostas erradas silenciosamente, por isso todo rollout da eesel é simulado contra tickets históricos antes de tocar em uma conversa real.

Se você quer o número honesto e completo em vez da linha da API, o detalhamento de custo do atendimento ao cliente com IA e a comparação de custo por resolução são pontos de partida melhores do que qualquer tabela por token, e custo de IA vs. agente humano enquadra o número que o financeiro realmente pergunta.

O trabalho de engenharia que uma tarifa de $0.03 não compra, mais ou menos na ordem em que ele te morde:

Nada disso é um argumento contra modelos baratos. É um argumento para saber qual fatura você está realmente lendo. Um modelo tão barato é um ótimo componente e um produto fraco, e a diferença entre os dois é exatamente o que define agente de IA vs. chatbot tradicional.

Experimente a eesel

Se você chegou aqui fazendo contas sobre se um modelo de $0.03 consegue sustentar sua fila de suporte, a resposta honesta é que os tokens nunca foram a parte difícil. A eesel é a versão desse projeto que você não precisa construir: ela se conecta ao Zendesk, Freshdesk, Gorgias ou à sua caixa de entrada em poucos minutos, lê a central de ajuda e os tickets anteriores que você já tem, e responde só o que tem certeza, escalando todo o resto.

A parte que mais importa para quem já se decepcionou com uma demo: você pode simulá-la contra milhares dos seus próprios tickets históricos antes de um único cliente vê-la, então você conhece a taxa de resolução e o custo por ticket de antemão, em vez de descobrir os dois em produção. Grátis para testar, sem precisar reconstruir nada.

O painel de helpdesk da eesel AI, mostrando a atividade de IA em uma fila de suporte real
O painel de helpdesk da eesel AI, mostrando a atividade de IA em uma fila de suporte real

A versão resumida

Os preços do Qwen 3.7 Flash são reais e são a tarifa de visão mais barata disponível, desde que seus prompts fiquem abaixo de 32K, você implante em Pequim, seu cache realmente seja lido, e seu agente não faça muitas retentativas. Mude qualquer um desses pontos e o número se move, em um caso em até 6.7x.

Modele antes de migrar. E se a carga de trabalho do outro lado da conta é uma fila de suporte, precifique o sistema inteiro, não os tokens: o melhor LLM para suporte costuma ser aquele que você não precisa manter.

Fontes

Perguntas frequentes

Quanto custa o Qwen 3.7 Flash por 1M de tokens?
O Qwen 3.7 Flash custa a partir de $0.03 por 1M de tokens de entrada e $0.13 por 1M de tokens de saída, e essa tarifa só vale para prompts com menos de 32K tokens. De 32K a 256K são $0.10/$0.40, e de 256K a 1M são $0.20/$0.80. A tabela de preços completa da família está no nosso detalhamento de preços do Qwen.
Por que minha fatura do Qwen 3.7 Flash é maior que o preço anunciado?
Quase sempre porque seus prompts cruzaram um degrau. A média móvel de 30 dias da OpenRouter sobre o que os clientes realmente pagam é de $0.044 na entrada e $0.149 na saída, acima do preço de referência de $0.03/$0.13, com taxa de acerto de cache de 51.0%. Prompts de sistema longos, documentos recuperados e conversas de agentes que crescem empurram tudo para além do limite de 32K. A mecânica é explicada na análise do Qwen 3.7 Flash.
O Qwen 3.7 Flash é mais barato que o Gemini 3.5 Flash-Lite?
No preço de tabela, sim, em 10x na entrada: $0.03 contra $0.30 por 1M. A diferença diminui quando se considera o nível de batch do Google, que reduz o Flash-Lite à metade para $0.15, e o throughput, no qual o Flash-Lite é várias vezes mais rápido por token. Os números estão no nosso post de preços do Gemini 3.5 Flash-Lite.
O Qwen 3.7 Flash tem um nível gratuito?
Não há cota gratuita específica do modelo publicada. O cartão do Model Studio não traz nenhuma cota gratuita para ele, e a linha "100 milhões de tokens gratuitos" no rodapé do site da Alibaba é uma promoção para novos usuários em todo o site, não um benefício específico do Qwen 3.7 Flash. Trate-o como uma API paga desde a primeira chamada.
Como os preços do Qwen 3.7 Flash se comparam com Plus e Max?
O Flash é 10.7x mais barato na entrada que o Qwen3.7 Plus ($0.32/$1.28) e 49x mais barato que o Qwen3.7 Max ($1.475/$4.425). Tanto Flash quanto Plus têm sobretaxas de contexto longo; o Max é o único com preço fixo em toda a janela de 1M. Para o novo carro-chefe, veja preços do Qwen3.8-Max.
O Qwen 3.7 Flash é barato o suficiente para rodar uma fila de suporte?
Os tokens são baratos; o sistema em torno deles é o custo real. Uma implantação de suporte precisa de retrieval sobre sua central de ajuda, regras de escalonamento, testes contra tickets anteriores e alguém para mantê-la funcionando. Nosso guia para escolher um LLM para suporte e o detalhamento do custo do atendimento ao cliente com IA colocam a linha de tokens em contexto.
O Qwen 3.7 Flash oferece desconto por batch?
Sim, mas apenas em uma região e apenas em um modo. Os preços do Batch File em Pequim reduzem entrada e saída à metade, para 0.1 e 0.4 CNY por 1M no degrau base. O Batch Chat é cobrado à tarifa padrão, e o Batch Inference está marcado como não suportado em Singapura, Frankfurt e Tóquio.
Em qual moeda o Qwen 3.7 Flash é precificado?
O cartão de modelo da Alibaba Cloud precifica apenas em CNY, nas quatro regiões. Os valores em USD que a maioria cita vêm da listagem de revenda da OpenRouter. Ambos descrevem a mesma estrutura de três degraus, então use o storefront pelo qual você realmente compra, em vez de converter entre eles.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Ilustração de painéis de imagem, vídeo e documentos alimentando um modelo de visão e linguagem, com o logotipo da Qwen
Trending

Qwen 3.7 Flash: especificações, preços e o que ele realmente faz

O Qwen 3.7 Flash foi lançado sem post no blog, sem benchmarks e sem pesos. Aqui está a folha de especificações completa, os preços em faixas e o que a Qwen nunca afirmou.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
Banner de capa das alternativas ao PromptQL sobre um fundo índigo
Trending

As 8 melhores alternativas ao PromptQL em 2026

As 8 melhores alternativas ao PromptQL em 2026, do Databricks Genie ao projeto open source Wren AI, com preços reais, pontos fortes e para quem cada uma realmente serve.

Rama Adi NugrahaRama Adi NugrahaJul 10, 2026
Banner de capa o que é PromptQL com o logotipo do PromptQL sobre um fundo índigo
Trending

O que é PromptQL? O agente de dados de IA da Hasura, explicado

O que é PromptQL? Uma explicação clara do agente de dados de IA da Hasura: a ideia de planejar e depois executar, com o que ele se conecta, quanto custa e para quem é indicado.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 10, 2026
Banner principal da análise do PromptQL com o logo do PromptQL sobre um fundo índigo
Trending

Análise do PromptQL (2026): o agente de dados da Hasura, testado

Uma análise prática do PromptQL: como o agente de dados da Hasura separa planejamento de execução, quanto custa e se a promessa de confiabilidade se sustenta.

Alicia Kirana UtomoAlicia Kirana UtomoJul 10, 2026
Ilustração do detalhamento de preços do PromptQL
Trending

Preço do PromptQL: quanto custa de verdade em 2026

Um detalhamento do preço do PromptQL: a unidade cobrável OLU, a tarifa promocional de US$ 0,14, créditos gratuitos, o multiplicador de modelo que realmente define sua fatura e exemplos reais de custo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 10, 2026
Ilustração de um cronômetro que se eleva revelando uma pista livre, representando um limite de uso removido
Trending

A OpenAI removeu o limite de 5 horas do Codex: o que realmente mudou

A OpenAI removeu temporariamente o limite de uso de 5 horas no Codex e no ChatGPT Work. Veja o que mudou em 12 de julho, o que permaneceu e o que isso significa para você.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Ilustração editorial de um ranking de benchmarks com uma barra alta em destaque, representando o ZCode e o modelo GLM-5.2
Trending

ZCode: o que a nova agente de codificação de IA da Z.ai realmente é

Uma análise prática do ZCode, o aplicativo de codificação agêntica gratuito da equipe GLM: o modelo GLM-5.2 por trás dele, as reclamações reais da semana de lançamento e quem deveria usá-lo.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Banner ilustrado para um guia sobre os preços e custos de API do Google Gemini 3.5 Pro
Trending

Preços do Gemini 3.5 Pro: quanto custa (e o que ainda falta)

Uma resposta direta sobre os preços do Gemini 3.5 Pro: ele ainda não está disponível. Veja quanto custa o nível Pro atual, os planos para consumidores e a conta real da API.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 21, 2026
Ilustração editorial de um modelo de linguagem grande raciocinando sobre um longo fluxo de documentos
Trending

Análise do Kimi K3: o modelo de fronteira aberto da Moonshot, testado

Uma análise prática do Kimi K3: a arquitetura do modelo aberto de 2,8T, os benchmarks, os preços reais e o que a comunidade realmente pensa na semana de lançamento.

Alicia Kirana UtomoAlicia Kirana UtomoJul 21, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis