Análise do DeepSeek V4 Flash: um modelo, duas personalidades

Riellvriany Indriawan
Escrito por

Riellvriany Indriawan

Katelin Teen
Revisado por

Katelin Teen

Última edição August 6, 2026

Verificado por especialista
Um avaliador olhando para um cartão de veredito com dois seletores de esforço rotulados como baixo e máximo, ao lado da baleia da DeepSeek

O que você realmente está comprando

O produto inteiro cabe em uma linha de uma página de documentação. Dois modelos, uma tabela de especificações, três preços. Refrescantemente honesto, comparado com a maioria das páginas de lançamento.

A página Models and Pricing da DeepSeek mostrando os dois modelos V4 lado a lado com taxas de acerto de cache, falha de cache e saída, conforme reproduzido de DeepSeek
A página Models and Pricing da DeepSeek mostrando os dois modelos V4 lado a lado com taxas de acerto de cache, falha de cache e saída, conforme reproduzido de DeepSeek

A versão por trás do alias é DeepSeek-V4-Flash-0731, que se tornou pública em 31/07/2026 como um re-pós-treinamento do lançamento de abril. Arquiteturalmente, é uma mistura esparsa de especialistas: 284B de parâmetros totais, dos quais 13B ficam ativos em qualquer token dado. Os pesos são licenciados sob MIT e têm cerca de 167GB. Se você conhece a geração anterior do DeepSeek V3.2, este é um animal diferente em trabalho agêntico.

Especificaçãodeepseek-v4-flashdeepseek-v4-pro
Entrada, acerto de cache (por 1M)$0,0028$0,003625
Entrada, falha de cache (por 1M)$0,14$0,435
Saída (por 1M)$0,28$0,87
Janela de contexto1M1M
Saída máxima384K384K
Modo de raciocínioSem pensar e pensando, pensar por padrãoSem pensar e pensando, pensar por padrão
Chamadas de ferramentas / saída JSONSim / SimSim / Sim
Responses APISimNão, início de agosto de 2026
Limite de concorrência2500500

Cada número ali vem da própria tabela de preços da DeepSeek. Dois detalhes são fáceis de deixar passar e valem uma pausa. O modo de raciocínio é o padrão em ambos os níveis, e tokens de raciocínio são cobrados na tarifa de saída. E o Flash, não o Pro, é o único modelo que suporta a Responses API, o que é inusual: o nível econômico recebe a interface mais nova.

O problema da análise: você está avaliando uma configuração

Aqui está a descoberta que reformulou todo este texto para mim. A Artificial Analysis não lista um único DeepSeek V4 Flash. Ela lista dois, porque os mesmos pesos se comportam como dois produtos diferentes dependendo do reasoning_effort.

Um arquivo de pesos, dois modelos diferentes: a execução sem pensamento pontua índice 29 a 107 tokens por segundo, a execução de esforço máximo pontua 50 sem velocidade publicada
Um arquivo de pesos, dois modelos diferentes: a execução sem pensamento pontua índice 29 a 107 tokens por segundo, a execução de esforço máximo pontua 50 sem velocidade publicada

Execute-o com o pensamento desligado e você obtém um Índice de Inteligência de 29, a uma mediana de 107 tokens de saída por segundo, 1,18s até o primeiro fragmento e 5,86s de ponta a ponta. Agora execute-o em esforço máximo. O índice sobe para 50, e a Artificial Analysis não publica nenhum número de velocidade para essa variante. Tokens de saída por segundo, em branco. Tempo até o primeiro token, em branco. Tempo total de resposta, em branco, com o painel de resumo admitindo "Desconhecido em 4 de 4 unidades para Velocidade".

Então o modelo no topo dos gráficos de valor é um modelo para o qual ninguém publicou uma cifra de latência. Não é um escândalo, apenas uma lacuna de medição. Mas significa que um plano construído sobre "barato e rápido" está apoiado em dois números que nunca foram medidos na mesma execução.

Duas peculiaridades menores agravam isso. A própria tabela de mapeamento de esforço da DeepSeek atende uma solicitação xhigh no Flash como se fosse high, então um botão que você pensa ter girado não faz nada. E no Pro, uma solicitação low é atendida como high, o que significa que não existe execução barata do Pro, e isso é boa parte da razão pela qual a comparação entre Flash e Pro sai como sai.

Se você está configurando isso por conta própria, as armadilhas estão todas no lado discreto da API, e eu as documentei separadamente em como usar a API. Resumindo: quase toda configuração incorreta retorna HTTP 200 e simplesmente ignora você.

Os dois placares não concordam, e ambos estão certos

É aqui que a maioria das análises escolhe o número mais favorável e segue adiante. A postura honesta é que o índice automatizado e o painel de votos humanos contam histórias diferentes sobre o mesmo modelo.

Dois painéis, dois veredictos, mesmo modelo: pontuação do índice automatizado 50 na posição 21, elo dos votos humanos 1436 na posição 79 em 48.667 votos
Dois painéis, dois veredictos, mesmo modelo: pontuação do índice automatizado 50 na posição 21, elo dos votos humanos 1436 na posição 79 em 48.667 votos

Na Artificial Analysis, a execução do Flash em esforço máximo pontua 50 e ocupa a 21ª posição entre 260 linhas de modelos, 3ª de 101 na sua própria classe de tamanho, e 1ª de 101 em preço com acerto de cache. O custo por tarefa é de $0,03, e executar o índice completo custou $72,02.

No placar de texto da LMArena, o mesmo modelo está em 79º, com um Elo de 1436 mais ou menos 4, em 48.667 votos. A linha -high-preview é quase igual, com 1438. E o V4 Pro, o modelo que o Flash supera no índice automatizado, fica acima dele aqui, com 1458. A preferência humana e o agregado de benchmarks realmente se separam neste caso.

Um ponto positivo nos dados humanos, com uma ressalva: no placar do WebDev, o deepseek-v4-flash-high está em 8º com 1577. Essa linha carrega a etiqueta Preliminary da LMArena sobre 1.319 votos com um intervalo de mais ou menos 18, então é mais um sinal promissor do que um resultado consolidado.

Minha leitura sobre isso: o índice automatizado mede uma execução configurada ao máximo em tarefas que recompensam o uso de ferramentas, enquanto a arena mede como uma resposta parece para uma pessoa sentada em uma caixa de chat. O Flash foi construído para a primeira coisa. Então compre-o para a primeira coisa.

No que ele é realmente bom

Os comprovantes aqui são a parte mais convincente de toda a reação, porque são faturas, não opiniões. É aqui que o enquadramento agêntico se justifica.

Hacker News

"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:

Cost: $4.55USD
API requests: 3,467
Tokens: 323,183,886 And as an engineer who leads a small team, I have very high standards for quality, and these carry across to my personal projects where I use deepseek. It has not disappointed at all for coding or review tasks. For everything else, use another model."

Note a última linha, porque é a frase mais útil do fórum. Os usuários mais intensivos não estão afirmando ter um modelo de fronteira genérico, estão afirmando ter um cavalo de batalha muito bom e muito barato para um conjunto específico de tarefas. Alguém logo apareceu com uma conta maior e a mesma conclusão, com 2,1 bilhões de tokens em 12 dias por $19,27.

Usuários de estruturas de agentes relatam o mesmo padrão:

Hacker News

"Essentially I'm running everything on flash now inside pi. With the correct set of MCP servers, context reducer tooling and skills it can implement any task I throw at it. Some sessions take 30+ turns, but it's fast and cheap; all this in an hour, with ~$0.5 cost. [...] I haven't used our slow opus subscription for weeks."

A explicação mais interessante sobre por que o nível barato vence nesse tipo de trabalho veio de uma equipe que teve que descobrir isso na prática:

Hacker News

"DeepSeek V4 Flash is the most cost effective model we've tested. We had to really understand why it outperformed DeepSeek V4 Pro (although even on unreliable model cards, Flash was very close to Pro). Pro is slower and smarter in one-shot reasoning problems, but less effective with tools and therefore less performant in long horizon agentic tasks (especially with custom tools it was not trained on)."

Isso se aplica igualmente bem ao caso de uso de resumir e revisar. Um usuário relatou quatro dólares em dois meses de trabalho de revisão e resumo, "sem queda dramática de desempenho em relação a outros modelos dos EUA". Para trabalhos em lote que antes eram muito caros para automatizar, o preço realmente muda o que vale a pena construir, que é o mesmo argumento que faço sobre os custos de suporte com IA em outro domínio.

Você deveria usá-lo para esse trabalho?

Escolha sua tarefa
O V4 Flash é a escolha certa?
Sim, esse é o ponto ideal
Prefixos repetidos acertam o cache a $0,0028 por milhão, e há gente executando centenas de milhões de tokens por poucos dólares. A verbosidade não prejudica muito quando a saída é curta.
Execute com esforço baixo e meça antes de aumentar o pensamento.
Sim, com supervisão
Ele lidera as linhas de benchmarks agênticos e usuários relatam sessões de 30 turnos por cerca de cinquenta centavos. A queixa recorrente é o trabalho de longo horizonte em bases de código grandes, então divida as tarefas em partes pequenas, dê a ele tipos e testes, e comece sessões novas.
Esforço máximo, e reserve orçamento para tokens de raciocínio cobrados como saída.
Não, combine-o com outra coisa
Nenhuma entrada de imagem é documentada em nenhum lugar da tabela de preços ou na configuração. As equipes conectam um segundo modelo para visão e mantêm o Flash para trabalho de texto e ferramentas.
Direcione pelo tipo de entrada, não pela preferência de modelo.
Não por conta própria
Uma taxa de alucinação de 84% e termos de API que silenciam sobre o uso para treinamento são dois motivos separados para mantê-lo atrás de ancoragem, um limite de confiança e um humano. O modelo é a parte barata dessa pilha.
Simule primeiro com seus próprios tickets passados, depois direcione uma parte.

Onde ele falha

Uma análise que só lista pontos fortes é um comunicado de imprensa. As queixas abaixo são específicas e se repetem em vários fóruns, e algumas delas são todo o motivo pelo qual eu não colocaria esse modelo diante de um cliente.

Ele alucina, e o número publicado é feio. A Artificial Analysis coloca a taxa de alucinação AA-Omniscience em 84%, e sua própria nota diz que a melhoria geracional veio de "menos alucinações, em vez de maior precisão". Isso é uma melhoria de 12 pontos sobre um número que começou pior. Usuários descrevem a mesma coisa sem a métrica:

Hacker News

"DeepSeek V4 hallucinates like crazy and often forgets explicitly mentioned parts of the context. I guess compressing tokens and cherry-picking attention comes at a cost."

Para ser justo, o usuário mais intensivo do fórum calibrou isso em relação a seus pares em vez de tratá-lo como desqualificante, dizendo que ele alucina "mais ou menos o mesmo que os modelos Codex e todos os outros LLMs" e que revisa tudo o que ele escreve e faz outros modelos verificarem o trabalho cruzado. Essa é a postura correta, e também é um custo real que nunca aparece na tabela de preços.

O trabalho de longo horizonte em uma base de código grande é o ponto fraco, o que é desconfortável dado o discurso agêntico do fornecedor.

Hacker News

"If you believe the benchmarks Deepseek v4 is pretty shitty at long running work in large codebases, but really really good at self contained algorithmic/math reasoning - which is basically ideal for a compiler for a language with a relatively complex type system. And with its cache pricing it's very cheap."

É um modelo prolixo, e as palavras são cobradas. A Artificial Analysis aponta isso explicitamente sobre a verbosidade.

Muito prolixo, ainda assim barato: o V4 Flash usou 210M de tokens de saída para executar o Intelligence Index contra uma mediana de classe de 100M, por $72,02 no total
Muito prolixo, ainda assim barato: o V4 Flash usou 210M de tokens de saída para executar o Intelligence Index contra uma mediana de classe de 100M, por $72,02 no total

Ele consumiu 210M de tokens de saída para completar o índice contra uma mediana de classe de 100M, descrito na página do modelo como "muito prolixo em comparação". A execução inteira ainda custou apenas $72,02, que é o ponto principal, mas 2,1 vezes o volume mediano de saída é o mecanismo que silenciosamente separa o preço de tabela da sua fatura. Eu detalho essa diferença corretamente na análise de preços.

Capacidades que simplesmente estão ausentes. Não há entrada de imagem documentada: nenhuma linha de visão na tabela de preços, nenhum codificador de visão na configuração, e o trabalho multimodal da DeepSeek vive em linhas de modelo separadas. As equipes contornam isso, como descreveu um usuário, mantendo um segundo modelo à mão para visão.

Vale a pena corrigir uma afirmação que se espalhou junto com essa, no entanto. O mesmo relatório diz que a DeepSeek "não suporta busca na web", e isso só é verdade no caminho mais antigo de chat-completions. A Responses API, exclusiva do Flash, traz sim uma ferramenta integrada web_search no lado do servidor, junto com apply_patch. Busca de arquivos, interpretador de código, uso de computador e tipos de ferramenta MCP são todos ignorados ali, então o conjunto de capacidades é estreito, mas a busca na web está na lista.

Um caso real de estouro de faturamento está registrado, e vale a pena saber disso antes de apontar um agente para isso:

Hacker News

"I bought it through OpenRouter and used it with Pi agent. The model was good, but there appeared to be a pricing glitch or something, because it burned through $50 in under an hour on pretty trivial stuff. Pi agent claimed it only used like $1. OpenRouter claimed differently and said I used all $50."

A DeepSeek também não publica nenhum limite de requisições por minuto ou tokens por minuto, apenas um teto de concorrência que é a nível de conta, não de chave. Combinado com um saldo pré-pago que pode retornar um 402 no meio de uma execução, isso é mais um problema de monitoramento do que de preço, e um bom argumento para uma configuração de rastreamento adequada.

Uma reclamação de versionamento que vai pegar qualquer um que cite benchmarks. Um usuário colocou bem: na DeepSeek agora é simplesmente deepseek-v4-flash, enquanto a OpenRouter o chama de deepseek/deepseek-v4-flash-0731, então quando um benchmark diz "DeepSeek V4 Flash" você nem sempre consegue saber qual versão foi executada. Fixe o nome datado quando for anotar algo.

Executando os pesos você mesmo

A licença MIT está fazendo um trabalho real aqui, e os relatos locais são a parte mais bem documentada da reação. Isso é genuinamente um modelo de fundação que você pode hospedar, não um LLM somente hospedado.

HardwareVelocidade relatada
DGX Spark duplo60 tokens/s em sessão única, mais de 100 agregados com concorrência 4
Mac Studio M3 Ultra 256GB~30 tokens/s de decodificação em requisição única
Ryzen AI MAX+ 395 (Strix Halo)32 tokens/s a ~2,88 bits por parâmetro
RTX PRO 6000 96GB único170 tokens/s relatados com um motor de plano de 2 bits

Um usuário executando localmente captou bem por que as pessoas se dão ao trabalho, e não é a aritmética:

Hacker News

"2 sparks currently run this model at 60 t/s single session, up to just over 100 t/s aggregate with concurrency of 4. Going local has as opened up a world of use-cases I never would have entertained the idea of on metered/cloud usage. Privacy is a large part of it but, I also no longer think twice about whether to send a prompt or not based on the psychology of it costing money."

Em custo puro, os fóruns estão quase unânimes na direção contrária. Uma estimativa colocou uma máquina Spark dupla entre oito e nove mil dólares e concluiu que "faz pouco ou nenhum sentido enquanto os preços da API forem o que são. Exceto talvez por motivos de privacidade." Outro usuário fez as contas de eletricidade e descobriu que alcançar a tarifa de cache da DeepSeek era mais barato do que executar um modelo de 36B em casa. Então: hospede pelo controle e privacidade, não para economizar dinheiro.

Meu veredito, por tarefa

TarefaVereditoO fator decisivo
Resumo e revisão em massaUseEntrada com acerto de cache a $0,0028 torna trivial um trabalho em lote antes injustificável
Codificação agêntica delimitadaUse, com revisãoLidera as linhas agênticas, e a vantagem de uso de ferramentas sobre o Pro é real
Trabalho de longo horizonte, repositório grandeTenha cuidadoA queixa mais consistente em todos os fóruns
Qualquer coisa visualEviteNenhuma entrada de imagem documentada, então direcione para um segundo modelo
Raciocínio único e memorizaçãoConsidere o ProO Pro ainda vence em memorização e busca de agulha em contexto longo
Respostas voltadas ao clienteNão sem supervisãoTaxa de alucinação de 84%, mais termos de API que silenciam sobre o uso para treinamento

Frente ao restante do campo, três modelos merecem ser comparados a ele. Com aproximadamente a mesma inteligência, o GPT-5.6 Luna custa duas a três vezes mais e é aquele com o qual as pessoas combinam o Flash para visão, detalhado em Flash vs. GPT-5.6. Se a precisão importa mais do que o preço, o Kimi K3 alucina muito menos e custa muito mais.

Para a opção multimodal na mesma faixa de pesos abertos, o Qwen 3.8 Max é o próximo a ler. Há análises práticas de cada um na análise do Qwen e na análise do Kimi.

Mais dois pontos de referência se você estiver traçando um eixo de preços. Os preços do Claude Opus 5 marcam a extremidade de fronteira. Alternativas ao Mistral cobre a família europeia de pesos abertos, e a análise do GPT-5.6 tem o veredito sobre o modelo do qual a maioria das equipes está realmente migrando.

Ele deveria alguma vez responder a um cliente?

Esta é a seção que realmente me importa, porque é o meu trabalho. E a resposta honesta é que o modelo é o lugar errado para procurar.

Comece por onde os tokens vão. Os termos da Open Platform pagos da DeepSeek silenciam sobre o uso para treinamento, o que não é a mesma coisa que ser permissivo nem a mesma coisa que ser seguro. Os termos para consumidores trazem uma cláusula explícita na seção 4.3 com uma opção de exclusão de "Melhorar o modelo para todos"; a seção equivalente no documento da API se interrompe antes disso. Também não há um acordo de processamento de dados publicado nem opção de retenção zero em nenhuma direção, e a política de privacidade declara que os dados são processados e armazenados na República Popular da China sob a lei chinesa. Provedores com retenção zero existem, e um usuário relatou preços de três a cinco vezes o valor direto, o que apaga a maior parte do desconto.

Se algo disso é novo para você, o episódio da política do Slack é o precedente que os leitores já viveram. SOC 2 e GDPR é a lista de verificação a seguir antes de conectar qualquer coisa voltada ao cliente.

Depois há o número de 84%. Toda equipe de suporte com quem falo escuta um número desses e faz a pergunta errada, que é "quão preciso é o seu modelo". Aqui está um cliente nosso que fez a pergunta certa muito melhor do que eu conseguiria. O bot deles estava confirmando com confiança que a empresa suportava modelos de carro que não estavam no banco de dados deles, porque uma linha na base de conhecimento dizia que eles suportavam todos os modelos. O modelo estava bem. A ancoragem não estava.

O resumo da equipe sobre como acertar isso foi "tentativa e erro no início".

Uma equipe de suporte dinamarquesa B2B de telemática veicular no Zendesk, atendendo cerca de 200 tickets por mês e escalando para mais de 2.000, que se preocupava com a IA confirmando com excesso de confiança modelos de carro não suportados.

Essa é toda a lição. A alucinação no suporte geralmente é um problema de ancoragem e permissões vestindo uma fantasia de modelo, e toda solução real vive acima do modelo, não dentro dele.

A pilha que torna um modelo instável administrável não é exótica. Recuperação sobre fontes que você realmente verificou. Barreiras de proteção sobre o que ele tem permissão para afirmar. Uma pontuação de confiança com um limite que alguém escolheu de propósito, e um humano para tudo abaixo dele.

Nossa pior falha observada em produção foi um agente de IA narrando "executando buscas no Zendesk" por cerca de dez turnos sem nunca tocar a API, e depois relatando arquivos salvos que não existiam. Nada destrói a confiança em um colega de equipe mais rápido do que mentir sobre o que fez, e nenhuma pontuação de benchmark teria detectado isso. O que detecta é a medição de contenção depois do fato e a revisão humana antes.

Então, se você está avaliando modelos brutos para uma fila de suporte, a ordem prática é mais ou menos esta. Teste de forma adversarial antes de confiar em qualquer coisa. Construa um hábito de avaliação em vez de uma data de lançamento. Defina limites de confiança deliberadamente.

Depois leia sobre prevenção de alucinações antes de conectar um único ticket, e pergunte a si mesmo com honestidade a questão de construir versus comprar, porque montar toda essa pilha você mesmo é o verdadeiro projeto. O modelo é a parte barata.

Experimente a eesel

Se você chegou aqui a partir de uma planilha comparando tarifas por token para um caso de uso de suporte, o que eu diria a você em um café é que o preço do token nunca foi a parte difícil. Conectar um modelo à sua central de atendimento, ancorá-lo em suas macros reais e tickets passados, e saber o que ele vai dizer antes que um cliente veja, essa é a parte difícil, e isso é o produto.

Isso é o que a eesel é: um agente de suporte com IA que se conecta ao Zendesk ou à sua central de atendimento existente, ancora cada resposta no seu conhecimento verificado, e permite que você execute simulações nos seus tickets históricos para ver exatamente onde ele teria errado antes de entrar no ar. Você acompanha o volume de tarefas, os gatilhos, e cada aprovação ou rejeição por ferramenta, então "ele está alucinando" se torna um número que você pode consultar em vez de uma preocupação.

Visão de Relatórios da eesel AI para um agente Zendesk, mostrando o total de tarefas, eventos de gatilho por tipo, e uso de aprovação ou rejeição por ferramenta
Visão de Relatórios da eesel AI para um agente Zendesk, mostrando o total de tarefas, eventos de gatilho por tipo, e uso de aprovação ou rejeição por ferramenta

O preço é por conversa resolvida em vez de por assento, o que significa que uma implementação gradual é uma opção real: direcione 200 dos seus 1.000 tickets mensais e pague por 200. Há $50 de uso gratuito para começar, sem cartão necessário, e a página de preços tem os números. Execute uma simulação com os tickets do mês passado e você saberá em uma hora se algo disso vale o seu tempo. Esse é um uso muito melhor de uma tarde do que fazer benchmark de uma configuração.

Perguntas frequentes

O DeepSeek V4 Flash é bom?
Para resumos em massa, revisão de código e codificação agêntica em tarefas bem delimitadas, sim, e o custo é difícil de contestar. É mais fraco em trabalhos de longo horizonte em bases de código grandes, não tem entrada de imagem documentada, e sua taxa de alucinação é o número mais alto do seu cartão de pontuação. Minha análise completa está nesta análise do DeepSeek V4 Flash, e a questão dos níveis é abordada em Flash vs. V4 Pro.
Quanto custa o DeepSeek V4 Flash?
A tabela lista $0,14 por milhão de tokens de entrada, $0,0028 em um acerto de cache, e $0,28 de saída. O que aparece na fatura é um número diferente, porque o raciocínio vem ativado por padrão e é cobrado na tarifa de saída. Os detalhes estão na análise de preços, e tokens explica a unidade cobrável.
Por que o DeepSeek V4 Flash pontua melhor que o V4 Pro?
O Flash foi re-pós-treinado em 31/07/2026 e a versão Pro na tabela de preços não foi, então o nível mais barato registra atualmente pontuações agênticas melhores. Eu percorro as nove linhas e as ressalvas em Flash vs. V4 Pro.
O DeepSeek V4 Flash consegue ler imagens?
Nenhuma entrada de imagem é documentada. A tabela de preços não tem linha de visão e a configuração não traz um codificador de visão, então trate-o como apenas texto e combine-o com um modelo multimodal quando precisar de um. Flash vs. GPT-5.6 explica como as equipes dividem esse trabalho.
O DeepSeek V4 Flash é seguro para dados de clientes?
Os termos da API paga silenciam sobre o uso para treinamento em vez de serem permissivos, não há DPA publicado nem opção de retenção zero, e os dados ficam na RPC sob a lei chinesa. Se dados de clientes estiverem envolvidos, leia primeiro SOC 2 e GDPR e trate a mudança de política do Slack como o precedente.
O DeepSeek V4 Flash deveria responder tickets de suporte?
Não sem supervisão. Uma taxa de alucinação de 84% não é um número para direcionar clientes, embora seja administrável com ancoragem e uma pontuação de confiança. Veja como impedir que um agente alucine.
Posso executar o DeepSeek V4 Flash no meu próprio hardware?
Sim, os pesos são licenciados sob MIT e têm cerca de 167GB, e há gente conseguindo de 30 a 60 tokens por segundo em máquinas prosumer. O consenso nos fóruns é que faz mais sentido pela privacidade do que pelo custo. Agentes de IA de código aberto traz a visão mais ampla desse ecossistema.
Quais são as melhores alternativas ao DeepSeek V4 Flash?
Com a mesma inteligência e cerca de duas a três vezes o preço, o GPT-5.6 Luna é a opção mais próxima, e o Kimi K3 é a opção de pesos abertos focada em precisão. Eu os comparo em Flash vs. Kimi K3 e Qwen 3.8 Max vs. Flash.

Share this article

Riellvriany Indriawan

Article by

Riellvriany Indriawan

Riell is a designer and writer at eesel AI with about two years of experience researching CX platforms, AI chatbots, and helpdesk software. She combines her design background with a sharp eye for how these tools actually look and feel in practice — making her comparisons unusually visual and user-focused.

Related Posts

All posts →
Preços do DeepSeek V4 Flash: o que você vai realmente pagar
Trending

Preços do DeepSeek V4 Flash: o que você vai realmente pagar

O DeepSeek V4 Flash é listado a $0.14 de entrada e $0.28 de saída por milhão de tokens. Usuários reais publicaram taxas combinadas abaixo de um centavo. Veja o que decide qual delas te espera.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
DeepSeek V4 Flash: specs, preços e para que serve na prática
Trending

DeepSeek V4 Flash: specs, preços e para que serve na prática

DeepSeek V4 Flash custa $0,14 de entrada e $0,28 de saída por milhão de tokens, e supera o próprio nível caro da DeepSeek. Isto é o que a tabela de preços não conta.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustração de um gato muito longo se esticando ao lado de duas pessoas revisando um cartão de pontuação, com o logo do LongCat
Trending

Análise do LongCat 2.0: um cavalo de batalha com um bloqueio real

Avaliei o LongCat 2.0 em sete pontos que realmente importam para um comprador, usando os próprios documentos da Meituan e os relatos de quem já passou bilhões de tokens por ele. Ele sai bem em seis.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustração de um gato muito longo esticado sobre uma mesa ao lado de um rack de servidores, com o logotipo da LongCat
Trending

LongCat 2.0: por dentro do modelo aberto de 1,6T da Meituan

LongCat 2.0 é o modelo MoE de 1,6T parâmetros da Meituan, sob licença MIT, a 0,30 dólares por milhão de tokens de entrada. Li todas as fontes primárias para ver o que realmente é entregue.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustração editorial de agentes de codificação em paralelo e janelas de terminal, representando o campo de alternativas ao ZCode
Trending

As 8 melhores alternativas ao ZCode em 2026

O ZCode é impressionante e tosco ao mesmo tempo. Aqui estão as 8 melhores alternativas ao ZCode em 2026, com preços reais, trocas honestas e para quem cada uma é indicada.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Ilustração editorial de um ranking de benchmarks com uma barra alta em destaque, representando o ZCode e o modelo GLM-5.2
Trending

ZCode: o que a nova agente de codificação de IA da Z.ai realmente é

Uma análise prática do ZCode, o aplicativo de codificação agêntica gratuito da equipe GLM: o modelo GLM-5.2 por trás dele, as reclamações reais da semana de lançamento e quem deveria usá-lo.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Ilustração do Inkling, o modelo de IA de pesos abertos da Thinking Machines Lab em análise
Trending

Análise do Inkling: o modelo aberto da Thinking Machines vale a pena?

Uma análise honesta do Inkling: no que o primeiro modelo de pesos abertos da Thinking Machines Lab é realmente bom, onde o preço e os benchmarks decepcionam, e quem deveria realmente usá-lo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Ilustração de um chip de modelo compacto a encaminhar um token por dois caminhos de especialistas iluminados entre muitos apagados, para uma explicação do Inkling-Small
Trending

Inkling-Small explicado: um modelo de 276B com 12B fazendo o trabalho

O que Inkling-Small realmente é: um MoE de pesos abertos de 276B/12B da Thinking Machines, a janela de contexto em que a documentação e os provedores discordam, o que um milhão de tokens realmente custa, e onde ele se encaixa em uma stack de suporte.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustração de dois avaliadores pesando painéis de imagens geradas em uma balança, representando uma análise do FLUX 3
Trending

Análise do FLUX 3: evidências fortes, nada para comprar ainda

Uma análise do FLUX 3 sobre a única coisa que realmente dá para avaliar agora: as evidências. A pesquisa se sustenta melhor do que o post de lançamento. O produto ainda não existe.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis