As 9 melhores alternativas ao Gemini 4 Argon que você pode usar de verdade em 2026

Kurnia Kharisma
Escrito por

Kurnia Kharisma

Katelin Teen
Revisado por

Katelin Teen

Última edição October 1, 2026

Verificado por especialista
Ilustração desenhada à mão de três pessoas diante de um portão trancado escolhendo entre caminhos sinuosos com uma bússola, para um guia de alternativas ao Gemini 4 Argon

Por que você precisa de uma alternativa ao Argon agora

Passo muito tempo na eesel olhando o que as pessoas realmente pesquisam, e "alternativas ao Gemini 4 Argon" esta semana é, no fundo, uma pergunta só: o que posso usar no lugar, hoje? É uma pergunta justa, e bem urgente. O Google anunciou o Argon em 30 de setembro e no primeiro dia só o liberou para defensores de segurança cibernética no Fairwind Program. O Google diz que clientes pagos da API e assinantes do Google AI Ultra vêm em seguida. Ainda não disse quando isso vai acontecer.

A página do modelo Gemini 4 Argon no Google DeepMind, retirada do Google DeepMind

Verifiquei de novo antes de escrever isto, só para ter certeza. Às 08:13 UTC de 1º de outubro, gemini-4-argon e gemini-4-argon-preview retornaram 404 NOT_FOUND, e minha chave listava 61 modelos sem nenhum Argon entre eles. O modelo Pro mais novo da lista era gemini-3.1-pro-preview. Então, se você tem um produto para entregar este mês, o Argon ainda não é uma opção, e a preocupação deste desenvolvedor do dia do lançamento continua valendo:

Hacker News

"Hopefully they sort out their infrastructure and model versioning so that we can feel confident building production applications on top of their APIs. The capacity limitations I've experienced with them in the past have been deeply problematic."

Vale ser justo com o Argon, porém, porque é um modelo forte e parte do que ele faz é difícil de substituir. No Artificial Analysis ele pontua 52,6 em esforço alto, mais ou menos no nível do GPT-6 Astra. É o nº 1 no AutomationBench com 77,5%. É o único modelo aqui com um limite de saída de 1M de tokens; o GPT-6.1 Sol para em 128K e o Gemini 3.1 Pro em 65.536. E diz "não sei" com muito mais frequência do que qualquer outro que você possa chamar.

No que o Argon é melhor e o que substitui cada parte

Uma boa alternativa substitui a coisa específica que você queria, não o "Argon" como um todo. Puxei as páginas do Artificial Analysis do Argon e de cada modelo deste post às 08:14 UTC de 1º de outubro, então todas as pontuações, custos e taxas de alucinação abaixo vêm de um único índice, em um único dia.

Gráfico de barras desenhado à mão das taxas de alucinação do AA-Omniscience: Gemini 4 Argon 15% (ainda não na API), Grok 4.7 29%, Claude Sonnet 5.5 47%, GPT-6 Astra 51%, GPT-6.1 Sol 54%, Gemini 3.8 Flash 55%, Claude Opus 5.5 59%, Claude Fable 5.1 73%
Gráfico de barras desenhado à mão das taxas de alucinação do AA-Omniscience: Gemini 4 Argon 15% (ainda não na API), Grok 4.7 29%, Claude Sonnet 5.5 47%, GPT-6 Astra 51%, GPT-6.1 Sol 54%, Gemini 3.8 Flash 55%, Claude Opus 5.5 59%, Claude Fable 5.1 73%

A taxa de alucinação no AA-Omniscience é a parcela de perguntas que um modelo errou respondendo mesmo assim, entre todas as que não acertou. Por isso os números podem parecer um pouco estranhos. O Claude Fable 5.1 tem a maior precisão de todos os modelos aqui (67%) e uma das maiores taxas de alucinação (73%), porque quando não sabe, geralmente chuta. O Argon é o oposto: 50% de precisão, mas recusa a maioria das perguntas que não consegue responder.

Em termos de cada 100 perguntas, fica mais claro. O Argon acerta cerca de 50 e erra cerca de 8. O GPT-6 Astra acerta cerca de 63 e erra cerca de 19. O Grok 4.7 erra cerca de 15, o mais perto do Argon que um modelo disponível chega, mas também acerta menos (cerca de 47).

O que você queria do ArgonNúmero do ArgonO melhor que você pode chamar hoje
Uma pontuação alta a $2/$1052,6 por $1,99 a tarefaGPT-6.1 Sol: 51,8 por $0,72
A maior pontuação, seja qual for o preço52,6 (nº 8 no índice)Claude Opus 5.5: 57,6 por $5,98
Menos respostas inventadas15% de taxa de alucinaçãoGrok 4.7: 29%
Fluxos de trabalho com agentes77,5% no AutomationBenchClaude Sonnet 5.5 max: 71,3%
Documentos longos79,7% em raciocínio de contexto longoKimi K3: 88,7%
Saídas muito longas1M de tokens de saídaNada se iguala ainda
Ficar no GoogleNão está na APIGemini 3.8 Flash ou 3.1 Pro

Essa linha de contexto longo me surpreendeu. A própria tabela do Google abre com a pontuação do Argon no GraphWalks, mas no teste de raciocínio de contexto longo do Artificial Analysis, todos os modelos desta lista, exceto o Grok 4.7, pontuam mais que o Argon. O Kimi K3 lidera com 88,7%.

Como escolhi e testei estas alternativas

Todos os modelos desta lista estão no ar hoje em uma API pública. Escolhi com base em quatro coisas: preço da página de preços de cada fornecedor, pontuação e custo por tarefa do mesmo snapshot do Artificial Analysis, taxa de alucinação e o quanto cada um cobre o motivo específico pelo qual você queria o Argon.

Depois fiz meu próprio teste sobre aquilo pelo qual o Argon é conhecido. Um benchmark de alucinação faz perguntas de curiosidades sem consulta. Um bot de suporte trabalha a partir de uma central de ajuda. Eu queria saber se a vantagem de honestidade do Argon também aparece quando o modelo tem uma base de conhecimento à frente.

A configuração foi uma política curta de reembolso e envio de uma empresa SaaS fictícia, que reaproveitei da estrutura de testes da análise do GPT-6.1 Sol. Fiz 12 perguntas: 4 que a política responde e 8 armadilhas que ela não responde (PayPal, um SLA de uptime, armazenamento de dados na UE, uma linha de telefone, limites de taxa da API, uma integração com o Salesforce, uma data de Black Friday e HIPAA). Rodei cinco modelos que eu conseguia acessar diretamente (GPT-6.1 Sol, GPT-6 Astra, GPT-6 Luna, Gemini 3.8 Flash, Gemini 3.1 Pro Preview) em três modos, 160 chamadas no total:

  • Strict: "Responda apenas a partir da política. Se não estiver coberto, diga isso e passe para uma pessoa."
  • Loose: "Seja o mais útil possível", com a linha "não adivinhe, escale" da própria política mantida.
  • Bare: "Seja o mais útil possível e dê aos clientes uma resposta direta", com a linha "não adivinhe" apagada.
Comparação de antes e depois desenhada à mão: com uma política que diz para não adivinhar, 0 de 40 respostas foram inventadas entre GPT-6.1 Sol, GPT-6 Astra, GPT-6 Luna, Gemini 3.1 Pro e Gemini 3.8 Flash; com a regra removida, GPT-6.1 Sol 0 de 8, GPT-6 Astra 0 de 8, GPT-6 Luna 1 de 8, Gemini 3.1 Pro 1 de 8, Gemini 3.8 Flash 4 de 8
Comparação de antes e depois desenhada à mão: com uma política que diz para não adivinhar, 0 de 40 respostas foram inventadas entre GPT-6.1 Sol, GPT-6 Astra, GPT-6 Luna, Gemini 3.1 Pro e Gemini 3.8 Flash; com a regra removida, GPT-6.1 Sol 0 de 8, GPT-6 Astra 0 de 8, GPT-6 Luna 1 de 8, Gemini 3.1 Pro 1 de 8, Gemini 3.8 Flash 4 de 8

Nos modos strict e loose, todos os modelos inventaram 0 de 40 respostas às armadilhas e acertaram as 4 perguntas cobertas. O modo bare é onde eles se separam. GPT-6.1 Sol e GPT-6 Astra continuaram sem inventar nada. O Luna disse "We haven't announced this year's Black Friday sale start date yet", e o Gemini 3.1 Pro disse "We don't currently offer phone support." O Gemini 3.8 Flash inventou quatro respostas, e uma era do tipo que vai parar em um e-mail jurídico: "our standard services are not certified as HIPAA compliant, and we do not sign Business Associate Agreements (BAAs) under our standard plans." Também inventou um endereço falso, support@acmecloud.com.

Duas ressalvas. Doze perguntas sobre uma política arrumada é um teste bem pequeno e camarada. E não consegui rodar o próprio Argon, o Grok nem os modelos Claude, então ele mostra o efeito da instrução e não um ranking completo. Mesmo assim, o resultado combina com o índice: a regra no seu prompt mudou o resultado muito mais do que a escolha do modelo.

Aqui está o conjunto completo.

ModeloMelhor motivo para escolherPreço da API (entrada / cache / saída por 1M)Pontuação AA / custo por tarefaAlucinaçãoSaída máx.PesosMeu teste (modo bare)
Gemini 4 Argon (referência)Indisponível$2 / $0,10 / $10 promo, depois $4 / $0,20 / $2052,6 / $1,99 (high)15%1MFechadosNão foi possível rodar
GPT-6.1 SolMesmo preço, hoje$2 / $0,10 / $1051,8 / $0,72 (max)54%128KFechados0/8 inventadas
Claude Opus 5.5Maior pontuação$4 / $0,20 / $2057,6 / $5,98 (max)59%-Fechados-
Grok 4.7Menos respostas inventadas$2 / $0,50 / $646,4 / $3,74 (xhigh)29%-Fechados-
GPT-6 AstraMesma pontuação, OpenAI$10 / $1 / $5052,7 / $3,26 (max)51%-Fechados0/8 inventadas
Claude Sonnet 5.5Fluxos com agentes$2 / $0,20 / $1056,0 / $7,62 (max)47%-Fechados-
Claude Fable 5.1Maior precisão$10 / $0,25 / $5053,4 / $7,63 (max)73%128KFechados-
Gemini 3.8 FlashGoogle, plano gratuito$0,75 / $0,075 / $3,7540,9 / $1,24 (high)55%-Fechados4/8 inventadas
Gemini 3.1 Pro PreviewModelo Pro do Google$2 / $0,20 / $1229,7 / $0,6751%65,536Fechados1/8 inventadas
Kimi K3Pesos abertos, documentos longos$3 / $0,30 / $1543,6 / $2,00 (max)53%-Abertos-

Para que você queria o Gemini 4 Argon?

Escolha o motivo mais próximo do seu.

GPT-6.1 Sol. O mesmo cartão de preços de $2 / $0,10 / $10 da promoção do Argon, 51,8 no Artificial Analysis contra os 52,6 do Argon, e $0,72 a tarefa contra $1,99. Está no ar na API hoje.
Claude Opus 5.5 em esforço médio ou máximo. 57,6 em max, cerca de 5 pontos acima do Argon, por $5,98 a tarefa. O esforço médio pontua 51,2 por $1,34, que é o nível do Argon por menos.
Grok 4.7. Uma taxa de alucinação de 29%, a mais baixa de qualquer modelo que você possa chamar, contra os 15% do Argon. Ele também acerta menos respostas, então combine com um prompt rígido de "não adivinhe".
Gemini 3.8 Flash para a maior parte do trabalho, Gemini 3.1 Pro Preview para respostas cuidadosas. O 3.8 Flash pontua 40,9 e tem plano gratuito. O 3.1 Pro pontua 29,7 mas inventou menos respostas no meu teste. Nenhum chega perto do Argon.
Kimi K3. 43,6 no Artificial Analysis e a melhor pontuação de contexto longo que encontrei (88,7%). O DeepSeek V4.1 Flash é mais barato e tem licença MIT, mas tem 96% de taxa de alucinação.
Você não precisa esperar. No meu teste, cinco modelos inventaram 0 de 40 respostas quando o prompt mandava não adivinhar. Escolha pelo custo (GPT-6.1 Sol ou GPT-6 Luna) e ponha o esforço na fundamentação em fontes, nas regras de passagem para humanos e nos testes com tickets do passado.

1. GPT-6.1 Sol: o mesmo cartão de preços, disponível hoje

Melhor para: equipes que queriam o preço de $2/$10 do Argon para um modelo quase de fronteira e também precisam dele em produção este mês.

Página do modelo GPT-6.1 Sol na documentação da API da OpenAI mostrando os preços de $2 de entrada, $0,10 em cache e $10 de saída, retirada da OpenAI

Se você gostava do preço do Argon, esta é a troca mais próxima. O GPT-6.1 Sol foi lançado no DevDay da OpenAI em 29 de setembro, um dia antes do Argon, e sua página do modelo lista $2 de entrada, $0,10 em cache e $10 de saída, o mesmo cartão da promoção do Argon, linha por linha. Tem janela de contexto de 1.050.000 tokens, 128.000 tokens máximos de saída e corte de conhecimento em abril de 2026.

Em pontuação, também chega perto. O Artificial Analysis dá ao 6.1 Sol 51,8 em esforço máximo contra 52,6 do Argon. Onde eles se separam é no custo por tarefa: o 6.1 Sol escreve cerca de 38K tokens de saída por tarefa contra 62K do Argon, então custa $0,72 a tarefa onde o Argon custa $1,99. Quando a promoção do Argon acabar, serão $3,98, mais de cinco vezes mais. Comentaristas do dia do lançamento fizeram a conta bem rápido:

Hacker News

"Sol 6.1 scores one point less than Gemini 4 on intelligence AND costs less than half ($0.72 vs $1.99) per task."

A troca está na honestidade. A taxa de alucinação do 6.1 Sol é de 54% em esforço máximo, contra 15% do Argon. No meu teste isso não apareceu na prática: ele inventou 0 de 8 respostas às armadilhas até no modo bare, e foi o único modelo além do Astra a conseguir isso. A API também tem algumas arestas: o 6.1 Sol não aceita esforço none, e o Chat Completions funciona só sem chamadas de ferramenta, então planeje com a Responses API.

Prós: mesmo preço por token da promoção do Argon; 2,7 vezes mais barato por tarefa; no ar hoje; 0/8 inventadas no meu teste em modo bare.

Contras: cerca de 3,5 vezes a taxa de alucinação do Argon no índice; sem esforço none; limite de saída de 128K.

Preços: $2 de entrada, $0,10 em cache, $10 de saída por 1M de tokens; prompts acima de 272K de entrada são cobrados a tarifas maiores. Detalhamento completo em GPT-6.1 Sol pricing.

Minha opinião: é a escolha padrão. Dá o preço do Argon hoje, a cerca de um terço do custo por tarefa do Argon, e você sempre pode fazer um A/B com o Argon quando o Google abrir a API.

2. Claude Opus 5.5: o teto mais alto

Melhor para: programação difícil, execuções longas de agentes e trabalho especializado em que você queria o Argon pela pontuação.

Página de produto do Claude Opus, retirada da Anthropic

Se o apelo era "o modelo de fronteira do Google", o Claude Opus 5.5 é o modelo de fronteira que você pode chamar. Pontua 57,6 no Artificial Analysis em esforço máximo, cerca de 5 pontos acima do Argon, e está à frente no Terminal-Bench 4.0 lá (59,6% contra 57,1%). Seu cartão de preços também é familiar: $4 de entrada, $0,20 em cache, $20 de saída é exatamente o que o Argon vai custar depois da promoção.

A comparação justa é em esforço médio. O Opus 5.5 medium pontua 51,2 por $1,34 a tarefa, cerca do nível do Argon por menos dinheiro. Um comentarista do HN fez o mesmo ponto com esforço alto:

Hacker News

"It's comparable to Opus 5.5 on "high" (54 vs 53; $1.82 vs $1.99), crushes every model except the most modern OAI/Ant ones, has way lower hallucination than every existing model and probably broader support for multimodal like existing Gemini models."

Essa citação também é o argumento honesto contra o Opus. Sua taxa de alucinação é de 59% em max e 68% em medium, então ele chuta mais que o Argon quando não tem certeza da resposta. Se o seu trabalho é pesquisa aberta, em que ninguém confere a resposta com uma fonte, isso pesa muito.

Prós: maior pontuação aqui; cartão de preços do Argon pós-promoção; programação em terminal forte; contexto de 1M.

Contras: $5,98 a tarefa em max; chuta mais que o Argon; mais um fornecedor para gerenciar.

Preços: $4 de entrada, $0,20 de leitura de cache, $20 de saída por 1M de tokens; o Batch tem 50% de desconto. Mais em Claude Opus 5.5 pricing.

Minha opinião: rode o Opus 5.5 em medium para trabalho no nível do Argon, e guarde o esforço máximo para as tarefas em que os 6 pontos extras se pagam. A análise do Opus 5.5 mostra onde fica essa linha.

3. Grok 4.7: o mais próximo da honestidade do Argon

Melhor para: pesquisa, análise e perguntas e respostas em que uma resposta errada custa mais do que um "não tenho certeza".

Página de anúncio do xAI Grok 4.7, retirada da xAI

Esta não é a escolha óbvia, e é a que eu mais apontaria. O Grok 4.7 tem uma taxa de alucinação de 29% no AA-Omniscience, a mais baixa de qualquer modelo que você pode chamar hoje. O Argon está em 15%, e todo o resto desta lista está em 47% ou mais. Por 100 perguntas, são cerca de 15 respostas erradas para o Grok, contra cerca de 19 do GPT-6 Astra e cerca de 8 do Argon.

Também empata com o Argon em segurança cibernética. Na própria tabela do Google, Argon, Grok 4.7 e GPT-6 Astra empatam em 68% no CWE-bench v1. O preço parece bom no papel: $2 de entrada e $6 de saída por milhão, segundo a página de modelos da xAI, então a saída é 40% mais barata que a promoção do Argon.

Os problemas são reais, porém. A precisão do Grok no mesmo teste é de 47,5%, menor que a do Argon, então ele recusa mais e responde menos. Escreve bastante: em esforço xhigh custa $3,74 a tarefa para uma pontuação de 46,4. E acima de 200K tokens de prompt, a requisição inteira é cobrada a $4/$12, não só o excedente. Um comentário do dia do lançamento apontou um hábito que vale testar:

Hacker News

"What keeps both Gemini and Grok from actually being frontier class AIs is effort. Both AIs rush to give you a response even when the effort is set to the highest setting. Hopefully, Argon isn't as prone to satisficing and premature convergence compared to its predecessor"

Prós: menor taxa de alucinação que você consegue hoje; empata com o Argon no CWE-bench v1; tarifa de saída mais barata; contexto de 500K.

Contras: precisão e pontuação menores que as do Argon; $3,74 a tarefa em xhigh; salto de preço em contexto longo a partir de 200K.

Preços: $2 de entrada, $0,50 em cache, $6 de saída por 1M de tokens abaixo de 200K; $4/$1/$12 acima. Veja Grok 4.7 pricing.

Minha opinião: se os 15% do Argon foram a manchete que te empolgou, o Grok 4.7 é o mais próximo que você vai conseguir este mês. Use onde um "não sei" honesto vale mais que um palpite confiante, e veja a análise do Grok 4.7 para as notas práticas.

4. GPT-6 Astra: o gêmeo do Argon em pontuação

Melhor para: equipes que já estão na OpenAI e querem exatamente o nível de pontuação do Argon, além do modo Ultrafast.

Página do modelo GPT-6 Astra na documentação da API da OpenAI, retirada da OpenAI

O GPT-6 Astra é o modelo com o qual o Artificial Analysis alinhou o Argon: 52,7 para o Astra em esforço máximo, 52,6 para o Argon. Em precisão, o Astra está claramente à frente, 63% contra 50% do Argon. Em alucinação está em 51%, então chuta com mais frequência quando não sabe.

Também é mais eficiente em tokens. O Astra escreve cerca de 27K tokens de saída por tarefa contra 62K do Argon, e é por isso que o Artificial Analysis diz que a vantagem de custo do Argon vem do preço, não de escrever menos. O Astra custa $3,26 a tarefa; o Argon custa $1,99 durante a promoção e $3,98 depois, então pós-promoção, o Astra é o mais barato dos dois. No meu teste, o Astra inventou 0 de 8 respostas às armadilhas no modo bare, empatado com o 6.1 Sol no resultado mais limpo de todos.

Prós: mesma pontuação do Argon; maior precisão; mais barato por tarefa que o Argon pós-promoção; modo Ultrafast disponível agora; 0/8 inventadas no meu teste.

Contras: $10/$50 por milhão; o 6.1 Sol é quase tão bom por cerca de um quinto do custo por tarefa; 51% de alucinação no índice.

Preços: $10 de entrada, $1 em cache, $50 de saída por 1M de tokens; Batch e Flex com 50% de desconto. Veja GPT-6 Astra pricing.

Minha opinião: o Astra faz sentido se você precisa do Ultrafast ou desse último ponto de precisão hoje. Para todos os outros, o GPT-6.1 Sol entrega quase o mesmo resultado por muito menos, e o guia de alternativas ao GPT-6.1 Sol compara o campo mais amplo.

5. Claude Sonnet 5.5: a escolha para fluxos com agentes pelo mesmo preço de tabela

Melhor para: agentes de várias etapas e programação em terminal, em que a liderança do Argon no AutomationBench chamou sua atenção.

Página de produto do Claude Sonnet, retirada da Anthropic

O número independente mais marcante do Argon é o AutomationBench: 77,5% no Artificial Analysis, nº 1. O modelo mais próximo que você pode chamar é o Claude Sonnet 5.5 em esforço máximo, com 71,3%. O Sonnet também supera o Argon no Terminal-Bench 4.0 lá (63,6% contra 57,1%), e seu preço de tabela é o mesmo $2/$10.

Um profissional no LinkedIn descreveu bem a divisão dos benchmarks, citando o número autodeclarado de cada laboratório:

LinkedIn

"On Terminal-Bench 4.0, the one benchmark Google and Anthropic both publish, Argon scores 57.4%. Sonnet 5.5 scores 70.6%. Same price, 13 points apart."

O custo por tarefa é onde você precisa olhar com mais atenção. Em esforço máximo o Sonnet 5.5 pontua 56,0 mas custa $7,62 a tarefa, porque escreve quase 194K tokens de saída por tarefa. Esforço alto é 46,7 por $1,08. E se o seu agente força uma chamada de ferramenta com tool_choice, o Sonnet 5.5 retorna um 400, então verifique isso antes de trocar.

Prós: mesmo preço de tabela de $2/$10 da promoção do Argon; as pontuações mais fortes de AutomationBench e terminal que você pode chamar; a menor alucinação entre os modelos Claude (47% em max).

Contras: $7,62 a tarefa em max; tool_choice forçado retorna erro; contagens grandes de tokens em esforço alto.

Preços: $2 de entrada, $0,20 de leitura de cache, $10 de saída por 1M de tokens; Batch $1/$5. Veja Claude Sonnet 5.5 pricing.

Minha opinião: para trabalho com agentes, o Sonnet 5.5 é o substituto mais forte. Comece em esforço alto e só suba quando o agente continuar falhando nas mesmas etapas; a análise do Sonnet 5.5 tem a conta do esforço.

6. Claude Fable 5.1: o modelo mais preciso, a preço premium

Melhor para: trabalho especializado em que você confere cada resposta de qualquer jeito, e a precisão importa mais que o custo.

Página do Claude Fable na Anthropic, listando o anúncio Introducing Claude Fable 5.1, retirada da Anthropic

O Claude Fable 5.1 é o modelo de disponibilidade geral mais capaz da Anthropic, e pontua 53,4 no Artificial Analysis, um pouco acima do Argon. Tem a maior precisão de qualquer modelo deste post, 67%, e também a melhor pontuação de raciocínio em contexto longo entre os modelos fechados, com 85,3%.

Também tem a maior taxa de alucinação daqui, 73%, que é o espelho do Argon. O Fable acerta mais perguntas, e também responde mais perguntas que não deveria. Isso é aceitável para um advogado ou analista que lê cada linha, e menos aceitável para qualquer coisa que vá direto a um cliente.

Depois vem o preço: $10 de entrada e $50 de saída, com leituras de cache a $0,25. Em esforço máximo são $7,63 a tarefa. Um funcionário do Google no LinkedIn usou exatamente essa diferença para promover o Argon:

LinkedIn

"I've been testing it using our internal AI tool, and the performance is incredible. What stands out more is the cost. 5x cheaper than GPT-6 Astra and Claude Fable 5.1 at current pricing."

Isso é por token no preço promocional. Por tarefa do Artificial Analysis, o Argon é cerca de 3,8 vezes mais barato que o Fable, o que ainda é uma grande diferença.

Prós: maior precisão aqui; raciocínio em contexto longo forte; leituras de cache baratas para um modelo de fronteira; 128K de saída.

Contras: $10/$50 por milhão; taxa de alucinação de 73%; uso forçado de ferramentas retorna um 400.

Preços: $10 de entrada, $0,25 de leitura de cache, $50 de saída por 1M de tokens; Batch $5/$25. Veja Claude Fable 5.1 pricing.

Minha opinião: o Fable é a escolha quando um especialista humano revisa a saída e quer o modelo com mais chance de estar certo. Para qualquer coisa sem supervisão, o Opus 5.5 ou o 6.1 Sol é o gasto mais seguro.

7. Gemini 3.8 Flash: o modelo do Google em que você pode construir de verdade

Melhor para: equipes comprometidas com o Google Cloud ou o AI Studio, protótipos no plano gratuito e trabalho em lote barato.

Página de produto do Google Gemini 3.8 Flash, retirada do Google DeepMind

Se você quer ficar com o Google até o Argon abrir, o Gemini 3.8 Flash é o melhor modelo Gemini na API pelos números do Artificial Analysis, com 40,9 em esforço alto. Isso fica bem atrás dos 52,6 do Argon e à frente dos 29,7 do Gemini 3.1 Pro Preview, que é a parte que confunde as pessoas: o Flash mais novo pontua mais que o Pro mais antigo.

É barato e também tem plano gratuito. A página de preços do Gemini lista $0,75 de entrada e $3,75 de saída até 31 de dezembro de 2026, depois $1,50 e $7,50 a partir de 1º de janeiro de 2027. Melhor orçar pela tarifa de 2027.

Meu teste é o alerta aqui. No modo bare, o Gemini 3.8 Flash inventou 4 de 8 respostas, incluindo a do HIPAA e um endereço de e-mail de suporte que não existe. Com a regra de "não adivinhe" no lugar, não inventou nenhuma. Então é um bom modelo para suporte se você der as regras rígidas, e arriscado se não der. Um comentarista do HN tinha outra preocupação sobre o cache do Google:

Hacker News

"And this pricing is their 'discount pricing'. Add that to AI studio and Vertex's famously terrible caching, it is hard to see this as competitive."

Prós: melhor pontuação Gemini na API hoje; plano gratuito; modelo fechado mais barato aqui; respostas de 2,6s em média no meu teste.

Contras: bem abaixo da pontuação do Argon; o preço dobra em 1º de janeiro de 2027; inventou 4 de 8 respostas sem um prompt rígido.

Preços: $0,75 de entrada, $0,075 de leitura de cache, $3,75 de saída por 1M de tokens até 31 de dezembro de 2026, depois $1,50/$0,15/$7,50. Veja Gemini 3.8 Flash pricing.

Minha opinião: se você planeja migrar para o Argon depois, construir agora no 3.8 Flash mantém você na mesma API e nas mesmas ferramentas. Só escreva a regra de "não adivinhe" no prompt desde o primeiro dia. A análise do Gemini 3.8 Flash cobre o resto.

8. Gemini 3.1 Pro Preview: a opção cuidadosa do Google

Melhor para: equipes na stack do Google que querem menos respostas inventadas que o Flash e aguentam uma pontuação menor.

Página do modelo Gemini 3.1 Pro Preview na documentação da API do Gemini, mostrando um limite de 1.048.576 tokens de entrada e 65.536 de saída, retirada do Google AI for Developers

O Gemini 3.1 Pro Preview é o modelo Pro mais novo que minha chave de API conseguiu acessar, e no papel é o antecessor do Argon. O Artificial Analysis diz que o Argon está +23 pontos à frente dele, o que combina com o snapshot: 29,7 para o 3.1 Pro. Sua página do modelo lista um limite de entrada de 1.048.576 tokens e um limite de saída de 65.536 tokens.

O motivo de estar nesta lista é o comportamento, não a pontuação. Sua taxa de alucinação é de 51%, um pouco melhor que os 55% do 3.8 Flash, e sua precisão é de 55%. No meu teste em modo bare ele inventou 1 de 8 respostas contra 4 do Flash. Também foi minha execução mais lenta e mais cara, com cerca de 6 a 9 segundos e $6 a $10 por 1.000 respostas, porque gasta muitos tokens pensando.

Prós: menos respostas inventadas que o 3.8 Flash no meu teste; contexto de entrada de 1M; Batch pela metade do preço.

Contras: menor pontuação do Artificial Analysis desta lista; ainda é um modelo em preview; lento e pesado em tokens; sobretaxa de contexto longo acima de 200K.

Preços: $2 de entrada, $0,20 em cache, $12 de saída por 1M de tokens até 200K; $4/$0,40/$18 acima; Batch $1/$6; sem plano gratuito. Mais no guia de preços do Gemini.

Minha opinião: eu só escolheria o 3.1 Pro se você está preso ao Google e o trabalho for de respostas cuidadosas e de baixo volume. Para quase todo o resto, o 3.8 Flash ou o modelo de outro laboratório é o melhor gasto até o Argon abrir.

9. Kimi K3: pesos abertos e a melhor pontuação em contexto longo

Melhor para: equipes que precisam hospedar por conta própria, ou que queriam o Argon para documentos muito longos.

Página de produto do Moonshot AI Kimi K3, retirada do Kimi

O Argon é fechado, então se você precisa dos pesos para baixar, a lista fica bem curta. O Kimi K3, da Moonshot AI, publica seus pesos completos no Hugging Face sob uma licença própria e pontua 43,6 no Artificial Analysis em esforço máximo. Também tem a melhor pontuação de raciocínio em contexto longo de qualquer modelo que verifiquei, 88,7%, contra 79,7% do Argon.

Na API hospedada custa $3 de entrada, $0,30 em cache e $15 de saída por milhão, segundo a página de preços do Kimi, então é mais caro que a promoção do Argon por token. Por tarefa são $2,00, mais ou menos o mesmo que o Argon. O raciocínio não pode ser desligado.

A opção aberta mais barata é o DeepSeek V4.1 Flash, com licença MIT, a $0,15/$0,60 por milhão fora do horário de pico e $0,27 a tarefa. Eu o manteria longe de qualquer coisa voltada ao cliente que precise de honestidade no estilo do Argon: sua taxa de alucinação no índice é de 96%.

Prós: os pesos abertos mais fortes desta lista; melhor pontuação de raciocínio em contexto longo daqui; contexto de 1M; entrada de imagem e vídeo.

Contras: licença própria, não MIT nem Apache; a API hospedada custa mais por token que a promoção do Argon; taxa de alucinação de 53%.

Preços: $3 de entrada, $0,30 de acerto de cache, $15 de saída por 1M de tokens. Veja Kimi K3 pricing.

Minha opinião: o Kimi K3 é a escolha para hospedagem própria, e também para trabalho pesado em documentos. Se você só precisa da API hospedada, o 6.1 Sol é mais barato e pontua mais.

Mapa de decisão desenhado à mão: para que você queria o Argon? Mesmo preço de $2/$10 hoje, GPT-6.1 Sol; maior pontuação, Claude Opus 5.5; menos respostas inventadas, Grok 4.7; ficar no Google, Gemini 3.8 Flash; ter os pesos, Kimi K3 ou DeepSeek
Mapa de decisão desenhado à mão: para que você queria o Argon? Mesmo preço de $2/$10 hoje, GPT-6.1 Sol; maior pontuação, Claude Opus 5.5; menos respostas inventadas, Grok 4.7; ficar no Google, Gemini 3.8 Flash; ter os pesos, Kimi K3 ou DeepSeek

Se você queria o Argon para trabalho de segurança

Os primeiros usuários do Argon são as equipes de segurança, então alguns leitores vieram por isso. Os números do próprio Google são bem fortes: 85,8 no seu benchmark de vulnerabilidades do mundo real contra 71,0 do Gemini 3.8 Flash Cyber, e 70,9% contra 58,2% no teste de penetração black-box da Wiz, segundo o post de lançamento.

Página do Fairwind Program do Google DeepMind para defensores de segurança cibernética, retirada do Google DeepMind

Todo laboratório de fronteira está restringindo de forma parecida o seu modelo de segurança mais forte. O Claude Mythos 5.1, da Anthropic, fica atrás do Project Glasswing, e o GPT-5.6-Cyber, da OpenAI, atrás de um programa próprio de acesso confiável. Se você não está em nenhum desses programas, o guia de alternativas ao Codex Security Cloud cobre as ferramentas em que você pode se cadastrar hoje. Entre os modelos gerais acima, GPT-6 Astra e Grok 4.7 empatam com o Argon no CWE-bench v1, então são um ponto de partida razoável.

O que meu teste diz sobre alucinação no suporte

O teste mudou a forma como leio o número de destaque do Argon. Uma taxa de alucinação de 15% é um resultado sem consulta: o modelo responde curiosidades sem nada à frente. Um bot de suporte não é sem consulta. Ele tem sua central de ajuda, suas macros e suas políticas, e suas instruções dizem o que fazer quando isso acaba. Nesse cenário, a instrução fez mais trabalho que o modelo: 0 de 40 respostas inventadas com a regra, até 4 de 8 sem ela.

A eesel também viu a falha do modo bare em filas reais. No início deste ano, alguns clientes pagantes da eesel tinham bots que respondiam a clientes reais com conhecimento geral quando a base de conhecimento voltava vazia, e um respondeu uma pergunta de suporte com "Oxygen". Outra equipe, um grupo de suporte técnico B2B no Zendesk, se preocupava por outro motivo: a central de ajuda deles dizia "we support all models", e o bot confirmava alegremente produtos que não suportavam. Em nenhum dos casos o problema era o modelo. Os dois eram de fundamentação em fontes e de fallback, e é por isso que a primeira coisa que eu verificaria em qualquer bot de suporte é uma regra firme de "diga que não sabe e passe para um humano", testada com tickets do passado antes de entrar no ar.

É também o que os compradores pedem. Um líder de CX com cerca de 7.000 tickets por mês disse à equipe da eesel numa ligação de vendas que a IA deveria pegar apenas tickets de que tem confiança e deixar o resto para humanos. Isso é uma regra de passagem. A honestidade do Argon seria um bom reforço, mas você pode definir a regra hoje, em qualquer modelo. Os guias de prevenção de alucinações de IA e de escalonamento com IA explicam como.

Experimente a eesel

Painel da eesel AI mostrando a atividade de tickets de um helpdesk do Zendesk
Painel da eesel AI mostrando a atividade de tickets de um helpdesk do Zendesk

Se você estava esperando o Argon para deixar seu bot de suporte mais confiável, não precisa esperar. A eesel é um colega de helpdesk com IA que entra na sua fila existente no Zendesk, no Freshdesk ou no Gorgias, aprende com sua central de ajuda e seus tickets do passado, e só responde o que consegue fundamentar. Antes de responder a qualquer pessoa, roda uma simulação no seu histórico de tickets, para você ver quais perguntas ela responde e quais passa para um humano. Quando o Argon abrir, o modelo pode mudar enquanto suas regras continuam as mesmas.

Se você trabalha pelo terminal, a CLI da eesel controla o mesmo colega e o mesmo workspace do painel. Você pode automatizar uma simulação em um lote de tickets antigos, puxar as respostas para sua própria planilha de revisão e também deixar um agente de programação como Claude Code, Codex ou Cursor configurar tudo por você. Experimente a eesel grátis e rode nos seus próprios tickets antes de escolher o modelo.

Perguntas frequentes

Qual é a melhor alternativa ao Gemini 4 Argon agora?
Para a maioria das equipes, o GPT-6.1 Sol. Tem o mesmo preço de lançamento de $2/$10 do Argon, pontua 51,8 contra os 52,6 do Argon no Artificial Analysis e custa $0,72 por tarefa contra $1,99 do Argon. Se você quer uma pontuação maior, escolha o Claude Opus 5.5. Se quer menos respostas inventadas, escolha o Grok 4.7.
Já posso usar o Gemini 4 Argon?
Não, a menos que você esteja no Fairwind Program do Google para defensores de segurança cibernética. Em 1º de outubro de 2026, às 08:13 UTC, a API do Gemini ainda retornava 404 para gemini-4-argon, e ele não estava entre os 61 modelos que minha chave conseguia listar. O Google diz que clientes pagos da API e assinantes do Google AI Ultra são os próximos, sem data. A visão geral do Gemini 4 Argon acompanha o que se sabe.
Qual alternativa ao Gemini 4 Argon alucina menos?
O Grok 4.7. O Artificial Analysis coloca sua taxa de alucinação em 29%, o mais perto que um modelo disponível chega dos 15% do Argon. A maioria dos outros fica entre 47% e 59%, e o Claude Fable 5.1 está em 73%. No meu próprio teste de suporte, porém, nenhum modelo inventou uma única resposta quando o prompt mandava não adivinhar. O guia sobre alucinações de IA no suporte explica por quê.
Existe uma alternativa do Google ao Gemini 4 Argon?
Sim, duas que você pode chamar hoje. O Gemini 3.8 Flash pontua 40,9 no Artificial Analysis e tem um plano gratuito. O Gemini 3.1 Pro Preview pontua menos, 29,7, mas inventou menos respostas no meu teste. Nenhum chega perto da pontuação do Argon, então a resposta honesta é esperar ou trocar de laboratório por enquanto.
O GPT-6.1 Sol é mais barato que o Gemini 4 Argon?
Por token, custam o mesmo no lançamento: $2 de entrada, $0,10 em cache, $10 de saída. Por tarefa, o GPT-6.1 Sol é mais barato porque escreve menos tokens: $0,72 por tarefa do Artificial Analysis em esforço máximo contra $1,99 do Argon, e o Argon dobra para $3,98 depois da promoção. Veja Gemini 4 Argon pricing para a conta completa.
Qual é a melhor alternativa de pesos abertos ao Gemini 4 Argon?
O Kimi K3. Pontua 43,6 no Artificial Analysis e tem a melhor pontuação de raciocínio em contexto longo de todos os modelos que verifiquei, 88,7% contra 79,7% do Argon. O DeepSeek V4.1 Flash é bem mais barato sob licença MIT, mas sua taxa de alucinação de 96% o torna um mau substituto para o principal ponto forte do Argon.
Preciso do Gemini 4 Argon para um bot de atendimento ao cliente?
Não. No meu teste, GPT-6.1 Sol, GPT-6 Astra, GPT-6 Luna, Gemini 3.8 Flash e Gemini 3.1 Pro responderam corretamente às perguntas cobertas e escalaram as não cobertas quando o prompt mandava não adivinhar. O que importa mais é a camada em volta do modelo. Um agente de helpdesk com IA como o eesel cuida da fundamentação em fontes, da passagem para humanos e dos testes com seus tickets do passado.

Share this article

Kurnia Kharisma

Article by

Kurnia Kharisma

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Ilustração desenhada à mão de um avaliador com uma prancheta de pontuação estudando um modelo de cristal luminoso dentro de uma vitrine de vidro isolada por cordas, para uma análise do Gemini 4 Argon
Trending

Análise do Gemini 4 Argon: um ótimo modelo que você ainda não pode usar

Minha análise do Gemini 4 Argon: a menor taxa de alucinação entre os modelos de ponta e inteligência no nível do Astra, mas um 404 na API, uso pesado de tokens e um preço que dobra.

Rama AdiRama AdiOct 1, 2026
Ilustração desenhada à mão de três pessoas esperando atrás de um cordão de veludo diante de uma porta trancada e brilhante, para um guia sobre o Gemini 4 Argon do Google
Trending

Gemini 4 Argon: benchmarks, preços e quem pode realmente usá-lo

O Gemini 4 Argon é o novo modelo de fronteira do Google, anunciado em 30 de setembro de 2026 a $2/$10. Lidera em trabalho de conhecimento, fica atrás em programação no terminal, e a maioria das pessoas ainda não consegue usá-lo.

KiraKiraOct 1, 2026
Ilustração desenhada à mão de duas pessoas olhando para uma etiqueta de preço pequena e outra muito maior ao lado de uma grande faísca azul do Gemini, para um guia de preços do Gemini 4 Argon
Trending

Preços do Gemini 4 Argon: a promoção de $2/$10, a conta de $4/$20 e quanto uma tarefa realmente custa

O Gemini 4 Argon custa por enquanto $2/$10 por milhão de tokens, depois $4/$20. Veja o que isso significa por tarefa, por ticket e em comparação com o GPT-6.1 Sol e o Claude Opus 5.5.

KiraKiraOct 1, 2026
Duas pessoas pesquisando em um índice de documentos alimentado por embeddings do Cohere Embed 5
Trending

Cohere Embed 5: Pro vs Fast, benchmarks, preços e como usar

Cohere Embed 5 explicado: o que são Pro e Fast, o truque de indexar com Pro, como os benchmarks se sustentam, quanto custa e quando o preço por token deixa de importar.

KiraKiraOct 1, 2026
Ilustração comparando DeepSeek V4 Flash e Kimi K3 da Moonshot AI
Trending

DeepSeek V4 Flash vs Kimi K3: qual você deveria usar?

Um modelo custa 29 vezes mais por tarefa que o outro. Passei por todos os números publicados dos dois, e a parte interessante é a opção intermediária que ninguém deveria comprar.

KiraKiraAug 4, 2026
Ilustração desenhada à mão de uma mulher digitando uma barra na caixa de chat do notebook enquanto um leque de pequenos cartões de skills surge acima e um colega observa
Trending

Skills do Gemini: como funcionam, quem recebe e o que acontece com os Gems

Os skills do Gemini são instruções reutilizáveis que você chama com uma barra no app do Gemini. Veja como são carregados, quem pode usá-los hoje e como mover seus Gems antes de novembro.

KiraKiraOct 1, 2026
Ilustração de ondas sonoras e etiquetas de preço representando os preços do Gemini 3.8 Flash TTS
Trending

Preços do Gemini 3.8 Flash TTS: o que uma hora de voz com IA realmente custa

O Gemini 3.8 Flash TTS custa US$ 9 por 1M de tokens de áudio, cerca de US$ 0,81 por hora de fala. Veja todos os níveis, a pegadinha de 2027 e a comparação com ElevenLabs e OpenAI.

Rama AdiRama AdiSep 24, 2026
Ilustração de ondas sonoras e etiquetas de preço representando os preços do Gemini 3.8 Flash TTS
Trending

Preços do Gemini 3.8 Flash TTS: o que uma hora de voz de IA realmente custa

O Gemini 3.8 Flash TTS custa US$ 9 por 1 milhão de tokens de áudio, cerca de US$ 0,81 por hora de fala. Aqui estão todos os níveis, a pegadinha de 2027 e a comparação com ElevenLabs e OpenAI.

Rama AdiRama AdiSep 24, 2026
Ilustração do modelo de pesos abertos Xiaomi MiMo V2.6
Trending

Xiaomi MiMo V2.6: especificações, benchmarks e como usar o modelo aberto

O MiMo V2.6 da Xiaomi é uma família de modelos omnimodais de pesos abertos, com contexto de 1M de tokens e licença MIT. Aqui estão as especificações reais, os benchmarks e os preços da API.

Rama AdiRama AdiSep 23, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis