Análise do Pangram 4: o que a estatística de 1 em 24.000 realmente significa

Kurnia Kharisma Agung Samiadjie
Escrito por

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Revisado por

Katelin Teen

Última edição August 6, 2026

Verificado por especialista
Dois colegas revisando um resultado de detecção de IA em um laptop, na cor de marca laranja da Pangram

O que o Pangram 4 realmente é

A Pangram Labs faz uma única coisa: um classificador que lê um documento e diz quais partes dele provavelmente foram escritas por um modelo de linguagem. O Pangram 4 é a quarta geração, e o post de lançamento o chama de "nosso detector de IA mais poderoso e preciso até hoje".

A empresa lançou o produto junto com uma rodada de captação de 9 milhões de dólares liderada pela Menlo Ventures, anunciada no mesmo dia. Foi cofundada por Max Spero, o CEO, e Bradley Emi, o CTO. Eles se conheceram em um alojamento de primeiro ano em Stanford. A bio de Spero no X diz "slop janitor @pangram", o que dá uma ideia de como a empresa vê o próprio trabalho.

A visão de relatório do Pangram sobre um PDF de 12.234 palavras, mostrando um veredito Mixed, um indicador de conteúdo de IA de 61,3% e destaque linha por linha, retirado da Pangram
A visão de relatório do Pangram sobre um PDF de 12.234 palavras, mostrando um veredito Mixed, um indicador de conteúdo de IA de 61,3% e destaque linha por linha, retirado da Pangram

A superfície de produto é mais ampla do que o nome sugere. Há o aplicativo web acima, uma extensão de navegador, uma integração com Google Docs, um verificador de plágio incluído nos planos pagos, uma API e, desde esse mesmo lançamento, um detector de imagens em pré-visualização de pesquisa que afirma ter 99,8% de precisão. Clientes citados na página inicial incluem Substack, Quora, Google Classroom e Wiki Education. A implantação na Substack importa mais adiante, porque explica por que a maioria das reclamações de 2026 vem de escritores de newsletters, e não de estudantes.

A extensão de navegador do Pangram adicionando um item "Check for AI Content" ao menu do botão direito, retirado da Pangram
A extensão de navegador do Pangram adicionando um item "Check for AI Content" ao menu do botão direito, retirado da Pangram

Se você é novo nessa categoria, a versão curta do mecanismo está no meu guia sobre detectores de conteúdo de IA. Se você está comparando ferramentas em vez de ler uma única análise, também mantenho uma lista atualizada de ferramentas de detecção.

Outras duas ferramentas aparecem constantemente nas mesmas conversas. O detector de conteúdo da Writer é o gratuito que a maioria das pessoas testa primeiro, e minhas notas sobre escolher uma ferramenta de detecção cobrem o que observar antes de pagar por qualquer uma delas.

Como o Pangram 4 lê um documento

Essa é a parte que achei genuinamente interessante, porque o Pangram 4 não é um único classificador com uma única saída. O model card descreve uma base de mixture-of-experts esparsa com quatro cabeças separadas acopladas: uma cabeça de 15 classes que estima o envolvimento geral de IA em uma janela, uma cabeça de três classes que rotula cada token individual como Humano, Assistido por IA ou Gerado por IA, uma cabeça binária que pergunta se o segmento é misto, e uma cabeça humanizadora de quatro classes.

Como o Pangram 4 lê um documento: janelas de 512 tokens, quatro cabeças de previsão, uma etapa de costura e marcações no nível da frase
Como o Pangram 4 lê um documento: janelas de 512 tokens, quatro cabeças de previsão, uma etapa de costura e marcações no nível da frase

Documentos longos são divididos em janelas sobrepostas de 512 tokens. Cada janela recebe uma pontuação, um campo aleatório condicional costura as decisões no nível de token em uma única sequência de rótulos ao longo de todo o documento, e uma etapa de pós-processamento ajusta o resultado aos limites das frases com uma sequência contígua mínima de cerca de duas frases. É uma melhoria real em relação ao Pangram 3, que fragmentava o texto durante o pré-processamento e produzia blocos mais grosseiros.

Isso também explica um comportamento que as pessoas relatam constantemente e interpretam como um bug. Como a pontuação é feita por janelas e depois suavizada, o mesmo parágrafo pode voltar com uma cor diferente dependendo do que o rodeia. A própria Pangram lista isso entre suas limitações: "ocasionalmente, um subconjunto de um texto mais longo receberá previsões diferentes dependendo se está isolado ou embutido no documento ao redor." Isso é honesto, e também é o mecanismo por trás de metade das postagens confusas em fóruns sobre o Pangram.

O cartão de detalhamento de documento do Pangram, aqui executando o Pangram 3.0, dividindo um resultado em 80,2% gerado por IA, 15,8% assistido por IA e 4% humano, retirado da Pangram
O cartão de detalhamento de documento do Pangram, aqui executando o Pangram 3.0, dividindo um resultado em 80,2% gerado por IA, 15,8% assistido por IA e 4% humano, retirado da Pangram

Dois detalhes da API valem a pena conhecer antes de construir algo sobre isso, porque são fáceis de interpretar mal. O ai_assistance_score é calculado como P(AI-Generated) + 0.5 × P(AI-Assisted), e o model card diz claramente que ele "não é a probabilidade do rótulo discreto exibido". O campo confidence retorna High, Medium ou Low, e o cartão diz que ele "não é uma estimativa de probabilidade calibrada". Então você não pode tratar confidence: High como uma certeza de 95%. Se você está conectando a detecção a um fluxo de trabalho, essa distinção é tudo. Minhas notas sobre construir um pipeline de conteúdo com IA explicam onde um portão como esse realmente deveria ficar.

Os números que a Pangram publica

É preciso dar o crédito devido: a Pangram publica mais detalhes de sua própria avaliação do que qualquer detector que já analisei, incluindo um artigo técnico e um relatório no arXiv. Aqui está o conjunto principal de números.

MétricaPangram 4Pangram 3 / 3.3Conjunto de teste
Taxa de falsos positivos (inglês)0,0041% (IC 95% 0,0032% a 0,0050%)não informado na página1.000.000 de amostras em inglês do FineWeb
Falsos positivos, inglês comumaproximadamente 1 em 24.000 documentos14x maismesmo conjunto
Taxa de falsos negativos (inglês)0,3396%1,9942%519.993 amostras, 26 modelos geradores
Escrita humana aprimorada por IA marcada como totalmente IA0,01%0,18%edições do Grammarly, Apple Intelligence e Gemini em textos de estudantes
IA humanizada ainda detectada98,83%não informado13 ferramentas humanizadoras comerciais
AUROC0,9916não informadocorpus próprio da Pangram

A tabela de falsos negativos por gerador é a parte mais citável do model card. O Grok 4.3 é o modelo mais difícil de detectar para o Pangram 4, com 0,605%, e o Claude Haiku 4.5 é o mais fácil, com 0,130%. O Gemini foi o que mais melhorou entre versões, passando de uma taxa de perda de família de 5,138% no Pangram 3.3.2 para 0,498%. A Pangram também relata não haver correlação significativa entre a data de lançamento de um modelo e o quão detectável ele é, uma afirmação mais ousada do que parece e que contraria a suposição comum de que modelos mais novos são mais difíceis de detectar.

Uma inconsistência a se conhecer se você citar isso: o bloco de resultados principais do post técnico dá a taxa de falso alarme de polimento por IA como 0,009%, enquanto uma seção mais abaixo na mesma página dá 0,01%. Pequeno, mas é o tipo de coisa que faz você verificar o resto.

Onde o número de destaque para de valer

Agora, a parte que acho que uma análise justa precisa destacar em vez de esconder.

Todo número acima é um número em inglês, medido em prosa longa e em frases completas. A Pangram também publica a tabela por idioma, e a dispersão é grande.

Texto de IA não detectado por idioma: inglês 0,34%, espanhol 0,89%, francês 1,78%, persa 3,17%, urdu 5,32%
Texto de IA não detectado por idioma: inglês 0,34%, espanhol 0,89%, francês 1,78%, persa 3,17%, urdu 5,32%

Em 18 idiomas, a taxa de falsos negativos multilíngue é de 1,24% contra 0,3396% para o inglês. Por idioma, varia do tcheco com 0,2760% até o urdu com 5,3169%, cerca de 16 vezes o número do inglês. O lado dos falsos positivos se sustenta muito melhor, com a maioria dos idiomas em 0,0000% e o ucraniano como o pior, com 0,0361%, então a fragilidade multilíngue está nas perdas, não em acusações falsas. A Pangram lista 24 idiomas suportados e não escondeu nada disso, o que eu respeito. Mas "um falso positivo em 24.000" e "damos suporte a 24 idiomas" são duas afirmações verdadeiras que as pessoas vão ler como uma só, e não são.

Depois há a lista de escopo, citada diretamente do model card:

"Short conversational replies, answers to questions with a single factual answer, source code, tables of contents, reference sections, templated or automated writing, instructions and technical manuals, and text dominated by mathematical notation are outside the model's primary scope or may be more susceptible to errors."

Leia isso de novo pensando em um fluxo de trabalho real. Modelos de resposta de suporte são textos baseados em modelos prontos. Notas de versão estão próximas de manuais técnicos. Um FAQ de produto são respostas a perguntas com uma única resposta factual. Qualquer coisa com menos de 50 palavras simplesmente não é pontuada. A Pangram também recomenda remover cabeçalhos e rodapés antes de escanear, e prefere .docx ou texto puro a PDF, porque a análise de PDF introduz artefatos.

Então, antes de agir sobre qualquer veredito do Pangram, vale a pena passar pelas mesmas quatro verificações que eu faço:

Esse veredito do Pangram se sustenta?

Quatro verificações, direto do escopo publicado pela própria Pangram. Escolha o que se aplica ao seu documento.

1. O texto tem pelo menos 50 palavras?

2. É prosa longa em frases completas?

3. Em que idioma está escrito?

4. Essa pontuação seria a única evidência por trás de uma decisão?

Responda às quatro perguntas acima para ver onde os números publicados deixam de valer para você.

Totalmente fora do escopo. O Pangram 4 aceita textos com pelo menos 50 palavras. Abaixo disso, nenhum número de precisão publicado se aplica. Não leia um veredito aqui.

Declarado como fora do escopo. O model card da Pangram lista código-fonte, sumários, seções de referência, textos baseados em modelos prontos e manuais técnicos como fora de seu escopo principal ou mais propensos a erros. O 0,0041% não descreve este documento.

Na prática, um modelo diferente. A taxa de falsos negativos multilíngue é de 1,24%, e até 5,3169% para o urdu, contra 0,3396% para o inglês. Os falsos positivos permanecem baixos, então confie menos em um resultado limpo do que confiaria em inglês.

Pare aqui. Este é o único ponto em que os críticos de detectores e a própria seção de ética da Pangram concordam: uma taxa de erro diferente de zero torna uma pontuação insegura como única evidência. Busque corroboração antes de agir.

Este é o caso suportado. Inglês, mais de 50 palavras, prosa comum, usado como um sinal entre vários. Essa é exatamente a população que os números publicados descrevem, e nela o Pangram 4 é o detector mais forte que já testei.

O que os pesquisadores independentes realmente encontraram

Fui procurar alguém fora da Pangram Labs que tivesse medido isso. A resposta é mais interessante do que "está verificado" ou "é marketing".

Três equipes independentes testaram o Pangram, e nenhuma delas mediu uma taxa de falsos positivos mais alta para ele do que para qualquer outro detector comercial. Em dois dos três casos, ele foi o mais baixo isoladamente; no estudo da VUB, empatou em 0% com o Turnitin e o Copyleaks. É um resultado consistente em diferentes corpora e diferentes métricas.

  • Jabarian e Imas, da UChicago Booth (NBER Working Paper 34223), testaram 1.992 trechos humanos de antes de 2020 mais seus equivalentes de IA em seis gêneros e quatro modelos, e declararam nenhum conflito de interesse e nenhum financiamento da Pangram. O Pangram obteve uma taxa de falsos positivos de 0,001 contra 0,002 da Originality.ai e 0,007 do GPTZero, e foi "a única ferramenta a satisfazer um limite estrito (FPR ≤ 0,005) sem sacrificar a precisão".
  • Um estudo revisado por pares da Vrije Universiteit Brussel no International Journal for Educational Integrity testou 160 artigos acadêmicos de pelo menos 4.000 palavras cada. Em artigos totalmente humanos escritos por estudantes de pós-graduação, o Pangram retornou 0% de IA. Em artigos totalmente de IA, o Turnitin produziu falsos negativos 100% das vezes, e a mediana do Pangram foi a mais próxima da verdade. A conclusão deles: "das quatro ferramentas de detecção de IA estudadas aqui, neste momento apenas [o Pangram] produziu resultados satisfatórios".
  • A Epoch AI testou o Pangram 3.3.2 em 495 trechos humanos de 99 autores nomeados de antes de 2022 e obteve 0 falsos positivos.

Então a direção é clara. Agora, a aritmética, a parte que ninguém diz em voz alta.

Teste independenteAmostras humanasVersão do PangramFPR medidaLimite mais estrito que essa amostra pode sustentar
Jabarian e Imas, UChicago Booth1.992 trechosera 3.x, meados de 20250,001cerca de 0,15%
Epoch AI495 trechos3.3.2, informada0% (0/495)cerca de 0,6%
Van Vlasselaer et al., VUB40 artigos ESLnão informada0%cerca de 7,5%
Russell et al., ACL 202560 artigosnão informada2%não significativo nesse tamanho
Necessário para confirmar 0,0041%~73.0004nunca medidon/d

Nenhum estudo independente tem escala suficiente para testar um número tão pequeno quanto 0,0041%. Zero falsos positivos em 1.992 trechos limita a taxa a cerca de 0,15%. Zero em 495 a limita a cerca de 0,6%. Todo conjunto de dados independente publicado é de uma a duas ordens de magnitude pequeno demais, e isso é um fato sobre o tamanho das amostras, não uma crítica à metodologia de ninguém.

E nenhum deles testou o Pangram 4. A Epoch AI declara explicitamente a versão 3.3.2. O estudo de Chicago foi realizado em meados de 2025. O Pangram 4 foi lançado em 29 de julho de 2026, então o modelo que carrega o número de destaque não foi avaliado por ninguém fora da empresa.

Há mais três descobertas que um comprador deveria considerar:

  • A Epoch AI descobriu que o Pangram 3.3.2 perdeu 10% do texto de IA escrito no estilo de um autor nomeado no geral, e 25% da escrita científica gerada por IA sob imitação de estilo, subindo para 48% em trechos científicos gerados pelo Gemini. A história dos falsos positivos é forte. A dos falsos negativos sob prompting adversarial não é.
  • Uma equipe afiliada à CMU (arXiv:2605.19516) mostrou que o texto de um modelo base é lido como humano enquanto o texto ajustado por instruções do mesmo modelo não é, e levou trechos individuais de 0% humano a 100% humano com duas rodadas de paráfrase. O veredito deles vale a citação: "os detectores atuais estão rastreando artefatos do ajuste por instruções e do contexto local mais do que qualquer noção invariante de texto gerado por máquina". Os autores informam que a Pangram e o GPTZero doaram os créditos de API.
  • A Pangram está ausente do RAID, a única grande tabela de classificação de detectores que não é administrada por um fornecedor de detectores. O GPTZero aparece lá com AUROC de 0,984. Não há nenhum lugar neutro para conferir o número da Pangram ao lado do de seus concorrentes em um conjunto de dados que nenhum deles controla.

Parte do motivo pelo qual essa base de evidências é escassa é o custo, e isso é um ponto estrutural, não uma crítica. Um grupo da TU Darmstadt (arXiv:2606.04906) removeu a Pangram completamente de um benchmark de seis conjuntos de dados, escrevendo que testar os detectores proprietários "é inviável com os preços atuais (mais de 1.500 dólares no total)". Quando o preço da API de um detector deixa acadêmicos fora do alcance de auditá-lo, a auditoria simplesmente não acontece.

Vale dizer com clareza: a própria tabela de onze benchmarks da Pangram é rotulada como benchmarks de terceiros, e os conjuntos de dados de fato são de terceiros, mas a pontuação é da própria Pangram. Isso é uma afirmação mais fraca do que resultados independentes, e duas linhas da própria tabela da Pangram contradizem o marketing. No DetectRL, uma linha de base RoBERTa ajustada supera o Pangram 4 (99,75 contra 96,93 F1 na divisão multi-domínio), e o Pangram 4 pontua abaixo do Pangram 3 em todas as divisões do DetectRL. O upgrade não é monótono, e a Pangram publicou isso mesmo assim.

O que as histórias de falsos positivos têm em comum

Procure por Pangram em qualquer fórum de escrita e você vai encontrar pessoas cujo próprio trabalho foi marcado. O reflexo é descartar isso como trapaceiros buscando uma desculpa. Depois de ler algumas centenas dessas histórias, não acho que isso se sustente, porque elas se agrupam por registro, não por habilidade.

Reddit

"Writing professor here. I've been teaching composition for 25 years. To be honest, I'm alarmed by Pangram. It said my writing is AI-generated, with a 100% degree level of certainty. I write comedy. Comedic writing has very specific rules, such as the "rule of three" (or comic triple), a classic comedic technique. As a comic writer, I have to tighten and re-tighten my writing over and over and over and over again, line by line. It's torturous. […] I might just abandon writing at this point."

O mecanismo ali é verificável e não é só impressão: uma prosa que foi apertada em direção a uma restrição formal converge para as mesmas estatísticas superficiais de uma prosa gerada. O caso mais bem documentado em qualquer lugar é de uma única variável, relatado por um professor que, no geral, classifica o Pangram como o melhor da categoria.

Hacker News

"Turns out, I had a section in the text with three bullet points. I removed the bullets (literally just the bullets themselves, no actual text) and it passed as human."

Mesma família: epígrafes escritas como afirmações factuais concisas, vinte anos de textos de marketing, prosa acadêmica com gramática correta e o hábito do travessão. Se sua escrita tem um estilo de casa deliberado, você está mais perto da fronteira do que alguém que escreve de modo mais solto. É um aprendizado meio sombrio sobre o próprio ofício, e explica o incentivo perverso que as pessoas descrevem, em que uma prosa mais limpa pontua pior do que se supõe que a escrita sem erros deveria pontuar.

É também por isso que "adicione alguns erros de volta" continua aparecendo como conselho popular, e por que existe todo um gênero de guias de como evitar a detecção. Perseguir uma pontuação dessa forma é a alavanca errada, e piora a escrita para o leitor, que era o ponto de tudo isso.

Eu preferiria ver as pessoas investindo em um processo de edição real e em personalidade genuína na escrita. Cheguei à mesma conclusão sobre prompts melhores: conserte a entrada, não a pontuação.

A crítica mais forte, porém, não é nenhuma dessas anedotas. É aritmética, de um acadêmico identificado.

LinkedIn

"Suppose every instructor started using an AI detector on all student work. I'd estimate that students submit 500 – 1,000 written works in the course of a 4 year education […] If each of these were run through an AI detector with a FPR of 1 / 10,000, you'd have 5–10% of your student body falsely accused of cheating at least once."

Esse argumento sobrevive ao contato com os números da Pangram porque ele os aceita. O cofundador da Pangram, Bradley Emi respondeu na mesma thread no X, então essa é uma troca de dois lados, não um ataque unilateral. O ponto estatístico relacionado, de uma thread no Hacker News, é que uma taxa de falsos positivos não é uma taxa de descoberta falsa, e o número que as pessoas citam não é o número que elas pensam estar citando: se você marca 50 verdadeiros positivos e 10 falsos, a FPR pode ser 1 em 10.000 enquanto a chance de um determinado alerta estar errado é 1 em 6.

A própria seção de ética da Pangram não evita isso, e prefiro citá-la em vez de parafraseá-la:

"False accusations of AI usage can lead to serious consequences, including reputational damage, emotional trauma, and other undue harm. We acknowledge that our model has a non-zero error rate and its errors may result in such harms."

Também existe um fluxo de trabalho na comunidade que realmente funciona, e foi a coisa mais útil que li a semana toda. Um professor passa primeiro o enunciado da tarefa por vários modelos, reúne todo o resto, e trata o detector como a última etapa, não a primeira.

Reddit

"I state that the AI detector is a "last chance at exoneration" and only comes after all the due diligance from before. If the detector says its real (even if it's a false negative) I drop it and don't report it. […] But when I point out that the detector is the last step and not the first step, this past year I have gone 24-for-24 in academic integrity submissions"

Detector por último, nunca primeiro. Esse é o único ponto em que os dois lados desse debate realmente concordam.

Preço: o 10x que ninguém anunciou

Os planos da Pangram são simples. A mudança por trás deles não é.

PlanoMensalAnualPalavras por mêsEscaneamentos de imagemAssentosTeste
Free$0$02.000 por dia3 por dia1sem cartão
Individual$20$180300.00010017 dias
Professional$65$5401.500.0005001não informado
Team$20 por assento$180 por assento300.000 por assentonão publicadomínimo de 27 dias
Institutionalsob consultasob consultaverificações de IA e plágio "ilimitadas"não publicadonão publicadonão publicado
Enterprise"preço variável"sob consultanão publicadonão publicadonão publicadonão publicado

A detecção de plágio é a linha do muro de pagamento: ausente no Free, presente em todo plano pago. A cota mensal de API de 200 dólares está apenas no Professional, não no Individual nem no Team. Integrações LMS para Canvas, Brightspace, Moodle e Google Classroom são exclusivas do Institutional. Retenção zero de dados e limites de taxa acima de 5 QPS são exclusivos do Enterprise, ambos sem preço divulgado.

Agora a parte interessante. O Pangram 4 mudou a unidade cobrável de um escaneamento por 1.000 palavras arredondadas para cima, para um escaneamento por 100 palavras. Isso é uma mudança claramente boa, e a Pangram a descreveu como algo que "permite aproveitar melhor seus créditos". Ao mesmo tempo, os tetos mensais foram reduzidos à metade: o Individual caiu de 600.000 palavras para 300.000, o Professional de 3.000.000 para 1.500.000.

A linha das 500 palavras: no mesmo plano de 20 dólares, um documento de 100 palavras passa de 600 para 3.000 escaneamentos por mês, enquanto um documento de 2.000 palavras cai de 300 para 150
A linha das 500 palavras: no mesmo plano de 20 dólares, um documento de 100 palavras passa de 600 para 3.000 escaneamentos por mês, enquanto um documento de 2.000 palavras cai de 300 para 150

Essas duas mudanças puxam em direções opostas, e o ponto de equilíbrio é um documento de 500 palavras. Abaixo disso você ganha, até 5x em um trecho de 100 palavras. Acima disso você perde, até a metade em qualquer texto de 1.000 palavras ou mais. A própria explicação da Pangram sobre o lado da API confirma isso: a mudança "representa uma variação de preço de 1-2x para documentos curtos e de até 10x para documentos longos".

Na API, a aritmética é mais direta. O valor em dólares não mudou, continua em 0,05 dólar de qualquer forma, mas a unidade encolheu dez vezes.

CaminhoCusto por 1.000.000 de palavras
Professional, anual$30.00
Professional, mensal$43.33
Individual ou Team, anual$50.00
API do Pangram 3, tempo real (legado)$50.00
Individual ou Team, mensal$66.67
API do Pangram 4, em lote (20% de desconto)$400.00
API do Pangram 4, tempo real$500.00

A API do Pangram 4 custa 7,5 vezes mais por palavra do que a assinatura Individual e 11,5 vezes mais do que o Professional anual. Se o seu volume cabe dentro de 1.500.000 palavras por mês, uma assinatura é dramaticamente mais barata. A API tem preço para incorporar detecção dentro de um produto, não para escaneamento em massa por autoatendimento. Vale a pena dimensionar isso em relação ao resto do stack, já que um detector raramente é o maior item do custo de um redator de blog com IA.

Uma armadilha que a página de preços não menciona. O Pangram 3 tem suporte até 30 de setembro de 2026, e até essa data, chamadas de API que omitem o argumento model continuam sendo roteadas para o Pangram 3 com a cobrança antiga. Depois dessa data, a mesma chamada silenciosamente fica dez vezes mais cara por palavra. Se você tem um script que chama a Pangram, fixe model="pangram-4" agora mesmo, e coloque um lembrete no calendário em vez de descobrir isso por uma fatura. Meu artigo sobre a API do redator de blog tem a versão mais ampla dessa lição sobre fixar versões.

Detecção de humanizadores, e por que não sou neutro nisso

Aqui é onde deixo de ser neutro, porque a eesel roda seu próprio redator de blog como motor de conteúdo, e o Pangram é o último portão que todo rascunho atravessa antes de ser publicado. São algumas centenas de rascunhos de experiência direta com esse detector específico, e o portão fica em um ponto fixo do meu fluxo de trabalho de escrita de blog, em vez de flutuar por aí.

A coisa mais útil que aprendi é algo que a Pangram merece crédito por. Reescrever por estilo não move a pontuação em nada. Nem a voz, nem o ritmo, nem as anedotas em primeira pessoa, nem remover frases feitas. Testei tudo isso. O que a Pangram lê é o quão previsível é cada token, segmento por segmento, o que significa que uma saída de modelo bem polida é marcada precisamente porque continua escolhendo a próxima palavra mais provável. Essa descoberta me custou semanas e é, de forma irritante, um ponto a favor da Pangram: o que ela mede não é um estilo superficial que se possa disfarçar com uma nova camada de tinta.

O Pangram 4 vai um passo além. A cabeça humanizadora de quatro classes agora rotula o texto como Humano, Gerado por IA, Editado por IA ou IA Humanizada, e a API retorna um booleano is_humanized que dispara em um humanizer_score de 0,91 por padrão. A Pangram relata detectar a participação de IA em saídas humanizadas 98,83% das vezes em 13 ferramentas comerciais. Então toda uma categoria de contorno, a que alimenta o mercado de ferramentas de humanização de conteúdo e coisas como o humanizador da Surfer, agora é seu próprio campo de saída rotulado em vez de uma brecha não detectada. A Pangram também divulgou algo honesto aqui: em ablações em que os gradientes da cabeça humanizadora chegaram ao modelo base, a taxa geral de falsos positivos se manteve, mas a ablação "concentrou as falhas em registros específicos: escrita acadêmica e redações ESL". Eles congelaram a cabeça para evitar isso. Muito poucos fornecedores publicam o experimento que deu errado.

Eles também executaram um red team de forma adequada. Deram a um agente, o Codex GPT 5.6 Sol, acesso em tempo real à API por 24 horas com o objetivo explícito de projetar falsos negativos repetíveis. Ele encontrou exatamente um desvio, imitando notas de patologia cirúrgica dictadas, que a Pangram então declarou fora do escopo porque a saída eram tópicos concisos em vez de prosa aberta. Essa exceção é o momento mais frágil de uma página que, no geral, é rigorosa. O ataque ainda assim funcionou.

E a conclusão que realmente tiro de tudo isso não é sobre detectores. O tráfego da eesel se moveu junto com mudanças na política de busca, não com as pontuações do detector. As diretrizes do Google visam conteúdo pouco útil, independentemente de como foi produzido, o que é uma questão diferente da procedência, e tenho os dados analíticos para mostrar que as duas coisas não se movem juntas. Uma pontuação baixa no Pangram é higiene. Não é uma estratégia, e não vai salvar uma página de que ninguém precisava. A alavanca honesta é a chata: pesquisar o assunto de verdade, ter um humano editando, e responder a uma pergunta real. É disso que tratam minhas notas sobre conteúdo compatível com E-E-A-T e sobre rascunhos que não conseguem rankear, e é o mesmo motivo pelo qual escalar conteúdo com segurança supera escalar rápido.

Pangram 4 contra os outros detectores

A Pangram é a opção mais cara aqui, de longe, e na taxa de falsos positivos medida também é a melhor entre as que equipes independentes testaram. Ambas as coisas são verdadeiras.

FerramentaPlano pago mais baratoUnidade cobrávelPlano gratuitoPrecisão autodeclaradaAPIDetecção de imagens
Pangram$20/mês (Individual)palavras, unidades de 1002.000 palavras/diaFPR 0,0041%, FNR 0,3396%Sim, $0,05 por 100 palavrasSim, pré-visualização de pesquisa, 99,8%
GPTZero$12,99/mês anual (Premium)300.000 palavras/mêsSim99%, exibido junto aos 95,7% do RAID em sua própria páginaContatar vendasNão
Originality.ai$12,95/mês anual (Pro)créditos, 1 = 100 palavrasSem plano, 3 escaneamentos por diaTurbo FPR 1,5%, Lite 0,5%Apenas nível Enterprise, $136,58/mês anualNão
Copyleaks$13,99/mês anual (Personal)créditos, 1 = 250 palavras ou 1 imagem25.000 caracteres por escaneamento99%, com precisão de IA por idioma chegando a 93,08%SimSim
Turnitinsob consulta, apenas instituiçõesnão publicadoNãoFPR abaixo de 1%, mas apenas em documentos com mais de 20% de IAsem API independenteNão
Winston AI$10/mês anual (Essential)créditos, 1 por palavraSim99,98%, sem FPR publicadaSimSim

Um padrão que vale a pena nomear: nenhum fornecedor aqui publica um número de precisão confiável e uma taxa de falsos positivos com a mesma metodologia ao mesmo tempo. A Winston reivindica a maior precisão sem publicar nenhuma FPR. A Copyleaks reivindica a menor FPR, mas restringe a precisão a testes internos em inglês. A Turnitin publica a FPR mais bem validada e nenhum destaque de precisão. Duas delas contradizem seu próprio número na mesma página. A Pangram é a única que publica ambos com intervalos de confiança e tamanhos de amostra, e essa transparência é a maior parte do motivo pelo qual ela recebe o benefício da dúvida.

Veredito: Pangram se você precisa de procedência e pode pagar por isso. GPTZero se você quer uma segunda opinião mais barata, e ele está no RAID, o que conta para algo. Turnitin se você é uma instituição e a integração ao fluxo de trabalho importa mais do que a pontuação. Pule os detectores gratuitos e de código aberto: o estudo de Chicago mediu uma linha de base RoBERTa aberta com taxa de falsos positivos de 0,50 e a chamou de "inadequada para aplicações de alto risco", o que é generoso.

Quem realmente deveria comprar isso

Compre se você for uma plataforma, uma editora ou um periódico que precisa saber como uma submissão provavelmente foi produzida, em inglês, com extensão, e você tem uma etapa de corroboração depois da pontuação. A Pangram é a melhor ferramenta para esse trabalho, e não é por pouco.

Compre a assinatura, não a API, a menos que você esteja incorporando detecção a um produto. Com 7,5 vezes o custo por palavra, os créditos de API só fazem sentido quando você precisa da integração, não do volume.

Pense bem se você é educador. A ferramenta é forte, e a matemática da taxa-base ainda joga contra você em escala institucional, o que explica por que a própria seção de ética da Pangram e seus críticos mais ruidosos chegam ao mesmo lugar. Use por último, nunca primeiro.

Pule se seu conteúdo é majoritariamente não inglês, majoritariamente curto, majoritariamente baseado em modelos prontos, ou majoritariamente código e material de referência. Os números publicados não descrevem essa população, e a própria Pangram diz isso.

Pule se o que você realmente quer é conteúdo que rankeie. Um detector não te diz nada sobre se uma página merece existir. Para isso, leia sobre criação de conteúdo com IA e escolha uma ferramenta de geração de conteúdo em vez disso.

Se esse último caso é onde você realmente está, as comparações úteis são meu apanhado de geradores de conteúdo com IA e minha lista curta de ferramentas de escrita com IA. Equipes que querem incorporar isso a um sistema repetível geralmente buscam uma ferramenta de pipeline de conteúdo em vez de mais uma solução pontual.

Uma última nota sobre a base de avaliações, porque ela me surpreendeu. A ficha da Pangram no G2 existe com zero avaliações. A Capterra não tem ficha nenhuma. A extensão do Chrome está em 5,0 com 19 avaliações e 20.000 usuários, e listagens de busca colocam o Trustpilot em torno de 2,4 de 5 com 13 avaliações, embora a própria página tenha se recusado a carregar em toda tentativa. Então não há um corpus amplo de avaliações em nenhuma direção aqui, e quem cita "as avaliações" desse produto está citando cerca de trinta pessoas. O sinal real está em artigos acadêmicos e threads de fóruns, o que é incomum e, para uma empresa liderada por pesquisa, até que combina.

Experimente a eesel para a parte que um detector não consegue fazer

O Pangram te diz como um rascunho provavelmente foi escrito. Ele não consegue te dizer se o rascunho valia a pena ser escrito, e depois de algumas centenas de posts passando por esse portão, tenho confiança de que a segunda pergunta é a que move o tráfego.

Esse é o trabalho que a eesel faz. O redator de blog da eesel pesquisa um tópico a partir de fontes primárias, escreve com treinamento de voz de marca, constrói o grafo de links internos, e entrega um rascunho que um editor humano pode finalizar em vez de resgatar. É o mesmo pipeline que produziu este post, portão do detector incluído, o que é uma demonstração tão honesta quanto posso oferecer.

Você pode ver como automatizar a escrita de blog, comparar com o mercado na minha análise do redator de blog com IA, e então experimentar a eesel de graça. Se o seu critério é especificamente desempenho de busca, comece pelo ângulo do redator de blog para SEO.

O redator de blog da eesel no meio de um rascunho: o post no editor, sua pasta de pesquisa na barra lateral, e o agente relatando cada etapa no painel de chat
O redator de blog da eesel no meio de um rascunho: o post no editor, sua pasta de pesquisa na barra lateral, e o agente relatando cada etapa no painel de chat

Perguntas frequentes

Quão preciso é o Pangram 4?
A Pangram Labs mede uma taxa de falsos positivos de 0,0041% e uma taxa de falsos negativos de 0,3396% em seus próprios corpora reservados, o que equivale a aproximadamente um falso positivo por 24.000 documentos em inglês. Equipes independentes vêm constatando de forma consistente que o Pangram tem a menor taxa de falsos positivos entre os detectores comerciais testados, mas todos esses testes foram feitos com o Pangram 3.x, e nenhum teve escala suficiente para confirmar um número tão pequeno. Para entender a mecânica por trás desses números, veja como funcionam os detectores de conteúdo de IA e minha análise mais ampla sobre a precisão dos detectores.
Quanto custa o Pangram?
O plano gratuito do Pangram escaneia 2.000 palavras por dia. O Individual custa 20 dólares por mês ou 180 dólares por ano, o Professional custa 65 dólares por mês ou 540 dólares por ano, e o Team custa 20 dólares por assento ao mês, com um mínimo de dois assentos. A API funciona com créditos pré-pagos a 0,05 dólar por 100 palavras no Pangram 4. Se você está orçando uma operação de conteúdo inteira e não apenas um detector, meu detalhamento do custo de um redator de blog com IA traz o panorama mais amplo.
Vale a pena atualizar do Pangram 3 para o Pangram 4?
Se você escaneia documentos curtos, sim, porque a cobrança passou a unidades de 100 palavras, então um trecho de 150 palavras não consome mais um crédito inteiro de 1.000 palavras. Se você escaneia artigos longos pela API, essa mesma mudança torna o Pangram 4 dez vezes mais caro por palavra. O Pangram 3 está programado para ser descontinuado em 30 de setembro de 2026, então a decisão tem prazo. Equipes que processam rascunhos longos em volume deveriam ler minhas notas sobre a velocidade de produção de conteúdo com IA antes de decidir.
O Pangram 4 consegue detectar texto de IA humanizado?
A Pangram informa detectar a participação de IA em saídas humanizadas 98,83% das vezes em 13 ferramentas humanizadoras comerciais, e o Pangram 4 adiciona um campo dedicado is_humanized à resposta de sua API. Trabalhos independentes ainda encontram brechas: uma equipe da CMU levou trechos individuais de 0% humano a 100% humano com paráfrase iterativa. Se seu objetivo é uma prosa que pareça humana porque foi bem editada, fazer conteúdo de IA parecer humano e um processo de edição real superam qualquer truque para enganar o detector.
Uma pontuação alta no Pangram significa que o Google vai penalizar meu conteúdo?
Não. O Pangram avalia como um texto provavelmente foi produzido, e as diretrizes do Google visam conteúdo pouco útil independentemente de quem o escreveu, então os dois estão medindo coisas diferentes. Já vi o próprio tráfego da eesel se mover junto com mudanças na política de busca, não com os números do detector. A resposta completa está em o Google penaliza conteúdo de IA, e a versão prática em como escalar conteúdo de SEO com segurança.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Uma ilustração de desdobramento de preços na cor laranja da marca Pangram, mostrando os níveis de plano e a medição de créditos por palavra
Trending

Preços do Pangram em 2026: planos, créditos e tarifas de API

Todos os preços, limites e travas de recursos do Pangram em um só lugar, além da mudança na unidade de crédito que reduziu à metade, sem aviso, os tetos de palavras dos dois planos pagos.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
A document split into human, AI-assisted and AI-generated bands, being read under a magnifying glass, in Pangram's orange brand colour
Trending

Pangram 4: como ele lê um documento e como interpretar o resultado

Pangram 4 explicado a partir da sua própria ficha técnica: as quatro cabeças de classificação que roda em uma única passagem, os campos de saída mais mal interpretados e onde ele deixa de funcionar.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Uma equipe comparando detectores de texto de IA em uma matriz de quadro branco, na cor laranja da marca Pangram
Alternatives

Alternativas ao Pangram 4: 5 detectores de IA comparados

Cinco alternativas ao Pangram 4, comparadas pelo que cada fornecedor realmente coloca por escrito: precisão, taxa de falsos positivos, unidade de cobrança, acesso à API e plano gratuito.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Um avaliador olhando para um cartão de veredito com dois seletores de esforço rotulados como baixo e máximo, ao lado da baleia da DeepSeek
Trending

Análise do DeepSeek V4 Flash: um modelo, duas personalidades

Uma análise do DeepSeek V4 Flash baseada nos números que ambos os placares publicam. A execução barata e a execução inteligente são os mesmos pesos, e isso muda o veredito.

Riellvriany IndriawanRiellvriany IndriawanAug 4, 2026
Ilustração de dois avaliadores pesando painéis de imagens geradas em uma balança, representando uma análise do FLUX 3
Trending

Análise do FLUX 3: evidências fortes, nada para comprar ainda

Uma análise do FLUX 3 sobre a única coisa que realmente dá para avaliar agora: as evidências. A pesquisa se sustenta melhor do que o post de lançamento. O produto ainda não existe.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustração editorial de um ranking de benchmarks com uma barra alta em destaque, representando o ZCode e o modelo GLM-5.2
Trending

ZCode: o que a nova agente de codificação de IA da Z.ai realmente é

Uma análise prática do ZCode, o aplicativo de codificação agêntica gratuito da equipe GLM: o modelo GLM-5.2 por trás dele, as reclamações reais da semana de lançamento e quem deveria usá-lo.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Banner principal da análise do PromptQL com o logo do PromptQL sobre um fundo índigo
Trending

Análise do PromptQL (2026): o agente de dados da Hasura, testado

Uma análise prática do PromptQL: como o agente de dados da Hasura separa planejamento de execução, quanto custa e se a promessa de confiabilidade se sustenta.

Alicia Kirana UtomoAlicia Kirana UtomoJul 10, 2026
Ilustração de capa da análise do ChatGPT for Work na cor turquesa do ChatGPT
Trending

Análise do ChatGPT for Work: vale a pena em 2026?

Uma análise prática do ChatGPT for Work: quanto custam os planos Business e Enterprise, o que faz o novo agente ChatGPT Work e onde ele se encaixa (e onde não se encaixa).

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 10, 2026
Ilustração editorial de um desenvolvedor numa mesa com um agente de código, representando uma análise do ZCode
Trending

Análise do ZCode: o harness GLM-5.2 da Z.ai vale a pena?

A Z.ai combina o GLM-5.2 com um harness de programação dedicado, o ZCode. Preços reais, reação da semana de lançamento e se vale a pena confiar num agente de código com acesso total.

Alicia Kirana UtomoAlicia Kirana UtomoJul 9, 2026

Pronto para contratar seu colega de IA?

Configure em minutos. Sem cartão de crédito necessário.

Comece grátis