
O que o Pangram 4 realmente é
A Pangram Labs faz uma única coisa: um classificador que lê um documento e diz quais partes dele provavelmente foram escritas por um modelo de linguagem. O Pangram 4 é a quarta geração, e o post de lançamento o chama de "nosso detector de IA mais poderoso e preciso até hoje".
A empresa lançou o produto junto com uma rodada de captação de 9 milhões de dólares liderada pela Menlo Ventures, anunciada no mesmo dia. Foi cofundada por Max Spero, o CEO, e Bradley Emi, o CTO. Eles se conheceram em um alojamento de primeiro ano em Stanford. A bio de Spero no X diz "slop janitor @pangram", o que dá uma ideia de como a empresa vê o próprio trabalho.

A superfície de produto é mais ampla do que o nome sugere. Há o aplicativo web acima, uma extensão de navegador, uma integração com Google Docs, um verificador de plágio incluído nos planos pagos, uma API e, desde esse mesmo lançamento, um detector de imagens em pré-visualização de pesquisa que afirma ter 99,8% de precisão. Clientes citados na página inicial incluem Substack, Quora, Google Classroom e Wiki Education. A implantação na Substack importa mais adiante, porque explica por que a maioria das reclamações de 2026 vem de escritores de newsletters, e não de estudantes.

Se você é novo nessa categoria, a versão curta do mecanismo está no meu guia sobre detectores de conteúdo de IA. Se você está comparando ferramentas em vez de ler uma única análise, também mantenho uma lista atualizada de ferramentas de detecção.
Outras duas ferramentas aparecem constantemente nas mesmas conversas. O detector de conteúdo da Writer é o gratuito que a maioria das pessoas testa primeiro, e minhas notas sobre escolher uma ferramenta de detecção cobrem o que observar antes de pagar por qualquer uma delas.
Como o Pangram 4 lê um documento
Essa é a parte que achei genuinamente interessante, porque o Pangram 4 não é um único classificador com uma única saída. O model card descreve uma base de mixture-of-experts esparsa com quatro cabeças separadas acopladas: uma cabeça de 15 classes que estima o envolvimento geral de IA em uma janela, uma cabeça de três classes que rotula cada token individual como Humano, Assistido por IA ou Gerado por IA, uma cabeça binária que pergunta se o segmento é misto, e uma cabeça humanizadora de quatro classes.

Documentos longos são divididos em janelas sobrepostas de 512 tokens. Cada janela recebe uma pontuação, um campo aleatório condicional costura as decisões no nível de token em uma única sequência de rótulos ao longo de todo o documento, e uma etapa de pós-processamento ajusta o resultado aos limites das frases com uma sequência contígua mínima de cerca de duas frases. É uma melhoria real em relação ao Pangram 3, que fragmentava o texto durante o pré-processamento e produzia blocos mais grosseiros.
Isso também explica um comportamento que as pessoas relatam constantemente e interpretam como um bug. Como a pontuação é feita por janelas e depois suavizada, o mesmo parágrafo pode voltar com uma cor diferente dependendo do que o rodeia. A própria Pangram lista isso entre suas limitações: "ocasionalmente, um subconjunto de um texto mais longo receberá previsões diferentes dependendo se está isolado ou embutido no documento ao redor." Isso é honesto, e também é o mecanismo por trás de metade das postagens confusas em fóruns sobre o Pangram.

Dois detalhes da API valem a pena conhecer antes de construir algo sobre isso, porque são fáceis de interpretar mal. O ai_assistance_score é calculado como P(AI-Generated) + 0.5 × P(AI-Assisted), e o model card diz claramente que ele "não é a probabilidade do rótulo discreto exibido". O campo confidence retorna High, Medium ou Low, e o cartão diz que ele "não é uma estimativa de probabilidade calibrada". Então você não pode tratar confidence: High como uma certeza de 95%. Se você está conectando a detecção a um fluxo de trabalho, essa distinção é tudo. Minhas notas sobre construir um pipeline de conteúdo com IA explicam onde um portão como esse realmente deveria ficar.
Os números que a Pangram publica
É preciso dar o crédito devido: a Pangram publica mais detalhes de sua própria avaliação do que qualquer detector que já analisei, incluindo um artigo técnico e um relatório no arXiv. Aqui está o conjunto principal de números.
| Métrica | Pangram 4 | Pangram 3 / 3.3 | Conjunto de teste |
|---|---|---|---|
| Taxa de falsos positivos (inglês) | 0,0041% (IC 95% 0,0032% a 0,0050%) | não informado na página | 1.000.000 de amostras em inglês do FineWeb |
| Falsos positivos, inglês comum | aproximadamente 1 em 24.000 documentos | 14x mais | mesmo conjunto |
| Taxa de falsos negativos (inglês) | 0,3396% | 1,9942% | 519.993 amostras, 26 modelos geradores |
| Escrita humana aprimorada por IA marcada como totalmente IA | 0,01% | 0,18% | edições do Grammarly, Apple Intelligence e Gemini em textos de estudantes |
| IA humanizada ainda detectada | 98,83% | não informado | 13 ferramentas humanizadoras comerciais |
| AUROC | 0,9916 | não informado | corpus próprio da Pangram |
A tabela de falsos negativos por gerador é a parte mais citável do model card. O Grok 4.3 é o modelo mais difícil de detectar para o Pangram 4, com 0,605%, e o Claude Haiku 4.5 é o mais fácil, com 0,130%. O Gemini foi o que mais melhorou entre versões, passando de uma taxa de perda de família de 5,138% no Pangram 3.3.2 para 0,498%. A Pangram também relata não haver correlação significativa entre a data de lançamento de um modelo e o quão detectável ele é, uma afirmação mais ousada do que parece e que contraria a suposição comum de que modelos mais novos são mais difíceis de detectar.
Uma inconsistência a se conhecer se você citar isso: o bloco de resultados principais do post técnico dá a taxa de falso alarme de polimento por IA como 0,009%, enquanto uma seção mais abaixo na mesma página dá 0,01%. Pequeno, mas é o tipo de coisa que faz você verificar o resto.
Onde o número de destaque para de valer
Agora, a parte que acho que uma análise justa precisa destacar em vez de esconder.
Todo número acima é um número em inglês, medido em prosa longa e em frases completas. A Pangram também publica a tabela por idioma, e a dispersão é grande.

Em 18 idiomas, a taxa de falsos negativos multilíngue é de 1,24% contra 0,3396% para o inglês. Por idioma, varia do tcheco com 0,2760% até o urdu com 5,3169%, cerca de 16 vezes o número do inglês. O lado dos falsos positivos se sustenta muito melhor, com a maioria dos idiomas em 0,0000% e o ucraniano como o pior, com 0,0361%, então a fragilidade multilíngue está nas perdas, não em acusações falsas. A Pangram lista 24 idiomas suportados e não escondeu nada disso, o que eu respeito. Mas "um falso positivo em 24.000" e "damos suporte a 24 idiomas" são duas afirmações verdadeiras que as pessoas vão ler como uma só, e não são.
Depois há a lista de escopo, citada diretamente do model card:
"Short conversational replies, answers to questions with a single factual answer, source code, tables of contents, reference sections, templated or automated writing, instructions and technical manuals, and text dominated by mathematical notation are outside the model's primary scope or may be more susceptible to errors."
Leia isso de novo pensando em um fluxo de trabalho real. Modelos de resposta de suporte são textos baseados em modelos prontos. Notas de versão estão próximas de manuais técnicos. Um FAQ de produto são respostas a perguntas com uma única resposta factual. Qualquer coisa com menos de 50 palavras simplesmente não é pontuada. A Pangram também recomenda remover cabeçalhos e rodapés antes de escanear, e prefere .docx ou texto puro a PDF, porque a análise de PDF introduz artefatos.
Então, antes de agir sobre qualquer veredito do Pangram, vale a pena passar pelas mesmas quatro verificações que eu faço:
Esse veredito do Pangram se sustenta?
Quatro verificações, direto do escopo publicado pela própria Pangram. Escolha o que se aplica ao seu documento.
1. O texto tem pelo menos 50 palavras?
2. É prosa longa em frases completas?
3. Em que idioma está escrito?
4. Essa pontuação seria a única evidência por trás de uma decisão?
Responda às quatro perguntas acima para ver onde os números publicados deixam de valer para você.
Totalmente fora do escopo. O Pangram 4 aceita textos com pelo menos 50 palavras. Abaixo disso, nenhum número de precisão publicado se aplica. Não leia um veredito aqui.
Declarado como fora do escopo. O model card da Pangram lista código-fonte, sumários, seções de referência, textos baseados em modelos prontos e manuais técnicos como fora de seu escopo principal ou mais propensos a erros. O 0,0041% não descreve este documento.
Na prática, um modelo diferente. A taxa de falsos negativos multilíngue é de 1,24%, e até 5,3169% para o urdu, contra 0,3396% para o inglês. Os falsos positivos permanecem baixos, então confie menos em um resultado limpo do que confiaria em inglês.
Pare aqui. Este é o único ponto em que os críticos de detectores e a própria seção de ética da Pangram concordam: uma taxa de erro diferente de zero torna uma pontuação insegura como única evidência. Busque corroboração antes de agir.
Este é o caso suportado. Inglês, mais de 50 palavras, prosa comum, usado como um sinal entre vários. Essa é exatamente a população que os números publicados descrevem, e nela o Pangram 4 é o detector mais forte que já testei.
O que os pesquisadores independentes realmente encontraram
Fui procurar alguém fora da Pangram Labs que tivesse medido isso. A resposta é mais interessante do que "está verificado" ou "é marketing".
Três equipes independentes testaram o Pangram, e nenhuma delas mediu uma taxa de falsos positivos mais alta para ele do que para qualquer outro detector comercial. Em dois dos três casos, ele foi o mais baixo isoladamente; no estudo da VUB, empatou em 0% com o Turnitin e o Copyleaks. É um resultado consistente em diferentes corpora e diferentes métricas.
- Jabarian e Imas, da UChicago Booth (NBER Working Paper 34223), testaram 1.992 trechos humanos de antes de 2020 mais seus equivalentes de IA em seis gêneros e quatro modelos, e declararam nenhum conflito de interesse e nenhum financiamento da Pangram. O Pangram obteve uma taxa de falsos positivos de 0,001 contra 0,002 da Originality.ai e 0,007 do GPTZero, e foi "a única ferramenta a satisfazer um limite estrito (FPR ≤ 0,005) sem sacrificar a precisão".
- Um estudo revisado por pares da Vrije Universiteit Brussel no International Journal for Educational Integrity testou 160 artigos acadêmicos de pelo menos 4.000 palavras cada. Em artigos totalmente humanos escritos por estudantes de pós-graduação, o Pangram retornou 0% de IA. Em artigos totalmente de IA, o Turnitin produziu falsos negativos 100% das vezes, e a mediana do Pangram foi a mais próxima da verdade. A conclusão deles: "das quatro ferramentas de detecção de IA estudadas aqui, neste momento apenas [o Pangram] produziu resultados satisfatórios".
- A Epoch AI testou o Pangram 3.3.2 em 495 trechos humanos de 99 autores nomeados de antes de 2022 e obteve 0 falsos positivos.
Então a direção é clara. Agora, a aritmética, a parte que ninguém diz em voz alta.
| Teste independente | Amostras humanas | Versão do Pangram | FPR medida | Limite mais estrito que essa amostra pode sustentar |
|---|---|---|---|---|
| Jabarian e Imas, UChicago Booth | 1.992 trechos | era 3.x, meados de 2025 | 0,001 | cerca de 0,15% |
| Epoch AI | 495 trechos | 3.3.2, informada | 0% (0/495) | cerca de 0,6% |
| Van Vlasselaer et al., VUB | 40 artigos ESL | não informada | 0% | cerca de 7,5% |
| Russell et al., ACL 2025 | 60 artigos | não informada | 2% | não significativo nesse tamanho |
| Necessário para confirmar 0,0041% | ~73.000 | 4 | nunca medido | n/d |
Nenhum estudo independente tem escala suficiente para testar um número tão pequeno quanto 0,0041%. Zero falsos positivos em 1.992 trechos limita a taxa a cerca de 0,15%. Zero em 495 a limita a cerca de 0,6%. Todo conjunto de dados independente publicado é de uma a duas ordens de magnitude pequeno demais, e isso é um fato sobre o tamanho das amostras, não uma crítica à metodologia de ninguém.
E nenhum deles testou o Pangram 4. A Epoch AI declara explicitamente a versão 3.3.2. O estudo de Chicago foi realizado em meados de 2025. O Pangram 4 foi lançado em 29 de julho de 2026, então o modelo que carrega o número de destaque não foi avaliado por ninguém fora da empresa.
Há mais três descobertas que um comprador deveria considerar:
- A Epoch AI descobriu que o Pangram 3.3.2 perdeu 10% do texto de IA escrito no estilo de um autor nomeado no geral, e 25% da escrita científica gerada por IA sob imitação de estilo, subindo para 48% em trechos científicos gerados pelo Gemini. A história dos falsos positivos é forte. A dos falsos negativos sob prompting adversarial não é.
- Uma equipe afiliada à CMU (arXiv:2605.19516) mostrou que o texto de um modelo base é lido como humano enquanto o texto ajustado por instruções do mesmo modelo não é, e levou trechos individuais de 0% humano a 100% humano com duas rodadas de paráfrase. O veredito deles vale a citação: "os detectores atuais estão rastreando artefatos do ajuste por instruções e do contexto local mais do que qualquer noção invariante de texto gerado por máquina". Os autores informam que a Pangram e o GPTZero doaram os créditos de API.
- A Pangram está ausente do RAID, a única grande tabela de classificação de detectores que não é administrada por um fornecedor de detectores. O GPTZero aparece lá com AUROC de 0,984. Não há nenhum lugar neutro para conferir o número da Pangram ao lado do de seus concorrentes em um conjunto de dados que nenhum deles controla.
Parte do motivo pelo qual essa base de evidências é escassa é o custo, e isso é um ponto estrutural, não uma crítica. Um grupo da TU Darmstadt (arXiv:2606.04906) removeu a Pangram completamente de um benchmark de seis conjuntos de dados, escrevendo que testar os detectores proprietários "é inviável com os preços atuais (mais de 1.500 dólares no total)". Quando o preço da API de um detector deixa acadêmicos fora do alcance de auditá-lo, a auditoria simplesmente não acontece.
Vale dizer com clareza: a própria tabela de onze benchmarks da Pangram é rotulada como benchmarks de terceiros, e os conjuntos de dados de fato são de terceiros, mas a pontuação é da própria Pangram. Isso é uma afirmação mais fraca do que resultados independentes, e duas linhas da própria tabela da Pangram contradizem o marketing. No DetectRL, uma linha de base RoBERTa ajustada supera o Pangram 4 (99,75 contra 96,93 F1 na divisão multi-domínio), e o Pangram 4 pontua abaixo do Pangram 3 em todas as divisões do DetectRL. O upgrade não é monótono, e a Pangram publicou isso mesmo assim.
O que as histórias de falsos positivos têm em comum
Procure por Pangram em qualquer fórum de escrita e você vai encontrar pessoas cujo próprio trabalho foi marcado. O reflexo é descartar isso como trapaceiros buscando uma desculpa. Depois de ler algumas centenas dessas histórias, não acho que isso se sustente, porque elas se agrupam por registro, não por habilidade.
"Writing professor here. I've been teaching composition for 25 years. To be honest, I'm alarmed by Pangram. It said my writing is AI-generated, with a 100% degree level of certainty. I write comedy. Comedic writing has very specific rules, such as the "rule of three" (or comic triple), a classic comedic technique. As a comic writer, I have to tighten and re-tighten my writing over and over and over and over again, line by line. It's torturous. […] I might just abandon writing at this point."
O mecanismo ali é verificável e não é só impressão: uma prosa que foi apertada em direção a uma restrição formal converge para as mesmas estatísticas superficiais de uma prosa gerada. O caso mais bem documentado em qualquer lugar é de uma única variável, relatado por um professor que, no geral, classifica o Pangram como o melhor da categoria.
"Turns out, I had a section in the text with three bullet points. I removed the bullets (literally just the bullets themselves, no actual text) and it passed as human."
Mesma família: epígrafes escritas como afirmações factuais concisas, vinte anos de textos de marketing, prosa acadêmica com gramática correta e o hábito do travessão. Se sua escrita tem um estilo de casa deliberado, você está mais perto da fronteira do que alguém que escreve de modo mais solto. É um aprendizado meio sombrio sobre o próprio ofício, e explica o incentivo perverso que as pessoas descrevem, em que uma prosa mais limpa pontua pior do que se supõe que a escrita sem erros deveria pontuar.
É também por isso que "adicione alguns erros de volta" continua aparecendo como conselho popular, e por que existe todo um gênero de guias de como evitar a detecção. Perseguir uma pontuação dessa forma é a alavanca errada, e piora a escrita para o leitor, que era o ponto de tudo isso.
Eu preferiria ver as pessoas investindo em um processo de edição real e em personalidade genuína na escrita. Cheguei à mesma conclusão sobre prompts melhores: conserte a entrada, não a pontuação.
A crítica mais forte, porém, não é nenhuma dessas anedotas. É aritmética, de um acadêmico identificado.
"Suppose every instructor started using an AI detector on all student work. I'd estimate that students submit 500 – 1,000 written works in the course of a 4 year education […] If each of these were run through an AI detector with a FPR of 1 / 10,000, you'd have 5–10% of your student body falsely accused of cheating at least once."
Esse argumento sobrevive ao contato com os números da Pangram porque ele os aceita. O cofundador da Pangram, Bradley Emi respondeu na mesma thread no X, então essa é uma troca de dois lados, não um ataque unilateral. O ponto estatístico relacionado, de uma thread no Hacker News, é que uma taxa de falsos positivos não é uma taxa de descoberta falsa, e o número que as pessoas citam não é o número que elas pensam estar citando: se você marca 50 verdadeiros positivos e 10 falsos, a FPR pode ser 1 em 10.000 enquanto a chance de um determinado alerta estar errado é 1 em 6.
A própria seção de ética da Pangram não evita isso, e prefiro citá-la em vez de parafraseá-la:
"False accusations of AI usage can lead to serious consequences, including reputational damage, emotional trauma, and other undue harm. We acknowledge that our model has a non-zero error rate and its errors may result in such harms."
Também existe um fluxo de trabalho na comunidade que realmente funciona, e foi a coisa mais útil que li a semana toda. Um professor passa primeiro o enunciado da tarefa por vários modelos, reúne todo o resto, e trata o detector como a última etapa, não a primeira.
"I state that the AI detector is a "last chance at exoneration" and only comes after all the due diligance from before. If the detector says its real (even if it's a false negative) I drop it and don't report it. […] But when I point out that the detector is the last step and not the first step, this past year I have gone 24-for-24 in academic integrity submissions"
Detector por último, nunca primeiro. Esse é o único ponto em que os dois lados desse debate realmente concordam.
Preço: o 10x que ninguém anunciou
Os planos da Pangram são simples. A mudança por trás deles não é.
| Plano | Mensal | Anual | Palavras por mês | Escaneamentos de imagem | Assentos | Teste |
|---|---|---|---|---|---|---|
| Free | $0 | $0 | 2.000 por dia | 3 por dia | 1 | sem cartão |
| Individual | $20 | $180 | 300.000 | 100 | 1 | 7 dias |
| Professional | $65 | $540 | 1.500.000 | 500 | 1 | não informado |
| Team | $20 por assento | $180 por assento | 300.000 por assento | não publicado | mínimo de 2 | 7 dias |
| Institutional | sob consulta | sob consulta | verificações de IA e plágio "ilimitadas" | não publicado | não publicado | não publicado |
| Enterprise | "preço variável" | sob consulta | não publicado | não publicado | não publicado | não publicado |
A detecção de plágio é a linha do muro de pagamento: ausente no Free, presente em todo plano pago. A cota mensal de API de 200 dólares está apenas no Professional, não no Individual nem no Team. Integrações LMS para Canvas, Brightspace, Moodle e Google Classroom são exclusivas do Institutional. Retenção zero de dados e limites de taxa acima de 5 QPS são exclusivos do Enterprise, ambos sem preço divulgado.
Agora a parte interessante. O Pangram 4 mudou a unidade cobrável de um escaneamento por 1.000 palavras arredondadas para cima, para um escaneamento por 100 palavras. Isso é uma mudança claramente boa, e a Pangram a descreveu como algo que "permite aproveitar melhor seus créditos". Ao mesmo tempo, os tetos mensais foram reduzidos à metade: o Individual caiu de 600.000 palavras para 300.000, o Professional de 3.000.000 para 1.500.000.

Essas duas mudanças puxam em direções opostas, e o ponto de equilíbrio é um documento de 500 palavras. Abaixo disso você ganha, até 5x em um trecho de 100 palavras. Acima disso você perde, até a metade em qualquer texto de 1.000 palavras ou mais. A própria explicação da Pangram sobre o lado da API confirma isso: a mudança "representa uma variação de preço de 1-2x para documentos curtos e de até 10x para documentos longos".
Na API, a aritmética é mais direta. O valor em dólares não mudou, continua em 0,05 dólar de qualquer forma, mas a unidade encolheu dez vezes.
| Caminho | Custo por 1.000.000 de palavras |
|---|---|
| Professional, anual | $30.00 |
| Professional, mensal | $43.33 |
| Individual ou Team, anual | $50.00 |
| API do Pangram 3, tempo real (legado) | $50.00 |
| Individual ou Team, mensal | $66.67 |
| API do Pangram 4, em lote (20% de desconto) | $400.00 |
| API do Pangram 4, tempo real | $500.00 |
A API do Pangram 4 custa 7,5 vezes mais por palavra do que a assinatura Individual e 11,5 vezes mais do que o Professional anual. Se o seu volume cabe dentro de 1.500.000 palavras por mês, uma assinatura é dramaticamente mais barata. A API tem preço para incorporar detecção dentro de um produto, não para escaneamento em massa por autoatendimento. Vale a pena dimensionar isso em relação ao resto do stack, já que um detector raramente é o maior item do custo de um redator de blog com IA.
Uma armadilha que a página de preços não menciona. O Pangram 3 tem suporte até 30 de setembro de 2026, e até essa data, chamadas de API que omitem o argumento model continuam sendo roteadas para o Pangram 3 com a cobrança antiga. Depois dessa data, a mesma chamada silenciosamente fica dez vezes mais cara por palavra. Se você tem um script que chama a Pangram, fixe model="pangram-4" agora mesmo, e coloque um lembrete no calendário em vez de descobrir isso por uma fatura. Meu artigo sobre a API do redator de blog tem a versão mais ampla dessa lição sobre fixar versões.
Detecção de humanizadores, e por que não sou neutro nisso
Aqui é onde deixo de ser neutro, porque a eesel roda seu próprio redator de blog como motor de conteúdo, e o Pangram é o último portão que todo rascunho atravessa antes de ser publicado. São algumas centenas de rascunhos de experiência direta com esse detector específico, e o portão fica em um ponto fixo do meu fluxo de trabalho de escrita de blog, em vez de flutuar por aí.
A coisa mais útil que aprendi é algo que a Pangram merece crédito por. Reescrever por estilo não move a pontuação em nada. Nem a voz, nem o ritmo, nem as anedotas em primeira pessoa, nem remover frases feitas. Testei tudo isso. O que a Pangram lê é o quão previsível é cada token, segmento por segmento, o que significa que uma saída de modelo bem polida é marcada precisamente porque continua escolhendo a próxima palavra mais provável. Essa descoberta me custou semanas e é, de forma irritante, um ponto a favor da Pangram: o que ela mede não é um estilo superficial que se possa disfarçar com uma nova camada de tinta.
O Pangram 4 vai um passo além. A cabeça humanizadora de quatro classes agora rotula o texto como Humano, Gerado por IA, Editado por IA ou IA Humanizada, e a API retorna um booleano is_humanized que dispara em um humanizer_score de 0,91 por padrão. A Pangram relata detectar a participação de IA em saídas humanizadas 98,83% das vezes em 13 ferramentas comerciais. Então toda uma categoria de contorno, a que alimenta o mercado de ferramentas de humanização de conteúdo e coisas como o humanizador da Surfer, agora é seu próprio campo de saída rotulado em vez de uma brecha não detectada. A Pangram também divulgou algo honesto aqui: em ablações em que os gradientes da cabeça humanizadora chegaram ao modelo base, a taxa geral de falsos positivos se manteve, mas a ablação "concentrou as falhas em registros específicos: escrita acadêmica e redações ESL". Eles congelaram a cabeça para evitar isso. Muito poucos fornecedores publicam o experimento que deu errado.
Eles também executaram um red team de forma adequada. Deram a um agente, o Codex GPT 5.6 Sol, acesso em tempo real à API por 24 horas com o objetivo explícito de projetar falsos negativos repetíveis. Ele encontrou exatamente um desvio, imitando notas de patologia cirúrgica dictadas, que a Pangram então declarou fora do escopo porque a saída eram tópicos concisos em vez de prosa aberta. Essa exceção é o momento mais frágil de uma página que, no geral, é rigorosa. O ataque ainda assim funcionou.
E a conclusão que realmente tiro de tudo isso não é sobre detectores. O tráfego da eesel se moveu junto com mudanças na política de busca, não com as pontuações do detector. As diretrizes do Google visam conteúdo pouco útil, independentemente de como foi produzido, o que é uma questão diferente da procedência, e tenho os dados analíticos para mostrar que as duas coisas não se movem juntas. Uma pontuação baixa no Pangram é higiene. Não é uma estratégia, e não vai salvar uma página de que ninguém precisava. A alavanca honesta é a chata: pesquisar o assunto de verdade, ter um humano editando, e responder a uma pergunta real. É disso que tratam minhas notas sobre conteúdo compatível com E-E-A-T e sobre rascunhos que não conseguem rankear, e é o mesmo motivo pelo qual escalar conteúdo com segurança supera escalar rápido.
Pangram 4 contra os outros detectores
A Pangram é a opção mais cara aqui, de longe, e na taxa de falsos positivos medida também é a melhor entre as que equipes independentes testaram. Ambas as coisas são verdadeiras.
| Ferramenta | Plano pago mais barato | Unidade cobrável | Plano gratuito | Precisão autodeclarada | API | Detecção de imagens |
|---|---|---|---|---|---|---|
| Pangram | $20/mês (Individual) | palavras, unidades de 100 | 2.000 palavras/dia | FPR 0,0041%, FNR 0,3396% | Sim, $0,05 por 100 palavras | Sim, pré-visualização de pesquisa, 99,8% |
| GPTZero | $12,99/mês anual (Premium) | 300.000 palavras/mês | Sim | 99%, exibido junto aos 95,7% do RAID em sua própria página | Contatar vendas | Não |
| Originality.ai | $12,95/mês anual (Pro) | créditos, 1 = 100 palavras | Sem plano, 3 escaneamentos por dia | Turbo FPR 1,5%, Lite 0,5% | Apenas nível Enterprise, $136,58/mês anual | Não |
| Copyleaks | $13,99/mês anual (Personal) | créditos, 1 = 250 palavras ou 1 imagem | 25.000 caracteres por escaneamento | 99%, com precisão de IA por idioma chegando a 93,08% | Sim | Sim |
| Turnitin | sob consulta, apenas instituições | não publicado | Não | FPR abaixo de 1%, mas apenas em documentos com mais de 20% de IA | sem API independente | Não |
| Winston AI | $10/mês anual (Essential) | créditos, 1 por palavra | Sim | 99,98%, sem FPR publicada | Sim | Sim |
Um padrão que vale a pena nomear: nenhum fornecedor aqui publica um número de precisão confiável e uma taxa de falsos positivos com a mesma metodologia ao mesmo tempo. A Winston reivindica a maior precisão sem publicar nenhuma FPR. A Copyleaks reivindica a menor FPR, mas restringe a precisão a testes internos em inglês. A Turnitin publica a FPR mais bem validada e nenhum destaque de precisão. Duas delas contradizem seu próprio número na mesma página. A Pangram é a única que publica ambos com intervalos de confiança e tamanhos de amostra, e essa transparência é a maior parte do motivo pelo qual ela recebe o benefício da dúvida.
Veredito: Pangram se você precisa de procedência e pode pagar por isso. GPTZero se você quer uma segunda opinião mais barata, e ele está no RAID, o que conta para algo. Turnitin se você é uma instituição e a integração ao fluxo de trabalho importa mais do que a pontuação. Pule os detectores gratuitos e de código aberto: o estudo de Chicago mediu uma linha de base RoBERTa aberta com taxa de falsos positivos de 0,50 e a chamou de "inadequada para aplicações de alto risco", o que é generoso.
Quem realmente deveria comprar isso
Compre se você for uma plataforma, uma editora ou um periódico que precisa saber como uma submissão provavelmente foi produzida, em inglês, com extensão, e você tem uma etapa de corroboração depois da pontuação. A Pangram é a melhor ferramenta para esse trabalho, e não é por pouco.
Compre a assinatura, não a API, a menos que você esteja incorporando detecção a um produto. Com 7,5 vezes o custo por palavra, os créditos de API só fazem sentido quando você precisa da integração, não do volume.
Pense bem se você é educador. A ferramenta é forte, e a matemática da taxa-base ainda joga contra você em escala institucional, o que explica por que a própria seção de ética da Pangram e seus críticos mais ruidosos chegam ao mesmo lugar. Use por último, nunca primeiro.
Pule se seu conteúdo é majoritariamente não inglês, majoritariamente curto, majoritariamente baseado em modelos prontos, ou majoritariamente código e material de referência. Os números publicados não descrevem essa população, e a própria Pangram diz isso.
Pule se o que você realmente quer é conteúdo que rankeie. Um detector não te diz nada sobre se uma página merece existir. Para isso, leia sobre criação de conteúdo com IA e escolha uma ferramenta de geração de conteúdo em vez disso.
Se esse último caso é onde você realmente está, as comparações úteis são meu apanhado de geradores de conteúdo com IA e minha lista curta de ferramentas de escrita com IA. Equipes que querem incorporar isso a um sistema repetível geralmente buscam uma ferramenta de pipeline de conteúdo em vez de mais uma solução pontual.
Uma última nota sobre a base de avaliações, porque ela me surpreendeu. A ficha da Pangram no G2 existe com zero avaliações. A Capterra não tem ficha nenhuma. A extensão do Chrome está em 5,0 com 19 avaliações e 20.000 usuários, e listagens de busca colocam o Trustpilot em torno de 2,4 de 5 com 13 avaliações, embora a própria página tenha se recusado a carregar em toda tentativa. Então não há um corpus amplo de avaliações em nenhuma direção aqui, e quem cita "as avaliações" desse produto está citando cerca de trinta pessoas. O sinal real está em artigos acadêmicos e threads de fóruns, o que é incomum e, para uma empresa liderada por pesquisa, até que combina.
Experimente a eesel para a parte que um detector não consegue fazer
O Pangram te diz como um rascunho provavelmente foi escrito. Ele não consegue te dizer se o rascunho valia a pena ser escrito, e depois de algumas centenas de posts passando por esse portão, tenho confiança de que a segunda pergunta é a que move o tráfego.
Esse é o trabalho que a eesel faz. O redator de blog da eesel pesquisa um tópico a partir de fontes primárias, escreve com treinamento de voz de marca, constrói o grafo de links internos, e entrega um rascunho que um editor humano pode finalizar em vez de resgatar. É o mesmo pipeline que produziu este post, portão do detector incluído, o que é uma demonstração tão honesta quanto posso oferecer.
Você pode ver como automatizar a escrita de blog, comparar com o mercado na minha análise do redator de blog com IA, e então experimentar a eesel de graça. Se o seu critério é especificamente desempenho de busca, comece pelo ângulo do redator de blog para SEO.

Perguntas frequentes
Quão preciso é o Pangram 4?
Quanto custa o Pangram?
Vale a pena atualizar do Pangram 3 para o Pangram 4?
O Pangram 4 consegue detectar texto de IA humanizado?
is_humanized à resposta de sua API. Trabalhos independentes ainda encontram brechas: uma equipe da CMU levou trechos individuais de 0% humano a 100% humano com paráfrase iterativa. Se seu objetivo é uma prosa que pareça humana porque foi bem editada, fazer conteúdo de IA parecer humano e um processo de edição real superam qualquer truque para enganar o detector.Uma pontuação alta no Pangram significa que o Google vai penalizar meu conteúdo?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








