
Por que me importo com o que o esquema diz
Eu construo agentes de IA na eesel, o que significa que leio fichas técnicas de modelos do jeito que outras pessoas leem notas de versão, e tenho a chance de ver o que acontece quando um detector vive dentro de um pipeline real, e não em uma caixa de demonstração.
Todo rascunho que o redator de blog da eesel produz passa por um filtro de detector antes que uma pessoa o veja. Isso não é uma amostra pequena. Um cliente, um responsável por conteúdo de SEO em um CMS Webflow, opera um pipeline de palavra-chave até publicação com mais de 360 posts por mês, cerca de 12 por dia, com revisão e publicação em lote no final. Quando você opera nesse ritmo, "o detector disse 84%" não serve para nada, e "esses quatro parágrafos leem como assistidos por IA, o resto está limpo" é algo em que dá para agir. Então, para mim, o esquema é o produto, e o Pangram 4 é a primeira versão em que o esquema é a funcionalidade principal.
Esse volume também é o motivo pelo qual leio a seção de limites antes da seção de resultados. Um detector que vive dentro de um pipeline de conteúdo com IA recebe coisas para as quais nunca foi testado, e a falha é silenciosa: ele retorna um número para uma entrada que está fora do próprio escopo declarado, e esse número tem exatamente a mesma cara de um número real.
A equipe da eesel passou anos colocando IA em filas reais e observando modelos que soam confiantes errarem de formas que só aparecem em volume, e é o mesmo instinto que aplico a uma alegação de 0,0041%. Não é desconfiança. É só o hábito de ler a nota de rodapé primeiro.
O que o Pangram 4 realmente é
A Pangram Labs é uma empresa do Brooklyn, fundada em 2023, com uma equipe de 11 a 50 pessoas. Max Spero (CEO) e Bradley Emi (CTO) se conheceram em um alojamento estudantil no primeiro ano em Stanford e depois construíram o classificador juntos, segundo a própria história contada pela Pangram. A empresa tem a certificação SOC 2 Type 2, verificada pela AssuranceLab.
O Pangram 4 foi lançado em 29 de julho de 2026, e no mesmo dia veio uma rodada de 9 milhões de dólares liderada pela Menlo Ventures e um primeiro modelo de detecção de imagens de IA rotulado como prévia de pesquisa. O modelo tem uma ficha técnica publicada e um relatório técnico no arXiv como 2607.27183, o que é mais transparência do que a maioria oferece nessa categoria.
O posicionamento é direto e combativo. O título da página inicial é "An AI detector that actually works" (um detector de IA que realmente funciona), e o subtítulo alega 99,98% de precisão. Vale notar que o site cita várias cifras de precisão diferentes dependendo da página em que você cai: 99,98% no banner principal, 99,9%+ na faixa de selos, "mais de 99%" no FAQ, e uma taxa de falso positivo de 1 em 10.000 em uma entrada de FAQ diferente da cifra de 1 em 24.000 da ficha técnica. Não são exatamente contradições, são medições diferentes apresentadas com a mesma confiança, o que é o primeiro motivo para ir à ficha técnica em vez da página de marketing.
Como o Pangram 4 lê um documento
Esta é a parte que diferencia o Pangram 4 do seu próprio antecessor, e está tudo documentado.

A base é "um modelo de linguagem causal, de pesos abertos, de mistura de especialistas esparsa". A Pangram não nomeia o modelo base e não publica uma contagem de parâmetros. O treinamento levou quatro dias em oito GPUs NVIDIA H100, usando PyTorch e bibliotecas do Hugging Face, com um processo LoRA de duas etapas em que o primeiro adaptador é fundido na base antes de a segunda etapa começar.
Sobre a representação compartilhada, ficam quatro cabeças lineares:
- Uma cabeça de segmento de 15 classes, que estima o nível geral de envolvimento de IA em uma janela de texto.
- Uma cabeça de procedência por token, de três classes, que prevê Human, AI-Assisted ou AI-Generated para cada token individualmente.
- Uma cabeça binária de autoria mista, que estima se um segmento contém texto de procedência mista.
- Uma cabeça humanizadora de quatro classes, que separa texto Human, AI-Generated, AI-Edited e Humanized-AI.
A cabeça humanizadora é treinada como uma sonda de gradiente interrompido, então seu objetivo nunca atualiza a base compartilhada. Ela também não vota no rótulo final: a ficha técnica é explícita ao dizer que, na etapa de decodificação, "a evidência do humanizador não contribui". Então is_humanized é um canal separado que se lê à parte, não uma entrada para o veredito.
A inferência trabalha sobre uma janela de 512 tokens, o que significa que documentos mais longos são divididos em janelas sobrepostas, e as previsões para tokens que aparecem em mais de uma janela são alinhadas e calculadas em média. Em seguida, um campo aleatório condicional de cadeia linear com três estados e calibrado combina as observações a nível de token, segmento e autoria mista ao longo de todo o documento, a decodificação de Viterbi escolhe a sequência de rótulos mais provável, e uma etapa de pós-processamento arredonda tudo para os limites das frases com um comprimento mínimo de bloco "ajustado para cerca de 2 frases".
Essa janela de 512 tokens é também o mecanismo por trás do relato de confusão de usuário mais comum sobre este produto, e já é assim há mais de um ano:
"Can you tell me how the sections work in Pangram? I am looking at a student's work, and Section 1 is all green, with 7.83% identified as possible AI use. Section 2, which includes most of Section 1 along with some additional new paragraphs, says 99.9% possible AI use, and some of the paragraphs that were green before are now red. Confused!"
Isso não é um bug, é o janelamento funcionando exatamente como projetado. O rótulo de um parágrafo depende do contexto em que foi avaliado, então o mesmo parágrafo pode mudar de cor quando você muda o que está ao redor dele. O Pangram 4 reduz o raio desse efeito ao levar o segmento mínimo a cerca de duas frases, onde o Pangram 3 era muito mais grosseiro, mas não elimina o efeito. Se você está escaneando trechos, escaneie o documento inteiro de uma vez, em vez de fragmento por fragmento, e as contradições vão parar de aparecer.
Os campos de saída, e os dois que são mal interpretados
Veja como um resultado finalizado do Pangram realmente se parece.

Por segmento, a API retorna a substring exata, um label, deslocamentos de caracteres, uma contagem de palavras e quatro números. Dois desses quatro são rotineiramente lidos como algo que não são, e a ficha técnica corrige ambos em linguagem simples.
ai_assistance_score é calculado como P(AI-Generated) + 0.5 × P(AI-Assisted). A ficha técnica declara que "é uma pontuação contínua de envolvimento de IA, não a probabilidade do rótulo discreto exibido". Então um segmento em 0,62 não significa 62% de confiança. Significa que a estimativa combinada de envolvimento de IA ficou em 0,62, e o rótulo ao lado dela vem de um caminho de decodificação separado.
confidence retorna High, Medium ou Low, e "mede o quão concentrado está o posterior irrestrito do CRF, não é uma estimativa de probabilidade calibrada". Confiança alta é uma afirmação sobre o quão nítido foi o pico da distribuição interna do modelo, não uma alegação de que ele acerta 95% das vezes.
Os outros dois são mais claros. humanizer_score é a probabilidade de uma ferramenta humanizadora ter tocado o segmento, e is_humanized vira verdadeiro a partir de 0,91 por padrão no lançamento, um limiar que a Pangram descreve como calibrado internamente, o que é uma forma educada de dizer que ele pode mudar.
Se você já discutiu com um colega sobre o que uma porcentagem de detector significa, é aqui que a discussão estava escondida. O número é real e o modelo está medindo algo, mas não é a cifra de "chance de isto ser IA" que todo mundo acha que está lendo. Essa lacuna é o assunto inteiro do meu artigo mais longo sobre a precisão dos detectores, e ela se aplica a toda essa categoria, não só a esta ferramenta.
Como o veredito do documento é decidido
No nível do documento, a Pangram retorna três frações ponderadas por caracteres que somam 1,0, mais um campo prediction_short com exatamente três valores possíveis e dois limiares publicados.

prediction_short, conforme a ficha técnica do Pangram 4.Human exige que pelo menos 90% dos caracteres do documento sejam classificados como humanos. AI exige que pelo menos 80% sejam classificados como gerados por IA. Tudo o mais é Mixed. Repare na assimetria: a barra para Human é mais rígida do que a barra para AI, então um documento com 85% gerado por IA não retorna AI, retorna Mixed.
Essa assimetria importa mais do que parece, porque a própria metodologia de avaliação da Pangram diz que, em conjuntos de dados binários que contêm apenas textos totalmente humanos ou totalmente de IA, uma previsão Mixed conta como erro. O que é justo, e também significa que as taxas de erro em destaque são medidas segundo um padrão mais rígido do que "acertou o clima geral".
Coloque sua própria divisão e observe onde o veredito muda:
O motivo pelo qual isso importa para quem está editando, e não avaliando: Mixed é o resultado normal para trabalho real. Um rascunho humano com uma introdução bem polida, ou um rascunho de IA que um humano reescreveu de forma adequada, ambos caem aí. Tratar Mixed como uma nota reprovadora significa tratar a edição de conteúdo com IA como comportamento suspeito, o que é contraproducente e empurra os redatores para o alvo errado. O objetivo é uma escrita sem erros que soe como uma pessoa, não uma fração que ultrapassa um limiar.
O que o Pangram 4 não cobre
A ficha técnica do modelo é incomumente direta sobre seus próprios limites, e esta é a seção que eu imprimiria antes de implantar a ferramenta em qualquer lugar.
O Pangram 4 "aceita entradas de texto com pelo menos 50 palavras" e é "projetado para prosa em linguagem natural escrita em frases completas". São citados como fora do escopo principal, ou mais propensos a erro: respostas conversacionais curtas, respostas de fato único, código-fonte, sumários, seções de referências, escrita baseada em modelos ou automatizada, instruções e manuais técnicos, e texto dominado por notação matemática. A Pangram também recomenda remover cabeçalhos, rodapés e formatação escritos por humanos antes de uma varredura, e prefere texto puro ou .docx em vez de PDF, porque a análise de PDF introduz artefatos.
Comparando essa lista com o modo como as pessoas realmente usam detectores, o descompasso é evidente. Descrições de produto, entradas de changelog, meta descrições, notas de versão, respostas de FAQ e legendas de redes sociais estão todas abaixo de 50 palavras ou são baseadas em modelo por natureza. Um veredito sobre qualquer uma delas fica fora do que o modelo afirma fazer, o que importa se você está filtrando a saída de uma ferramenta de geração de conteúdo que produz exatamente esses formatos em escala.
A lacuna de idiomas é o outro limite, e ela é quantificada. Contra 0,3396% do inglês, as taxas de falso negativo publicadas por idioma vão do tcheco, com 0,2760%, até o persa com 3,1715% e o urdu com 5,3169%. Os falsos negativos multilíngues somam 1,24%, quase quatro vezes o número do inglês. No lado dos falsos positivos a dispersão é menor, mas real, com o ucraniano no pior caso, 0,0361%.
| Corpus | N | Erros | Taxa |
|---|---|---|---|
| FineWeb inglês, humano | 1.000.000 | 41 falsos positivos | 0,0041% |
| FineWeb2, 104 idiomas, humano | 996.273 | 14 falsos positivos | 0,0014% |
| IA em inglês, 26 modelos geradores | 519.993 | 1.766 falsos negativos | 0,3396% |
| IA multilíngue, 18 idiomas | 190.149 | 23.578 falsos negativos | 1,24% |
Números da ficha técnica do Pangram 4.
Em comparação com o Pangram 3.3.2, a taxa geral de falso negativo em inglês caiu de 1,9942% para 0,3396%, o que é uma melhora geracional real, e não um arredondamento. Por gerador, o Grok 4.3 é o mais difícil, com 0,605%, e o Claude Haiku 4.5 o mais fácil, com 0,130%, e o maior ganho individual foi no Gemini, de 5,138% para 0,498%.
Onde você realmente pode rodar uma varredura
Cinco superfícies, e o plano gratuito alcança a maioria delas.
O aplicativo web aceita texto colado ou upload de arquivos, e suporta PDF, DOCX e RTF, até 100 arquivos por vez. Existe uma extensão de navegador para Chrome e Firefox que adiciona uma ação de clique direito "Check for AI Content" e funciona dentro do Google Docs.

A API funciona com créditos pré-pagos em vez de assinatura, a 0,05 dólar por 100 palavras no Pangram 4, com desconto de volume de 20% e um teto de 5 QPS em tempo real. Essa é a superfície que você usaria para colocar um filtro de detector dentro da sua própria stack, a mesma forma de integração de uma API de redação do lado da geração. Dois detalhes ali são fáceis de entender errado. O Pangram 4 custa exatamente dez vezes mais que o Pangram 3 por palavra, porque o valor em dólares ficou em 0,05 enquanto a unidade encolheu de 1.000 palavras para 100. E uma chamada que omite o argumento model continua sendo roteada para o Pangram 3 na cobrança antiga até 30 de setembro de 2026, momento em que a mesma chamada fica silenciosamente dez vezes mais cara por palavra. Fixe model="pangram-4" agora e você não vai se surpreender em outubro.
As integrações com LMS para Canvas, Moodle, Brightspace e Google Classroom ficam atrás da licença institucional sob cotação, e a checagem de plágio é a linha que separa o gratuito do pago. O detector de imagens está disponível em todos os planos, incluindo o gratuito, com três varreduras por dia, mas é uma prévia de pesquisa: a página declara 99,8% de precisão sem conjunto de dados, sem metodologia e sem lista publicada de quais geradores ele cobre.
Lendo os números sem interpretá-los demais
O Pangram 4 é, pelas evidências disponíveis, o detector mais forte dessa categoria. Equipes independentes de UChicago Booth, Vrije Universiteit Brussel e University of Maryland encontraram, todas, que o Pangram tinha a menor taxa de falso positivo entre os detectores comerciais que testaram. Todos esses estudos rodaram o Pangram 3.x. Nenhum terceiro testou o Pangram 4 ainda, e o maior conjunto de controle humano que alguém já reuniu limita a taxa de falso positivo a cerca de 0,15%, não 0,0041%. Confirmar uma cifra de 1 em 24.000 precisa de cerca de 73.000 amostras humanas limpas.
As duas críticas mais afiadas não são anedotas, são estatísticas, e ambas resistem ao confronto com os próprios números da Pangram.
"Pangram boasts a false positive rate of 1 in a 10,000. That is, if Pangram says a block of text is AI there is only a one in ten thousand chance that it was written by a human. That'd be if they had a false discovery rate of 1/10,000."
Essa distinção é a que vale a pena internalizar. Uma taxa de falso positivo responde "com que frequência isto sinaliza texto limpo", e uma taxa de falsa descoberta responde "dado que houve uma sinalização, qual a chance de estar errada". Esses dois números divergem muito quando o texto de IA genuíno é raro no monte que você está escaneando, que é exatamente a situação na maioria dos fluxos editoriais.
O segundo ponto é sobre quem você escaneia, não quantos.
"People mention Pangram has a low false positive rate, but usually such statistics are over a large population. […] But in your example you aren't checking 10 random works from an assortment of authors. You are checking 10 works from one author. […] all it might take for them to get most of them flagged even if they are 100% human written is for that author to have some style choice, like those 3 bullet point sections, that they just use in much of their writing."
Uma taxa de erro por população não diz nada sobre uma taxa de erro por autor. E os erros se correlacionam com estilo. As estatísticas publicadas pela Pangram não respondem a isso e, para ser justo com a Pangram, as de nenhum detector respondem. O próprio Spero relativiza a alegação de marketing quando pressionado, descrevendo benchmarks em conjuntos de dados públicos que colocam a taxa de falso positivo em "cerca de 1 em 10.000" em sua própria resposta no HN, um número diferente do destaque na ficha técnica, e honesto ao admitir que é apenas um entre vários.
Existe uma versão bem formulada do para que essa ferramenta serve, à qual eu sempre volto.
"The most reliable automatic detector right now must be https://www.pangram.com/. If Pangram says something is AI, it is very likely AI. Sometimes it concludes more unusual AI text is human-written"
Confie mais nos positivos do que nos negativos. Essa assimetria está embutida nos números publicados, onde a taxa de falso negativo é cerca de 80 vezes a de falso positivo, e é um modelo mental melhor do que qualquer porcentagem isolada. Isso também não é exclusivo da Pangram, decorre de como os detectores funcionam em geral: eles são ajustados para evitar acusar texto inocente, e o custo dessa escolha é a IA que passa despercebida.
Como eu implantaria isso
Detector por último, nunca primeiro. Se você tem um motivo independente para pensar que um texto é escrito por máquina, uma varredura pode sustentar isso, e a visão por segmento vai mostrar onde. Partir da varredura e trabalhar de trás para frente é como se acaba discutindo com uma probabilidade.
Observe padrões, não resultados isolados. Uma sinalização entre dez textos do mesmo autor é ruído. Oito em dez é motivo de conversa, e a versão sensata desse argumento foi feita no HN melhor do que eu conseguiria fazer aqui.
Escaneie documentos inteiros, não fragmentos, para que o janelamento de 512 tokens pare de produzir cores contraditórias no mesmo parágrafo.
E mantenha à vista o limite categórico, que o lado da educação neste debate já havia articulado anos antes de o lado do SEO alcançar.
"Ultimately they're black boxes. You don't really know what causes false positives/negatives. You get a number and hopefully its correct, but it's not like something that scans for plagiarism because with that you have the original source that you can refer to and make more insightful decisions on."
A detecção de plágio produz uma fonte que você pode abrir. A detecção de IA produz uma probabilidade que você não pode auditar. A saída por segmento do Pangram 4 é o mais próximo que alguém chegou de fechar essa lacuna, e mesmo assim ainda não é a mesma coisa.
Para uma equipe de conteúdo especificamente, isso empurra o trabalho útil para etapas anteriores. Um detector diz quais parágrafos leem como escritos por máquina; ele não diz se o texto responde à consulta, e esses dois fatos não têm relação. É por isso que eu gastaria o esforço em fazer o conteúdo soar humano por meio de edição de verdade e em adicionar personalidade, em vez de perseguir uma pontuação.
As diversas ferramentas de humanização otimizam, em sua maioria, para o número em vez do leitor, e a cabeça humanizadora dedicada do Pangram 4 existe justamente porque essa categoria ficou popular. O humanizador da Surfer é o que mais me pedem para comparar, e minha leitura honesta é que prompts de entrada melhores vencem qualquer passe de reescrita posterior.
Se você está escolhendo um detector, minha comparação de opções de software de detecção e minhas notas sobre o Grammarly como fonte de assistência de IA são as perguntas vizinhas. E se a sua preocupação é busca, e não autoria, a resposta honesta está em o Google penaliza conteúdo de IA, porque as duas coisas sempre foram medidas de forma diferente.
Para quem faz isso em escala organizacional, a versão de governança da mesma discussão é como escalar conteúdo de SEO com segurança. Um detector é um controle dentro desse sistema, não o sistema.
Experimente a eesel para o rascunho, não para o detector
O Pangram 4 dá nota ao rascunho que você já tem. Ele não tem opinião sobre se a pesquisa foi boa, e depois de ver muitos rascunhos passarem por esse filtro, os que passam facilmente são os que foram pesquisados de forma adequada e editados de forma adequada desde o início. Não existe atalho em que um post raso passe porque você achou a formulação certa.
Esse é o trabalho que a eesel faz. A eesel pesquisa um tema a partir de fontes primárias, escreve com treinamento de voz de marca, constrói o grafo de links internos e entrega um rascunho que um editor finaliza em vez de resgatar. O mesmo pipeline produziu este post, filtro do detector incluso, o que é praticamente a demonstração mais honesta que posso oferecer. Try eesel grátis, ou veja o ciclo automatizado funcionando de palavra-chave até publicação.
Se você quer a mecânica antes do discurso de vendas, como o redator funciona é a explicação, os prós e contras é a versão imparcial, e como eu testo uma ferramenta é o método que eu usaria com qualquer ferramenta desse espaço, incluindo a nossa.

Para onde ir a seguir depende de onde você já está. Ainda está comparando ferramentas? Minha análise do redator de blog com IA é o confronto direto, e os exemplos do redator mostram resultados antes de você se comprometer com qualquer coisa.
Já publica em volume? Então a restrição raramente é a redação em si, é quase sempre o ciclo de revisão, que é do que tratam a automação da escrita de blog e a velocidade de produção.
E se os rascunhos estão limpos mas o tráfego não vem, isso é um problema totalmente diferente. Escrevi sobre a lacuna de ranqueamento em separado, junto com o ângulo E-E-A-T, que costuma acabar sendo a causa real.
Para uma visão mais ampla, há meu resumo de geradores de conteúdo com IA e uma lista curta de ferramentas de redação com IA.
Se o ranqueamento é a única métrica que importa, comece pelo ângulo focado em SEO. Meu próprio fluxo de trabalho de redação também está documentado, para quem prefere copiar um processo a comprar um produto.
Perguntas frequentes
O que é o Pangram 4?
Como funciona o Pangram 4?
O Pangram 4 é gratuito?
Quais idiomas o Pangram 4 suporta?
Qual é a diferença entre AI-generated e AI-assisted no Pangram 4?
O Pangram 4 consegue detectar imagens geradas por IA?
Para que tipo de texto o Pangram 4 não foi projetado?
O Pangram 4 é preciso o suficiente para acusar alguém de usar IA?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.






