Reseña de Pangram 4: qué significa realmente el dato de 1 entre 24.000

Kurnia Kharisma Agung Samiadjie
Escrito por

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Revisado por

Katelin Teen

Última edición August 6, 2026

Verificado por expertos
Dos compañeros revisando un resultado de detección de IA en un portátil, con los colores de marca naranja de Pangram

Qué es realmente Pangram 4

Pangram Labs hace una sola cosa: un clasificador que lee un documento y te dice qué partes probablemente escribió un modelo de lenguaje. Pangram 4 es la cuarta generación, y la publicación de lanzamiento lo llama "nuestro detector de IA más potente y preciso hasta la fecha".

La compañía lo lanzó junto a una ronda de 9 millones de dólares liderada por Menlo Ventures, anunciada el mismo día. Fue cofundada por Max Spero, que es el CEO, y Bradley Emi, el CTO. Se conocieron en una residencia de estudiantes de primer año en Stanford. La biografía de Spero en X dice "slop janitor @pangram", lo que da una idea de cómo ve la empresa su propio trabajo.

La vista de informe de Pangram sobre un PDF de 12.234 palabras, mostrando un veredicto Mixed, un indicador de contenido de IA del 61,3% y resaltado línea por línea, tomado de Pangram
La vista de informe de Pangram sobre un PDF de 12.234 palabras, mostrando un veredicto Mixed, un indicador de contenido de IA del 61,3% y resaltado línea por línea, tomado de Pangram

La superficie de producto es más amplia de lo que sugiere el nombre. Está la aplicación web de arriba, una extensión de navegador, una integración con Google Docs, un verificador de plagio incluido en los planes de pago, una API, y, desde ese mismo lanzamiento, un detector de imágenes en vista previa de investigación que afirma un 99,8% de precisión. Entre los clientes nombrados en la página de inicio están Substack, Quora, Google Classroom y Wiki Education. La implantación en Substack importa más adelante, porque explica por qué la mayoría de las quejas de 2026 vienen de escritores de newsletters y no de estudiantes.

La extensión de navegador de Pangram añadiendo un elemento "Check for AI Content" al menú del botón derecho, tomado de Pangram
La extensión de navegador de Pangram añadiendo un elemento "Check for AI Content" al menú del botón derecho, tomado de Pangram

Si esta categoría te resulta nueva, la versión corta del mecanismo está en mi guía sobre detectores de contenido de IA. Si estás comparando herramientas en vez de leer una sola reseña, también mantengo una lista actualizada de herramientas de detección.

Otras dos herramientas aparecen constantemente en las mismas conversaciones. El detector de contenido de Writer es el gratuito que la gente prueba primero, y mis notas sobre cómo elegir una herramienta de detección cubren qué buscar antes de pagar por cualquiera de ellas.

Cómo lee Pangram 4 un documento

Esta es la parte que encontré genuinamente interesante, porque Pangram 4 no es un solo clasificador con una sola salida. La ficha del modelo describe una arquitectura de mezcla de expertos disperso con cuatro cabezales independientes: un cabezal de 15 clases que estima la implicación general de IA en una ventana, un cabezal de tres clases que etiqueta cada token individual como Humano, Asistido por IA o Generado por IA, un cabezal binario que preguntar si el segmento es mixto, y un cabezal humanizador de cuatro clases.

Cómo lee Pangram 4 un documento: ventanas de 512 tokens, cuatro cabezales de predicción, un paso de unión y marcas a nivel de frase
Cómo lee Pangram 4 un documento: ventanas de 512 tokens, cuatro cabezales de predicción, un paso de unión y marcas a nivel de frase

Los documentos largos se dividen en ventanas superpuestas de 512 tokens. Cada ventana se puntúa, un campo aleatorio condicional une las decisiones a nivel de token en una única secuencia de etiquetas a lo largo de todo el documento, y un paso de posprocesamiento ajusta el resultado a los límites de las frases con una serie contigua mínima de unas dos frases. Es una mejora real frente a Pangram 3, que dividía el texto en fragmentos durante el preprocesamiento y producía bloques más gruesos.

Esto también explica un comportamiento que la gente reporta constantemente y confunde con un fallo. Como la puntuación se hace por ventanas y luego se suaviza, el mismo párrafo puede recibir un color distinto según lo que lo rodee. Pangram lo reconoce entre sus propias limitaciones: "en ocasiones, un subconjunto de un texto más largo recibirá predicciones distintas según esté aislado o incrustado en el documento que lo rodea". Es una explicación honesta, y también el mecanismo detrás de la mitad de los mensajes confundidos en foros sobre Pangram.

La tarjeta de desglose de documento de Pangram, aquí ejecutando Pangram 3.0, dividiendo un resultado en 80,2% generado por IA, 15,8% asistido por IA y 4% humano, tomado de Pangram
La tarjeta de desglose de documento de Pangram, aquí ejecutando Pangram 3.0, dividiendo un resultado en 80,2% generado por IA, 15,8% asistido por IA y 4% humano, tomado de Pangram

Hay dos detalles de la API que vale la pena conocer antes de construir nada sobre esto, porque son fáciles de malinterpretar. El ai_assistance_score se calcula como P(AI-Generated) + 0.5 × P(AI-Assisted), y la ficha del modelo dice claramente que "no es la probabilidad de la etiqueta discreta mostrada". El campo confidence devuelve High, Medium o Low, y la ficha dice que "no es una estimación de probabilidad calibrada". Así que no puedes tratar confidence: High como una certeza del 95%. Si estás conectando la detección a un flujo de trabajo, esa distinción lo es todo. Mis notas sobre cómo construir un pipeline de contenido con IA explican dónde debería ir realmente una compuerta como esta.

Los números que publica Pangram

Hay que reconocer el mérito: Pangram publica más detalle de su propia evaluación que cualquier detector que haya analizado, incluido un artículo técnico y un informe en arXiv. Aquí está el conjunto de cifras principales.

MétricaPangram 4Pangram 3 / 3.3Conjunto de prueba
Tasa de falsos positivos (inglés)0,0041% (IC 95% 0,0032% a 0,0050%)no indicada en la página1.000.000 de muestras en inglés de FineWeb
Falsos positivos, inglés estándaraproximadamente 1 de cada 24.000 documentos14 veces másmismo conjunto
Tasa de falsos negativos (inglés)0,3396%1,9942%519.993 muestras, 26 modelos generadores
Escritura humana pulida por IA marcada como totalmente IA0,01%0,18%ediciones de Grammarly, Apple Intelligence y Gemini sobre textos de estudiantes
IA humanizada aún detectada98,83%no indicada13 herramientas humanizadoras comerciales
AUROC0,9916no indicadacorpus propio de Pangram

La tabla de falsos negativos por generador es lo más citable de la ficha del modelo. Grok 4.3 es el modelo más difícil de detectar para Pangram 4, con un 0,605%, y Claude Haiku 4.5 es el más fácil, con un 0,130%. Gemini es el que más mejoró entre versiones, pasando de una tasa de fallo familiar del 5,138% en Pangram 3.3.2 a un 0,498%. Pangram también reporta que no hay una correlación significativa entre la fecha de lanzamiento de un modelo y lo detectable que resulta, lo cual es una afirmación más audaz de lo que parece y va en contra de la suposición habitual de que los modelos más nuevos son más difíciles de detectar.

Una inconsistencia que hay que conocer si citas esto: el bloque de resultados clave del artículo técnico da la tasa de falsas alertas por pulido de IA como 0,009%, mientras que una sección más abajo en la misma página la da como 0,01%. Es pequeño, pero es del tipo de detalle que te hace revisar el resto.

Dónde deja de sostenerse la cifra del titular

Ahora, la parte que creo que una reseña justa debe destacar en vez de esconder.

Cada número de arriba es un número en inglés, medido sobre prosa larga en frases completas. Pangram también publica la tabla por idioma, y la dispersión es amplia.

Texto de IA no detectado por idioma: inglés 0,34%, español 0,89%, francés 1,78%, persa 3,17%, urdu 5,32%
Texto de IA no detectado por idioma: inglés 0,34%, español 0,89%, francés 1,78%, persa 3,17%, urdu 5,32%

En 18 idiomas, la tasa de falsos negativos multilingüe es del 1,24% frente al 0,3396% del inglés. Por idioma, va desde el checo con 0,2760% hasta el urdu con 5,3169%, unas 16 veces la cifra del inglés. El lado de los falsos positivos se sostiene mucho mejor, con la mayoría de los idiomas en 0,0000% y el ucraniano como el peor con 0,0361%, así que la debilidad multilingüe está en los fallos y no en las acusaciones falsas. Pangram indica 24 idiomas compatibles y no oculta nada de esto, algo que respeto. Pero "un falso positivo entre 24.000" y "damos soporte a 24 idiomas" son dos afirmaciones verdaderas que la gente leerá como una sola, y no lo son.

Luego está la lista de alcance, citada directamente de la ficha del modelo:

"Short conversational replies, answers to questions with a single factual answer, source code, tables of contents, reference sections, templated or automated writing, instructions and technical manuals, and text dominated by mathematical notation are outside the model's primary scope or may be more susceptible to errors."

Léelo otra vez pensando en un flujo de trabajo real. Las macros de soporte son escritura basada en plantillas. Las notas de versión están cerca de los manuales técnicos. Un FAQ de producto son respuestas a preguntas con una única respuesta factual. Cualquier texto de menos de 50 palabras no se puntúa en absoluto. Pangram también recomienda quitar cabeceras y pies antes de escanear, y prefiere .docx o texto plano frente a PDF porque el análisis de PDF introduce artefactos.

Así que antes de actuar sobre cualquier veredicto de Pangram, vale la pena repasar las mismas cuatro comprobaciones que hago yo:

¿Se sostiene este veredicto de Pangram?

Cuatro comprobaciones, directamente del alcance publicado por Pangram. Elige lo que aplique a tu documento.

1. ¿El texto tiene al menos 50 palabras?

2. ¿Es prosa larga en frases completas?

3. ¿En qué idioma está?

4. ¿Sería esta puntuación la única evidencia detrás de una decisión?

Responde a las cuatro anteriores para ver dónde deja de aplicar los números publicados.

Totalmente fuera de alcance. Pangram 4 acepta texto de al menos 50 palabras. Por debajo de eso, ninguna cifra de precisión publicada aplica. No leas un veredicto aquí.

Declarado fuera de alcance. La ficha del modelo de Pangram enumera el código fuente, los índices, las secciones de referencia, la escritura basada en plantillas y los manuales técnicos como fuera de su alcance principal o más propensos a errores. El 0,0041% no describe este documento.

Un modelo distinto, en la práctica. La tasa de falsos negativos multilingüe es del 1,24%, y hasta el 5,3169% para el urdu, frente al 0,3396% del inglés. Los falsos positivos se mantienen bajos, así que confía menos en un resultado limpio que en inglés.

Detente aquí. Esto es lo único en lo que coinciden los críticos de los detectores y la propia sección de ética de Pangram: una tasa de error distinta de cero hace que una puntuación sea insegura como única evidencia. Consigue corroboración antes de actuar.

Este es el caso soportado. Inglés, más de 50 palabras, prosa normal, usado como una señal entre varias. Esta es exactamente la población que describen los números publicados, y en ella Pangram 4 es el detector más sólido que he probado.

Lo que encontraron realmente los investigadores independientes

Fui a buscar a alguien fuera de Pangram Labs que hubiera medido esto. La respuesta es más interesante que "está verificado" o "es marketing".

Tres equipos independientes han probado Pangram, y ninguno de ellos midió una tasa de falsos positivos más alta para Pangram que para cualquier otro detector comercial. En dos de los tres fue la más baja sin discusión; en el estudio de la VUB empató en 0% con Turnitin y Copyleaks. Es un resultado consistente en distintos corpus y distintas métricas.

  • Jabarian e Imas, de la Booth School of Business de la Universidad de Chicago (NBER Working Paper 34223), analizaron 1.992 pasajes humanos anteriores a 2020 más sus contrapartes de IA en seis géneros y cuatro modelos, y declararon no tener conflictos de interés ni financiación de Pangram. Pangram obtuvo una tasa de falsos positivos de 0,001 frente a 0,002 de Originality.ai y 0,007 de GPTZero, y fue "la única herramienta que cumplió un límite estricto (FPR ≤ 0,005) sin sacrificar precisión".
  • Un estudio revisado por pares de la Vrije Universiteit Brussel en el International Journal for Educational Integrity probó 160 artículos académicos de al menos 4.000 palabras cada uno. En artículos completamente humanos escritos por estudiantes de posgrado, Pangram devolvió 0% de IA. En artículos completamente generados por IA, Turnitin produjo falsos negativos el 100% de las veces, y la mediana de Pangram fue la más cercana a la verdad. Su conclusión: "de las cuatro herramientas de detección de IA estudiadas aquí, en este momento solo [Pangram] produjo resultados satisfactorios".
  • Epoch AI probó Pangram 3.3.2 con 495 pasajes humanos de 99 autores identificados anteriores a 2022 y obtuvo 0 falsos positivos.

Así que la dirección está clara. Ahora, la aritmética, que es la parte que nadie dice en voz alta.

Prueba independienteMuestras humanasVersión de PangramTasa de falsos positivos medidaLímite más estricto que esa muestra puede sostener
Jabarian e Imas, Chicago Booth1.992 pasajesera 3.x, mediados de 20250,001aproximadamente 0,15%
Epoch AI495 pasajes3.3.2, indicada0% (0/495)aproximadamente 0,6%
Van Vlasselaer et al., VUB40 artículos ESLno indicada0%aproximadamente 7,5%
Russell et al., ACL 202560 artículosno indicada2%no significativo a este tamaño
Necesario para confirmar 0,0041%~73.0004nunca medidon/a

Ningún estudio independiente tiene el tamaño suficiente para probar un número tan pequeño como 0,0041%. Cero falsos positivos en 1.992 pasajes acota la tasa a alrededor del 0,15%. Cero en 495 la acota a alrededor del 0,6%. Todos los conjuntos de datos independientes publicados son de uno a dos órdenes de magnitud demasiado pequeños, y eso es un hecho sobre el tamaño de las muestras y no una crítica a la metodología de nadie.

Y ninguno de ellos probó Pangram 4. Epoch AI indica explícitamente la versión 3.3.2. El estudio de Chicago se realizó a mediados de 2025. Pangram 4 se lanzó el 29 de julio de 2026, así que el modelo que sostiene la cifra estrella no ha sido evaluado por nadie fuera de la empresa.

Hay tres hallazgos más que un comprador debería considerar:

  • Epoch AI encontró que Pangram 3.3.2 se perdió el 10% del texto de IA escrito en el estilo de un autor nombrado en general, y el 25% de la escritura científica generada por IA bajo imitación de estilo, subiendo al 48% en pasajes científicos generados por Gemini. La historia de los falsos positivos es sólida. La de los falsos negativos bajo prompting adversarial no lo es.
  • Un equipo afiliado a CMU (arXiv:2605.19516) mostró que el texto de un modelo base se lee como humano mientras que el texto ajustado por instrucciones del mismo modelo no, y llevó pasajes individuales del 0% humano al 100% humano con dos rondas de paráfrasis. Su veredicto vale la pena citarlo: "los detectores actuales están rastreando artefactos del ajuste por instrucciones y del contexto local más que cualquier noción invariante de texto generado por máquina". Cabe notar que los autores revelan que Pangram y GPTZero donaron los créditos de la API.
  • Pangram está ausente de RAID, la única gran tabla de clasificación de detectores que no gestiona un proveedor de detectores. GPTZero aparece ahí con un AUROC de 0,984. No hay ningún lugar neutral donde comprobar el número de Pangram junto al de sus competidores sobre un conjunto de datos que ninguno de ellos controla.

Parte de por qué esa base de evidencia es delgada es el coste, y es un asunto estructural más que un reproche. Un grupo de la TU Darmstadt (arXiv:2606.04906) eliminó a Pangram por completo de un benchmark de seis conjuntos de datos, escribiendo que probar los detectores propietarios "es inviable con los precios actuales (más de 1.500$ en total)". Cuando el precio de la API de un detector deja fuera del rango de precio a los académicos que quieren auditarlo, la auditoría no ocurre.

Vale la pena decirlo con claridad: la propia tabla de once benchmarks de Pangram está etiquetada como benchmarks de terceros, y los conjuntos de datos sí son genuinamente de terceros, pero la puntuación es de Pangram. Eso es una afirmación más débil que los resultados independientes, y dos filas de la propia tabla de Pangram van en contra del marketing. En DetectRL, un modelo base RoBERTa afinado supera a Pangram 4 (99,75 frente a 96,93 F1 en la división multidominio), y Pangram 4 puntúa por debajo de Pangram 3 en todas las divisiones de DetectRL. La mejora no es monótona, y Pangram lo publicó de todos modos.

Lo que tienen en común las historias de falsos positivos

Busca Pangram en cualquier foro de escritura y encontrarás a gente cuyo propio trabajo fue marcado. El reflejo es descartar esto como tramposos buscando una excusa. Habiendo leído unos cuantos cientos de estos casos, no creo que eso se sostenga, porque las historias se agrupan por registro y no por habilidad.

Reddit

"Writing professor here. I've been teaching composition for 25 years. To be honest, I'm alarmed by Pangram. It said my writing is AI-generated, with a 100% degree level of certainty. I write comedy. Comedic writing has very specific rules, such as the "rule of three" (or comic triple), a classic comedic technique. As a comic writer, I have to tighten and re-tighten my writing over and over and over and over again, line by line. It's torturous. […] I might just abandon writing at this point."

El mecanismo ahí es verificable y no es una simple sensación: la prosa que se ha ajustado hacia una restricción formal converge en las mismas estadísticas superficiales que la prosa generada. El caso mejor documentado en cualquier parte es de una sola variable, reportado por un profesor que por lo demás califica a Pangram como el mejor de su categoría.

Hacker News

"Turns out, I had a section in the text with three bullet points. I removed the bullets (literally just the bullets themselves, no actual text) and it passed as human."

La misma familia: epígrafes escritos como afirmaciones de hecho recortadas, veinte años de textos de marketing, prosa académica con gramática correcta y una costumbre de usar rayas largas. Si tu escritura tiene un estilo de casa deliberado, estás más cerca del límite que alguien que escribe de manera más suelta. Es un aprendizaje algo sombrío sobre tu propio oficio, y explica el incentivo perverso que la gente describe, donde una prosa más limpia puntúa peor de lo que se supone que debería puntuar una escritura sin errores.

Por eso también "vuelve a meter algunos errores" sigue apareciendo como consejo popular, y por eso existe todo un género de guías para evitar la detección. Perseguir una puntuación de esa forma es la palanca equivocada, y empeora la escritura para el lector, que era el punto de todo esto.

Preferiría ver a la gente invertir en un proceso de edición real y en personalidad genuina en la escritura. Llegué a la misma conclusión sobre mejores prompts: arregla la entrada, no la puntuación.

La crítica más contundente, sin embargo, no es ninguna de estas anécdotas. Es aritmética, de un académico identificado.

LinkedIn

"Suppose every instructor started using an AI detector on all student work. I'd estimate that students submit 500 – 1,000 written works in the course of a 4 year education […] If each of these were run through an AI detector with a FPR of 1 / 10,000, you'd have 5–10% of your student body falsely accused of cheating at least once."

Ese argumento sobrevive al contacto con las cifras de Pangram porque las acepta. El cofundador de Pangram, Bradley Emi respondió al mismo hilo en X, así que este es un intercambio de dos partes y no un ataque unilateral. El punto estadístico relacionado, de un hilo de Hacker News, es que una tasa de falsos positivos no es una tasa de descubrimiento falso, y el número que la gente cita no es el número que quieren decir: si marcas 50 verdaderos positivos y 10 falsos, la FPR puede ser de 1 en 10.000 mientras que la probabilidad de que una alerta dada sea errónea sea de 1 en 6.

La propia sección de ética de Pangram no evita esto, y prefiero citarla en vez de parafrasearla:

"False accusations of AI usage can lead to serious consequences, including reputational damage, emotional trauma, and other undue harm. We acknowledge that our model has a non-zero error rate and its errors may result in such harms."

También existe un flujo de trabajo en la comunidad que realmente funciona, y es lo más útil que leí en toda la semana. Un profesor pasa primero el enunciado de la tarea por varios modelos, reúne todo lo demás, y trata el detector como el último paso en vez del primero.

Reddit

"I state that the AI detector is a "last chance at exoneration" and only comes after all the due diligance from before. If the detector says its real (even if it's a false negative) I drop it and don't report it. […] But when I point out that the detector is the last step and not the first step, this past year I have gone 24-for-24 in academic integrity submissions"

El detector al final, nunca al principio. Es lo único en lo que ambos bandos de este debate realmente coinciden.

Precio: el 10x que nadie anunció

Los planes de Pangram son simples. El cambio que hay debajo no lo es.

PlanMensualAnualPalabras al mesEscaneos de imagenAsientosPrueba
Free$0$02.000 al día3 al día1sin tarjeta
Individual$20$180300.00010017 días
Professional$65$5401.500.0005001no indicada
Team$20 por asiento$180 por asiento300.000 por asientono publicadomínimo 27 días
Institutionala consultara consultarverificaciones de IA y plagio "ilimitadas"no publicadono publicadono publicado
Enterprise"precio variable"a consultarno publicadono publicadono publicadono publicado

La detección de plagio es la línea del muro de pago: ausente en Free, presente en todos los planes de pago. La asignación mensual de la API de 200 $ está solo en Professional, no en Individual ni en Team. Las integraciones LMS con Canvas, Brightspace, Moodle y Google Classroom son exclusivas de Institutional. La retención de datos cero y los límites de tasa por encima de 5 QPS son exclusivos de Enterprise, y ambos sin precio.

Ahora la parte interesante. Pangram 4 cambió la unidad facturable de un escaneo por cada 1.000 palabras redondeadas hacia arriba, a un escaneo por cada 100 palabras. Es un cambio claramente positivo, y Pangram lo describió como algo que "te permite aprovechar mejor tus créditos". Al mismo tiempo, los límites mensuales se redujeron a la mitad: Individual pasó de 600.000 palabras a 300.000, y Professional de 3.000.000 a 1.500.000.

La línea de las 500 palabras: en el mismo plan de 20$, un documento de 100 palabras pasa de 600 a 3.000 escaneos al mes, mientras que un documento de 2.000 palabras pasa de 300 a 150
La línea de las 500 palabras: en el mismo plan de 20$, un documento de 100 palabras pasa de 600 a 3.000 escaneos al mes, mientras que un documento de 2.000 palabras pasa de 300 a 150

Esos dos cambios tiran en direcciones opuestas, y el punto de equilibrio es un documento de 500 palabras. Por debajo de eso ganas, hasta 5 veces más en un fragmento de 100 palabras. Por encima pierdes, hasta la mitad en cualquier texto de 1.000 palabras o más. El propio planteamiento de Pangram sobre el lado de la API coincide: el cambio "representa un cambio de precio de 1-2x para documentos cortos y de hasta 10x para documentos largos".

En la API la aritmética es más directa. La cifra en dólares no cambió, sigue siendo 0,05$ en cualquier caso, pero la unidad se redujo diez veces.

VíaCoste por 1.000.000 de palabras
Professional, anual$30.00
Professional, mensual$43.33
Individual o Team, anual$50.00
API de Pangram 3, en tiempo real (legado)$50.00
Individual o Team, mensual$66.67
API de Pangram 4, por lotes (20% de descuento)$400.00
API de Pangram 4, en tiempo real$500.00

La API de Pangram 4 cuesta 7,5 veces más por palabra que la suscripción Individual y 11,5 veces más que la Professional anual. Si tu volumen entra dentro de 1.500.000 palabras al mes, una suscripción es dramáticamente más barata. La API está pensada para integrar la detección dentro de un producto, no para escaneo masivo de autoservicio. Vale la pena dimensionar esto frente al resto del stack, ya que un detector rara vez es la línea más grande del coste de un redactor de blog con IA.

Hay una trampa que la página de precios no menciona. Pangram 3 tiene soporte hasta el 30 de septiembre de 2026, y hasta entonces las llamadas a la API que omiten el argumento model siguen enrutándose a Pangram 3 con la facturación antigua. Después de esa fecha, la misma llamada se vuelve silenciosamente diez veces más cara por palabra. Si tienes un script que llama a Pangram, fija model="pangram-4" ahora mismo, y pon una nota en tu calendario en vez de descubrirlo por una factura. Mi artículo sobre la API del redactor de blog tiene la versión más amplia de esa lección sobre fijar versiones.

Detección de humanizadores, y por qué esto me toca personalmente

Aquí es donde dejo de ser neutral, porque eesel dirige su propio redactor de blog como motor de contenido, y Pangram es la última puerta por la que pasa cada borrador antes de publicarse. Eso es unos cuantos cientos de borradores de experiencia directa con este detector concreto, y la puerta se sitúa en un punto fijo de mi flujo de trabajo de escritura de blog en vez de flotar sin lugar fijo.

Lo más útil que aprendí es algo que hay que reconocerle a Pangram. Reescribir por estilo no mueve la puntuación en absoluto. Ni la voz, ni el ritmo, ni las anécdotas en primera persona, ni eliminar frases hechas. Probé todo eso. Lo que Pangram lee es cuán predecible es cada token, segmento por segmento, lo que significa que el resultado pulido de un modelo se marca precisamente porque sigue elegiendo la siguiente palabra más probable. Este hallazgo me costó semanas y, molestamente, es un punto a favor de Pangram: lo que mide no es un estilo superficial que puedas pintar por encima.

Pangram 4 va un paso más allá. El cabezal humanizador de cuatro clases ahora etiqueta el texto como Humano, Generado por IA, Editado por IA o IA Humanizada, y la API devuelve un booleano is_humanized que se activa con un humanizer_score de 0,91 por defecto. Pangram reporta detectar la participación de IA en salida humanizada el 98,83% de las veces en 13 herramientas comerciales. Así que toda una categoría de solución alternativa, la que alimenta el mercado de herramientas de humanización de contenido y cosas como el humanizador de Surfer, ahora es su propio campo de salida etiquetado en lugar de un hueco no detectado. Pangram también reveló algo honesto aquí: en ablaciones donde los gradientes del cabezal humanizador llegaron al modelo base, la tasa general de falsos positivos se mantuvo, pero la ablación "concentró los fallos en registros específicos: escritura académica y ensayos ESL". Congelaron el cabezal para evitarlo. Muy pocos proveedores publican el experimento que salió mal.

También hicieron un red team en serio. Le dieron a un agente, Codex GPT 5.6 Sol, acceso en vivo a la API durante 24 horas con el objetivo explícito de diseñar falsos negativos repetibles. Encontró exactamente una manera de saltarse el detector, imitando notas de patología quirúrgica dictadas, que Pangram luego declaró fuera de alcance porque la salida eran viñetas concisas en vez de prosa abierta. Ese matiz es el momento más blando de una página que, por lo demás, es rigurosa. El ataque siguió funcionando.

Y la conclusión que realmente saco de todo esto no tiene que ver con los detectores. El tráfico de eesel se movió con los cambios de política de búsqueda, no con las puntuaciones del detector. Las directrices de Google apuntan al contenido poco útil sin importar cómo se produjo, lo cual es una pregunta distinta a la de la procedencia, y tengo las analíticas para demostrar que ambas cosas no se mueven juntas. Una puntuación baja de Pangram es higiene. No es una estrategia, y no rescatará una página que nadie necesitaba. La palanca honesta es la aburrida: investigar el tema con seriedad, que lo edite un humano y responder a una pregunta real. De eso van mis notas sobre contenido conforme a E-E-A-T y sobre borradores que no logran posicionar, y es la misma razón por la que escalar contenido de forma segura supera a escalarlo rápido.

Pangram 4 frente a los demás detectores

Pangram es la opción más cara de esta lista, con diferencia, y según la tasa de falsos positivos medida también es el mejor de los que han probado los equipos independientes. Ambas cosas son ciertas.

HerramientaPlan de pago más económicoUnidad facturablePlan gratisPrecisión autodeclaradaAPIDetección de imágenes
Pangram$20/mes (Individual)palabras, unidades de 1002.000 palabras/díaFPR 0,0041%, FNR 0,3396%Sí, $0,05 por cada 100 palabrasSí, vista previa de investigación, 99,8%
GPTZero$12,99/mes anual (Premium)300.000 palabras/mes99%, se muestra junto al 95,7% de RAID en su propia páginaContactar con ventasNo
Originality.ai$12,95/mes anual (Pro)créditos, 1 = 100 palabrasSin plan, 3 escaneos al díaTurbo FPR 1,5%, Lite 0,5%Solo nivel Enterprise, $136,58/mes anualNo
Copyleaks$13,99/mes anual (Personal)créditos, 1 = 250 palabras o 1 imagen25.000 caracteres por escaneo99%, con precisión de IA por idioma tan baja como 93,08%
Turnitina consultar, solo institucionesno publicadaNoFPR por debajo del 1%, pero solo en documentos con más del 20% de IASin API independienteNo
Winston AI$10/mes anual (Essential)créditos, 1 por palabra99,98%, sin FPR publicada

Un patrón que vale la pena nombrar: ningún proveedor aquí publica una cifra de precisión creíble y una tasa de falsos positivos con la misma metodología, a la vez. Winston reclama la mayor precisión sin ninguna FPR publicada. Copyleaks reclama la FPR más baja pero limita la precisión a pruebas internas en inglés. Turnitin publica la FPR mejor validada y sin titular de precisión. Dos de ellos contradicen su propia cifra en la misma página. Pangram es el único que publica ambas con intervalos de confianza y tamaños de muestra, y esa transparencia es la mayor parte de por qué se ganan el beneficio de la duda.

Veredicto: Pangram si necesitas procedencia y puedes permitírtelo. GPTZero si quieres una segunda opinión más barata, y aparece en RAID, lo cual cuenta para algo. Turnitin si eres una institución y la integración en el flujo de trabajo importa más que la puntuación. Salta los detectores gratuitos y de código abierto: el estudio de Chicago midió una línea base RoBERTa abierta con una tasa de falsos positivos de 0,50 y la calificó como "inadecuada para aplicaciones de alto riesgo", lo cual es generoso.

Quién debería comprar esto en realidad

Cómpralo si eres una plataforma, una editorial o una revista que necesita saber cómo se produjo probablemente un envío, en inglés, con extensión, y tienes un paso de corroboración después de la puntuación. Pangram es la mejor herramienta para ese trabajo, y no hay comparación.

Compra la suscripción, no la API, salvo que estés integrando la detección en un producto. Con 7,5 veces el coste por palabra, los créditos de la API solo tienen sentido cuando necesitas la integración y no el volumen.

Piénsalo bien si eres educador. La herramienta es sólida y la matemática de la tasa base sigue estando en tu contra a escala institucional, que es por lo que la propia sección de ética de Pangram y sus críticos más ruidosos llegan al mismo lugar. Úsala al final, nunca al principio.

Sáltatela si tu contenido es en su mayoría no en inglés, en su mayoría corto, en su mayoría basado en plantillas, o en su mayoría código y material de referencia. Los números publicados no describen esa población, y Pangram mismo lo dice.

Sáltatela si lo que realmente quieres es contenido que posicione. Un detector no te dice nada sobre si una página merece existir. Para eso, lee sobre creación de contenido con IA y elige una herramienta de generación de contenido en su lugar.

Si ese último caso es donde realmente estás, las comparaciones útiles son mi repaso de generadores de contenido con IA y mi lista corta de herramientas de escritura con IA. Los equipos que quieren integrar esto en un sistema repetible normalmente buscan una herramienta de pipeline de contenido en vez de otra solución puntual.

Una última nota sobre la base de reseñas, porque me sorprendió. La ficha de Pangram en G2 existe con cero reseñas. Capterra no tiene ninguna ficha. La extensión de Chrome está en 5,0 con 19 valoraciones y 20.000 usuarios, y los listados de búsqueda sitúan a Trustpilot en torno a 2,4 sobre 5 con 13 reseñas, aunque la propia página se negó a cargar en cada intento. Así que no hay un corpus de reseñas amplio en ninguna dirección aquí, y quien cite "las reseñas" de este producto está citando a unas treinta personas. La señal real vive en artículos académicos e hilos de foros, lo cual es inusual y, para una empresa liderada por investigación, resulta bastante apropiado.

Prueba eesel para la parte que un detector no puede hacer

Pangram te dice cómo se escribió probablemente un borrador. No puede decirte si el borrador valía la pena escribirse, y después de unos cuantos cientos de artículos pasando por esa puerta, tengo la confianza de que la segunda pregunta es la que realmente mueve el tráfico.

Ese es el trabajo que hace eesel. El redactor de blog de eesel investiga un tema a partir de fuentes primarias, escribe con entrenamiento de voz de marca, construye el grafo de enlaces internos y te entrega un borrador que un editor humano puede terminar en vez de rescatar. Es el mismo pipeline que produjo este artículo, puerta del detector incluida, que es la demostración más honesta que puedo ofrecer.

Puedes ver cómo automatizar la escritura de blog, compararlo con el resto del sector en mi reseña del redactor de blog con IA, y luego probar eesel gratis. Si tu criterio es específicamente el rendimiento en búsqueda, empieza mejor por el enfoque de redactor de blog para SEO.

El redactor de blog de eesel a mitad de un borrador: el artículo en el editor, su carpeta de investigación en la barra lateral y el agente informando de cada paso en el panel de chat
El redactor de blog de eesel a mitad de un borrador: el artículo en el editor, su carpeta de investigación en la barra lateral y el agente informando de cada paso en el panel de chat

Preguntas frecuentes

¿Qué tan preciso es Pangram 4?
Pangram Labs mide una tasa de falsos positivos del 0,0041% y una tasa de falsos negativos del 0,3396% en sus propios corpus reservados, lo que equivale aproximadamente a un falso positivo por cada 24.000 documentos en inglés. Equipos independientes han encontrado de forma constante que Pangram tiene la tasa de falsos positivos más baja entre los detectores comerciales que probaron, pero todas esas pruebas se hicieron sobre Pangram 3.x, y ninguna tuvo el tamaño suficiente para confirmar una cifra tan pequeña. Para entender la mecánica detrás de estos números, consulta cómo funcionan los detectores de contenido de IA y mi análisis más amplio sobre la precisión de los detectores.
¿Cuánto cuesta Pangram?
El plan gratuito de Pangram escanea 2.000 palabras al día. Individual cuesta 20 $ al mes o 180 $ al año, Professional cuesta 65 $ al mes o 540 $ al año, y Team cuesta 20 $ por asiento al mes con un mínimo de dos asientos. La API funciona con créditos prepagados a 0,05 $ por cada 100 palabras en Pangram 4. Si estás presupuestando toda una operación de contenido y no solo un detector, mi desglose del coste de un redactor de blog con IA ofrece el panorama más amplio.
¿Vale la pena actualizar de Pangram 3 a Pangram 4?
Si escaneas documentos cortos, sí, porque la facturación pasó a unidades de 100 palabras, así que un fragmento de 150 palabras ya no consume un crédito completo de 1.000 palabras. Si escaneas artículos largos a través de la API, ese mismo cambio hace que Pangram 4 sea diez veces más caro por palabra. Pangram 3 tiene fecha de retirada el 30 de septiembre de 2026, así que la decisión tiene plazo. Los equipos que procesan borradores largos a volumen deberían leer mis notas sobre la velocidad de producción de contenido con IA antes de decidirse.
¿Puede Pangram 4 detectar texto de IA humanizado?
Pangram reporta detectar la participación de IA en texto humanizado el 98,83% de las veces en 13 herramientas humanizadoras comerciales, y Pangram 4 añade un campo dedicado is_humanized a la respuesta de su API. El trabajo independiente sigue encontrando huecos: un equipo de CMU llevó pasajes individuales del 0% humano al 100% humano con paráfrasis iterativa. Si tu objetivo es una prosa que suene humana porque está bien editada, hacer que el contenido de IA suene humano y un proceso de edición real superan a cualquier truco para engañar al detector.
¿Una puntuación alta de Pangram significa que Google penalizará mi contenido?
No. Pangram puntúa cómo se produjo probablemente un texto, y las directrices de Google apuntan al contenido poco útil sin importar la autoría, así que ambas cosas miden algo distinto. He visto cómo el tráfico propio de eesel se movía con los cambios de política de búsqueda y no con las cifras del detector. La respuesta completa está en si Google penaliza el contenido de IA, y la versión práctica en cómo escalar contenido SEO de forma segura.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Una ilustración de desglose de precios en el color naranja de la marca Pangram, mostrando los niveles de plan y la medición de créditos por palabra
Trending

Precios de Pangram en 2026: planes, créditos y tarifas de API

Todos los precios, límites y funciones de Pangram en un solo lugar, más el cambio de unidad de crédito que redujo a la mitad, sin avisar, los topes de palabras de ambos planes de pago.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
A document split into human, AI-assisted and AI-generated bands, being read under a magnifying glass, in Pangram's orange brand colour
Trending

Pangram 4: cómo lee un documento y cómo interpretar el resultado

Pangram 4 explicado a partir de su propia ficha técnica: los cuatro cabezales clasificadores que ejecuta en una sola pasada, los campos de salida que más se malinterpretan y dónde deja de funcionar.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Un equipo comparando detectores de texto de IA en una matriz de pizarra, con el color naranja de la marca Pangram
Alternatives

Alternativas a Pangram 4: comparativa de 5 detectores de IA

Cinco alternativas a Pangram 4, comparadas por lo que cada proveedor deja realmente por escrito: precisión, tasa de falsos positivos, unidad de facturación, acceso a la API y plan gratuito.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustración editorial de una tabla de clasificación de benchmarks con una barra alta destacada, que representa a ZCode y el modelo GLM-5.2
Trending

ZCode: qué es realmente el nuevo agente de codificación con IA de Z.ai

Un análisis práctico de ZCode, la app gratuita de codificación agéntica del equipo de GLM: el modelo GLM-5.2 que hay detrás, las quejas reales de la semana de lanzamiento y quién debería usarla.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Ilustración editorial de un desarrollador en un escritorio con un agente de código, representando una reseña de ZCode
Trending

Reseña de ZCode: ¿vale la pena el harness GLM-5.2 de Z.ai?

Z.ai combina GLM-5.2 con un harness de programación dedicado, ZCode. Precios reales, reacción de la semana de lanzamiento y si vale la pena confiar en un agente de código con acceso total.

Alicia Kirana UtomoAlicia Kirana UtomoJul 9, 2026
Ilustración dibujada a mano con el logo de Grok, un agente de soporte y paneles de benchmarks y precios
Trending

Grok 4.5: benchmarks, precios y lo que significa para el soporte

xAI acaba de lanzar Grok 4.5. Analizamos los benchmarks reales, el precio por token y si un modelo nuevo y de moda realmente cambia algo para tu cola de soporte.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 9, 2026
Texto alternativo de la imagen
Guides

Cómo hacer que el contenido de IA suene humano: Una guía práctica

¿Tiene problemas con el contenido de IA que suena robótico? Aprenda las técnicas clave, desde la edición manual hasta el uso de herramientas de humanización de IA, para que sus artículos sean atractivos y auténticos para sus lectores.

Stevia PutriStevia PutriJan 30, 2026
Texto alternativo de la imagen
Guides

¿Penaliza Google el contenido de IA? Esto es lo que dicen los datos

Exploramos la pregunta: ¿penaliza Google el contenido de IA? Analizaremos lo que Google ha dicho oficialmente, profundizaremos en un estudio masivo sobre lo que realmente está posicionando y resolveremos este asunto de una vez por todas.

Stevia PutriStevia PutriJan 14, 2026
Un revisor mirando una tarjeta de veredicto con dos diales de esfuerzo etiquetados como bajo y máximo, junto a la ballena de DeepSeek
Trending

Revisión de DeepSeek V4 Flash: un modelo, dos personalidades

Una revisión de DeepSeek V4 Flash basada en los números que publican ambos marcadores. La ejecución barata y la ejecución inteligente son los mismos pesos, y eso cambia el veredicto.

Riellvriany IndriawanRiellvriany IndriawanAug 4, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis