
Qué es realmente Pangram 4
Pangram Labs hace una sola cosa: un clasificador que lee un documento y te dice qué partes probablemente escribió un modelo de lenguaje. Pangram 4 es la cuarta generación, y la publicación de lanzamiento lo llama "nuestro detector de IA más potente y preciso hasta la fecha".
La compañía lo lanzó junto a una ronda de 9 millones de dólares liderada por Menlo Ventures, anunciada el mismo día. Fue cofundada por Max Spero, que es el CEO, y Bradley Emi, el CTO. Se conocieron en una residencia de estudiantes de primer año en Stanford. La biografía de Spero en X dice "slop janitor @pangram", lo que da una idea de cómo ve la empresa su propio trabajo.

La superficie de producto es más amplia de lo que sugiere el nombre. Está la aplicación web de arriba, una extensión de navegador, una integración con Google Docs, un verificador de plagio incluido en los planes de pago, una API, y, desde ese mismo lanzamiento, un detector de imágenes en vista previa de investigación que afirma un 99,8% de precisión. Entre los clientes nombrados en la página de inicio están Substack, Quora, Google Classroom y Wiki Education. La implantación en Substack importa más adelante, porque explica por qué la mayoría de las quejas de 2026 vienen de escritores de newsletters y no de estudiantes.

Si esta categoría te resulta nueva, la versión corta del mecanismo está en mi guía sobre detectores de contenido de IA. Si estás comparando herramientas en vez de leer una sola reseña, también mantengo una lista actualizada de herramientas de detección.
Otras dos herramientas aparecen constantemente en las mismas conversaciones. El detector de contenido de Writer es el gratuito que la gente prueba primero, y mis notas sobre cómo elegir una herramienta de detección cubren qué buscar antes de pagar por cualquiera de ellas.
Cómo lee Pangram 4 un documento
Esta es la parte que encontré genuinamente interesante, porque Pangram 4 no es un solo clasificador con una sola salida. La ficha del modelo describe una arquitectura de mezcla de expertos disperso con cuatro cabezales independientes: un cabezal de 15 clases que estima la implicación general de IA en una ventana, un cabezal de tres clases que etiqueta cada token individual como Humano, Asistido por IA o Generado por IA, un cabezal binario que preguntar si el segmento es mixto, y un cabezal humanizador de cuatro clases.

Los documentos largos se dividen en ventanas superpuestas de 512 tokens. Cada ventana se puntúa, un campo aleatorio condicional une las decisiones a nivel de token en una única secuencia de etiquetas a lo largo de todo el documento, y un paso de posprocesamiento ajusta el resultado a los límites de las frases con una serie contigua mínima de unas dos frases. Es una mejora real frente a Pangram 3, que dividía el texto en fragmentos durante el preprocesamiento y producía bloques más gruesos.
Esto también explica un comportamiento que la gente reporta constantemente y confunde con un fallo. Como la puntuación se hace por ventanas y luego se suaviza, el mismo párrafo puede recibir un color distinto según lo que lo rodee. Pangram lo reconoce entre sus propias limitaciones: "en ocasiones, un subconjunto de un texto más largo recibirá predicciones distintas según esté aislado o incrustado en el documento que lo rodea". Es una explicación honesta, y también el mecanismo detrás de la mitad de los mensajes confundidos en foros sobre Pangram.

Hay dos detalles de la API que vale la pena conocer antes de construir nada sobre esto, porque son fáciles de malinterpretar. El ai_assistance_score se calcula como P(AI-Generated) + 0.5 × P(AI-Assisted), y la ficha del modelo dice claramente que "no es la probabilidad de la etiqueta discreta mostrada". El campo confidence devuelve High, Medium o Low, y la ficha dice que "no es una estimación de probabilidad calibrada". Así que no puedes tratar confidence: High como una certeza del 95%. Si estás conectando la detección a un flujo de trabajo, esa distinción lo es todo. Mis notas sobre cómo construir un pipeline de contenido con IA explican dónde debería ir realmente una compuerta como esta.
Los números que publica Pangram
Hay que reconocer el mérito: Pangram publica más detalle de su propia evaluación que cualquier detector que haya analizado, incluido un artículo técnico y un informe en arXiv. Aquí está el conjunto de cifras principales.
| Métrica | Pangram 4 | Pangram 3 / 3.3 | Conjunto de prueba |
|---|---|---|---|
| Tasa de falsos positivos (inglés) | 0,0041% (IC 95% 0,0032% a 0,0050%) | no indicada en la página | 1.000.000 de muestras en inglés de FineWeb |
| Falsos positivos, inglés estándar | aproximadamente 1 de cada 24.000 documentos | 14 veces más | mismo conjunto |
| Tasa de falsos negativos (inglés) | 0,3396% | 1,9942% | 519.993 muestras, 26 modelos generadores |
| Escritura humana pulida por IA marcada como totalmente IA | 0,01% | 0,18% | ediciones de Grammarly, Apple Intelligence y Gemini sobre textos de estudiantes |
| IA humanizada aún detectada | 98,83% | no indicada | 13 herramientas humanizadoras comerciales |
| AUROC | 0,9916 | no indicada | corpus propio de Pangram |
La tabla de falsos negativos por generador es lo más citable de la ficha del modelo. Grok 4.3 es el modelo más difícil de detectar para Pangram 4, con un 0,605%, y Claude Haiku 4.5 es el más fácil, con un 0,130%. Gemini es el que más mejoró entre versiones, pasando de una tasa de fallo familiar del 5,138% en Pangram 3.3.2 a un 0,498%. Pangram también reporta que no hay una correlación significativa entre la fecha de lanzamiento de un modelo y lo detectable que resulta, lo cual es una afirmación más audaz de lo que parece y va en contra de la suposición habitual de que los modelos más nuevos son más difíciles de detectar.
Una inconsistencia que hay que conocer si citas esto: el bloque de resultados clave del artículo técnico da la tasa de falsas alertas por pulido de IA como 0,009%, mientras que una sección más abajo en la misma página la da como 0,01%. Es pequeño, pero es del tipo de detalle que te hace revisar el resto.
Dónde deja de sostenerse la cifra del titular
Ahora, la parte que creo que una reseña justa debe destacar en vez de esconder.
Cada número de arriba es un número en inglés, medido sobre prosa larga en frases completas. Pangram también publica la tabla por idioma, y la dispersión es amplia.

En 18 idiomas, la tasa de falsos negativos multilingüe es del 1,24% frente al 0,3396% del inglés. Por idioma, va desde el checo con 0,2760% hasta el urdu con 5,3169%, unas 16 veces la cifra del inglés. El lado de los falsos positivos se sostiene mucho mejor, con la mayoría de los idiomas en 0,0000% y el ucraniano como el peor con 0,0361%, así que la debilidad multilingüe está en los fallos y no en las acusaciones falsas. Pangram indica 24 idiomas compatibles y no oculta nada de esto, algo que respeto. Pero "un falso positivo entre 24.000" y "damos soporte a 24 idiomas" son dos afirmaciones verdaderas que la gente leerá como una sola, y no lo son.
Luego está la lista de alcance, citada directamente de la ficha del modelo:
"Short conversational replies, answers to questions with a single factual answer, source code, tables of contents, reference sections, templated or automated writing, instructions and technical manuals, and text dominated by mathematical notation are outside the model's primary scope or may be more susceptible to errors."
Léelo otra vez pensando en un flujo de trabajo real. Las macros de soporte son escritura basada en plantillas. Las notas de versión están cerca de los manuales técnicos. Un FAQ de producto son respuestas a preguntas con una única respuesta factual. Cualquier texto de menos de 50 palabras no se puntúa en absoluto. Pangram también recomienda quitar cabeceras y pies antes de escanear, y prefiere .docx o texto plano frente a PDF porque el análisis de PDF introduce artefactos.
Así que antes de actuar sobre cualquier veredicto de Pangram, vale la pena repasar las mismas cuatro comprobaciones que hago yo:
¿Se sostiene este veredicto de Pangram?
Cuatro comprobaciones, directamente del alcance publicado por Pangram. Elige lo que aplique a tu documento.
1. ¿El texto tiene al menos 50 palabras?
2. ¿Es prosa larga en frases completas?
3. ¿En qué idioma está?
4. ¿Sería esta puntuación la única evidencia detrás de una decisión?
Responde a las cuatro anteriores para ver dónde deja de aplicar los números publicados.
Totalmente fuera de alcance. Pangram 4 acepta texto de al menos 50 palabras. Por debajo de eso, ninguna cifra de precisión publicada aplica. No leas un veredicto aquí.
Declarado fuera de alcance. La ficha del modelo de Pangram enumera el código fuente, los índices, las secciones de referencia, la escritura basada en plantillas y los manuales técnicos como fuera de su alcance principal o más propensos a errores. El 0,0041% no describe este documento.
Un modelo distinto, en la práctica. La tasa de falsos negativos multilingüe es del 1,24%, y hasta el 5,3169% para el urdu, frente al 0,3396% del inglés. Los falsos positivos se mantienen bajos, así que confía menos en un resultado limpio que en inglés.
Detente aquí. Esto es lo único en lo que coinciden los críticos de los detectores y la propia sección de ética de Pangram: una tasa de error distinta de cero hace que una puntuación sea insegura como única evidencia. Consigue corroboración antes de actuar.
Este es el caso soportado. Inglés, más de 50 palabras, prosa normal, usado como una señal entre varias. Esta es exactamente la población que describen los números publicados, y en ella Pangram 4 es el detector más sólido que he probado.
Lo que encontraron realmente los investigadores independientes
Fui a buscar a alguien fuera de Pangram Labs que hubiera medido esto. La respuesta es más interesante que "está verificado" o "es marketing".
Tres equipos independientes han probado Pangram, y ninguno de ellos midió una tasa de falsos positivos más alta para Pangram que para cualquier otro detector comercial. En dos de los tres fue la más baja sin discusión; en el estudio de la VUB empató en 0% con Turnitin y Copyleaks. Es un resultado consistente en distintos corpus y distintas métricas.
- Jabarian e Imas, de la Booth School of Business de la Universidad de Chicago (NBER Working Paper 34223), analizaron 1.992 pasajes humanos anteriores a 2020 más sus contrapartes de IA en seis géneros y cuatro modelos, y declararon no tener conflictos de interés ni financiación de Pangram. Pangram obtuvo una tasa de falsos positivos de 0,001 frente a 0,002 de Originality.ai y 0,007 de GPTZero, y fue "la única herramienta que cumplió un límite estricto (FPR ≤ 0,005) sin sacrificar precisión".
- Un estudio revisado por pares de la Vrije Universiteit Brussel en el International Journal for Educational Integrity probó 160 artículos académicos de al menos 4.000 palabras cada uno. En artículos completamente humanos escritos por estudiantes de posgrado, Pangram devolvió 0% de IA. En artículos completamente generados por IA, Turnitin produjo falsos negativos el 100% de las veces, y la mediana de Pangram fue la más cercana a la verdad. Su conclusión: "de las cuatro herramientas de detección de IA estudiadas aquí, en este momento solo [Pangram] produjo resultados satisfactorios".
- Epoch AI probó Pangram 3.3.2 con 495 pasajes humanos de 99 autores identificados anteriores a 2022 y obtuvo 0 falsos positivos.
Así que la dirección está clara. Ahora, la aritmética, que es la parte que nadie dice en voz alta.
| Prueba independiente | Muestras humanas | Versión de Pangram | Tasa de falsos positivos medida | Límite más estricto que esa muestra puede sostener |
|---|---|---|---|---|
| Jabarian e Imas, Chicago Booth | 1.992 pasajes | era 3.x, mediados de 2025 | 0,001 | aproximadamente 0,15% |
| Epoch AI | 495 pasajes | 3.3.2, indicada | 0% (0/495) | aproximadamente 0,6% |
| Van Vlasselaer et al., VUB | 40 artículos ESL | no indicada | 0% | aproximadamente 7,5% |
| Russell et al., ACL 2025 | 60 artículos | no indicada | 2% | no significativo a este tamaño |
| Necesario para confirmar 0,0041% | ~73.000 | 4 | nunca medido | n/a |
Ningún estudio independiente tiene el tamaño suficiente para probar un número tan pequeño como 0,0041%. Cero falsos positivos en 1.992 pasajes acota la tasa a alrededor del 0,15%. Cero en 495 la acota a alrededor del 0,6%. Todos los conjuntos de datos independientes publicados son de uno a dos órdenes de magnitud demasiado pequeños, y eso es un hecho sobre el tamaño de las muestras y no una crítica a la metodología de nadie.
Y ninguno de ellos probó Pangram 4. Epoch AI indica explícitamente la versión 3.3.2. El estudio de Chicago se realizó a mediados de 2025. Pangram 4 se lanzó el 29 de julio de 2026, así que el modelo que sostiene la cifra estrella no ha sido evaluado por nadie fuera de la empresa.
Hay tres hallazgos más que un comprador debería considerar:
- Epoch AI encontró que Pangram 3.3.2 se perdió el 10% del texto de IA escrito en el estilo de un autor nombrado en general, y el 25% de la escritura científica generada por IA bajo imitación de estilo, subiendo al 48% en pasajes científicos generados por Gemini. La historia de los falsos positivos es sólida. La de los falsos negativos bajo prompting adversarial no lo es.
- Un equipo afiliado a CMU (arXiv:2605.19516) mostró que el texto de un modelo base se lee como humano mientras que el texto ajustado por instrucciones del mismo modelo no, y llevó pasajes individuales del 0% humano al 100% humano con dos rondas de paráfrasis. Su veredicto vale la pena citarlo: "los detectores actuales están rastreando artefactos del ajuste por instrucciones y del contexto local más que cualquier noción invariante de texto generado por máquina". Cabe notar que los autores revelan que Pangram y GPTZero donaron los créditos de la API.
- Pangram está ausente de RAID, la única gran tabla de clasificación de detectores que no gestiona un proveedor de detectores. GPTZero aparece ahí con un AUROC de 0,984. No hay ningún lugar neutral donde comprobar el número de Pangram junto al de sus competidores sobre un conjunto de datos que ninguno de ellos controla.
Parte de por qué esa base de evidencia es delgada es el coste, y es un asunto estructural más que un reproche. Un grupo de la TU Darmstadt (arXiv:2606.04906) eliminó a Pangram por completo de un benchmark de seis conjuntos de datos, escribiendo que probar los detectores propietarios "es inviable con los precios actuales (más de 1.500$ en total)". Cuando el precio de la API de un detector deja fuera del rango de precio a los académicos que quieren auditarlo, la auditoría no ocurre.
Vale la pena decirlo con claridad: la propia tabla de once benchmarks de Pangram está etiquetada como benchmarks de terceros, y los conjuntos de datos sí son genuinamente de terceros, pero la puntuación es de Pangram. Eso es una afirmación más débil que los resultados independientes, y dos filas de la propia tabla de Pangram van en contra del marketing. En DetectRL, un modelo base RoBERTa afinado supera a Pangram 4 (99,75 frente a 96,93 F1 en la división multidominio), y Pangram 4 puntúa por debajo de Pangram 3 en todas las divisiones de DetectRL. La mejora no es monótona, y Pangram lo publicó de todos modos.
Lo que tienen en común las historias de falsos positivos
Busca Pangram en cualquier foro de escritura y encontrarás a gente cuyo propio trabajo fue marcado. El reflejo es descartar esto como tramposos buscando una excusa. Habiendo leído unos cuantos cientos de estos casos, no creo que eso se sostenga, porque las historias se agrupan por registro y no por habilidad.
"Writing professor here. I've been teaching composition for 25 years. To be honest, I'm alarmed by Pangram. It said my writing is AI-generated, with a 100% degree level of certainty. I write comedy. Comedic writing has very specific rules, such as the "rule of three" (or comic triple), a classic comedic technique. As a comic writer, I have to tighten and re-tighten my writing over and over and over and over again, line by line. It's torturous. […] I might just abandon writing at this point."
El mecanismo ahí es verificable y no es una simple sensación: la prosa que se ha ajustado hacia una restricción formal converge en las mismas estadísticas superficiales que la prosa generada. El caso mejor documentado en cualquier parte es de una sola variable, reportado por un profesor que por lo demás califica a Pangram como el mejor de su categoría.
"Turns out, I had a section in the text with three bullet points. I removed the bullets (literally just the bullets themselves, no actual text) and it passed as human."
La misma familia: epígrafes escritos como afirmaciones de hecho recortadas, veinte años de textos de marketing, prosa académica con gramática correcta y una costumbre de usar rayas largas. Si tu escritura tiene un estilo de casa deliberado, estás más cerca del límite que alguien que escribe de manera más suelta. Es un aprendizaje algo sombrío sobre tu propio oficio, y explica el incentivo perverso que la gente describe, donde una prosa más limpia puntúa peor de lo que se supone que debería puntuar una escritura sin errores.
Por eso también "vuelve a meter algunos errores" sigue apareciendo como consejo popular, y por eso existe todo un género de guías para evitar la detección. Perseguir una puntuación de esa forma es la palanca equivocada, y empeora la escritura para el lector, que era el punto de todo esto.
Preferiría ver a la gente invertir en un proceso de edición real y en personalidad genuina en la escritura. Llegué a la misma conclusión sobre mejores prompts: arregla la entrada, no la puntuación.
La crítica más contundente, sin embargo, no es ninguna de estas anécdotas. Es aritmética, de un académico identificado.
"Suppose every instructor started using an AI detector on all student work. I'd estimate that students submit 500 – 1,000 written works in the course of a 4 year education […] If each of these were run through an AI detector with a FPR of 1 / 10,000, you'd have 5–10% of your student body falsely accused of cheating at least once."
Ese argumento sobrevive al contacto con las cifras de Pangram porque las acepta. El cofundador de Pangram, Bradley Emi respondió al mismo hilo en X, así que este es un intercambio de dos partes y no un ataque unilateral. El punto estadístico relacionado, de un hilo de Hacker News, es que una tasa de falsos positivos no es una tasa de descubrimiento falso, y el número que la gente cita no es el número que quieren decir: si marcas 50 verdaderos positivos y 10 falsos, la FPR puede ser de 1 en 10.000 mientras que la probabilidad de que una alerta dada sea errónea sea de 1 en 6.
La propia sección de ética de Pangram no evita esto, y prefiero citarla en vez de parafrasearla:
"False accusations of AI usage can lead to serious consequences, including reputational damage, emotional trauma, and other undue harm. We acknowledge that our model has a non-zero error rate and its errors may result in such harms."
También existe un flujo de trabajo en la comunidad que realmente funciona, y es lo más útil que leí en toda la semana. Un profesor pasa primero el enunciado de la tarea por varios modelos, reúne todo lo demás, y trata el detector como el último paso en vez del primero.
"I state that the AI detector is a "last chance at exoneration" and only comes after all the due diligance from before. If the detector says its real (even if it's a false negative) I drop it and don't report it. […] But when I point out that the detector is the last step and not the first step, this past year I have gone 24-for-24 in academic integrity submissions"
El detector al final, nunca al principio. Es lo único en lo que ambos bandos de este debate realmente coinciden.
Precio: el 10x que nadie anunció
Los planes de Pangram son simples. El cambio que hay debajo no lo es.
| Plan | Mensual | Anual | Palabras al mes | Escaneos de imagen | Asientos | Prueba |
|---|---|---|---|---|---|---|
| Free | $0 | $0 | 2.000 al día | 3 al día | 1 | sin tarjeta |
| Individual | $20 | $180 | 300.000 | 100 | 1 | 7 días |
| Professional | $65 | $540 | 1.500.000 | 500 | 1 | no indicada |
| Team | $20 por asiento | $180 por asiento | 300.000 por asiento | no publicado | mínimo 2 | 7 días |
| Institutional | a consultar | a consultar | verificaciones de IA y plagio "ilimitadas" | no publicado | no publicado | no publicado |
| Enterprise | "precio variable" | a consultar | no publicado | no publicado | no publicado | no publicado |
La detección de plagio es la línea del muro de pago: ausente en Free, presente en todos los planes de pago. La asignación mensual de la API de 200 $ está solo en Professional, no en Individual ni en Team. Las integraciones LMS con Canvas, Brightspace, Moodle y Google Classroom son exclusivas de Institutional. La retención de datos cero y los límites de tasa por encima de 5 QPS son exclusivos de Enterprise, y ambos sin precio.
Ahora la parte interesante. Pangram 4 cambió la unidad facturable de un escaneo por cada 1.000 palabras redondeadas hacia arriba, a un escaneo por cada 100 palabras. Es un cambio claramente positivo, y Pangram lo describió como algo que "te permite aprovechar mejor tus créditos". Al mismo tiempo, los límites mensuales se redujeron a la mitad: Individual pasó de 600.000 palabras a 300.000, y Professional de 3.000.000 a 1.500.000.

Esos dos cambios tiran en direcciones opuestas, y el punto de equilibrio es un documento de 500 palabras. Por debajo de eso ganas, hasta 5 veces más en un fragmento de 100 palabras. Por encima pierdes, hasta la mitad en cualquier texto de 1.000 palabras o más. El propio planteamiento de Pangram sobre el lado de la API coincide: el cambio "representa un cambio de precio de 1-2x para documentos cortos y de hasta 10x para documentos largos".
En la API la aritmética es más directa. La cifra en dólares no cambió, sigue siendo 0,05$ en cualquier caso, pero la unidad se redujo diez veces.
| Vía | Coste por 1.000.000 de palabras |
|---|---|
| Professional, anual | $30.00 |
| Professional, mensual | $43.33 |
| Individual o Team, anual | $50.00 |
| API de Pangram 3, en tiempo real (legado) | $50.00 |
| Individual o Team, mensual | $66.67 |
| API de Pangram 4, por lotes (20% de descuento) | $400.00 |
| API de Pangram 4, en tiempo real | $500.00 |
La API de Pangram 4 cuesta 7,5 veces más por palabra que la suscripción Individual y 11,5 veces más que la Professional anual. Si tu volumen entra dentro de 1.500.000 palabras al mes, una suscripción es dramáticamente más barata. La API está pensada para integrar la detección dentro de un producto, no para escaneo masivo de autoservicio. Vale la pena dimensionar esto frente al resto del stack, ya que un detector rara vez es la línea más grande del coste de un redactor de blog con IA.
Hay una trampa que la página de precios no menciona. Pangram 3 tiene soporte hasta el 30 de septiembre de 2026, y hasta entonces las llamadas a la API que omiten el argumento model siguen enrutándose a Pangram 3 con la facturación antigua. Después de esa fecha, la misma llamada se vuelve silenciosamente diez veces más cara por palabra. Si tienes un script que llama a Pangram, fija model="pangram-4" ahora mismo, y pon una nota en tu calendario en vez de descubrirlo por una factura. Mi artículo sobre la API del redactor de blog tiene la versión más amplia de esa lección sobre fijar versiones.
Detección de humanizadores, y por qué esto me toca personalmente
Aquí es donde dejo de ser neutral, porque eesel dirige su propio redactor de blog como motor de contenido, y Pangram es la última puerta por la que pasa cada borrador antes de publicarse. Eso es unos cuantos cientos de borradores de experiencia directa con este detector concreto, y la puerta se sitúa en un punto fijo de mi flujo de trabajo de escritura de blog en vez de flotar sin lugar fijo.
Lo más útil que aprendí es algo que hay que reconocerle a Pangram. Reescribir por estilo no mueve la puntuación en absoluto. Ni la voz, ni el ritmo, ni las anécdotas en primera persona, ni eliminar frases hechas. Probé todo eso. Lo que Pangram lee es cuán predecible es cada token, segmento por segmento, lo que significa que el resultado pulido de un modelo se marca precisamente porque sigue elegiendo la siguiente palabra más probable. Este hallazgo me costó semanas y, molestamente, es un punto a favor de Pangram: lo que mide no es un estilo superficial que puedas pintar por encima.
Pangram 4 va un paso más allá. El cabezal humanizador de cuatro clases ahora etiqueta el texto como Humano, Generado por IA, Editado por IA o IA Humanizada, y la API devuelve un booleano is_humanized que se activa con un humanizer_score de 0,91 por defecto. Pangram reporta detectar la participación de IA en salida humanizada el 98,83% de las veces en 13 herramientas comerciales. Así que toda una categoría de solución alternativa, la que alimenta el mercado de herramientas de humanización de contenido y cosas como el humanizador de Surfer, ahora es su propio campo de salida etiquetado en lugar de un hueco no detectado. Pangram también reveló algo honesto aquí: en ablaciones donde los gradientes del cabezal humanizador llegaron al modelo base, la tasa general de falsos positivos se mantuvo, pero la ablación "concentró los fallos en registros específicos: escritura académica y ensayos ESL". Congelaron el cabezal para evitarlo. Muy pocos proveedores publican el experimento que salió mal.
También hicieron un red team en serio. Le dieron a un agente, Codex GPT 5.6 Sol, acceso en vivo a la API durante 24 horas con el objetivo explícito de diseñar falsos negativos repetibles. Encontró exactamente una manera de saltarse el detector, imitando notas de patología quirúrgica dictadas, que Pangram luego declaró fuera de alcance porque la salida eran viñetas concisas en vez de prosa abierta. Ese matiz es el momento más blando de una página que, por lo demás, es rigurosa. El ataque siguió funcionando.
Y la conclusión que realmente saco de todo esto no tiene que ver con los detectores. El tráfico de eesel se movió con los cambios de política de búsqueda, no con las puntuaciones del detector. Las directrices de Google apuntan al contenido poco útil sin importar cómo se produjo, lo cual es una pregunta distinta a la de la procedencia, y tengo las analíticas para demostrar que ambas cosas no se mueven juntas. Una puntuación baja de Pangram es higiene. No es una estrategia, y no rescatará una página que nadie necesitaba. La palanca honesta es la aburrida: investigar el tema con seriedad, que lo edite un humano y responder a una pregunta real. De eso van mis notas sobre contenido conforme a E-E-A-T y sobre borradores que no logran posicionar, y es la misma razón por la que escalar contenido de forma segura supera a escalarlo rápido.
Pangram 4 frente a los demás detectores
Pangram es la opción más cara de esta lista, con diferencia, y según la tasa de falsos positivos medida también es el mejor de los que han probado los equipos independientes. Ambas cosas son ciertas.
| Herramienta | Plan de pago más económico | Unidad facturable | Plan gratis | Precisión autodeclarada | API | Detección de imágenes |
|---|---|---|---|---|---|---|
| Pangram | $20/mes (Individual) | palabras, unidades de 100 | 2.000 palabras/día | FPR 0,0041%, FNR 0,3396% | Sí, $0,05 por cada 100 palabras | Sí, vista previa de investigación, 99,8% |
| GPTZero | $12,99/mes anual (Premium) | 300.000 palabras/mes | Sí | 99%, se muestra junto al 95,7% de RAID en su propia página | Contactar con ventas | No |
| Originality.ai | $12,95/mes anual (Pro) | créditos, 1 = 100 palabras | Sin plan, 3 escaneos al día | Turbo FPR 1,5%, Lite 0,5% | Solo nivel Enterprise, $136,58/mes anual | No |
| Copyleaks | $13,99/mes anual (Personal) | créditos, 1 = 250 palabras o 1 imagen | 25.000 caracteres por escaneo | 99%, con precisión de IA por idioma tan baja como 93,08% | Sí | Sí |
| Turnitin | a consultar, solo instituciones | no publicada | No | FPR por debajo del 1%, pero solo en documentos con más del 20% de IA | Sin API independiente | No |
| Winston AI | $10/mes anual (Essential) | créditos, 1 por palabra | Sí | 99,98%, sin FPR publicada | Sí | Sí |
Un patrón que vale la pena nombrar: ningún proveedor aquí publica una cifra de precisión creíble y una tasa de falsos positivos con la misma metodología, a la vez. Winston reclama la mayor precisión sin ninguna FPR publicada. Copyleaks reclama la FPR más baja pero limita la precisión a pruebas internas en inglés. Turnitin publica la FPR mejor validada y sin titular de precisión. Dos de ellos contradicen su propia cifra en la misma página. Pangram es el único que publica ambas con intervalos de confianza y tamaños de muestra, y esa transparencia es la mayor parte de por qué se ganan el beneficio de la duda.
Veredicto: Pangram si necesitas procedencia y puedes permitírtelo. GPTZero si quieres una segunda opinión más barata, y aparece en RAID, lo cual cuenta para algo. Turnitin si eres una institución y la integración en el flujo de trabajo importa más que la puntuación. Salta los detectores gratuitos y de código abierto: el estudio de Chicago midió una línea base RoBERTa abierta con una tasa de falsos positivos de 0,50 y la calificó como "inadecuada para aplicaciones de alto riesgo", lo cual es generoso.
Quién debería comprar esto en realidad
Cómpralo si eres una plataforma, una editorial o una revista que necesita saber cómo se produjo probablemente un envío, en inglés, con extensión, y tienes un paso de corroboración después de la puntuación. Pangram es la mejor herramienta para ese trabajo, y no hay comparación.
Compra la suscripción, no la API, salvo que estés integrando la detección en un producto. Con 7,5 veces el coste por palabra, los créditos de la API solo tienen sentido cuando necesitas la integración y no el volumen.
Piénsalo bien si eres educador. La herramienta es sólida y la matemática de la tasa base sigue estando en tu contra a escala institucional, que es por lo que la propia sección de ética de Pangram y sus críticos más ruidosos llegan al mismo lugar. Úsala al final, nunca al principio.
Sáltatela si tu contenido es en su mayoría no en inglés, en su mayoría corto, en su mayoría basado en plantillas, o en su mayoría código y material de referencia. Los números publicados no describen esa población, y Pangram mismo lo dice.
Sáltatela si lo que realmente quieres es contenido que posicione. Un detector no te dice nada sobre si una página merece existir. Para eso, lee sobre creación de contenido con IA y elige una herramienta de generación de contenido en su lugar.
Si ese último caso es donde realmente estás, las comparaciones útiles son mi repaso de generadores de contenido con IA y mi lista corta de herramientas de escritura con IA. Los equipos que quieren integrar esto en un sistema repetible normalmente buscan una herramienta de pipeline de contenido en vez de otra solución puntual.
Una última nota sobre la base de reseñas, porque me sorprendió. La ficha de Pangram en G2 existe con cero reseñas. Capterra no tiene ninguna ficha. La extensión de Chrome está en 5,0 con 19 valoraciones y 20.000 usuarios, y los listados de búsqueda sitúan a Trustpilot en torno a 2,4 sobre 5 con 13 reseñas, aunque la propia página se negó a cargar en cada intento. Así que no hay un corpus de reseñas amplio en ninguna dirección aquí, y quien cite "las reseñas" de este producto está citando a unas treinta personas. La señal real vive en artículos académicos e hilos de foros, lo cual es inusual y, para una empresa liderada por investigación, resulta bastante apropiado.
Prueba eesel para la parte que un detector no puede hacer
Pangram te dice cómo se escribió probablemente un borrador. No puede decirte si el borrador valía la pena escribirse, y después de unos cuantos cientos de artículos pasando por esa puerta, tengo la confianza de que la segunda pregunta es la que realmente mueve el tráfico.
Ese es el trabajo que hace eesel. El redactor de blog de eesel investiga un tema a partir de fuentes primarias, escribe con entrenamiento de voz de marca, construye el grafo de enlaces internos y te entrega un borrador que un editor humano puede terminar en vez de rescatar. Es el mismo pipeline que produjo este artículo, puerta del detector incluida, que es la demostración más honesta que puedo ofrecer.
Puedes ver cómo automatizar la escritura de blog, compararlo con el resto del sector en mi reseña del redactor de blog con IA, y luego probar eesel gratis. Si tu criterio es específicamente el rendimiento en búsqueda, empieza mejor por el enfoque de redactor de blog para SEO.

Preguntas frecuentes
¿Qué tan preciso es Pangram 4?
¿Cuánto cuesta Pangram?
¿Vale la pena actualizar de Pangram 3 a Pangram 4?
¿Puede Pangram 4 detectar texto de IA humanizado?
is_humanized a la respuesta de su API. El trabajo independiente sigue encontrando huecos: un equipo de CMU llevó pasajes individuales del 0% humano al 100% humano con paráfrasis iterativa. Si tu objetivo es una prosa que suene humana porque está bien editada, hacer que el contenido de IA suene humano y un proceso de edición real superan a cualquier truco para engañar al detector.¿Una puntuación alta de Pangram significa que Google penalizará mi contenido?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.






