
Por qué me importa lo que dice el esquema
Construyo agentes de IA en eesel, lo que significa que leo fichas técnicas de modelos como otros leen notas de versión, y tengo la oportunidad de ver qué pasa cuando un detector vive dentro de un pipeline real en lugar de una caja de demostración.
Cada borrador que produce el redactor de blogs de eesel pasa por un filtro de detector antes de que lo vea una persona. No es una muestra pequeña. Un cliente, un responsable de contenido SEO en Webflow CMS, opera un pipeline de palabra clave a publicación a más de 360 posts al mes, unos 12 al día, con revisión y publicación en bloque al final. Cuando operas a ese ritmo, "el detector dijo 84%" no sirve de nada, y "estos cuatro párrafos leen como asistidos por IA, el resto está limpio" sí es procesable. Así que, en lo que a mí respecta, el esquema es el producto, y Pangram 4 es la primera versión en la que el esquema es la característica principal.
Ese volumen es también la razón por la que leo la sección de límites antes que la de resultados. Un detector que vive dentro de un pipeline de contenido con IA recibe cosas para las que nunca fue probado, y el fallo es silencioso: devuelve un número para una entrada que está fuera de su propio alcance declarado, y ese número tiene el mismo aspecto que uno real.
El equipo de eesel lleva años poniendo IA en colas reales y viendo cómo modelos que suenan seguros se equivocan de formas que solo se manifiestan a volumen, y es el mismo instinto que aplico a una afirmación del 0,0041%. No es desconfianza. Es solo el hábito de leer primero la nota al pie.
Qué es Pangram 4 en realidad
Pangram Labs es una empresa de Brooklyn, fundada en 2023, con un equipo de entre 11 y 50 personas. Max Spero (CEO) y Bradley Emi (CTO) se conocieron en una residencia de primer año en Stanford y más tarde construyeron el clasificador juntos, según la propia historia de Pangram. La compañía cuenta con la certificación SOC 2 Type 2, verificada por AssuranceLab.
Pangram 4 se lanzó el 29 de julio de 2026, y el mismo día llegó una ronda de 9 millones de dólares liderada por Menlo Ventures y un primer modelo de detección de imágenes de IA etiquetado como vista previa de investigación. El modelo tiene una ficha técnica publicada y un informe técnico en arXiv como 2607.27183, lo cual es más transparencia de la que ofrece la mayoría de esta categoría.
El posicionamiento es directo y combativo. El titular de la página de inicio es "An AI detector that actually works" ("un detector de IA que realmente funciona"), y el subtítulo afirma una precisión del 99,98%. Vale la pena notar que el sitio cita varias cifras de precisión distintas según la página en la que estés: 99,98% en el héroe, 99,9%+ en la franja de distintivos, "más del 99%" en el FAQ, y una tasa de falsos positivos de 1 entre 10.000 en una entrada de FAQ distinta de la cifra de 1 entre 24.000 de la ficha técnica. No son contradicciones exactamente, son mediciones distintas presentadas con la misma seguridad, que es la primera razón para acudir a la ficha técnica en lugar de a la página de marketing.
Cómo lee un documento Pangram 4
Esta es la parte que hace que Pangram 4 sea distinto de su propio predecesor, y todo está documentado.

La base es "un modelo de lenguaje causal, de pesos abiertos y mezcla de expertos dispersa". Pangram no nombra el modelo base y no publica un recuento de parámetros. El entrenamiento tomó cuatro días con ocho GPU NVIDIA H100, usando PyTorch y librerías de Hugging Face, con un proceso LoRA de dos etapas donde el primer adaptador se fusiona en la base antes de que empiece la segunda etapa.
Sobre la representación compartida se apoyan cuatro cabezales lineales:
- Un cabezal de segmento de 15 clases que estima el nivel general de implicación de IA en una ventana de texto.
- Un cabezal de procedencia por token de tres clases que predice Human, AI-Assisted o AI-Generated para cada token.
- Un cabezal binario de autoría mixta que estima si un segmento contiene texto de procedencia mixta.
- Un cabezal humanizador de cuatro clases que separa texto Human, AI-Generated, AI-Edited y Humanized-AI.
El cabezal humanizador se entrena como una sonda con gradiente detenido, así que su objetivo nunca actualiza la base compartida. Tampoco vota en la etiqueta final: la ficha técnica es explícita al decir que, en el paso de decodificación, "la evidencia del humanizador no contribuye". Así que is_humanized es un canal aparte que se lee por separado, no una entrada del veredicto.
La inferencia funciona sobre una ventana de 512 tokens, lo que significa que los documentos más largos se dividen en ventanas solapadas y las predicciones de los tokens que aparecen en más de una ventana se alinean y se promedian. Después, un campo aleatorio condicional de cadena lineal de tres estados y calibrado combina las observaciones a nivel de token, segmento y autoría mixta a lo largo de todo el documento, la decodificación de Viterbi elige la secuencia de etiquetas más probable, y un paso de posprocesamiento redondea todo a los límites de las oraciones con una longitud mínima de tramo "ajustada a alrededor de 2 oraciones".
Esa ventana de 512 tokens es también el mecanismo detrás del informe de confusión más común sobre este producto, y lo ha sido desde hace más de un año:
"Can you tell me how the sections work in Pangram? I am looking at a student's work, and Section 1 is all green, with 7.83% identified as possible AI use. Section 2, which includes most of Section 1 along with some additional new paragraphs, says 99.9% possible AI use, and some of the paragraphs that were green before are now red. Confused!"
Eso no es un fallo, es la ventana funcionando tal como fue diseñada. La etiqueta de un párrafo depende del contexto en el que fue evaluado, así que el mismo párrafo puede cambiar de color cuando cambias lo que lo rodea. Pangram 4 reduce el radio de este efecto al llevar el segmento mínimo a unas dos oraciones, donde Pangram 3 era mucho más grueso, pero no elimina el efecto. Si estás escaneando extractos, escanea el documento completo de una vez en lugar de fragmento por fragmento, y dejarás de ver contradicciones.
Los campos de salida, y los dos que se malinterpretan
Así es como se ve realmente un resultado terminado de Pangram.

Por segmento, la API devuelve la subcadena exacta, una label, los desplazamientos de caracteres, un recuento de palabras y cuatro números. Dos de esos cuatro se leen habitualmente como algo que no son, y la ficha técnica corrige ambos en lenguaje llano.
ai_assistance_score se calcula como P(AI-Generated) + 0.5 × P(AI-Assisted). La ficha técnica afirma que "es una puntuación continua de implicación de IA, no la probabilidad de la etiqueta discreta mostrada". Así que un segmento en 0,62 no significa un 62% de confianza. Significa que la estimación combinada de implicación de IA se situó en 0,62, y la etiqueta junto a ella proviene de una ruta de decodificación distinta.
confidence devuelve High, Medium o Low, y "mide lo pronunciado del posterior no restringido del CRF, no es una estimación de probabilidad calibrada". Una confianza alta es una afirmación sobre lo pronunciado que fue el pico de la distribución interna del modelo, no una afirmación de que acierta el 95% de las veces.
Los otros dos son más limpios. humanizer_score es la probabilidad de que una herramienta humanizadora haya tocado el segmento, e is_humanized se vuelve verdadero a partir de 0,91 por defecto en el lanzamiento, un umbral que Pangram describe como calibrado internamente, que es una forma educada de decir que puede cambiar.
Si alguna vez has discutido con un colega sobre qué significa el porcentaje de un detector, aquí es donde estaba escondida la discusión. El número es real y el modelo mide algo, pero no es la cifra de "probabilidad de que esto sea IA" que todo el mundo cree que es. Esa brecha es el tema completo de mi artículo más largo sobre la precisión de los detectores, y se aplica a toda esta categoría, no solo a esta herramienta.
Cómo se decide el veredicto del documento
A nivel de documento, Pangram devuelve tres fracciones ponderadas por caracteres que suman 1,0, más un campo prediction_short con exactamente tres valores posibles y dos umbrales publicados.

prediction_short, según la ficha técnica de Pangram 4.Human requiere que al menos el 90% de los caracteres del documento estén clasificados como humanos. AI requiere que al menos el 80% esté clasificado como generado por IA. Todo lo demás es Mixed. Fíjate en la asimetría: la barra para humano es más estricta que la barra para IA, así que un documento con un 85% generado por IA no devuelve AI, devuelve Mixed.
Esa asimetría importa más de lo que parece, porque la propia metodología de evaluación de Pangram dice que, en conjuntos de datos binarios que solo contienen textos completamente humanos o completamente de IA, una predicción Mixed cuenta como error. Lo cual es justo, y también significa que las tasas de error destacadas se miden con un estándar más estricto que "acertó el tono en general".
Introduce tu propia división y observa dónde cambia el veredicto:
La razón por la que esto importa para quien edita en lugar de calificar: Mixed es el resultado normal para un trabajo real. Un borrador humano con una introducción pulida, o un borrador de IA que un humano reescribió correctamente, ambos caen ahí. Tratar Mixed como una calificación reprobatoria significa tratar la edición de contenido con IA como un comportamiento sospechoso, lo cual es contraproducente, y empuja a los escritores hacia el objetivo equivocado. La meta es una escritura sin errores que suene como una persona, no una fracción que supere un umbral.
Lo que Pangram 4 no cubre
La ficha técnica es inusualmente directa sobre sus propios límites, y esta es la sección que imprimiría antes de desplegarlo en cualquier sitio.
Pangram 4 "acepta entradas de texto de al menos 50 palabras" y está "diseñado para prosa en lenguaje natural escrita en oraciones completas". Se nombran como fuera de su alcance principal, o más propensos a error: respuestas conversacionales breves, respuestas de un solo dato, código fuente, tablas de contenido, secciones de referencias, escritura plantillada o automatizada, instrucciones y manuales técnicos, y texto dominado por notación matemática. Pangram también recomienda eliminar encabezados, pies de página y formato escritos por humanos antes de un escaneo, y prefiere texto sin formato o .docx en lugar de PDF porque el análisis de PDF introduce artefactos.
Si comparas esa lista con cómo la gente usa realmente los detectores, el desajuste es evidente. Las descripciones de producto, las entradas de changelog, las meta descripciones, las notas de versión, las respuestas de FAQ y los pies de redes sociales están todos por debajo de las 50 palabras o son plantillados por naturaleza. Un veredicto sobre cualquiera de ellos queda fuera de lo que el modelo afirma hacer, lo cual importa si estás filtrando la salida de una herramienta de generación de contenido que produce exactamente esos formatos a escala.
La brecha de idiomas es el otro límite, y está cuantificada. Frente al 0,3396% del inglés, las tasas de falsos negativos publicadas por idioma van desde el checo con 0,2760% hasta el persa con 3,1715% y el urdu con 5,3169%. Los falsos negativos multilingües se agregan a un 1,24%, casi cuatro veces la cifra del inglés. En el lado de los falsos positivos la dispersión es menor pero real, siendo el ucraniano el peor con 0,0361%.
| Corpus | N | Errores | Tasa |
|---|---|---|---|
| FineWeb inglés, humano | 1.000.000 | 41 falsos positivos | 0,0041% |
| FineWeb2, 104 idiomas, humano | 996.273 | 14 falsos positivos | 0,0014% |
| IA en inglés, 26 modelos generadores | 519.993 | 1.766 falsos negativos | 0,3396% |
| IA multilingüe, 18 idiomas | 190.149 | 23.578 falsos negativos | 1,24% |
Cifras de la ficha técnica de Pangram 4.
Frente a Pangram 3.3.2, la tasa general de falsos negativos en inglés cayó del 1,9942% al 0,3396%, lo cual es una mejora generacional real y no un redondeo. Por generador, Grok 4.3 es el más difícil con 0,605% y Claude Haiku 4.5 el más fácil con 0,130%, y la mayor mejora individual fue en Gemini, del 5,138% al 0,498%.
Dónde puedes ejecutar realmente un escaneo
Cinco superficies, y el plan gratuito alcanza a la mayoría de ellas.
La aplicación web acepta texto pegado o archivos subidos, y admite PDF, DOCX y RTF, hasta 100 archivos a la vez. Hay una extensión de navegador para Chrome y Firefox que añade una acción de clic derecho "Check for AI Content" y funciona dentro de Google Docs.

La API funciona con créditos prepagados en lugar de suscripción, a 0,05 dólares por 100 palabras en Pangram 4, con un descuento por volumen del 20% y un límite de 5 QPS en tiempo real. Esa es la superficie que usarías para meter un filtro de detector dentro de tu propia pila, la misma forma de integración que una API de redacción en el lado de la generación. Hay dos detalles fáciles de pasar por alto ahí. Pangram 4 cuesta exactamente diez veces lo que Pangram 3 por palabra, porque la cifra en dólares se quedó en 0,05 mientras la unidad se redujo de 1.000 palabras a 100. Y una llamada que omite el argumento model sigue enrutándose a Pangram 3 con la facturación antigua hasta el 30 de septiembre de 2026, momento en el que la misma llamada se vuelve silenciosamente diez veces más cara por palabra. Fija model="pangram-4" ahora y no te llevarás una sorpresa en octubre.
Las integraciones LMS para Canvas, Moodle, Brightspace y Google Classroom están detrás de la licencia institucional con precio a medida, y la comprobación de plagio es la línea que separa lo gratuito de lo de pago. El detector de imágenes está en todos los planes, incluido el gratuito, con tres escaneos al día, pero es una vista previa de investigación: la página declara un 99,8% de precisión sin conjunto de datos, sin metodología y sin lista publicada de qué generadores cubre.
Leer las cifras sin sobreinterpretarlas
Pangram 4 es, según la evidencia disponible, el detector más fuerte de esta categoría. Equipos independientes de UChicago Booth, Vrije Universiteit Brussel y la Universidad de Maryland encontraron todos que Pangram tenía la tasa de falsos positivos más baja de los detectores comerciales que probaron. Todos esos estudios se ejecutaron sobre Pangram 3.x. Ningún tercero ha probado Pangram 4 todavía, y el mayor conjunto de control humano que alguien ha ejecutado acota la tasa de falsos positivos en torno al 0,15%, no al 0,0041%. Confirmar una cifra de 1 en 24.000 necesita alrededor de 73.000 muestras humanas limpias.
Las dos críticas más agudas no son anécdotas, son estadísticas, y ambas resisten el contraste con las propias cifras de Pangram.
"Pangram boasts a false positive rate of 1 in a 10,000. That is, if Pangram says a block of text is AI there is only a one in ten thousand chance that it was written by a human. That'd be if they had a false discovery rate of 1/10,000."
Esa distinción es la que hay que interiorizar. Una tasa de falsos positivos responde a "con qué frecuencia esto marca texto limpio", y una tasa de falso descubrimiento responde a "dado que hay una alerta, qué probabilidad hay de que esté equivocada". Esos dos números divergen mucho cuando el texto de IA genuino es escaso en el montón que estás escaneando, que es exactamente la situación en la mayoría de los flujos editoriales.
La segunda tiene que ver con a quién escaneas, no con cuántos.
"People mention Pangram has a low false positive rate, but usually such statistics are over a large population. […] But in your example you aren't checking 10 random works from an assortment of authors. You are checking 10 works from one author. […] all it might take for them to get most of them flagged even if they are 100% human written is for that author to have some style choice, like those 3 bullet point sections, that they just use in much of their writing."
Una tasa de error por población no dice nada sobre una tasa de error por autor. Y los errores se correlacionan con el estilo. Las estadísticas publicadas por Pangram no responden a esto y, para ser justos con Pangram, las de ningún detector lo hacen. El propio Spero matiza la afirmación de marketing cuando se le presiona, describiendo puntos de referencia en conjuntos de datos públicos que sitúan la tasa de falsos positivos en "aproximadamente 1 entre 10.000" en su propia respuesta en HN, una cifra distinta de la titular de la ficha técnica, y honesto sobre ser solo una de las cifras.
Hay una versión bien planteada de para qué sirve esta herramienta a la que vuelvo constantemente.
"The most reliable automatic detector right now must be https://www.pangram.com/. If Pangram says something is AI, it is very likely AI. Sometimes it concludes more unusual AI text is human-written"
Confía más en los positivos que en los negativos. Esa asimetría está integrada en las cifras publicadas, donde la tasa de falsos negativos es unas 80 veces la de falsos positivos, y es un mejor modelo mental que cualquier porcentaje aislado. Tampoco es exclusivo de Pangram: se deriva de cómo funcionan los detectores en general, que están ajustados para evitar acusar a texto inocente, y el coste de esa elección es la IA que se les escapa.
Cómo lo desplegaría yo
El detector al final, nunca al principio. Si tienes una razón independiente para pensar que un texto está escrito por una máquina, un escaneo puede respaldar eso, y la vista por segmento te dirá dónde. Partir del escaneo y trabajar hacia atrás es la forma de acabar discutiendo con una probabilidad.
Fíjate en los patrones, no en resultados aislados. Una alerta entre diez textos del mismo autor es ruido. Ocho de diez es una conversación, y la versión razonable de ese argumento se hizo en HN mejor de lo que puedo hacerla yo aquí.
Escanea documentos completos, no fragmentos, para que el sistema de ventanas de 512 tokens deje de producir colores contradictorios en el mismo párrafo.
Y mantén a la vista el límite categórico, algo que el lado educativo de este debate articuló años antes de que el lado del SEO lo alcanzara.
"Ultimately they're black boxes. You don't really know what causes false positives/negatives. You get a number and hopefully its correct, but it's not like something that scans for plagiarism because with that you have the original source that you can refer to and make more insightful decisions on."
La detección de plagio produce una fuente que puedes abrir. La detección de IA produce una probabilidad que no puedes auditar. La salida por segmento de Pangram 4 es lo más cerca que nadie ha llegado a cerrar esa brecha, y aun así no es lo mismo.
Para un equipo de contenido en concreto, eso empuja el trabajo útil río arriba. Un detector te dice qué párrafos se leen como escritos por máquina; no te dice si el texto responde a la consulta, y esos dos hechos no están relacionados. Por eso yo invertiría el esfuerzo en hacer que el contenido suene humano mediante una edición real y en añadir personalidad, en lugar de perseguir una puntuación.
Las diversas herramientas de humanización optimizan en su mayoría para el número en lugar de para el lector, y el cabezal humanizador dedicado de Pangram 4 existe precisamente porque esa categoría se hizo popular. El humanizador de Surfer es el que más me piden comparar, y mi lectura honesta es que mejores prompts de entrada superan a cualquier pasada de reescritura posterior.
Si estás eligiendo un detector, mi comparación de opciones de software de detección y mis notas sobre Grammarly como fuente de asistencia de IA son las preguntas vecinas. Y si tu preocupación es la búsqueda y no la autoría, la respuesta honesta vive en si Google penaliza el contenido con IA, porque las dos cosas siempre se han medido de forma distinta.
Para quien haga esto a escala organizativa, la versión de gobernanza de la misma discusión es cómo escalar contenido SEO de forma segura. Un detector es un control dentro de ese sistema, no el sistema entero.
Prueba eesel para el borrador, no para el detector
Pangram 4 califica el borrador que ya tienes. No tiene opinión sobre si la investigación fue buena, y después de ver pasar muchos borradores por ese filtro, los que lo superan con facilidad son los que estaban bien investigados y bien editados desde el principio. No existe un atajo donde un texto flojo pase porque encontraste la frase adecuada.
Ese es el trabajo que hace eesel. eesel investiga un tema a partir de fuentes primarias, escribe con entrenamiento de voz de marca, construye el grafo de enlaces internos y entrega un borrador que un editor termina en lugar de rescatar. El mismo pipeline produjo este post, filtro del detector incluido, que es la demostración más honesta que puedo ofrecer. Try eesel gratis, o mira el bucle automatizado funcionando de palabra clave a publicación.
Si quieres la mecánica antes que el discurso, cómo funciona el redactor es la explicación, los pros y los contras es la versión imparcial, y cómo pruebo yo una herramienta es el método que usaría con cualquier herramienta de este espacio, incluida la nuestra.

A dónde ir después depende de dónde estés ya. ¿Sigues comparando herramientas? Mi reseña de redactores de blogs con IA es el cara a cara, y los ejemplos del redactor muestran resultados antes de comprometerte con nada.
¿Ya publicas a gran volumen? Entonces la limitación rara vez es la redacción, es el ciclo de revisión, que es de lo que tratan la automatización de la escritura de blogs y la velocidad de producción.
Y si los borradores están limpios pero el tráfico no llega, ese es un problema completamente distinto. Escribí sobre la brecha de posicionamiento por separado, junto con el enfoque E-E-A-T que suele resultar ser la causa real.
Para una visión más amplia, está mi resumen de generadores de contenido con IA y una lista breve de herramientas de escritura con IA.
Si el posicionamiento es la única métrica que cuenta, empieza por el enfoque centrado en SEO. Mi propio flujo de trabajo de redacción también está documentado, para quien prefiera copiar un proceso antes que comprar un producto.
Preguntas frecuentes
¿Qué es Pangram 4?
¿Cómo funciona Pangram 4?
¿Es Pangram 4 gratis?
¿Qué idiomas admite Pangram 4?
¿Cuál es la diferencia entre AI-generated y AI-assisted en Pangram 4?
¿Puede Pangram 4 detectar imágenes generadas por IA?
¿Para qué tipo de texto no está diseñado Pangram 4?
¿Es Pangram 4 lo bastante preciso como para acusar a alguien de usar IA?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.






