Pangram es un modelo de red neuronal diseñado para distinguir con alta precisión si un texto fue escrito por una persona o por un modelo de lenguaje de gran tamaño como ChatGPT o Claude. A diferencia de detectores previos basados en análisis de perplejidad —que se limitaban a preguntarse qué palabra escribiría un LLM a continuación y presentaban fallos notorios, como clasificar la Declaración de Independencia o la Biblia como contenido generado por IA—, Pangram aborda el problema como una tarea de identificación de autor.
El sistema aprende a representar cada estilo de escritura como un punto en un mapa interno: los autores con estilos similares se agrupan cerca, mientras que los estilos distintos se alejan. En ese mapa, los textos humanos y los producidos por distintos LLM ocupan regiones diferenciadas. Para clasificar un texto nuevo, Pangram lo sitúa en ese mapa y evalúa si sus coordenadas caen en una zona humana, ambigua o mixta, lo que permite señalar documentos que combinan pasajes humanos con otros generados.
El entrenamiento se realiza con pares de textos: para cada escrito humano con licencia comercial se genera una versión equivalente creada por IA, con igual longitud, tono y tema. Aprender a separar esos pares permite a Pangram afinar los límites entre estilos y reducir los falsos positivos. El conjunto de datos humanos procede de 2021 o antes, antes de la irrupción masiva de textos de IA en internet, lo que ayuda a evitar contaminación. Pangram publica benchmarks internos con cada actualización y ha sido verificado por equipos independientes de las universidades de Chicago y Maryland. Los investigadores pueden solicitar créditos de API para evaluar el modelo por su cuenta.
