Un desarrollador ha retomado un proyecto personal para detectar textos generados por modelos de lenguaje (LLM) mediante clasificadores clásicos de machine learning, en lugar de depender de otros modelos de lenguaje. La motivación práctica fue el ruido masivo de fanfics producidos por IA en plataformas como Lofter, muchos de los cuales resultan indistinguibles a simple vista de la escritura humana.
El método parte de una hipótesis sencilla: los LLM dejan patrones estadísticos detectables en la elección de palabras que pueden ser capturados por algoritmos clásicos. Tras descartar la perplexity por su alto coste y escasa robustez, el autor entrenó clasificadores TF-IDF combinados con LinearSVC y Naive Bayes de scikit-learn. Para construir el conjunto de datos, recopiló cerca de 10.000 textos humanos publicados entre 2010 y 2022, les generó resúmenes con un LLM y los reconstruyó con siete modelos distintos (gemini-3-pro, qwen-coder-plus, glm-5, glm-4.7, kimi-k2.5, doubao-seed-code y deepseek-v3.2). Cabe señalar que para abaratar costes el autor recurrió a cuotas gratuitas y promociones que incumplen los términos de servicio de las plataformas implicadas.
El clasificador binario a nivel de frase alcanza alrededor del 85% de exactitud y más del 80% de F1. Para textos largos, el autor entrenó siete clasificadores binarios independientes y aplicó votación por mayoría, de modo que una frase se marca como IA cuando al menos dos modelos coinciden. El intento de un único modelo multiclase con 8 etiquetas falló, con solo un 50% de acierto, probablemente por la similitud entre LLMs debida a la destilación cruzada.
El proyecto incluye una demostración web alojada en GitHub Pages y el código en el repositorio lyc8503/AITextDetector, pensado como prueba de concepto más que como detector de producción.
