Un clasificador reentrenado detecta comentarios de IA en código fuente

Fuentes: Better AI code comment detector

Un programador ha reconstruido desde cero su clasificador de comentarios de código generados por IA, esta vez sobre una base de datos pública y una arquitectura más sólida. La herramienta está disponible como página web donde el texto pegado no sale del navegador del usuario, y permite explorar, haciendo clic en cualquier fragmento, qué características lingüísticas activan la veredicto de "humano" o "robot". En pruebas de validación cruzada, el clasificador alcanza un 77 % de exactitud balanceada: identifica correctamente el 73 % de los comentarios escritos por personas y el 80 % de los generados por modelos de lenguaje. Cuando se evalúa con comentarios reales no sintéticos, el rendimiento sube hasta un 88 % de exactitud y un F1 de 87 %, lo que sugiere que los casos del mundo real son más fáciles de discriminar que los del conjunto de entrenamiento. El sistema también ofrece un porcentaje calibrado de confianza: con un 80 % o más de certeza, la tasa de falsos positivos baja al 5 %. El autor detalla el proceso de construcción: selección de repositorios con licencias permisivas de 2021 para obtener comentarios humanos, eliminación de docstrings y comentarios existentes, y regeneración posterior por varios LLM para crear la clase "robot". Relata errores costosos en la recopilación, como fugas temático entre clases, contaminación por comentarios cortos estilo "main task structure", o el uso de un prompt fijo que limitaba la variedad. El clasificador está entrenado exclusivamente sobre comentarios de código y su autor no garantiza precisión sobre otros tipos de texto.