La codificación de pares de bytes supera a la entropía en detección de secretos

Fuentes: Byte-Pair Encoding Outperforms Entropy in Secret Detection

La detección de secretos en el código fuente depende tradicionalmente de expresiones regulares y la entropía de Shannon para filtrar candidatos. Sin embargo, la entropía mide la impredecibilidad de los caracteres, lo que genera falsos positivos al no distinguir entre cadenas aleatorias y texto natural poco frecuente. Un análisis técnico propone la Codificación de Pares de Bytes (BPE) como alternativa superior para medir la rareza de las cadenas. A diferencia de la entropía, el BPE refleja la frecuencia de patrones en el vocabulario del tokenizador: las palabras comunes se consolidan en pocos tokens, mientras que las cadenas raras o de secretos se fragmentan en muchos tokens cortos. La métrica de eficiencia de tokens, calculada como la longitud de la cadena dividida por el número de tokens, permite identificar secretos con mayor precisión. Al evaluar el conjunto de datos CredData, la eficiencia de tokens demostró un rendimiento significativamente superior a la entropía. Con un umbral de 2.5, la eficiencia de tokens alcanzó una precisión del 57.3% y una recuperación del 98.6%, frente al 21.1% de precisión y 70.4% de recuperación de la entropía. Al añadir un filtro de palabras comunes, la eficiencia de tokens mejoró a una precisión del 80.4% y una puntuación F1 de 0.874, superando ampliamente a la entropía combinada con el mismo filtro (F1 de 0.715). Este método reduce drásticamente los falsos positivos, pasando de 28,000 a 2,508, lo que lo convierte en una herramienta más eficaz para la seguridad del código.