Un desarrollador explica cómo afinó un clasificador de tráfico en su Cloudflare Worker para distinguir bots de lectores reales sin recurrir a JavaScript en el cliente. En dos días completos, las reglas de red y cabeceras HTTP reclasificaron 277 de 372 peticiones con User-Agent de navegador (74,5%) fuera de la categoría 'Browsers', dejando 95 observaciones HTML que aún no coinciden con las 14 cargas de página de Cloudflare Web Analytics.
El clasificador combina cuatro fuentes de evidencia: metadatos de red (ASN, que el cliente no puede alterar fácilmente), cabeceras Fetch Metadata (Sec-Fetch-Mode, Sec-Fetch-Dest, Sec-Fetch-Site), los campos Accept y Accept-Language, y la cadena User-Agent. Dos reglas clave marcan la diferencia. La primera clasifica como 'cloud-browser' cualquier User-Agent de navegador que llegue desde una red de hosting curada: en una muestra de 72 horas, 430 de 844 GET de página exitosos eran tráfico con forma de navegación desde redes de hosting, incluido un clúster de 374 peticiones atribuidas a un cliente de Google Cloud que se declaraba Chrome Mobile 114. La segunda contrasta la presencia de Fetch Metadata con la versión de navegador reclamada (Chromium 76+, Firefox 90+, Safari/iOS 16.4+).
El artículo distingue entre identificar peticiones automatizadas (lo que sus reglas logran) y medir audiencia real, una cuestión que requiere otra evidencia. Señala errores detectados y corregidos en el proceso, y subraya que comparar un contador de edge con un contador de script solo abre la investigación: no existe una proporción universal que separe bots de lectores.
