La media no dice nada: visualizaciones de latencia que evitan malas decisiones

Fuentes: The mean means nothing

Un ingeniero de software narra un caso real en el que el equipo evaluó un cambio en la caché de un servicio web observando únicamente la latencia media: la cifra pasó de 112 ms a 122 ms, un aumento del 9 % que disparó una alerta y la cancelación del despliegue. El artículo usa un conjunto de datos sintéticos para demostrar cómo un único estadístico puede inducir a error y por qué la elección del método de visualización es una decisión técnica con consecuencias operativas.

La historia gira en torno a un cambio que desplegó una nueva capa de caché. La media sugería regresión, pero la mediana (p50) caía un 46 % y el p99 se disparaba un 119 %. La contradicción se resuelve al examinar la forma de la distribución: la densidad muestra dos poblaciones, una rápida y otra lenta, que la media aplana en un único número. La función de distribución acumulada (CDF) y la función de desplazamiento (shift function) permiten ver el efecto en cada percentil y revela que la mejora para los aciertos de caché convivía con un empeoramiento notable en los fallos.

El texto recorre después visualizaciones adicionales: ridgeline diario durante una semana de despliegue gradual, mapa de calor, y un jointplot de latencia frente a tamaño de respuesta, que atribuye la bimodalidad a los objetos grandes que no caben en caché. La conclusión operativa es clara: medir solo la media oculta efectos compuestos y puede llevar al equipo a revertir mejoras reales o mantener regresiones sin detectarlas.