Un equipo de investigadores de Stanford, Microsoft, Facebook y Google presenta DIFF, un operador relacional que integra la funcionalidad de los motores de explicación de datos dentro de flujos de trabajo SQL tradicionales. Los motores de explicación, como MacroBase, Scorpion o Data X-Ray, ayudan a los analistas a identificar combinaciones de atributos estadísticamente significativas que explican diferencias entre subconjuntos de datos, una tarea habitual en análisis de comportamiento de usuario, procesamiento de eventos operativos y diagnóstico de incidencias. Hasta ahora, estas herramientas funcionaban como sistemas aislados, sin interoperar con el procesamiento relacional estándar, lo que obligaba a costosos pre y posprocesamientos y limitaba su adopción en entornos analíticos reales.
DIFF resuelve esta brecha al formalizar la búsqueda de explicaciones como un operador de agregación relacional parametrizable por métricas de diferencia, equivalente semánticamente a una consulta con UNION, GROUP BY y CUBE. De este modo, se integra de forma nativa en pipelines de almacenamiento de datos y admite optimizaciones tanto en la capa lógica como en la física. En el plano lógico, los autores proponen reordenar operaciones para ejecutar DIFF antes de materializar JOINs cuando el resultado del JOIN es mucho mayor que la salida esperada de DIFF, evitando materializaciones costosas. En el plano físico, presentan algoritmos, índices y formatos de almacenamiento adaptados a la ejecución distribuida.
La implementación se realiza en MB SQL, una extensión de MacroBase, en versiones mono-nodo y distribuida. En evaluaciones con cargas reales de telemetría de Microsoft, los autores muestran que MB SQL con DIFF iguala la expresividad de motores previos y supera a implementaciones existentes hasta en un orden de magnitud, habilitando análisis interactivos sobre cientos de millones de eventos con docenas de columnas de alta cardinalidad.
