CDC de MySQL a BigQuery: guía práctica con binlog

La captura de datos modificados (CDC) basada en el registro binario (binlog) de MySQL soluciona las carencias de los sincronizadores periódicos: elimina puntos ciegos en borrados y actualizaciones intermedias, y reduce la carga sobre la base de datos de producción. Un job programado con SELECT solo

Spotify presenta RAP: índices para consultas puntuales sobre el data lake

Spotify ha detallado en su blog de ingeniería Random Access Parquet (RAP), una técnica para realizar consultas puntuales por clave sobre archivos Parquet almacenados en lagos de datos en la nube, sin necesidad de mantener copias redundantes en sistemas de servicio clave-valor como Bigtable o DynamoD

Guía de reconocimiento y explotación de servidores IIS para bug bounty

Esta guía detalla el flujo de trabajo que un cazador de vulnerabilidades aplica al enfrentarse a servidores Microsoft IIS dentro de un programa de bug bounty. El texto parte de la premisa de que la página azul característica de IIS rara vez es un callejón sin salida y suele esconder servicios mal co

Skiplists: la estructura de datos que optimiza análisis

Este artículo de Antithesis.com explora el uso de 'skiplists' y una extensión llamada 'skiptrees' para resolver un problema específico de rendimiento en el análisis de datos. Inicialmente, los skiplists se consideraban una estructura de datos de nicho, pero la empresa descubrió su utilidad para opti

IA interna de Parallel Learning agiliza acceso a datos

La startup Parallel Learning ha desarrollado un agente de inteligencia artificial interno llamado Voltaire para resolver un cuello de botella en el acceso a datos que afectaba a sus empleados. Voltaire, implementado como un bot de Slack, permite a los usuarios obtener respuestas a preguntas compleja

Google mejora su modelo de predicción de series temporales

Google Research ha lanzado TimesFM 2.5, una versión mejorada de su modelo de predicción de series temporales. El modelo, disponible en GitHub, se basa en una arquitectura 'decoder-only' y está diseñado para ofrecer pronósticos más precisos y eficientes. TimesFM 2.5 reduce el número de parámetros de

Apache Otava detecta caídas de rendimiento con nueva herramienta

Apache Otava ha lanzado una nueva herramienta diseñada para detectar regresiones de rendimiento en aplicaciones y sistemas. La herramienta, presentada recientemente, analiza resultados de pruebas de rendimiento almacenados en formatos CSV, PostgreSQL, BigQuery o bases de datos Graphite. Su función p