Paneles de análisis rápidos desde un único archivo Parquet

Este artículo técnico explica cómo crear paneles de análisis interactivos y rápidos a partir de un único archivo Parquet almacenado en un bucket de R2, sin necesidad de una base de datos ni un motor de consultas. El autor, un ingeniero de MotherDuck, presenta el concepto del "cubo de datos" (data cu

Python Polars: hoja de referencia definitiva

Polars es una biblioteca de Python para transformar, analizar y visualizar datos mediante una API de DataFrames rápida y expresiva, publicada por primera vez por Ritchie Vink en 2020. A diferencia de pandas, no emplea un índice de filas y favorece la inmutabilidad y el encadenamiento de métodos; sus

DuckDB incorporará E/S asíncrona en lectura de Parquet y CSV a partir de v2.0

DuckDB prepara su mayor salto arquitectónico en años: a partir de la versión 2.0, prevista para otoño de 2026, el motor de bases de datos analíticas incorporará E/S asíncrona de forma predeterminada para la lectura de archivos Parquet y CSV, una mejora que promete acelerar de forma significativa las

Spotify presenta RAP: índices para consultas puntuales sobre el data lake

Spotify ha detallado en su blog de ingeniería Random Access Parquet (RAP), una técnica para realizar consultas puntuales por clave sobre archivos Parquet almacenados en lagos de datos en la nube, sin necesidad de mantener copias redundantes en sistemas de servicio clave-valor como Bigtable o DynamoD

Cómo paginar un archivo Parquet en DuckDB sin perder filas ni velocidad

Cuando una API tiene que devolver el contenido de un archivo Parquet muy grande y las respuestas están limitadas en tamaño —por ejemplo, 6 MB en AWS Lambda o 32 MiB en Cloud Run—, lo habitual es paginar con LIMIT y OFFSET. Pero esa forma de escribir la consulta es la equivocada. DuckDB ofrece la opc

Hardwood acelera la lectura de listas de longitud fija en Parquet

Hardwood, un lector de Parquet en Java, incorpora una ruta rápida para listas de longitud fija que evita el costoso mecanismo de reconstrucción de registros Dremel cuando todas las listas de una página tienen el mismo tamaño. La técnica detecta, examinando las secuencias de niveles de definición y r

Por qué DuckDB es tan rápida: claves de su diseño interno

DuckDB es una base de datos SQL analítica en proceso que se ha convertido, desde su origen como proyecto de investigación del CWI de Ámsterdam en 2019, en uno de los motores analíticos mononodo más usados y más rápidos del momento. Se distribuye como un binario único de menos de 20 MB, se instala co

Streambed: motor de CDC de Postgres a Iceberg en S3

Streambed es una herramienta de código abierto que replica cambios de PostgreSQL hacia Apache Iceberg en Amazon S3 mediante replicación lógica, permitiendo consultas analíticas sin modificar la aplicación original. Actúa como suscriptor de replicación lógica: captura los mensajes del WAL (insert, up

KORE Desafía a Parquet con Superior Compresión y Velocidad

KORE es un nuevo formato de archivo binario de alto rendimiento diseñado para cargas de trabajo analíticas, que cuenta con una relación de compresión del 38%—significativamente mejor que el 63% de Parquet—y una aceleración de la consulta de 131x a través de la poda de columnas y el filtrado descende

Hacker News: archivo completo ahora es un conjunto de datos

Hugging Face ha puesto a disposición un extenso conjunto de datos del archivo completo de Hacker News, abarcando desde 2006 hasta marzo de 2026. Este recurso, que incluye cada historia, comentario, pregunta, oferta de trabajo y encuesta publicada en la plataforma, se actualiza cada cinco minutos. Ha

Error en Shopify: Nombre de país causa interrupción de datos

Un error inesperado en el pipeline de datos de Shopify, causado por el nombre oficial del país de Moldavia, ha interrumpido temporalmente la replicación de datos a su sistema de análisis. El problema surgió porque el nombre completo de Moldavia, “Moldova, Republic of”, contenía una coma, que al ser

Vortex: Nueva compresión de datos supera a Parquet

SpiralDB ha anunciado que su sistema de compresión de datos Vortex supera significativamente a Parquet con ZSTD en términos de tamaño y velocidad de descompresión. Vortex utiliza un enfoque inspirado en el trabajo BtrBlocks de la TU Munich, que consiste en probar múltiples codecs de compresión y per

Google Street View: Análisis revela cobertura global

Este artículo describe el proceso de análisis de un conjunto de datos que rastrea la cobertura global de Google Street View a lo largo del tiempo. El autor, Mark Litwintschik, utiliza una potente estación de trabajo (con un procesador AMD Ryzen 9, 96GB de RAM y un SSD NVMe de alta velocidad) y la ba

Lance: Nueva alternativa para Big Data

Un nuevo formato de archivo y tabla llamado Lance ha surgido como una alternativa optimizada a Apache Iceberg y Delta Lake, generando interés en el mundo del big data y el almacenamiento de objetos. Desarrollado en 2025, Lance combina un formato de archivo similar a Parquet (optimizado para lecturas

Overture Lanza Base de Datos Global de 72 Millones de POI

Overture Maps ha publicado un conjunto de datos masivo de 72.4 millones de puntos de interés (POI) que cubre el mundo, como parte de sus lanzamientos mensuales. Estos POI están etiquetados con nombres, categorías y otra información relevante, y el conjunto de datos ha sido mejorado continuamente con