Sistemas eficientes y precisos para consultar datos no estructurados

La tesis doctoral de Daniel Kang, defendida en diciembre de 2022 en el Departamento de Ciencias de la Computación de la Universidad de Stanford bajo la dirección de Matei Zaharia y Tatsunori Hashimoto, aborda uno de los retos centrales del análisis moderno de datos: cómo extraer información útil de

Guía operativa para validar y renderizar artefactos de analítica

Este documento técnico describe el procedimiento oficial para producir y entregar informes y paneles de analítica de datos dentro de un sistema con modo de trabajo (Work Mode) y fuera de él. Antes de renderizar cualquier artefacto, se debe invocar la función validate_artifact con el manifiesto compl

Los responsables de marketing son adictos a los datos defectuosos

La obsesión del marketing moderno por las métricas ha generado una dependencia de datos poco fiables. Tasas de clics, impresiones, conversiones, aperturas, ROAS, CPM, CPC y docenas de KPI más inundan los informes, pero la mayoría de los profesionales no entienden cómo se recopilan esos datos ni dónd

Los museos de arte usan datos para reinventar la experiencia del visitante

Los museos de arte están recurriendo al análisis de datos para transformar la manera en que presentan sus colecciones y conectan con el público, en un esfuerzo por abandonar el modelo tradicional de 'torres de marfil' y convertirse en espacios participativos de encuentro y discusión. Así lo explica

La carrera por el dominio de la inteligencia artificial en el Mundial 2026

La Copa Mundial de la FIFA de 2026 se convertirá en el torneo con mayor volumen de datos jamás registrado: alrededor de 150 millones de puntos por partido y 500 mediciones por segundo dentro del balón, gracias a sensores inerciales. Empresas como Stats Perform y PLAIER procesan esa información para

Cómo Hex construyó un laboratorio para evaluar agentes de datos

Hex ha desarrollado una infraestructura propia, llamada The Shoebox, para entrenar y comparar agentes de datos en un entorno controlado. La plataforma funciona como un banco de pruebas dentro del entorno de desarrollo local de Hex, pero se conecta a un espacio de trabajo interno compartido donde se

KORE Desafía a Parquet con Superior Compresión y Velocidad

KORE es un nuevo formato de archivo binario de alto rendimiento diseñado para cargas de trabajo analíticas, que cuenta con una relación de compresión del 38%—significativamente mejor que el 63% de Parquet—y una aceleración de la consulta de 131x a través de la poda de columnas y el filtrado descende

Google acelera en IA para competir con Amazon y Microsoft

Google está intensificando su apuesta por la inteligencia artificial (IA) en el borde (edge computing) como estrategia para recuperar terreno frente a sus rivales, Amazon y Microsoft, en el mercado de la computación en la nube. La compañía busca aprovechar su liderazgo en IA para ofrecer servicios m

Rill simplifica métricas con nueva capa SQL

Rill ha lanzado Metrics SQL, una capa semántica basada en SQL diseñada para simplificar la consulta y gestión de métricas empresariales. La plataforma busca resolver el problema común de definiciones de métricas dispersas y conflictivas en diferentes herramientas de análisis (dbt, Looker, Metabase,

ParadeDB: Nueva alternativa a Elasticsearch para Postgres

ParadeDB, un equipo pequeño y distribuido con sede en Estados Unidos y Canadá, ha anunciado el lanzamiento de una alternativa nativa a PostgreSQL para Elasticsearch. La plataforma, cuyo objetivo es ofrecer una solución optimizada para sistemas de datos, búsqueda y análisis, se basa en Rust y busca s