DSCI Job Artifacts: cómo compartir archivos entre tareas de un pipeline

DSCI Job Artifacts es una funcionalidad pensada para simplificar el intercambio de datos entre los distintos trabajos que componen un pipeline. En lugar de configurar explícitamente entradas y salidas, basta con escribir cualquier archivo en el directorio ~/artifacts/ dentro de una tarea para que qu

Python Polars: hoja de referencia definitiva

Polars es una biblioteca de Python para transformar, analizar y visualizar datos mediante una API de DataFrames rápida y expresiva, publicada por primera vez por Ritchie Vink en 2020. A diferencia de pandas, no emplea un índice de filas y favorece la inmutabilidad y el encadenamiento de métodos; sus

Daft acelera hasta 15 veces la lectura de vídeo en formato LeRobot

Daft, la biblioteca de procesamiento de datos, ha reescrito su lector nativo del formato LeRobot para descodificar fotogramas de vídeo de forma por lotes en lugar de fila a fila, lo que reduce los tiempos de procesamiento hasta 15 veces en conjuntos de datos remotos. LeRobot se ha consolidado como e

Guía del panorama de herramientas de datos para desarrolladores

Esta guía ofrece una panorámica estructurada del ecosistema de herramientas de datos pensada para ingenieros de software que trabajan en compañías de datos sin experiencia previa en el campo. El artículo parte de la experiencia personal del autor, OlegWock, que tras incorporarse a Deepnote —un cuade

Cómo Python se transformó dentro de los grandes bancos de inversión

Dentro de los grandes bancos de inversión existe un ecosistema de Python prácticamente desconocido fuera de sus muros, que el autor denomina "Bank Python". Se trata de forks propietarios del lenguaje y de sus librerías, mantenidos por miles de ingenieros, que poco tienen que ver con el Python públic

Un repositorio que demuestra que PostgreSQL basta para casi todo

El proyecto «Postgres is Enough» es una colección curada de enlaces que defiende una tesis concreta: PostgreSQL puede sustituir, por sí solo, a múltiples sistemas especializados en la mayoría de proyectos de software. El repositorio, alojado en GitHub, agrupa artículos, extensiones, herramientas y c

Cómo implementar un lenguaje de consulta a medida con Python y Apache Spark

Este artículo describe, paso a paso, cómo construir un esqueleto funcional de un lenguaje de consulta propio —denominado Entity History Query Language (EHQL)— utilizando Python y la biblioteca de análisis sintáctico Lark, con Apache Spark como motor de ejecución. EHQL fue diseñado para analistas se

Por qué acortamos los chunks de TimescaleDB de 30 a 7 días

El equipo de ingeniería de Sodatone, plataforma de inteligencia de A&R de Warner Music Group, explica cómo y por qué redujo el intervalo de chunk de sus hipertablas de TimescaleDB de 30 a 7 días, y qué mejoras concretas obtuvieron en producción. TimescaleDB es una extensión de PostgreSQL para serie

databow: una CLI en Rust para consultar cualquier base de datos con ADBC

databow es una nueva herramienta de línea de comandos de código abierto, escrita en Rust, que ofrece una interfaz unificada para consultar cualquier base de datos que disponga de un driver ADBC (Arrow Database Connectivity). Su propósito es sustituir el uso de múltiples clientes CLI específicos —psq

Ardent permite probar código de agentes IA en clones seguros de bases de datos

Ardent, plataforma especializada en gestión de datos para inteligencia artificial, ha lanzado una nueva funcionalidad denominada «ramificación de base de datos» que permite a los agentes de IA de codificación probar su código en copias exactas de bases de datos de producción PostgreSQL. La tecnologí

IA agiliza captación de fondos para grandes inversores

Una startup respaldada por Y Combinator, llamada GovernGPT, está revolucionando la gestión de inversiones al utilizar inteligencia artificial para automatizar el proceso de captación de fondos, un área tradicionalmente manual y crucial para fondos multimillonarios. La empresa, ya rentable, proporcio

Ingeniero crea sistema RAG interno con LLM

Este artículo narra la experiencia de un ingeniero al construir un sistema de Recuperación Aumentada de Generación (RAG) interno para su empresa, utilizando un modelo de lenguaje grande (LLM) local. El objetivo era crear una herramienta de chat que permitiera a los ingenieros acceder rápidamente a i

Bases de datos vectoriales: ¿moda innecesaria?

La creciente popularidad de las bases de datos vectoriales como solución a problemas de búsqueda está generando una tendencia que, según expertos, es a menudo innecesaria. Si bien son útiles en casos específicos, muchas empresas están implementándolas sin comprender completamente su complejidad y el

IA analiza registros de CI con rapidez y SQL

Una empresa ha desarrollado un sistema que utiliza modelos de lenguaje grandes (LLMs) para analizar eficientemente grandes volúmenes de registros de CI (Integración Continua). El sistema, que funciona como un agente, puede rastrear errores y dependencias en segundos, escribiendo sus propias consulta

Guía práctica de ingeniería de datos ahora disponible

El libro 'Data Engineering Book' de Datascale AI es una guía completa y práctica para profesionales que buscan dominar el campo de la ingeniería de datos. En un mundo impulsado por datos, la ingeniería de datos es la disciplina que se encarga de construir y mantener la infraestructura necesaria para

Guía de Ingeniería de Datos para Modelos de IA

En la era de los grandes modelos de lenguaje (LLM), la calidad de los datos se ha convertido en el factor determinante que limita su rendimiento. El libro "Data Engineering for LLMs" de Datascale-AI aborda esta problemática, ofreciendo una guía completa y práctica para la ingeniería de datos necesar