Noticias que mencionan DuckDB

Guía técnica para instalar y configurar Strata localmente

Strata es una herramienta de modelado de datos que permite ejecutar análisis semánticos y visualización de datos directamente en el equipo del usuario, eliminando la dependencia de la nube. El sistema opera mediante un servidor local que se instala en Docker, requiriendo Ruby 3.4.4 o superior, Git y

Guía para integrar la IA en la escritura sin perder la voz humana

La integración de la inteligencia artificial en la creación de textos ha generado un debate sobre la calidad y la autenticidad del contenido. El texto argumenta que, aunque la IA puede generar textos fluidos, tiende a producir resultados complejos, innaturales y repetitivos que fatigan al lector. Pa

El problema de año 2038 y otros errores de desbordamiento en software

El episodio 37 de Runtime Arguments analiza el clásico problema de año 2038 de Unix, donde el desbordamiento del timestamp de 32 bits podría romper sistemas que dependen de comparaciones de tiempo. Los presentadores, Jim McQuillan y Wolf, explican cómo esta limitación técnica, derivada de restriccio

Por qué dominar la línea de comandos supera a las interfaces gráficas

Dominar la línea de comandos permite a los desarrolladores orquestar programas de forma lógica y eficiente, una capacidad que las interfaces gráficas (GUI) no ofrecen de manera nativa. A diferencia de las herramientas visuales, el shell permite ejecutar scripts complejos que integran múltiples proce

DuckDB-Wasm permite bases de datos persistentes en el navegador

DuckDB-Wasm ha incorporado soporte para el Origin Private File System (OPFS), permitiendo a las aplicaciones web almacenar bases de datos persistentes directamente en el navegador. Esta funcionalidad, disponible en versiones 1.32.0 y posteriores, resuelve la limitación histórica de la herramienta, q

Guía técnica para optimizar el consumo de combustible en vuelos

El artículo técnico detalla el uso de herramientas de código abierto para optimizar el consumo de combustible en aviación civil. Se presenta Scikit-decide, un marco de aprendizaje por refuerzo y planificación automatizada, junto con OpenAP, un modelo de rendimiento de aeronaves desarrollado por el D

Alternativas a MinIO para almacenamiento S3 local en un solo nodo

La decisión de la empresa de MinIO de abandonar el proyecto en finales de 2025 ha dejado sin soporte a una herramienta ampliamente utilizada para emular almacenamiento S3 local en demos y pipelines de desarrollo. Este artículo técnico analiza las alternativas más simples para reemplazar a MinIO en e

QueryBrew optimiza consultas SQL mediante reescritura agnóstica de sistemas

QueryBrew es un servicio de optimización de consultas SQL diseñado para desacoplar el optimizador del motor de base de datos mediante reescritura SQL-to-SQL. Desarrollado por investigadores de la Technische Universität München, esta herramienta permite que cualquier sistema de base de datos relacion

Cómo consultar el catálogo abierto de satélites de Planet Labs

Planet Labs, fabricante y operador de constelaciones satelitales con sede en San Francisco y quince años de trayectoria, publica de forma abierta las efemérides (parámetros orbitales en formato TLE, Two-Line Element) de sus satélites a través de un servicio público. La compañía, dirigida por uno de

Exportar datos del Language Server a SQL para analizarlos

Un desarrollador ha publicado un proyecto que extrae la información de tipos y símbolos que poseen los servidores de lenguaje y la vuelca en una base de datos SQL, con el objetivo de analizarla mediante consultas convencionales en lugar de pelearse con JSON-RPC. El artículo parte de una observación:

Keenable SELECT: un agente que busca en la web usando SQL

Keenable SELECT es un agente basado en un servidor MCP cuya herramienta principal, select, ejecuta una única consulta SELECT de DuckDB en modo solo lectura sobre datos web en tiempo real. A diferencia de la búsqueda web tradicional, que devuelve diez enlaces y obliga al modelo a leer cada página con

HFlow, un SDK abierto para pipelines de datos multimodales en robótica

HFlow es un SDK de código abierto creado por Hebbian Robotics (YC S26) para construir pipelines de datos multimodales escalables en robótica e inteligencia artificial física. Su propósito es democratizar herramientas de procesamiento de datos que, hasta ahora, solo dominaban los grandes equipos de r

Mantén la IA fuera de tu vault de Obsidian

Un usuario avanzado de Obsidian argumenta que integrar IA generativa en el vault personal resulta contraproducente para el método de notas y la construcción de conocimiento a largo plazo. El autor parte de una premisa técnica: los archivos de Obsidian son Markdown plano almacenados en disco local, p

DuckLabs se incorpora a AWS y mantiene sus proyectos de código abierto

DuckLabs, la empresa holandesa responsable del proyecto DuckDB, anunció su incorporación a Amazon Web Services (AWS), una operación prevista para principios de septiembre. El equipo, de más de 30 personas, permanecerá en Amsterdam y continuará desarrollando DuckDB, DuckLake, Quack y otros componente

El fin de la programación tal y como la conocemos

La irrupción de modelos de inteligencia artificial con capacidades de razonamiento cercanas a las de un programador humano está marcando el inicio de una nueva era en el desarrollo de software. Un reciente episodio ilustra este cambio: la reescritura completa del entorno de ejecución Bun 1.4, que pa

Paneles de análisis rápidos desde un único archivo Parquet

Este artículo técnico explica cómo crear paneles de análisis interactivos y rápidos a partir de un único archivo Parquet almacenado en un bucket de R2, sin necesidad de una base de datos ni un motor de consultas. El autor, un ingeniero de MotherDuck, presenta el concepto del "cubo de datos" (data cu

El mito del 15% de commits de corrección: un análisis con 200 repos

Un análisis empírico sobre el porcentaje real de commits de corrección ("fix") en proyectos de software desmonta la extendida creencia del 15%. El autor, al incorporarse a un nuevo empleo, observó que el repositorio principal de su empresa rondaba esa cifra (exactamente un 14,87%) y decidió comproba

DuckDB v2.0 sustituye su analizador SQL por uno basado en PEG

DuckDB v2.0 reemplaza el analizador sintáctico (parser) SQL derivado de PostgreSQL que utilizaba desde su primer commit en 2018 por uno nuevo basado en PEG (Parsing Expression Grammars). El cambio no altera el dialecto SQL que acepta DuckDB —al que los autores denominan informalmente DuckSQL y que m

DuckDB anuncia la versión 2.0 'Cyanoptera' con servidor nativo y tipo VARIANT

El equipo de DuckDB ha anunciado que la versión 2.0 de su base de datos analítica en proceso, bautizada 'Cyanoptera' en honor a la cerceta colorada (Anas cyanoptera), se lanzará este otoño. El salto a una versión mayor —la primera desde la 1.5 publicada en marzo— incorpora más de 10.000 commits y un

Autoriza, no autentiques: recuperar el control de tus datos personales

El ingeniero Marc-Uwe Klauck presenta un cambio de paradigma en la arquitectura de aplicaciones web: en lugar de que los usuarios se autentiquen en una aplicación para que esta guarde sus datos en una base de datos controlada por el proveedor, los usuarios deberían autorizar a la aplicación a accede

Cómo paginar un archivo Parquet en DuckDB sin perder filas ni velocidad

Cuando una API tiene que devolver el contenido de un archivo Parquet muy grande y las respuestas están limitadas en tamaño —por ejemplo, 6 MB en AWS Lambda o 32 MiB en Cloud Run—, lo habitual es paginar con LIMIT y OFFSET. Pero esa forma de escribir la consulta es la equivocada. DuckDB ofrece la opc

CSV Unwrap: por qué entender un CSV es más difícil que leerlo

Detrás de un archivo CSV aparentemente trivial se esconde un problema mucho más complejo: ayudar a quien lo abre a construir un modelo mental de lo que contiene en los primeros cinco minutos. Esa es la motivación del proyecto CSV Unwrap, que el autor describe en primera persona. El texto repasa var

Hardwood acelera la lectura de listas de longitud fija en Parquet

Hardwood, un lector de Parquet en Java, incorpora una ruta rápida para listas de longitud fija que evita el costoso mecanismo de reconstrucción de registros Dremel cuando todas las listas de una página tienen el mismo tamaño. La técnica detecta, examinando las secuencias de niveles de definición y r

Boffin: una capa de control para agentes de IA que restringe cada edición

Boffin (npm: boffinit) es una capa de control para agentes de programación con IA que actúa como un «staff engineer» automático: antes de cada edición, inyecta al agente únicamente las restricciones arquitectónicas relevantes para el fichero concreto que va a modificar y, después, le obliga a verifi

DuckPGQ: extensión comunitaria de DuckDB para consultas de grafos con SQL/PGQ

DuckPGQ es una extensión comunitaria de DuckDB pensada para cargas de trabajo de grafos y compatible con el estándar SQL/PGQ. Su objetivo es llevar las capacidades de consulta de grafos basadas en SQL, con alto rendimiento, directamente a los flujos analíticos, aprovechando el motor en proceso de Du

l: un nuevo motor compatible con k, q y qSQL sobre vectores comprimidos

l es un nuevo runtime para la familia de lenguajes k y q que ejecuta código k4, q y qSQL existente sin necesidad de reescritura. La propuesta mantiene la sintaxis, los modismos, las tablas, los diccionarios y el trabajo con series temporales tal como se escriben hoy, pero cambia el motor subyacente

QuestDB hace WINDOW JOIN paralelo y vectorizado con SIMD

QuestDB ha reescrito su operador WINDOW JOIN para que se ejecute en paralelo a nivel de datos y aproveche instrucciones SIMD en la agregación interna. La nueva ruta emplea dos piezas: paralelización por page frames sobre la tabla izquierda (LHS), y una vía rápida para claves de baja cardinalidad que

Por qué DuckDB es tan rápida: claves de su diseño interno

DuckDB es una base de datos SQL analítica en proceso que se ha convertido, desde su origen como proyecto de investigación del CWI de Ámsterdam en 2019, en uno de los motores analíticos mononodo más usados y más rápidos del momento. Se distribuye como un binario único de menos de 20 MB, se instala co

Cómo Prela logra ejecución columnar rápida usando continuaciones

Este artículo técnico explica un atajo elegante para construir bases de datos rápidas sin recurrir a técnicas industrializadas como la vectorización o la compilación de consultas a código máquina. El autor parte de un problema conocido: implementar operadores de álgebra relacional como funciones pur

databow: una CLI en Rust para consultar cualquier base de datos con ADBC

databow es una nueva herramienta de línea de comandos de código abierto, escrita en Rust, que ofrece una interfaz unificada para consultar cualquier base de datos que disponga de un driver ADBC (Arrow Database Connectivity). Su propósito es sustituir el uso de múltiples clientes CLI específicos —psq

Streambed: motor de CDC de Postgres a Iceberg en S3

Streambed es una herramienta de código abierto que replica cambios de PostgreSQL hacia Apache Iceberg en Amazon S3 mediante replicación lógica, permitiendo consultas analíticas sin modificar la aplicación original. Actúa como suscriptor de replicación lógica: captura los mensajes del WAL (insert, up

Rocksky: nueva plataforma descentralizada para rastrear tu historial musical

Rocksky es una nueva plataforma descentralizada de seguimiento y descubrimiento de música construida sobre el protocolo AT. La herramienta ofrece APIs compatibles con Last.fm y ListenBrainz, permitiendo a los usuarios rastrear su historial de reproducción, visualizar estadísticas personalizadas de s

DuckDB presenta Quack, el nuevo protocolo para arquitectura cliente-servidor

DuckDB ha presentado Quack, un nuevo protocolo cliente-servidor que permite a múltiples instancias de DuckDB comunicarse entre sí. El protocolo, cuyo nombre hace referencia al sonido que emiten los patos, permite configurar DuckDB en una arquitectura cliente-servidor con múltiples escritores concurr

LLMs en vuelo: Ingeniero prueba IA sin conexión

Este artículo describe un experimento realizado por Dmitri Lerko, un ingeniero, durante un vuelo de 10 horas de Londres a Las Vegas, utilizando un MacBook Pro M5 Max para ejecutar modelos de lenguaje grandes (LLMs) localmente sin conexión a internet. El objetivo era evaluar la viabilidad de realizar

IA aprende a recordar: nuevo sistema imita la memoria humana

Un desarrollador ha creado "YourMemory", un nuevo sistema de memoria para agentes de IA que imita la forma en que los humanos recuerdan información. La herramienta, disponible en GitHub, permite que los asistentes de IA conserven el contexto entre conversaciones, evitando la necesidad de repetir pre

OpenDuck: DuckDB en la nube, ahora de código abierto

Un nuevo proyecto de código abierto llamado OpenDuck busca replicar y democratizar las innovaciones de la plataforma MotherDuck para la base de datos DuckDB. MotherDuck, un servicio comercial, demostró cómo DuckDB puede funcionar eficientemente en la nube mediante técnicas como el almacenamiento dif

DuckDB: Curso revela los secretos de su diseño

DuckDB ha emergido como una base de datos analítica en memoria de alto rendimiento, diseñada para ser incrustada directamente en aplicaciones. Su popularidad radica en su simplicidad, velocidad y capacidad para operar con datos sin la necesidad de un servidor dedicado, lo que la hace ideal para anál

Gran repositorio de blogs sobre tecnologías clave en GitHub

Un desarrollador, OneUptime, ha añadido una extensa colección de 12.000 artículos de blog a un repositorio de GitHub, cubriendo una amplia gama de tecnologías clave. Los temas incluyen ClickHouse (una base de datos analítica de columnas), Redis (un almacén de datos en memoria), MongoDB, MySQL, Rook/

MiniStack: Alternativa gratuita a LocalStack para emular AWS

LocalStack, una popular herramienta gratuita para emular servicios de Amazon Web Services (AWS), ha cambiado a un modelo de pago, dejando un vacío que ahora llena MiniStack. MiniStack se presenta como una alternativa gratuita y de código abierto que ofrece una amplia gama de servicios de AWS, incluy

DuckDB: Búsqueda vectorial más rápida y eficiente

Un desarrollador ha creado una extensión para DuckDB, una base de datos analítica en memoria, que mejora significativamente la búsqueda vectorial de similitud. La extensión aborda dos limitaciones de la versión anterior: la búsqueda filtrada, que a menudo devolvía resultados incompletos, y la falta

Hacker News: archivo completo ahora es un conjunto de datos

Hugging Face ha puesto a disposición un extenso conjunto de datos del archivo completo de Hacker News, abarcando desde 2006 hasta marzo de 2026. Este recurso, que incluye cada historia, comentario, pregunta, oferta de trabajo y encuesta publicada en la plataforma, se actualiza cada cinco minutos. Ha

MacBook Neo: Big Data asequible supera a la nube

Un análisis reciente de DuckDB.org evalúa el rendimiento del nuevo MacBook Neo (equipado con un chip Apple A18 Pro, originalmente para el iPhone 16 Pro) en tareas de procesamiento de grandes datos. El objetivo era determinar si el dispositivo, con un precio de $700-$800, se ajusta a la filosofía de

SQG: Generación de código SQL ahora con soporte Java Streams

SQG, un generador de código SQL de tipo seguro, ha lanzado su versión 0.10.0, introduciendo importantes mejoras para desarrolladores Java. La actualización permite la generación de código Java que incluye métodos para retornar resultados en formato `Stream<T>` además de `List<T>`, facilitando la eva

Hardwood: Parser Parquet más rápido y ligero

Un nuevo parser de código abierto llamado Hardwood ha sido lanzado para el formato de archivo Apache Parquet. Desarrollado por Gunnar Morling, Hardwood busca ofrecer una alternativa más eficiente y con menos dependencias a la biblioteca `parquet-java` existente, que es ampliamente utilizada pero inc

Google Street View: Análisis revela cobertura global

Este artículo describe el proceso de análisis de un conjunto de datos que rastrea la cobertura global de Google Street View a lo largo del tiempo. El autor, Mark Litwintschik, utiliza una potente estación de trabajo (con un procesador AMD Ryzen 9, 96GB de RAM y un SSD NVMe de alta velocidad) y la ba

DataStudio: análisis de datos local y sin nube

Un nuevo software de análisis y visualización de datos llamado DataStudio ha sido lanzado, permitiendo a los usuarios explorar y manipular datos directamente en sus navegadores web. Desarrollado por Dataspren Analytics y disponible en GitHub, DataStudio se distingue por su enfoque en la privacidad y

Shaper: visualiza datos SQL con esta herramienta open source

Una nueva herramienta de código abierto llamada Shaper ha sido lanzada por Taleshape OÜ, permitiendo a los usuarios crear paneles de visualización de datos interactivos directamente desde consultas SQL utilizando la base de datos DuckDB. La herramienta, disponible desde esta semana, simplifica la cr

Hacker News: ¿qué pasó con Show HN en 2025?

Este análisis exhaustivo examina la evolución de las publicaciones 'Show HN' (proyectos presentados por usuarios) en Hacker News desde sus inicios hasta 2025, utilizando técnicas de modelado de temas jerárquicos y análisis de datos. El objetivo principal es identificar tendencias en los intereses de