Por qué no puedes combinar archivos .tar.gz con cat

Concatenar archivos .tar.gz con un simple cat no funciona, y la razón está en el diseño original de tar y gzip. Tar (tape archive) se creó pensando en cintas magnéticas: las lecturas son secuenciales, los bloques tienen tamaño fijo y el final del archivo se marca con uno o más bloques de ceros que a

La situación de la IA: pensar, prompt y comprimir para trabajar con modelos

Un desarrollador comparte sus reflexiones sobre cómo trabajar con modelos de lenguaje grandes en proyectos reales. Describe tres formas de dar instrucciones a una IA: detallar cada aspecto, enunciar solo el objetivo general, o seguir el camino intermedio explicando las partes difíciles. Alimentar co

Predicción y compresión: dónde empieza y dónde termina la equivalencia

El reciente debate en Hacker News sobre la afirmación "comprimir es predecir" ha reunido explicaciones de 3Blue1Brown, ngrok y Salvatore Sanfilippo. Todas convergen en una idea central: si un modelo probabilístico asigna una probabilidad a cada continuación posible de una secuencia, un codificador e

Por qué comprimir datos es, en el fondo, predecirlos

El blog de ngrok publica un artículo didáctico que explica la relación profunda entre la compresión de datos y el modelado de lenguaje. El texto parte de la idea de que compresores como gzip o Brotli y los modelos de lenguaje grandes (LLM) resuelven, en esencia, el mismo problema: predecir la redund

Reequilibrio de los niveles de compresión Deflate en Go

Tras un trabajo prolongado de optimización de la compresión Deflate en Go, el análisis de los benchmarks reveló dos problemas claros en los niveles de compresión existentes. En primer lugar, existía un salto de rendimiento considerable entre el nivel 1 y el nivel 2, algo esperable porque el nivel 1

Cómo funciona JPEG: anatomía de la compresión con pérdidas

JPEG, el estándar de imagen nacido en 1992, sigue siendo casi tres décadas después uno de los formatos más usados del mundo digital. Su éxito se explica por un enfoque particular: en lugar de comprimir sin pérdidas, recorta información que el ojo humano apenas nota. Este artículo explica, con un com

Zstandard en la práctica (parte 1): conceptos clave

Zstandard (Zstd), definido en el RFC 8478 y publicado por primera vez en 2015, es un algoritmo de compresión moderno que ofrece mejor relación de compresión y mayor velocidad que el veterano Zlib/Deflate (RFC 1950 y 1951, de 1995). Su implementación de referencia, de calidad de producción, es de cód

Postgres 19 sustituirá pglz por LZ4 como compresión por defecto en TOAST

Postgres 19 cambiará el algoritmo de compresión por defecto de su subsistema TOAST, pasando de pglz a LZ4. El movimiento forma parte de una evolución que el proyecto de código abierto arrancó en la versión 14, cuando LZ4 se incorporó como opción configurable. TOAST (The Oversized-Attribute Storage

ALP: compresión sin pérdida de coma flotante presente en repositorio de GitHub

ALP es un algoritmo de compresión sin pérdida para datos en coma flotante conforme al estándar IEEE 754, publicado como código fuente y banco de pruebas en el repositorio cwida/ALP de GitHub. Su artículo asociado, "ALP: Adaptive Lossless Floating-Point Compression", fue presentado en ACM SIGMOD 2024

misa77: un códec LZ con descompresión hasta tres veces más rápida que LZ4

misa77 es un códec de compresión basado en algoritmos LZ orientado al nicho de datos que se escriben una vez y se leen muchas veces. Su objetivo principal es ofrecer una velocidad de descompresión muy alta en un solo hilo, con un uso de memoria constante e independiente del tamaño de la entrada: com

Conexiones en Matemáticas: los dos tipos de aleatoriedad

Este ensayo explora la diferencia entre dos tipos de aleatoriedad y compresibilidad. Plantea un acertijo: dos archivos de un millón de dígitos, uno generado aleatoriamente y otro con los primeros millones de dígitos de π, son estadísticamente idénticos (cada dígito aparece con frecuencia similar), p

Por qué acortamos los chunks de TimescaleDB de 30 a 7 días

El equipo de ingeniería de Sodatone, plataforma de inteligencia de A&R de Warner Music Group, explica cómo y por qué redujo el intervalo de chunk de sus hipertablas de TimescaleDB de 30 a 7 días, y qué mejoras concretas obtuvieron en producción. TimescaleDB es una extensión de PostgreSQL para serie

KORE Desafía a Parquet con Superior Compresión y Velocidad

KORE es un nuevo formato de archivo binario de alto rendimiento diseñado para cargas de trabajo analíticas, que cuenta con una relación de compresión del 38%—significativamente mejor que el 63% de Parquet—y una aceleración de la consulta de 131x a través de la poda de columnas y el filtrado descende

Yogthos publica libwce, una librería de códecs de ondas en Rust

El desarrollador yogthos ha lanzado libwce, una nueva biblioteca de código abierto escrita en Rust diseñada para la codificación de entropía de ondas. Esta implementación minimalista, compuesta por un solo archivo de 500 líneas, ofrece una capa de codificación de conteo de planos de bits (BPC) libre

Modelos de lenguaje: técnica reduce tamaño sin perder calidad

Investigadores han desarrollado una nueva técnica para comprimir incrustaciones (embeddings) de modelos de lenguaje, mejorando significativamente la eficiencia sin sacrificar la calidad de la recuperación de información. La técnica, denominada 'poly-autoencoder', combina un codificador PCA (Principa

TQ4_1S: LLMs más pequeños para dispositivos Apple

Un desarrollador ha presentado una nueva técnica de compresión de modelos de lenguaje grandes (LLM) llamada TQ4_1S, diseñada específicamente para dispositivos Apple con chips Metal. Esta técnica reduce el tamaño de los modelos en un 27-38%, dependiendo del modelo, sin necesidad de reentrenamiento ni