Fusionar archivos CSV gratis desde el navegador, sin subir datos

filetools ofrece una herramienta web gratuita para combinar varios archivos CSV en uno solo directamente desde el navegador, sin enviar los datos a ningún servidor. Basta con arrastrar dos o más archivos .csv a la página y descargar el resultado ya fusionado. Una función clave es la alineación de co

Rex: un lenguaje funcional puro para flujos de trabajo científicos

Rex (abreviatura de Rush Expressions) es un lenguaje de programación funcional puro y de tipado estático, orientado al cálculo científico y al procesamiento de datos. Su premisa central es que el trabajo en Rex se expresa como transformaciones puras sobre valores inmutables, mientras que módulos de

La tarjeta perforada de Hollerith: el origen de la informática de datos

A finales del siglo XIX, la Oficina del Censo de Estados Unidos acumulaba un retraso operativo monumental: el recuento de 1880 había requerido más de ocho años. Herman Hollerith, un ingeniero de minas de Buffalo (Nueva York) que trabajaba en estadísticas de fabricación para el censo, propuso automat

IBM explica la organización de archivos en System/360

Este documental histórico, producido por IBM en los años 60, ofrece una lección fundamental sobre la gestión de datos en la era de la computación central. El objetivo principal es desglosar la 'organización de archivos' dentro del sistema System/360, un estándar que revolucionó la informática de la

Menos es más: ¿cuánta memoria contigua es necesaria?

Este artículo de Solidean investiga la cantidad óptima de contigüidad de memoria lineal necesaria para un rendimiento máximo en cálculos de alta velocidad. La sabiduría convencional dicta que la memoria lineal y contigua siempre es la mejor opción, pero este estudio experimental desafía esa idea, de

IA corrige documentos de seguros y agiliza procesos

FurtherAI ha desarrollado un sistema de auto-corrección para mejorar la extracción de datos de documentos de seguros, específicamente 'loss runs', que son informes de historial de reclamaciones cruciales para la fijación de precios de pólizas. Estos documentos son notoriamente difíciles de procesar

Búsqueda eficiente de trillones de vectores: un desafío

Este artículo explora el desafío de realizar búsquedas de similitud vectorial a gran escala, específicamente con 3 mil millones de vectores. El problema surge al intentar encontrar elementos semánticamente similares, una técnica crucial en aplicaciones como búsqueda, recomendaciones y recuperación g

Rendimiento en riesgo: el problema oculto de los structs

El artículo "Nobody ever got fired for using a struct" explora un problema de rendimiento inesperado en Feldera, una plataforma que procesa datos SQL. La plataforma convierte tablas SQL en structs de Rust para su procesamiento incremental. Inicialmente, los structs parecen una solución ideal: son si

libxml2-ee: mejora la biblioteca para XML

libxml2-ee es una versión mejorada de la popular biblioteca libxml2, un conjunto de herramientas en C para procesar documentos XML. Originalmente, libxml2 es una biblioteca fundamental para muchos proyectos que necesitan analizar, manipular y generar archivos XML. libxml2-ee se centra en optimizar e

Google Street View: Análisis revela cobertura global

Este artículo describe el proceso de análisis de un conjunto de datos que rastrea la cobertura global de Google Street View a lo largo del tiempo. El autor, Mark Litwintschik, utiliza una potente estación de trabajo (con un procesador AMD Ryzen 9, 96GB de RAM y un SSD NVMe de alta velocidad) y la ba

Nueva escala evalúa el poder de procesamiento de datos

Un debate reciente en la comunidad tecnológica ha propuesto la creación de una nueva escala para medir la capacidad de procesamiento de datos, inspirada en la escala de Kardashev utilizada para clasificar civilizaciones según su dominio energético. La idea surgió durante una llamada comunitaria de M