Noticias que mencionan SIMD

GPT en C: modelo más rápido para dispositivos

Un desarrollador ha creado una implementación en lenguaje C99 de un modelo GPT de estilo 'character-level', denominado MicroGPT-C, que permite un entrenamiento y generación de texto significativamente más rápidos que las implementaciones en Python. El proyecto, publicado en GitHub, busca ofrecer una

Optimiza tu código C: rendimiento y portabilidad

Este artículo explora técnicas para optimizar el rendimiento de software C, especialmente en arquitecturas x86-64, donde la capacidad de la CPU juega un papel crucial. El problema radica en que el código optimizado para una CPU específica puede no funcionar bien en otras, limitando la portabilidad.

Programación: ¿Siempre es más lento lo de bajo nivel?

Este artículo explora el concepto de "costos ocultos" en la programación, desafiando la idea de que los lenguajes de alto nivel son inherentemente menos eficientes que los lenguajes de bajo nivel como C o C++. El autor observa que los programadores de sistemas a menudo evitan lenguajes con recolecci

WebAssembly: ¿Por qué no despega en la web?

WebAssembly (Wasm) ha avanzado significativamente desde su lanzamiento en 2017, incorporando nuevas funcionalidades como memoria compartida, SIMD y manejo de excepciones. Sin embargo, a pesar de estos avances, su adopción en la web se ve limitada por su estatus como lenguaje de segunda clase. Wasm n

macOS: ejecuta apps de Linux sin emuladores

Usuarios de macOS ahora pueden ejecutar aplicaciones de Linux de forma nativa gracias a Cocoa-Way, un nuevo compositor Wayland desarrollado por J-x-Z. La herramienta, disponible desde GitHub, elimina la necesidad de máquinas virtuales o emuladores, ofreciendo una integración transparente de aplicaci

Markdown: ¿Sigue valiendo la pena usarlo?

Este artículo de Burak Güngör explora por qué seguimos utilizando Markdown, a pesar de sus deficiencias. El autor argumenta que, si bien Markdown se presenta como un lenguaje de marcado minimalista y legible para convertir archivos de texto plano en HTML, su implementación práctica a menudo se aleja

Binario vs. JSON: ¿Mejor rendimiento en bases de datos?

Un artículo de jincongho.com explora cómo las codificaciones binarias de JSON podrían reemplazar al JSON tradicional en bases de datos, impulsando significativamente el rendimiento de las consultas repetidas. El análisis revela que el cuello de botella no es tanto el JSON en sí, sino el proceso de a

Gemma: IA crea diagramas en Chrome con WebGPU

Un equipo de desarrolladores ha presentado Gemma LLM, un modelo de lenguaje capaz de generar diagramas directamente en el navegador Chrome utilizando WebGPU. La demostración, disponible para Chrome versión 134 o superior, permite a los usuarios describir un diagrama y que Gemma lo cree como un dibuj

Lwan adopta Swiss Tables para optimizar su servidor web

Lwan, un servidor web de alto rendimiento conocido por su eficiencia en memoria, ha reemplazado completamente su tabla hash antigua (basada en el proyecto kmod) por una implementación completamente nueva inspirada en las llamadas 'Swiss Tables'. Este cambio busca resolver años de deuda técnica y com

Swift alcanza Teraflops entrenando LLMs en Apple Silicon

Este artículo explora cómo optimizar operaciones de multiplicación de matrices en Swift para entrenar Large Language Models (LLMs) en Apple Silicon, buscando alcanzar rendimiento de Teraflop/s desde el punto de partida de Gigaflops. El autor, Matt Gallagher, toma como referencia la implementación ll

Endive: nuevo runtime de wasm para java sin dependencias nativas

El proyecto Endive, desarrollado por Bytecode Alliance, es un nuevo tiempo de ejecución nativo de Java para WebAssembly (Wasm). Lanzado como un fork de Chicory, permite ejecutar módulos Wasm directamente en la Máquina Virtual de Java (JVM) sin dependencias nativas ni llamadas JNI. La relevancia de e

Física del CPU y ciclos de reloj: borrador de libro sobre C++ eficiente

## Física del CPU y ciclos de reloj: claves del rendimiento en C++ moderno Un borrador del primer tramo del capítulo 4 de un libro en preparación, "Efficient C++ Programming for Modern 64-bit CPUs" de Sherry Ignatchenko y Dmytro Ivanchykhin, ha sido compartido públicamente para recibir retroaliment

Zen de la programación paralela: la postura de un kernel

Un ensayo publicado en el blog smolnero reflexiona sobre el paper 'HipKittens: Fast and Furious AMD Kernels' (arXiv:2511.08083) y lo conecta con la filosofía zen de 'Mente zen, mente de principiante' de Shunryu Suzuki. El texto parte de una idea técnica: un kernel de GPU es una función especializada

Un compilador mínimo para entender cómo se paralelizan los kernels de datos

El artículo describe un compilador experimental de unas 180 líneas de Python, disponible en GitHub, que realiza una fase de "lowering" sobre kernels: transforma bucles `for` convencionales en bucles `vector_for` en los que el paralelismo de datos queda explícito. La entrada es un AST pequeño escrito

QuestDB hace WINDOW JOIN paralelo y vectorizado con SIMD

QuestDB ha reescrito su operador WINDOW JOIN para que se ejecute en paralelo a nivel de datos y aproveche instrucciones SIMD en la agregación interna. La nueva ruta emplea dos piezas: paralelización por page frames sobre la tabla izquierda (LHS), y una vía rápida para claves de baja cardinalidad que

Kimi K3 optimiza código Rust con SWAR y mejora el rendimiento un 2%

Un programador sometió a Kimi K3, el nuevo modelo de IA presentado esta semana como cercano a la frontera de calidad de modelos como GPT, a una prueba práctica de optimización de código en Rust. La tarea consistía en mejorar una función sobre la que el autor llevaba tiempo trabajando sin avances sig

l: un nuevo motor compatible con k, q y qSQL sobre vectores comprimidos

l es un nuevo runtime para la familia de lenguajes k y q que ejecuta código k4, q y qSQL existente sin necesidad de reescritura. La propuesta mantiene la sintaxis, los modismos, las tablas, los diccionarios y el trabajo con series temporales tal como se escriben hoy, pero cambia el motor subyacente

Box3D aplica SIMD a la detección de colisiones con cascos convexos complejos

El motor de física Box3D incorpora optimizaciones SIMD (instrucciones vectoriales) en su algoritmo de detección de colisiones para reducir el coste del test de ejes de separación (SAT) entre cascos convexos en tres dimensiones. El autor parte de una técnica previa de SIMD "ancho" usada en el solver

Andy Pavlo se incorpora a ClickHouse para lanzar ClickHouse Labs

El profesor de la Carnegie Mellon University Andy Pavlo se incorpora a ClickHouse para crear y dirigir ClickHouse Labs, un nuevo grupo de investigación en bases de datos. Pavlo, que seguirá vinculado a la universidad, liderará un equipo que colaborará estrechamente con los ingenieros, clientes y soc

Por qué ryg_rans no es una librería y qué usar en su lugar

Fabian Giesen, conocido en la comunidad de gráficos y compresión como 'ryg', aclara en un extenso post que ryg_rans, su repositorio público publicado en 2014, nunca estuvo pensado para usarse como librería de producción, sino como ejemplo didáctico que acompaña a sus artículos sobre codificación ent

Go 1.27 introduce SIMD portátil para mejorar el rendimiento

Go 1.27 incorpora una API experimental de SIMD (Single Instruction Multiple Data) que permite a los desarrolladores acceder a operaciones de vectorización sin depender de la arquitectura específica del hardware. Esta novedad, que se complementa con las APIs experimentales de Go 1.26 para amd64 y 1.2