Geolocalización OSINT de un islote mediante geometría y CUDA

Un autor publica un writeup detallado del reto OSINT 'Gralhix #004', creado por Sofia Santos, en el que se pide identificar un resort situado en un islote tropical a partir de una sola fotografía aérea obtenida con un dron. En lugar de recurrir a Google Lens, el autor plantea una resolución basada í

Swizzling de memoria compartida en CUDA: evitar conflictos de banco

Los kernels CUDA que usan memoria compartida pueden sufrir conflictos de banco, una penalización de rendimiento habitual cuando un warp accede simultáneamente a posiciones que caen en el mismo banco de la memoria compartida. Una solución sencilla es el padding, pero desperdicia memoria y tiene otros

Futhark incorpora flatmap para expresar algoritmos con arrays irregulares

Futhark, un lenguaje de programación funcional orientado a la computación paralela en GPU, tradicionalmente prohíbe los arrays irregulares (aquellos cuyos subarrays difieren en tamaño) por motivos de eficiencia de compilación. El blog oficial del proyecto explica cómo los autores proponen sortear es

Por qué las abstracciones de código empiezan a jubilarse

En mayo de 2025, el equipo de HazyResearch y de Cursor describió su trabajo con megakernels para acelerar el modelo Llama, una técnica que obliga a coordinar manualmente cientos de hilos y bloques de GPU. Para hacer manejable esa complejidad, desarrollaron una capa de abstracción en C++ publicada en

Tutorial de Vulkan: introducción a la API de gráficos y cómputo

Vulkan es una API de gráficos y cómputo desarrollada por el grupo Khronos, la misma organización detrás de OpenGL. Ofrece una abstracción mucho más explícita del hardware gráfico moderno que sus predecesoras, lo que se traduce en un mejor rendimiento y en un comportamiento del controlador más predec

Loon GPU: una capa de abstracción bindless sobre Vulkan y Metal

Loon GPU es un proyecto de código abierto presentado por Kevin Gibson que ofrece una capa de abstracción gráfica bindless inspirada en el artículo «No Graphics API» publicado por Sebastian Aaltonen en diciembre de 2025. La biblioteca se apoya en Vulkan 1.3 y Metal 4 como backends y propone simplific

Cómo implementar operaciones personalizadas en PyTorch con C++ y CUDA

Esta entrada del blog explica cómo implementar operaciones personalizadas en PyTorch utilizando C++ y CUDA, y cómo integrarlas tanto en modelos de PyTorch como en programas de inferencia compilados con AOTInductor. El ejemplo guía es una convolución identidad mínima que ilustra el ciclo completo: de

Domina la programación CUDA con los mejores libros del mercado

Esta lista curada reúne los mejores libros de programación CUDA, la plataforma de NVIDIA para computación paralela en GPUs. CUDA permite aprovechar la enorme capacidad de procesamiento paralelo de las tarjetas gráficas para tareas de alto rendimiento que antes requerían clusters costosos. La colecci