Cognition Devin descompone RSA-260 y rebaja el coste de factorizar RSA-1024

El equipo de investigación de Cognition Labs ha anunciado la factorización de RSA-260, un número de 260 dígitos que pulveriza el récord anterior, RSA-250, logrado en febrero de 2020. El cálculo se realizó como prueba de concepto mientras se optimizaba el planificador de trabajos para aprovechar capa

NVIDIA presenta CUDA Rust con dos vías para escribir kernels de GPU

NVIDIA ha anunciado CUDA Rust, una iniciativa con la que busca llevar a Rust al núcleo de la programación de GPU. Hasta ahora, los desarrolladores podían lanzar kernels desde Rust, pero el código del kernel solía escribirse en otro lenguaje; CUDA Rust elimina esa barrera al permitir que los kernels

Pantheon: pruebas de GPU y gestión de caché

Pantheon es una herramienta para evaluar el comportamiento de las GPU mediante cargas de trabajo enfocadas. El texto describe pruebas de cómputo, memoria, caché, interconexión y consumo energético, junto con la captura de telemetría y el almacenamiento de resultados para compararlos posteriormente.

Futhark incorpora funciones recursivas tras casi una década sin ellas

Futhark, un lenguaje funcional orientado a la computación paralela sobre datos, ha carecido de soporte para funciones recursivas durante casi toda su existencia. La ausencia no respondía a una postura ideológica contra la recursión —el propio compilador contiene definiciones recursivas—, sino a la f

Futhark logra aplanar por completo el paralelismo de datos anidado

El compilador Futhark, un lenguaje funcional orientado a la generación de código paralelo para GPUs, alcanza por fin la capacidad de aplanar cualquier forma de paralelismo de datos anidado, incluidas las variantes irregulares que hasta ahora quedaban fuera de su alcance. El aplanamiento (flattening)

Diseño orientado a datos: fundamentos y rendimiento de caché

El diseño orientado a datos (Data-Oriented Design, DOD) es un paradigma de programación que prioriza el acceso y la transformación de la información por encima de la estructura jerárquica de clases propia de la programación orientada a objetos (OOD). Su motivación principal es el rendimiento, deriva

Una serie para entender de cabo a rabo la pila tecnológica de los LLM

Una guía en forma de serie de artículos recorre, de forma ordenada por dependencias, la pila tecnológica completa de un modelo de lenguaje grande (LLM) actual. El recorrido va de los fundamentos de álgebra lineal —vectores, matrices y espacios vectoriales— hasta los protocolos de agentes que llegan

T-Head publica un fork de Triton con backend para sus procesadores PPU

El repositorio t-head/triton-for-sail es un fork del compilador y lenguaje Triton que añade un backend específico para los procesadores PPU desarrollados por T-Head Semiconductor, utilizados en su SDK SAIL. Está pensado para dos generaciones de Tensor Core: PPU0010, con instrucciones MMAv1, y PPU001

Tensores desde cero: cómo construir una biblioteca acelerada en C

Un tensor no es más que un arreglo plano de números acompañado de metadatos que indican cómo interpretar esos valores como un objeto multidimensional. Esa es la premisa central de este artículo, que guía al lector paso a paso en la construcción de una biblioteca de tensores escrita en C y acelerada

Phobos: un mini-lenguaje para kernels de GPU inspirado en Triton

Phobos es un lenguaje experimental de kernels creado por el desarrollador João como ejercicio personal de aprendizaje sobre la programación de bajo nivel en GPUs NVIDIA. Inspirado en Triton, el proyecto se plantea como una alternativa minimalista que compila directamente a PTX, el lenguaje ensamblad

Anatomía de un kernel CUDA: del código en C al silicio de la GPU

Ejecutar un kernel aparentemente trivial —sumar dos vectores de un millón de floats— esconde una cadena de traducciones y movimientos de datos que este artículo recorre paso a paso. El programa fuente, escrito en CUDA C, se divide en dos ramas: el código del host lo compila el compilador habitual de

Expanse (YC P26) reduce el desperdicio de GPU en clústeres HPC

Expanse es una herramienta respaldada por Y Combinator en su promoción P26 que aborda un problema estructural de los centros de datos: la baja utilización efectiva de la capacidad de cómputo. Sus fundadores, Ismaeel, Eren, Yafet y Nikodem, con experiencia previa en fondos cuantitativos y grandes ins

Domina la programación CUDA con los mejores libros del mercado

Esta lista curada reúne los mejores libros de programación CUDA, la plataforma de NVIDIA para computación paralela en GPUs. CUDA permite aprovechar la enorme capacidad de procesamiento paralelo de las tarjetas gráficas para tareas de alto rendimiento que antes requerían clusters costosos. La colecci

Swift alcanza Teraflops entrenando LLMs en Apple Silicon

Este artículo explora cómo optimizar operaciones de multiplicación de matrices en Swift para entrenar Large Language Models (LLMs) en Apple Silicon, buscando alcanzar rendimiento de Teraflop/s desde el punto de partida de Gigaflops. El autor, Matt Gallagher, toma como referencia la implementación ll

Entrenan LLM gigante en una GPU: avance tecnológico

El entrenamiento de modelos de lenguaje grandes (LLMs), como GPT-3 o LaMDA, es un desafío computacional enorme. Estos modelos pueden tener cientos de miles de millones de parámetros, lo que requiere una cantidad significativa de memoria y potencia de cálculo. Tradicionalmente, el entrenamiento de es

Cálculos dispersos: nuevo método optimiza el rendimiento

El cálculo eficiente con datos dispersos (sparse data) es crucial en muchas áreas científicas y de ingeniería, desde simulaciones físicas hasta aprendizaje automático. Sin embargo, optimizar el código para estas operaciones, especialmente en hardware diverso como diferentes GPUs, puede ser extremada

IA investiga y optimiza modelos de lenguaje sola

Este repositorio de GitHub, creado por Andrej Karpathy, presenta un enfoque innovador para la investigación en inteligencia artificial: la 'autoresearch'. En lugar de la investigación tradicional, donde humanos modifican el código, este sistema permite a agentes de IA experimentar y optimizar modelo

Nueva técnica acelera cálculos complejos con GPUs

El artículo de Bee Rosa Davis presenta una innovadora técnica llamada 'Curvature-Guided Wavefront Execution' (Ejecución de Frente de Onda Guiada por Curvatura) que revoluciona la resolución de problemas de satisfacción de restricciones (CSP) utilizando la potencia de las GPUs. En esencia, se trata d