Cómo Netflix sirve sus propios LLM en producción: decisiones y lecciones

Netflix ha optado por ejecutar internamente la pila completa de servicio de modelos de lenguaje grandes (LLM), desde el despliegue hasta la inferencia, dentro de su entorno de producción habitual en lugar de un silo de aprendizaje automático separado. El artículo, firmado por los equipos Model Runti

Triton: un nuevo driver DirectX 11 para QEMU sobre Windows

El proyecto QEMU ha presentado Triton, un controlador gráfico para invitados Windows que, combinado con la capa de virtualización Neptune, ofrece aceleración 3D nativa basada en DirectX 11 dentro de máquinas virtuales. El anuncio, publicado en el blog técnico del proyecto, explica por qué los enfoqu

T-Head publica un fork de Triton con backend para sus procesadores PPU

El repositorio t-head/triton-for-sail es un fork del compilador y lenguaje Triton que añade un backend específico para los procesadores PPU desarrollados por T-Head Semiconductor, utilizados en su SDK SAIL. Está pensado para dos generaciones de Tensor Core: PPU0010, con instrucciones MMAv1, y PPU001

Phobos: un mini-lenguaje para kernels de GPU inspirado en Triton

Phobos es un lenguaje experimental de kernels creado por el desarrollador João como ejercicio personal de aprendizaje sobre la programación de bajo nivel en GPUs NVIDIA. Inspirado en Triton, el proyecto se plantea como una alternativa minimalista que compila directamente a PTX, el lenguaje ensamblad

La creciente complejidad de los LLM y el retorno de la composabilidad

Los grandes modelos de lenguaje han dejado de ser una pila limpia de módulos Transformer repetidos. Entre 2022 y 2023, en Meta, el trabajo en LLM —que condujo a Llama— contrastaba con la aparatosa complejidad de los sistemas de recomendación. La industria ha corregido esa brecha incorporando a los L

Desvirtualización estática de Themida mediante evaluación simbólica guiada

Themida y CodeVirtualizer, desarrollados por Oreans Technology, son protectores comerciales que traducen código nativo a una máquina virtual interna con un juego de instrucciones propio, un esquema que también emplea VMProtect y que comparten vxlang, EagleVM, Covirt y BinProtect. Este artículo descr

Atención Híbrida: Acelera modelos de lenguaje

El proyecto presentado explora una nueva arquitectura de atención llamada 'Atención Híbrida' para modelos de lenguaje, con un enfoque particular en la generación de código Rust. El objetivo principal es acelerar significativamente la inferencia sin comprometer la calidad del modelo. Tradicionalmente

Nvidia lanza Gluon: más potencia para GPUs

NVIDIA ha presentado Gluon, una extensión del lenguaje y compilador Triton diseñada para mejorar el rendimiento de las GPU. Gluon ofrece un mayor control a los desarrolladores al exponer más detalles internos del compilador, permitiendo optimizaciones más precisas y un mayor potencial de rendimiento

Flash Attention en TPUs: desafíos y aprendizaje

Este artículo explora los desafíos encontrados al intentar portar el algoritmo Flash Attention, optimizado para GPUs con el lenguaje Triton, a un TPU (Tensor Processing Unit). El objetivo era aprovechar la potencia gratuita de los TPUs ofrecidos en Colab. La experiencia reveló que la transición no f

IA optimiza GPUs: nuevo agente agiliza el rendimiento

RightNow AI ha presentado AutoKernel, un agente de inteligencia artificial que automatiza la optimización de kernels de GPU, inspirándose en el trabajo de autoresearch de Andrej Karpathy. AutoKernel toma cualquier modelo PyTorch, identifica los kernels de cuello de botella, los optimiza de forma aut

Rust en GPU: Async/await facilita la programación

VectorWare ha anunciado un hito significativo en la programación de GPU: la capacidad de utilizar las características `async/await` de Rust directamente en la GPU. Esto representa un avance importante hacia la visión de la empresa de facilitar a los desarrolladores la creación de aplicaciones de alt