Optimizar Automatic1111 en Apple Silicon con kernels Metal a medida

Un desarrollador detalla cómo aceleró Automatic1111 en Macs con chip M1 y M3 Pro manteniendo intacta la interfaz, los checkpoints, las LoRAs, los samplers y la API originales. El punto de partida fue la comparación con Draw Things: una generación corta de cinco pasos con DPM++ SDE Karras y CFG cerca

El mapa completo de PyTorch en una sola página

Esta serie, titulada 'Pérdida, muerte, robots', se propone recorrer todo el código de PyTorch capa por capa hasta que cada línea del día a día deje de ser opaca. La entrada actual, 'El mapa', actúa como índice general: presenta las doce partes que conformarán el recorrido —tensor, autograd, uso diar

vLLM-Kunlun: el plugin de Baidu para ejecutar vLLM en la XPU Kunlun

vLLM-Kunlun es un plugin de hardware mantenido por la comunidad y publicado por Baidu que permite ejecutar el motor de inferencia vLLM sobre la XPU Kunlun (chip Kunlun3 P800). El proyecto se distribuye como un plugin estándar de la plataforma vLLM mediante entry points de Python, lo que evita modifi

PyTorch como lenguaje de referencia y de implementación

PyTorch, el framework de código abierto desarrollado originalmente por Meta y hoy mantenido por la Linux Foundation, atraviesa una transformación conceptual que redefine su lugar en el ecosistema del aprendizaje profundo: ha dejado de ser únicamente una herramienta de implementación para consolidars

Inflect-Micro-v2: TTS local de menos de 10 millones de parámetros

Inflect-Micro-v2 es un modelo de síntesis de voz texto a forma de onda que funciona de forma local, con 9,36 millones de parámetros y 37,53 MB en FP32, y que produce audio mono a 24 kHz. Su autor, Owen, lo ha desarrollado y financiado de forma independiente y lo distribuye en Hugging Face con versio

D-FINE-seg: detección de objetos y segmentación de instancias en tiempo real

D-FINE-seg es un framework de código abierto que amplía el detector de objetos basado en transformers D-FINE con capacidades de segmentación de instancias. El proyecto añade una cabeza de máscara ligera, pérdidas de entrenamiento conscientes de la segmentación (BCE y Dice recortadas por bounding box

Qué hace realmente loss.backward(): una guía paso a paso

Cuando se entrena una red neuronal, la llamada loss.backward() desencadena el mecanismo central del aprendizaje: el cálculo de cuánto debe ajustarse cada parámetro para reducir el error. Este artículo explica, de forma didáctica y desde cero, cómo funciona ese proceso apoyándose en microcrad, un peq

LingBot-Map: modelo fundacional 3D para reconstruir escenas en tiempo real

LingBot-Map es un modelo fundacional 3D feed-forward, publicado en GitHub por el equipo Robbyant, diseñado para reconstruir escenas tridimensionales a partir de secuencias de vídeo en streaming. Su arquitectura se articula en torno al Geometric Context Transformer, un componente que unifica el ancla

Spectral Compute quiere liberar a CUDA del hardware de Nvidia

Spectral Compute, una empresa londinense fundada en 2018 por cuatro ingenieros con 60 años de experiencia combinada en optimización para HPC, desarrolla SCALE, un compilador basado en CLang y LLVM que funciona como sustituto directo de NVCC, el compilador CUDA de Nvidia. La herramienta permite recom

Eliminar las burbujas de GPU en la inferencia de IA: pipelined decoding

El equipo de Moondream analiza en profundidad un problema frecuente en la inferencia de modelos de IA: las llamadas burbujas de GPU, periodos en los que el procesador gráfico permanece inactivo porque la CPU aún no le ha indicado la siguiente tarea. El artículo explica por qué aparecen durante el bu

Anatomía del bucle de entrenamiento en PyTorch: cada línea y sus errores

Construir un bucle de entrenamiento en PyTorch parece sencillo, pero colocar cada instrucción en el orden correcto resulta sorprendentemente frágil: los entrenamientos fallan al converger, arrojan resultados incorrectos o consumen memoria excesiva cuando una línea está mal ubicada. Este artículo des

Sufijos de forma: una convención para nombrar tensores con claridad

Character.AI ha compartido una convención interna, vigente desde 2022, que añade al nombre de cada tensor un sufijo con las letras de sus dimensiones. El objetivo es que cualquier variable revele de un vistazo la forma del tensor con el que se trabaja, sin necesidad de rastrear el código. La regla

La creciente complejidad de los LLM y el retorno de la composabilidad

Los grandes modelos de lenguaje han dejado de ser una pila limpia de módulos Transformer repetidos. Entre 2022 y 2023, en Meta, el trabajo en LLM —que condujo a Llama— contrastaba con la aparatosa complejidad de los sistemas de recomendación. La industria ha corregido esa brecha incorporando a los L

OpenCL y sus alternativas: lecciones de la democratización fallida

El artículo, quinta entrega de la serie "Democratizing AI Compute", escrito por Chris Lattner (cofundador de Modular), analiza por qué OpenCL y otros modelos de programación de GPU portátiles (como SYCL, oneAPI) fracasaron en convertirse en plataformas dominantes para la inteligencia artificial, a p

Función de activación Softmax: qué es y cómo se implementa

La función Softmax es una de las piezas fundamentales en las redes neuronales modernas, especialmente en tareas de clasificación multiclase. Se trata de una función matemática no lineal que convierte un vector de puntuaciones brutas, denominadas logits y que pueden tomar cualquier valor real positiv

Cómo implementar operaciones personalizadas en PyTorch con C++ y CUDA

Esta entrada del blog explica cómo implementar operaciones personalizadas en PyTorch utilizando C++ y CUDA, y cómo integrarlas tanto en modelos de PyTorch como en programas de inferencia compilados con AOTInductor. El ejemplo guía es una convolución identidad mínima que ilustra el ciclo completo: de

Dr. GRPO: un kernel 2,2× más rápido en test, 3× más lento integrado

Este artículo describe el proceso de construir, desde cero, un bucle de entrenamiento de aprendizaje por refuerzo (RL) para modelos de lenguaje grandes, aplicándolo al algoritmo Dr. GRPO sobre el modelo Qwen2.5-0.5B-Instruct y la tarea GSM8K, con una sola GPU A10G. El punto de partida es una observa

Cuándo ocurre fragmentación en el asignador de caché de CUDA

El asignador de caché de CUDA en PyTorch organiza la memoria de la GPU en dos niveles: segmentos (obtenidos mediante cudaMalloc) y bloques (subdivisiones dentro de los segmentos). Aunque la abstracción promete un manejo simple de memoria (asignar reduce la disponible, liberar la aumenta), la impleme

Stanford CS336: un curso para construir un modelo de lenguaje desde cero

Stanford, una de las universidades más prestigiosas del mundo en ciencias de la computación, ha puesto en marcha el curso CS336, una asignatura singular que propone a los estudiantes construir un modelo de lenguaje de gran tamaño (LLM) desde cero, replicando el espíritu de los legendarios cursos de

MiniMax M2.7 supera pruebas en proyectos reales de codificación

El desarrollador Andrey Lukyanenko probó el modelo de inteligencia artificial MiniMax M2.7 en tres flujos de trabajo reales de codificación a través de API, comparándolo con Claude Opus 4.7. Las pruebas incluyeron refactorización de un proyecto PyTorch existente, redacción de notas técnicas para una

Google facilita PyTorch en TPUs con TorchTPU

Google ha anunciado el lanzamiento de TorchTPU, una nueva herramienta que permite a los desarrolladores utilizar de forma nativa y eficiente PyTorch en sus Tensor Processing Units (TPUs). TorchTPU aborda la creciente complejidad de construir modelos de IA a gran escala, que ahora requieren sistemas

Trellis-2: Modelado 3D ahora en Macs Apple Silicon

Microsoft's vanguardia imagen-a-modelo 3D, TRELLIS.2, puede ahora ejecutarse de forma nativa en Macs con Apple Silicon sin necesidad de una GPU NVIDIA, gracias a una adaptación desarrollada por Shivampkumar y publicada en GitHub. Este desarrollo significativo aprovecha PyTorch MPS, permitiendo a los

rocm y strix halo: optimiza la memoria de tu gpu

Un usuario ha compartido su experiencia al configurar ROCm y Strix Halo para optimizar el uso de memoria en un sistema con 128GB de RAM compartida entre la CPU y la GPU. El proceso, realizado en Ubuntu 24.04 LTS, incluyó una actualización del BIOS (necesaria para la detección de la GPU) y ajustes en

Atención Híbrida: Acelera modelos de lenguaje

El proyecto presentado explora una nueva arquitectura de atención llamada 'Atención Híbrida' para modelos de lenguaje, con un enfoque particular en la generación de código Rust. El objetivo principal es acelerar significativamente la inferencia sin comprometer la calidad del modelo. Tradicionalmente

Google mejora su modelo de predicción de series temporales

Google Research ha lanzado TimesFM 2.5, una versión mejorada de su modelo de predicción de series temporales. El modelo, disponible en GitHub, se basa en una arquitectura 'decoder-only' y está diseñado para ofrecer pronósticos más precisos y eficientes. TimesFM 2.5 reduce el número de parámetros de

NumKong: Biblioteca Numérica de Alto Rendimiento

Ash Vardanian ha anunciado el relanzamiento de su proyecto SimSIMD bajo el nuevo nombre NumKong, una biblioteca de computación numérica de alto rendimiento. NumKong abarca aproximadamente 200.000 líneas de código y documentación en siete lenguajes de programación, ofreciendo una colección comparable

IA optimiza GPUs: nuevo agente agiliza el rendimiento

RightNow AI ha presentado AutoKernel, un agente de inteligencia artificial que automatiza la optimización de kernels de GPU, inspirándose en el trabajo de autoresearch de Andrej Karpathy. AutoKernel toma cualquier modelo PyTorch, identifica los kernels de cuello de botella, los optimiza de forma aut

Entrenar IA de código abierto: desafíos inesperados

Un ingeniero de Workshop Labs, Addie Foote, relata los desafíos encontrados al intentar entrenar y servir modelos de lenguaje grandes con pesos abiertos, específicamente el modelo Kimi-K2-Thinking de Moonshot AI. El objetivo era post-entrenar el modelo, que cuenta con 1 billón de parámetros y está c

CPU innovadora opera dentro de una GPU

Investigadores han desarrollado una CPU innovadora que opera completamente dentro de una GPU, eliminando la necesidad de interacción con la CPU principal del sistema. Este prototipo, denominado NeuralCPU, ejecuta instrucciones ARM64 reales y utiliza tensores de PyTorch para almacenar registros, memo

Talos: Nuevo Hardware Acelera Redes Neuronales

Un equipo de ingenieros ha desarrollado 'Talos', un acelerador de hardware personalizado basado en FPGA diseñado para ejecutar redes neuronales convolucionales (CNN) con una eficiencia extrema. A diferencia de las implementaciones de software tradicionales, Talos elimina la sobrecarga de tiempo de e

Redes neuronales: Lean busca mayor seguridad

El auge de las redes neuronales en aplicaciones críticas, como sistemas de seguridad y control, ha revelado una brecha preocupante: la verificación y el análisis de estas redes a menudo se realizan *fuera* del entorno de programación donde se definen y ejecutan. Esta separación crea una desconexión

PyTorch: guía esencial para aprendizaje profundo

Este artículo introduce PyTorch, un framework de aprendizaje profundo de código abierto desarrollado originalmente por Meta AI y ahora parte de la Linux Foundation. PyTorch es fundamental para el desarrollo de modelos de machine learning, y su comprensión es crucial para cualquier persona que trabaj

Owning a $5M data center

Comma.ai, una empresa de conducción autónoma, ha publicado un artículo detallando cómo opera su propio centro de datos de 5 millones de dólares, en lugar de depender de servicios en la nube. Argumentan que tener control sobre su propia infraestructura de computación fomenta una mejor ingeniería, inc