Optimizar Automatic1111 en Apple Silicon con kernels Metal a medida

Un desarrollador detalla cómo aceleró Automatic1111 en Macs con chip M1 y M3 Pro manteniendo intacta la interfaz, los checkpoints, las LoRAs, los samplers y la API originales. El punto de partida fue la comparación con Draw Things: una generación corta de cinco pasos con DPM++ SDE Karras y CFG cerca

Cua libera un shim que acelera Metal en VMs macOS sobre Apple Silicon

Cua, el equipo detrás de la pila de virtualización Lume para macOS, ha publicado como 'research release' una pequeña capa de compatibilidad, limitada a un proceso, que desbloquea rutas modernas de Metal dentro de una máquina virtual macOS invitada ejecutada sobre Apple Virtualization.framework. La c

h3.c: motor nativo de inferencia MiniMax H3 para Apple Silicon

h3.c es un motor de inferencia nativo para el modelo de generación de vídeo MiniMax-H3, desarrollado específicamente para equipos Mac con chip Apple Silicon (procesadores M3 Max y M5 Max). El proyecto se construye mediante rebanadas verticales funcionales: primero metadatos deterministas del modelo

Ferrox: un motor de inferencia en Rust que rivaliza con llama.cpp

Ferrox, un motor de inferencia escrito íntegramente en Rust, ejecuta modelos de lenguaje abiertos en local —tanto densos como Mixture-of-Experts— sobre CPU, Apple Metal o CUDA, sin recurrir a enlaces con llama.cpp ni con ggml. Cada kernel, cargador y mecanismo de planificación se ha implementado des

Renderizado de un toro 3D en el terminal mediante el protocolo gráfico Kitty

Andrea presenta la versión 0.5 de 'torus', un programa que renderiza un toro tridimensional directamente en la terminal. Para conseguirlo, utiliza el protocolo gráfico Kitty, compatible con terminales como Ghostty, que permite mostrar imágenes mediante secuencias de escape específicas. La imagen deb

Renderizado software en 500 líneas de C++ puro

Una serie de artículos docentes enseña, desde la base, cómo funcionan internamente las APIs de gráficos 3D como OpenGL, Vulkan, Metal o DirectX. Para ello propone escribir un clon simplificado de un motor de renderizado en C++ puro, sin recurrir a librerías externas ni a la GPU. El proyecto parte d

transcribe.cpp: nueva biblioteca de transcripción local basada en ggml

transcribe.cpp es una biblioteca de transcripción de voz a texto basada en ggml, presentada por el autor y mantenedor de Handy como un proyecto de código abierto en su versión 0.1.0. Su objetivo es simplificar la distribución de aplicaciones de reconocimiento automático del habla (ASR) multiplatafor

Tensores desde cero: cómo construir una biblioteca acelerada en C

Un tensor no es más que un arreglo plano de números acompañado de metadatos que indican cómo interpretar esos valores como un objeto multidimensional. Esa es la premisa central de este artículo, que guía al lector paso a paso en la construcción de una biblioteca de tensores escrita en C y acelerada

Loon GPU: una capa de abstracción bindless sobre Vulkan y Metal

Loon GPU es un proyecto de código abierto presentado por Kevin Gibson que ofrece una capa de abstracción gráfica bindless inspirada en el artículo «No Graphics API» publicado por Sebastian Aaltonen en diciembre de 2025. La biblioteca se apoya en Vulkan 1.3 y Metal 4 como backends y propone simplific

Qué aprender para ser programador de gráficos en tiempo real

Esta guía didáctica, escrita por un programador veterano de gráficos, detalla las habilidades necesarias para incorporarse al mercado laboral como desarrollador de gráficos en tiempo real, un campo clave de la industria del videojuego y del renderizado. El autor parte de una advertencia sobre el pap

avoxelgame: un voxel game experimental escrito en Dyalog APL y SDL3

avoxelgame es un proyecto de código abierto en el que el autor, namgyaaal, se propuso demostrar que la notación de APL permite construir un juego de vóxeles de forma más sencilla. El resultado, reconoce, es un título altamente experimental e inestable, pero ofrece una base jugable: el usuario se des

DeepSeek v4 Flash: Motor de inferencia más rápido y eficiente

Un equipo de ingenieros, liderado por Antirez, ha lanzado DeepSeek v4 Flash, un nuevo motor de inferencia optimizado para el modelo de lenguaje DeepSeek V4 Flash. Este motor, denominado 'ds4.c', está diseñado específicamente para este modelo y no es un framework genérico. La principal ventaja radica

Apple Silicon: GPU y WebAssembly comparten memoria

Apple ha habilitado una innovadora técnica de inferencia de GPU sin copia en sus chips Silicon, permitiendo que los módulos WebAssembly (Wasm) compartan directamente su memoria lineal con la GPU. Tradicionalmente, la comunicación entre Wasm y la GPU implicaba costosas copias de datos a través de un

TQ4_1S: LLMs más pequeños para dispositivos Apple

Un desarrollador ha presentado una nueva técnica de compresión de modelos de lenguaje grandes (LLM) llamada TQ4_1S, diseñada específicamente para dispositivos Apple con chips Metal. Esta técnica reduce el tamaño de los modelos en un 27-38%, dependiendo del modelo, sin necesidad de reentrenamiento ni

Impresión 3D de Metal: Startup Bajan el Precio

Scrap Labs, una startup tecnológica, está desarrollando un sistema de impresión 3D de metal a un precio radicalmente accesible, con un objetivo de lanzamiento para junio de 2027. La plataforma, que se espera que cueste menos de 20.000 dólares, busca democratizar el acceso a la fabricación aditiva de