Noticias que mencionan CUDA

vLLM v0.28.0 optimiza inferencia de Kimi-K3 y DeepSeek V4

El proyecto vLLM ha publicado la versión 0.28.0, una actualización que incorpora 584 contribuciones de 270 desarrolladores para mejorar significativamente el rendimiento y la compatibilidad de modelos de lenguaje avanzados. Esta liberación se centra en optimizaciones profundas para Kimi-K3, incluyen

Por qué tu LLM local parece más torpe de lo que es

Muchos usuarios instalan un modelo de lenguaje local, a menudo en una versión cuantizada, y comprueban decepcionados que rinde peor de lo prometido en los benchmarks originales. Esta brecha se explica porque cada combinación de hardware y software introduce pequeñas variaciones que alteran los cálcu

Por qué las abstracciones de código empiezan a jubilarse

En mayo de 2025, el equipo de HazyResearch y de Cursor describió su trabajo con megakernels para acelerar el modelo Llama, una técnica que obliga a coordinar manualmente cientos de hilos y bloques de GPU. Para hacer manejable esa complejidad, desarrollaron una capa de abstracción en C++ publicada en

transcribe.cpp: nueva biblioteca de transcripción local basada en ggml

transcribe.cpp es una biblioteca de transcripción de voz a texto basada en ggml, presentada por el autor y mantenedor de Handy como un proyecto de código abierto en su versión 0.1.0. Su objetivo es simplificar la distribución de aplicaciones de reconocimiento automático del habla (ASR) multiplatafor

Karaoke IA: Nightingale mejora tu experiencia cantando

Nightingale, una nueva aplicación de karaoke, ha lanzado una versión innovadora que utiliza inteligencia artificial para ofrecer una experiencia de canto mejorada. Disponible para Linux, macOS y Windows, la aplicación separa las voces de la instrumentación de las canciones utilizando modelos como UV