Noticias que mencionan Qwen3

AirLLM: cómo ejecutar modelos de 70B en una sola GPU de 4 GB

AirLLM es una biblioteca de Python de código abierto que reduce drásticamente el consumo de memoria durante la inferencia de modelos de lenguaje de gran tamaño, permitiendo ejecutar un modelo de 70B parámetros en una única GPU con apenas 4 GB de VRAM, sin recurrir a cuantización, destilación ni poda

Entrenar una sola capa de un transformer basta para replicar el ajuste por RL

Un nuevo estudio de aprendizaje automático cuestiona uno de los supuestos más asentados del post-entrenamiento de modelos de lenguaje: que los beneficios del aprendizaje por refuerzo (RL) se distribuyen de forma pareja entre todas las capas del transformer. Los autores demuestran que entrenar una ún

Modelos de lenguaje: nueva técnica supera limitaciones

I-DLM (Introspective Diffusion Language Models) representa un avance significativo en el campo de los modelos de lenguaje, abordando una limitación clave de los modelos de difusión: su inferior rendimiento en comparación con los modelos autoregresivos (AR) tradicionales. Los modelos de difusión, a d

SwiftLM: LLMs nativos y rápidos en Apple Silicon

Un equipo de desarrolladores ha lanzado SwiftLM, un servidor de inferencia nativo para dispositivos Apple Silicon que ofrece compatibilidad con la API de OpenAI. Esta herramienta, de código abierto, elimina la necesidad de un entorno de ejecución de Python y el Global Interpreter Lock (GIL), lo que

macOS: asistente de voz IA funciona sin internet

RunanywhereAI ha lanzado RCLI, un asistente de voz con inteligencia artificial diseñado para macOS que funciona completamente en el dispositivo, eliminando la necesidad de conexión a la nube o claves de API. Utilizando Apple Silicon (M1 o posterior), RCLI integra reconocimiento de voz (STT), un mode

Unsloth mejora LLMs con Dynamic 2.0 GGUFs

Unsloth ha lanzado Dynamic 2.0 GGUFs, una actualización significativa de su método de cuantización para modelos de lenguaje grandes (LLMs). Esta nueva versión supera a otros métodos de cuantización líderes, estableciendo nuevos puntos de referencia en pruebas MMLU y KL Divergence, lo que permite a l

Edge-Veda: IA estable y privada para dispositivos móviles

Un nuevo runtime de IA para dispositivos llamado Edge-Veda busca solucionar problemas de estabilidad en aplicaciones de IA que se ejecutan directamente en teléfonos móviles, especialmente aquellas basadas en Flutter. Desarrollado por Ramanujammv, Edge-Veda permite ejecutar modelos de texto, visión y