Noticias que mencionan Qwen3

Edge-Veda: IA estable y privada para dispositivos móviles

Un nuevo runtime de IA para dispositivos llamado Edge-Veda busca solucionar problemas de estabilidad en aplicaciones de IA que se ejecutan directamente en teléfonos móviles, especialmente aquellas basadas en Flutter. Desarrollado por Ramanujammv, Edge-Veda permite ejecutar modelos de texto, visión y

Unsloth mejora LLMs con Dynamic 2.0 GGUFs

Unsloth ha lanzado Dynamic 2.0 GGUFs, una actualización significativa de su método de cuantización para modelos de lenguaje grandes (LLMs). Esta nueva versión supera a otros métodos de cuantización líderes, estableciendo nuevos puntos de referencia en pruebas MMLU y KL Divergence, lo que permite a l

macOS: asistente de voz IA funciona sin internet

RunanywhereAI ha lanzado RCLI, un asistente de voz con inteligencia artificial diseñado para macOS que funciona completamente en el dispositivo, eliminando la necesidad de conexión a la nube o claves de API. Utilizando Apple Silicon (M1 o posterior), RCLI integra reconocimiento de voz (STT), un mode

SwiftLM: LLMs nativos y rápidos en Apple Silicon

Un equipo de desarrolladores ha lanzado SwiftLM, un servidor de inferencia nativo para dispositivos Apple Silicon que ofrece compatibilidad con la API de OpenAI. Esta herramienta, de código abierto, elimina la necesidad de un entorno de ejecución de Python y el Global Interpreter Lock (GIL), lo que

Modelos de lenguaje: nueva técnica supera limitaciones

I-DLM (Introspective Diffusion Language Models) representa un avance significativo en el campo de los modelos de lenguaje, abordando una limitación clave de los modelos de difusión: su inferior rendimiento en comparación con los modelos autoregresivos (AR) tradicionales. Los modelos de difusión, a d

Entrenar una sola capa de un transformer basta para replicar el ajuste por RL

Un nuevo estudio de aprendizaje automático cuestiona uno de los supuestos más asentados del post-entrenamiento de modelos de lenguaje: que los beneficios del aprendizaje por refuerzo (RL) se distribuyen de forma pareja entre todas las capas del transformer. Los autores demuestran que entrenar una ún

AirLLM: cómo ejecutar modelos de 70B en una sola GPU de 4 GB

AirLLM es una biblioteca de Python de código abierto que reduce drásticamente el consumo de memoria durante la inferencia de modelos de lenguaje de gran tamaño, permitiendo ejecutar un modelo de 70B parámetros en una única GPU con apenas 4 GB de VRAM, sin recurrir a cuantización, destilación ni poda

Comparativa de modelos de IA local para decisiones en el navegador

Esta herramienta permite ejecutar modelos de lenguaje de gran escala (LLM) directamente en el navegador del usuario, facilitando la comparación entre dos métodos de obtención de probabilidades de decisión. El sistema opera en modo local, utilizando GPUs del equipo para procesar modelos como MiniCPM5