Un ingeniero denuncia la pérdida de pericia técnica por usar LLMs

Un ingeniero de software con cinco años de formación universitaria y una extensa trayectoria en el desarrollo de sistemas, bibliotecas de machine learning y administración de servidores expresa su descontento ante la adopción generalizada de los modelos de lenguaje grandes (LLMs) en su flujo de trab

Cómo alcanzar 50 tokens/s con Qwen3 27B y 256K de contexto en una GPU de 24 GB

El ingeniero Michał Piszczek documenta el proceso seguido para ejecutar el modelo denso Qwen3 27B con su contexto nativo completo de 262.144 tokens, entrada multimodal y decodificación especulativa MTP sobre una sola GPU NVIDIA RTX PRO 4000 Blackwell SFF de 24 GB. El sistema final, bautizado Qwen3.8

Qwen3.8-27B en formato GGUF: guía de uso local con llama.cpp, Ollama y Unsloth

Unsloth ha publicado en Hugging Face la versión GGUF del modelo Qwen3.8-27B, una variante densa de 27.000 millones de parámetros con comprensión nativa de imágenes y vídeo, control flexible del modo de razonamiento y mejoras en la ejecución autónoma de tareas largas. El repositorio incluye cuantizac

Ferrox: un motor de inferencia en Rust que rivaliza con llama.cpp

Ferrox, un motor de inferencia escrito íntegramente en Rust, ejecuta modelos de lenguaje abiertos en local —tanto densos como Mixture-of-Experts— sobre CPU, Apple Metal o CUDA, sin recurrir a enlaces con llama.cpp ni con ggml. Cada kernel, cargador y mecanismo de planificación se ha implementado des

GPT2-BASIC: un transformador en DOS con aritmética de punto fijo

GPT2-BASIC es un runtime de transformer y asistente local implementado en BASIC para máquinas de clase DOS, compilado con FreeBASIC y verificado en QEMU. No es un frontend web ni un envoltorio de API: carga artefactos de modelo desde disco, ejecuta inferencia tipo GPT con aritmética entera de punto

Rotary GPU: ejecución local de modelos MoE con memoria GPU limitada

Rotary GPU es un enfoque de ejecución local para modelos grandes de mezcla de expertos (MoE) que permite correrlos en hardware de consumo con memoria limitada. Desarrollado a partir del concepto de residencia en aceleradores rotatorios, el método fue validado públicamente con el modelo Qwen3.6-35B-A

LLMs en vuelo: Ingeniero prueba IA sin conexión

Este artículo describe un experimento realizado por Dmitri Lerko, un ingeniero, durante un vuelo de 10 horas de Londres a Las Vegas, utilizando un MacBook Pro M5 Max para ejecutar modelos de lenguaje grandes (LLMs) localmente sin conexión a internet. El objetivo era evaluar la viabilidad de realizar

IA local: AMD lanza GAIA, framework de código abierto

AMD ha presentado GAIA, un nuevo framework de código abierto que permite a los usuarios crear y ejecutar agentes de inteligencia artificial directamente en sus dispositivos locales, sin necesidad de conexión a la nube. Desarrollado en Python y C++, GAIA ofrece un SDK completo en ambos lenguajes y es

Gemma 4 de Google: IA potente ahora en tu PC

Google ha lanzado la familia de modelos Gemma 4, que ahora puede ejecutarse localmente en dispositivos gracias a la nueva versión 0.4.0 de LM Studio. Esta actualización introduce 'llmster' y la CLI 'lms', permitiendo a los usuarios ejecutar modelos como Gemma 4 26B en sus propios ordenadores, elimin