Un LoRA pequeño corrige el sesgo de los transformers

Un estudio reciente revela que los modelos de transformers preentrenados subutilizan su profundidad arquitectónica al seguir referencias en el contexto. Los análisis indican que trece modelos base confían únicamente en 1,4 a 3,6 líneas de contexto, mientras que los bucles adicionales de preentrenami

Guía técnica para implementar el modelo multimodal Cloudflare/clef

Cloudflare/clef es un modelo de lenguaje multimodal de 27.000 millones de parámetros diseñado para la toma de decisiones estructuradas. A diferencia de los modelos de generación de texto libre, Clef procesa estados y esquemas de preguntas tipadas para devolver probabilidades para cada opción permiti

Edge0 Audio8 ASR Infinite: modelo de reconocimiento de voz en tiempo real

Edge0 Audio8 ASR Infinite es un modelo de reconocimiento de voz nativo en streaming diseñado para ofrecer latencia mínima y transcripciones de audio de longitud ilimitada. Su arquitectura hereda la estructura Voxtral Realtime y combina un Decoder basado en Qwen2.5-3B-Instruct con un sistema de caché

NVIDIA lanza Nemotron-3-Diarización para identificar hablantes en audio

NVIDIA ha publicado Nemotron-3-Diarización, un modelo de diarización de hablantes de código abierto diseñado para determinar quién habló y cuándo en audio real. Este modelo, basado en la arquitectura Sortformer, soporta la inferencia en tiempo real y en lote, gestionando hasta ocho hablantes simultá

Guía técnica para ejecutar Qwen3.8-27B en Hugging Face

El repositorio de Hugging Face para Qwen/Qwen3.8-27B ofrece una guía integral para el despliegue y uso de este modelo de lenguaje multimodal. El documento detalla las instrucciones para integrar la herramienta mediante librerías como Transformers, vLLM y SGLang, así como la configuración de entornos

Guía técnica para ejecutar MiMo-V2.6-Pro-RL en Hugging Face

La colección de Hugging Face para XiaomiMiMo/MiMo-V2.6-Pro-RL ofrece una guía integral para el despliegue y uso de este modelo de lenguaje de gran escala. El documento detalla las instrucciones para integrar el modelo mediante librerías de Python, como Transformers, y a través de entornos de inferen

Hugging Face integra soporte nativo para modelos GGUF en Transformers

La librería Transformers de Hugging Face ha incorporado soporte nativo para modelos GGUF, permitiendo cargar y servir cuantizaciones de llama.cpp directamente desde el ecosistema de Python. Esta actualización elimina la necesidad de alternar entre la potencia de llama.cpp y la comodidad del stack de

Estimación de log-sum-exp mediante regresión de mínimos cuadrados

La estimación de funciones log-sum-exp presenta un desafío estadístico significativo debido a la explosión de la varianza cuando los valores de la función potencial son grandes. Este problema afecta a aplicaciones clave en el aprendizaje automático, como la normalización de modelos probabilísticos,

Foundation Model Engineering: guía técnica para arquitectos de IA

Foundation Model Engineering es un texto técnico diseñado para ingenieros de inteligencia artificial y lectores orientados a la investigación que buscan comprender el funcionamiento interno de los modelos de fundación modernos. A diferencia de las guías superficiales, este recurso explora la evoluci

FlashAttention: optimización de memoria para acelerar transformers

FlashAttention es una familia de algoritmos diseñada para optimizar la atención en modelos de lenguaje mediante la reducción del tráfico de datos en la jerarquía de memoria de la GPU, no mediante la aproximación matemática de la atención. A diferencia de los métodos aproximados que modifican la func

Ingeniería inversa de la arquitectura interna del Neural Engine de Apple

El Neural Engine (ANE) de Apple, introducido en el A11 Bionic en 2017, fue diseñado originalmente para acelerar cargas de trabajo de redes neuronales convolucionales (CNN) mediante un flujo de datos optimizado para reutilizaciones predecibles. Sin embargo, el auge de los modelos de transformers, esp

Cómo construir un modelo de lenguaje por difusión: guía técnica

Los modelos de lenguaje por difusión (DLM) representan una alternativa a los modelos autorregresivos que dominan el campo. Mientras los autorregresivos generan texto token a token de izquierda a derecha, los modelos de difusión parten de una secuencia completa ruidosa —en este caso, totalmente enmas

Muere Peter Cullen, voz de Optimus Prime en Transformers, a los 85 años

Peter Cullen, actor de voz canadiense que dio vida al líder de los Autobots Optimus Prime en la saga 'Transformers' y al melancólico Tiggr en decenas de producciones de Winnie the Pooh, falleció el miércoles en su domicilio de Los Ángeles a los 85 años. Su representante, Kevin Motley, confirmó la no

Qwen3.8-27B-FP8: el nuevo modelo multimodal de código abierto de Alibaba

Alibaba ha publicado en Hugging Face los pesos cuantizados en FP8 de Qwen3.8-27B, un modelo denso de lenguaje causal con codificador de visión integrado, sucesor de las series Qwen3.5 y Qwen3.6. La versión cuenta con 27.000 millones de parámetros, 64 capas, una dimensión oculta de 5.120 y un vocabul

Qwen publica en open source los pesos cuantizados FP8 de Qwen3.8-2.4T-A95B

El repositorio Qwen/Qwen3.8-2.4T-A95B-FP8 en Hugging Face distribuye los pesos cuantizados en FP8 de un modelo MoE de 2,4 billones de parámetros con 95.000 millones activos, pensado para ejecutarse en vLLM, SGLang, TokenSpeed o mediante Docker. El cuantificado utiliza granularidad fina con bloques d

NVIDIA publica Nemotron 3.5 Lightning 30B-A3B en cuantización NVFP4

NVIDIA ha presentado Nemotron 3.5 Lightning 30B-A3B en cuantización NVFP4, una variante optimizada para inferencia de su familia de modelos de lenguaje abiertos. El lanzamiento, fechado el 11 de agosto de 2026 según la ficha técnica publicada en Hugging Face, supone un paso más en la estrategia de l

Una serie para entender de cabo a rabo la pila tecnológica de los LLM

Una guía en forma de serie de artículos recorre, de forma ordenada por dependencias, la pila tecnológica completa de un modelo de lenguaje grande (LLM) actual. El recorrido va de los fundamentos de álgebra lineal —vectores, matrices y espacios vectoriales— hasta los protocolos de agentes que llegan

Un nuevo test mide si la IA puede aprender como un bebé

Investigadores de Meta, Stanford, la Universidad de Tokio y la École Normale Supérieure francesa han creado un test, el EgoBabyVLM Challenge, que evalúa si los modelos de visión y lenguaje son capaces de aprender a partir de unas mil horas de vídeo grabado con cámaras colocadas en la cabeza de bebés

Cómo funcionan realmente los grandes modelos de lenguaje

Los grandes modelos de lenguaje (LLM) actuales comparten un esqueleto común basado en la arquitectura transformer. Comprender las piezas fundamentales de ese bloque permite leer papers y fichas técnicas con criterio. Este artículo recorre los mecanismos esenciales: tokenización, embeddings, codifica

El backend de modelado de transformers en vLLM alcanza velocidad nativa

Hugging Face ha anunciado una actualización del backend de modelado de transformers dentro de vLLM que permite ejecutar los modelos de Hugging Face a la misma velocidad —o superior— que las implementaciones nativas escritas a mano para vLLM, sin necesidad de portar el código. La mejora se valida con

Espresso: inferencia directa en el Neural Engine de Apple sin pasar por CoreML

Espresso es un proyecto de código abierto escrito en Swift 6.2 que permite entrenar y ejecutar modelos transformer directamente sobre el Neural Engine (ANE) de los chips Apple Silicon, esquivando por completo la capa CoreML. Para ello, la herramienta accede a APIs privadas del sistema mediante dlope

Stanford CS336: un curso para construir un modelo de lenguaje desde cero

Stanford, una de las universidades más prestigiosas del mundo en ciencias de la computación, ha puesto en marcha el curso CS336, una asignatura singular que propone a los estudiantes construir un modelo de lenguaje de gran tamaño (LLM) desde cero, replicando el espíritu de los legendarios cursos de

Ia aprende a dormir para mejorar su memoria

Los modelos de lenguaje basados en Transformers han revolucionado la inteligencia artificial, pero enfrentan un cuello de botella crítico: su mecanismo de atención no escala eficientemente con el aumento de la longitud del contexto. Este artículo, titulado "Language Models Need Sleep", propone una s

Nueva arquitectura Interfaze supera a GPT-5, Claude y Gemini en benchmarks

Interfaze es una nueva arquitectura de modelo de inteligencia artificial que supera a modelos líderes como Gemini-3-Flash, Claude-Sonnet-4.6, GPT-5.4-Mini y Grok-4.3 en nueve benchmarks comparativos directos. La arquitectuta combina la especialización de redes neuronales profundas (DNN/CNN) con tran

Entrena GPT en tu laptop: Taller práctico y accesible

Un desarrollador ha creado un taller práctico para permitir a usuarios entrenar modelos GPT en laptops, incluso sin experiencia previa en aprendizaje automático. Inspirado por el proyecto 'nanoGPT' de Andrej Karpathy, el taller simplifica el proceso, reduciendo el tamaño del modelo a aproximadamente

Investigación revela eficiencia oculta en Transformers

Este artículo de investigación, titulado "Transformers son inherentemente concisos", explora una propiedad fundamental y sorprendente de los modelos Transformer, la arquitectura que impulsa la mayoría de los modelos de lenguaje grandes (LLMs) como ChatGPT. Tradicionalmente, los Transformers se han c

IA: Nvidia impulsa modelos con mayor contexto

La capacidad de los modelos de inteligencia artificial para mantener conversaciones coherentes se ve limitada por el "contexto de ventana", la cantidad de información que pueden procesar simultáneamente. Aunque los modelos actuales pueden manejar entre 128.000 y más de un millón de tokens, su rendim

Aprendizaje profundo: separan modelo y cálculo para más eficiencia

Investigadores de Facebook AI (Meta) han publicado dos nuevos métodos que separan el tamaño del modelo y la potencia computacional en el aprendizaje profundo, desafiando la práctica común de considerarlos como una sola entidad. El primer método, basado en capas de hash, permite aumentar el tamaño de

Modelos de lenguaje: hallan patrones numéricos comunes

Este artículo de investigación, titulado "Evolución Convergente: Cómo Diferentes Modelos de Lenguaje Aprenden Representaciones Numéricas Similares", explora un fenómeno fascinante en el campo del procesamiento del lenguaje natural: la forma en que distintos modelos de lenguaje, incluso aquellos con

Cómo funcionan los modelos de lenguaje como ChatGPT

Los Modelos de Lenguaje Grandes (LLMs), como ChatGPT, han revolucionado la forma en que interactuamos con la tecnología. Pero, ¿cómo funcionan realmente? Este resumen explica el proceso, desde los datos brutos hasta la creación de un asistente conversacional. **¿Qué son y por qué son importantes?*

DeepSeek-V4: IA procesa textos extensos sin problemas

DeepSeek-V4 es una nueva generación de modelos de lenguaje de gran escala (LLM) desarrollados por DeepSeek AI, que se destacan por su capacidad para procesar contextos extremadamente largos, hasta un millón de tokens. Esto representa un avance significativo, ya que la mayoría de los LLM tradicionale

Atención Híbrida: Acelera modelos de lenguaje

El proyecto presentado explora una nueva arquitectura de atención llamada 'Atención Híbrida' para modelos de lenguaje, con un enfoque particular en la generación de código Rust. El objetivo principal es acelerar significativamente la inferencia sin comprometer la calidad del modelo. Tradicionalmente

AtnRes: Nueva técnica optimiza modelos de lenguaje

Attention Residuals (AttnRes) es una innovadora técnica que optimiza las conexiones residuales en los Transformers, una arquitectura fundamental en modelos de lenguaje grandes (LLMs) como GPT. Tradicionalmente, las conexiones residuales simplemente suman la salida de cada capa con una ponderación u

NanoGPT: Entrenamiento de IA más eficiente desafía modelos existentes

Este artículo de Q Labs describe un avance significativo en la eficiencia del uso de datos en el entrenamiento de modelos de lenguaje, logrando una mejora de 10 veces utilizando su técnica 'NanoGPT Slowrun'. Esto desafía las leyes de escalamiento convencionales, como las propuestas por Chinchilla, q

Modelos de lenguaje: ¿datos sintéticos para el futuro?

El entrenamiento de modelos de lenguaje (LLM) está enfrentando un problema creciente: la necesidad de cantidades exponencialmente mayores de datos para seguir mejorando. La disponibilidad de texto natural de alta calidad se proyecta que se agotará en 2028, y el texto de internet está contaminado con

LLM más potentes: técnica de duplicación sorprende

Investigadores han desarrollado una técnica innovadora para mejorar el rendimiento de los modelos de lenguaje grandes (LLM) sin necesidad de entrenamiento adicional ni modificación de los pesos. El método, basado en el trabajo previo de David Ng (RYS), implica duplicar bloques específicos de capas d

LLMs ejecutan programas: IA más rápida y potente

Investigadores de Percepta han demostrado la capacidad de ejecutar programas directamente dentro de modelos de lenguaje grandes (LLMs), como los transformers, logrando una velocidad de inferencia exponencialmente más rápida. El avance, anunciado el 11 de marzo de 2026, abre nuevas posibilidades para

Entrenar IA de código abierto: desafíos inesperados

Un ingeniero de Workshop Labs, Addie Foote, relata los desafíos encontrados al intentar entrenar y servir modelos de lenguaje grandes con pesos abiertos, específicamente el modelo Kimi-K2-Thinking de Moonshot AI. El objetivo era post-entrenar el modelo, que cuenta con 1 billón de parámetros y está c

Ciencia frente a la complejidad: ¿basta con las ecuaciones?

Durante la mayor parte de la historia humana, los fenómenos complejos se atribuían a lo místico. Con el tiempo, la ciencia, con sus concisas ecuaciones (F=ma, E=mc², PV=nRT), logró comprimir vastas cantidades de información en modelos manejables, diseñados para ser comprendidos y aplicados por la me

Obliteratus: elimina filtros de IA sin reentrenar

Un nuevo toolkit de código abierto llamado 'Obliteratus' ha sido lanzado para eliminar comportamientos de rechazo en modelos de lenguaje grandes (LLMs). Desarrollado por Elder-Plinius y disponible en Hugging Face Spaces, Obliteratus utiliza técnicas de 'abliterator' para identificar y remover las re

Heretic: herramienta elimina censura de IA automáticamente

Un nuevo conjunto de herramientas llamado Heretic está automatizando la eliminación de restricciones de seguridad (censura) de modelos de lenguaje basados en transformadores, sin necesidad de costosos procesos de reentrenamiento. Desarrollado por P-E-W y disponible en GitHub, Heretic combina técnica

AGI: ¿Tan cerca está la IA humana?

La industria de la inteligencia artificial se encuentra en un momento de euforia sin precedentes. Los líderes de OpenAI y Anthropic han afirmado repetidamente que la inteligencia artificial de nivel humano (AGI) está al alcance de la mano, y en algunos casos, ya ha sido alcanzada. Estas declaracione

FORTH y Transformadores: Una Alternativa Inesperada

El artículo explora una alternativa a la descomposición recursiva de problemas al usar arquitecturas de transformadores, sugiriendo que lenguajes como FORTH y los lenguajes asociativos/aplicativos podrían ser más adecuados. El autor propone un enfoque de "concatenación" en lugar de "integración", en