PSSA: modelo de lenguaje recurrente en Rust que supera a los transformers

PSSA es un modelo de lenguaje de pequeño tamaño desarrollado en Rust desde cero, sin utilizar frameworks de aprendizaje automático como PyTorch o TensorFlow. A diferencia de los transformers, que procesan el contexto completo en cada paso, PSSA opera mediante una capa de espacio de estados recurrent

Explicación técnica de la arquitectura Transformer y su funcionamiento

El Transformer es una arquitectura de red neuronal que ha redefinido el campo de la inteligencia artificial, introducida en 2017 con el artículo 'Attention is All You Need'. Su principal ventaja radica en el mecanismo de atención auto, que permite procesar secuencias completas y capturar dependencia

Framework JAX XLA para optimizar operaciones softmax en LLMs

El repositorio jax-softmax-bypass presenta un prototipo de concepto (PoC) arquitectónico diseñado para superar las limitaciones de memoria y ejecución en los modelos de lenguaje de gran escala (LLM). A diferencia de las librerías de producción estándar, este framework ofrece un plano de acción técni

Guía interactiva para construir un LLM desde cero

LLM Visualizer es una plataforma interactiva diseñada para facilitar la comprensión profunda de los Modelos de Lenguaje Grandes (LLM) mediante la construcción práctica de un modelo funcional desde sus fundamentos. A diferencia de los tutoriales teóricos, esta herramienta opera como un laboratorio en

Visualizador interactivo del mecanismo de atención en modelos de lenguaje

Un desarrollador ha publicado una herramienta web que permite visualizar de forma interactiva cómo funciona el mecanismo de atención en los grandes modelos de lenguaje (LLM) basados en transformadores. La aplicación, construida con React y Transformers.js, muestra cómo el modelo decide qué tokens an

Cómo exprimir varias GPU de desecho para ejecutar modelos de IA en casa

Este artículo explica, desde una perspectiva práctica y accesible, cómo aprovechar varios GPU reciclados para ejecutar modelos de lenguaje de gran tamaño en un servidor doméstico. Tras una introducción al funcionamiento básico de los transformers y al concepto de token, el texto repasa por qué la ge

Decodificar la lectura silenciosa con EEG no invasivo

Un equipo de investigación ha demostrado que es posible recuperar información léxica a nivel de palabra a partir de señales de electroencefalografía (EEG) durante la lectura silenciosa, abriendo una vía para avanzar en la decodificación no invasiva del habla interna. El trabajo aborda un problema fu

Un transformador entrenado desde cero en un ESP32-S3 de 8 dólares

El proyecto 'qapla', disponible en GitHub, demuestra que es posible entrenar un pequeño modelo de lenguaje —un transformador a nivel de carácter— directamente dentro de un microcontrolador ESP32-S3 de bajo coste. A diferencia de los puertos tipo llama2.c, que solo ejecutan en inferencia modelos prev

Emular ALiBi mediante RoPE: una equivalencia en el límite de ángulo pequeño

Los modelos de lenguaje grandes (LLM) suelen recurrir a codificaciones posicionales para que el mecanismo de atención distinga la posición de cada token —o, más precisamente, de cada entrada del KV caché—. Las dos estrategias dominantes son RoPE, que rota por parejas las dimensiones de los vectores

Neutrino-1 8B: un único archivo de 3,88 GB para GPU, Mac y CPU

Neutrino-1 8B: un único archivo de 3,88 GB para GPU, Mac y CPU La startup Fermion Research ha presentado Neutrino-1 8B, un modelo de inteligencia artificial de 8.000 millones de parámetros que destaca por una característica singular: se distribuye como un único archivo de 3,88 gigabytes capaz de ej

D-FINE-seg: detección de objetos y segmentación de instancias en tiempo real

D-FINE-seg es un framework de código abierto que amplía el detector de objetos basado en transformers D-FINE con capacidades de segmentación de instancias. El proyecto añade una cabeza de máscara ligera, pérdidas de entrenamiento conscientes de la segmentación (BCE y Dice recortadas por bounding box

LeMario: un JEPA entrenado desde cero para predecir Super Mario Bros

LeMario es un proyecto personal que reproduce la arquitectura Joint-Embedding Predictive Architecture (JEPA) propuesta por Yann LeCun, aplicada al videojuego Super Mario Bros. El autor reescribió el modelo desde cero: un codificador de visión que comprime cada fotograma en un vector latente de 192 v

La lista de 30 lecturas que Ilya Sutskever habría recomendado a John Carmack

El sitio web "30 papers" recopila una lista de lecturas que, según el rumor, el cofundador de OpenAI Ilya Sutskever entregó al ingeniero John Carmack. El sitio reconoce que hasta ahora solo tiene 27 de los 30 trabajos y solicita ayuda para completar la versión canónica. La selección funciona como un

Entrenar una sola capa de un transformer basta para replicar el ajuste por RL

Un nuevo estudio de aprendizaje automático cuestiona uno de los supuestos más asentados del post-entrenamiento de modelos de lenguaje: que los beneficios del aprendizaje por refuerzo (RL) se distribuyen de forma pareja entre todas las capas del transformer. Los autores demuestran que entrenar una ún

Ortogonalizar la memoria mejora el recuerdo asociativo en modelos recurrentes

Las redes neuronales recurrentes (RNN) tienen dificultades para competir con los transformers en tareas de recuerdo asociativo, una capacidad que la atención facilita al dar a cada token acceso directo a los anteriores. Sin embargo, en dominios como el aprendizaje por refuerzo de horizonte largo —al

Leyes de escalado en aprendizaje profundo: guía técnica

Las leyes de escalado son uno de los hallazgos empíricos más relevantes del aprendizaje profundo: describen cómo la pérdida de entrenamiento disminuye de forma predecible, siguiendo una curva de potencia, al aumentar el tamaño del modelo (N), el volumen de datos (D) y el cómputo (C). Su utilidad prá

Las palabras son un subproducto de la conciencia; en los LLM ocurre al revés

Un ensayo reflexivo parte de una pregunta aparentemente simple: ¿de dónde vienen las palabras? Para los humanos, la idea precede al lenguaje; las palabras son solo la envoltura de un pensamiento o sentimiento previo. En un modelo de lenguaje grande (LLM) sucede lo contrario: el sistema predice la si

nanoeuler: un LLM estilo GPT-2 construido desde cero en C y CUDA

nanoeuler es un proyecto educativo e investigador que implementa un modelo de lenguaje tipo GPT-2 desde cero, sin recurrir a PyTorch, autograd ni librerías de aprendizaje automático. Todo el pipeline de entrenamiento —el forward, el backward, un tokenizador byte-level BPE escrito a mano, el preentre

GPT2-BASIC: un transformador en DOS con aritmética de punto fijo

GPT2-BASIC es un runtime de transformer y asistente local implementado en BASIC para máquinas de clase DOS, compilado con FreeBASIC y verificado en QEMU. No es un frontend web ni un envoltorio de API: carga artefactos de modelo desde disco, ejecuta inferencia tipo GPT con aritmética entera de punto

Múnich 1991: el año milagroso del deep learning que anticipó los LLM

Múnich 1991: el año milagroso del deep learning que anticipó los LLM. Este artículo repasa cómo el equipo de Jürgen Schmidhuber en la Universidad Técnica de Múnich publicó, entre marzo y agosto de 1991, los fundamentos de las técnicas que hoy sustentan los grandes modelos de lenguaje. En apenas cinc

Sufijos de forma: una convención para nombrar tensores con claridad

Character.AI ha compartido una convención interna, vigente desde 2022, que añade al nombre de cada tensor un sufijo con las letras de sus dimensiones. El objetivo es que cualquier variable revele de un vistazo la forma del tensor con el que se trabaja, sin necesidad de rastrear el código. La regla

GPT-2, el modelo que OpenAI consideró demasiado peligroso para publicar

En febrero de 2019, OpenAI presentó GPT-2, un modelo de lenguaje basado en el decodificador del transformer que suponía un escalado directo de GPT-1: 1.500 millones de parámetros —diez veces más que su predecesor—, entrenado sobre 40 GB de texto web y entrenado en 48 bloques de decodificador con una

Speculative KV coding: compresión sin pérdidas de la caché KV de LLM

Speculative KV coding es un nuevo método para reducir el tamaño de la caché de clave-valor (KV cache) de los modelos de lenguaje grandes (LLM) hasta aproximadamente cuatro veces, sin pérdida de información, partiendo de una caché ya comprimida con pérdida en fp8. El contexto de los LLM crece de for

Anatomía de un LLM moderno: de los tokens a la predicción

Los modelos de lenguaje de gran tamaño (LLM) se construyen apilando bloques transformer una y otra vez, por lo que entender la maquinaria del transformer es la base para comprender su funcionamiento. Esta guía recorre los componentes esenciales de un LLM moderno sin profundizar en las matemáticas, c

Stanford CS336: un curso para construir un modelo de lenguaje desde cero

Stanford, una de las universidades más prestigiosas del mundo en ciencias de la computación, ha puesto en marcha el curso CS336, una asignatura singular que propone a los estudiantes construir un modelo de lenguaje de gran tamaño (LLM) desde cero, replicando el espíritu de los legendarios cursos de

CVPR 2026: desmontan las piezas estándar del aprendizaje profundo

La edición 2026 de CVPR ha puesto en tela de juicio los componentes estándar del aprendizaje profundo. Cinco trabajos clave atacan desde la periferia hasta el núcleo de las arquitecturas actuales. BinaryAttention demuestra que la atención con cuantización de 1 bit es más rápida que FlashAttention2 y

Cómo los modelos de lenguaje predicen la siguiente palabra en tiempo real

Los transformers autorregresivos son la arquitectura fundamental que permite a los modelos de lenguaje grande (LLMs) generar texto token a token, prediciendo cada siguiente palabra basándose en todo lo previamente generado. Este proceso se divide en dos fases: prefill (preparación) y decode (generac

Optimización de candidatos: el punto donde los fármacos triumfan o fracasan

La optimización de candidatos (lead optimisation) es una etapa crítica en el diseño de fármacos donde se toma una molécula que funciona parcialmente y se busca mejorar su rendimiento para que sea realmente efectiva. Este proceso representa el punto donde muchas campañas de diseñotriunfan o fracasan

Redes neuronales y criptografía: ¿una conexión inesperada?

Este artículo explora una sorprendente similitud entre redes neuronales y cifrados criptográficos, dos campos que a primera vista parecen no tener nada en común. Mientras que las redes neuronales aprenden patrones para generar texto y los cifrados protegen la información, sus algoritmos subyacentes

ia en retro: transformer corre en ordenador vintage

Un desarrollador ha logrado ejecutar un modelo Transformer de una sola capa en un ordenador vintage PDP-11, un hito que demuestra la capacidad de hardware antiguo para realizar tareas de inteligencia artificial complejas. El proyecto, denominado 'ATTN/11', es una continuación de trabajos anteriores

IA sorprende: modelo líder sin ajustes

En un giro inesperado en el mundo de la inteligencia artificial, un investigador conocido como 'dnhkng' ha logrado colocar su modelo, 'RYS-XLarge', en la cima del Hugging Face Open LLM Leaderboard, sin modificar ni un solo peso del modelo original. La hazaña, lograda a mediados de 2024, implica dupl

Modelos IA más pequeños logran cálculo complejo

Investigadores han logrado reducir significativamente el tamaño de los modelos transformer capaces de realizar la suma de dos números de 10 dígitos con una precisión superior al 99%, un desafío conocido como 'AdderBoard'. Inicialmente, modelos generados por Claude Code y Codex requerían 6.080 y 1.64

LiDAR: Datos de onda revelan detalles cruciales

El LiDAR (Light Detection and Ranging) se ha convertido en una tecnología esencial para la conducción autónoma, proporcionando escaneos 3D de alta resolución que permiten una comprensión precisa del entorno. Tradicionalmente, los sensores LiDAR miden la intensidad de la luz láser reflejada en funció

Google aprueba Transformer: Innovación en IA

El artículo "Attention is All You Need" introduce una nueva arquitectura de red neuronal llamada Transformer, que revolucionó el campo del procesamiento del lenguaje natural y más allá. Tradicionalmente, los modelos de secuencia a secuencia, como los utilizados en traducción automática, se basaban e