Un transformador entrenado desde cero en un ESP32-S3 de 8 dólares

El proyecto 'qapla', disponible en GitHub, demuestra que es posible entrenar un pequeño modelo de lenguaje —un transformador a nivel de carácter— directamente dentro de un microcontrolador ESP32-S3 de bajo coste. A diferencia de los puertos tipo llama2.c, que solo ejecutan en inferencia modelos prev

Emular ALiBi mediante RoPE: una equivalencia en el límite de ángulo pequeño

Los modelos de lenguaje grandes (LLM) suelen recurrir a codificaciones posicionales para que el mecanismo de atención distinga la posición de cada token —o, más precisamente, de cada entrada del KV caché—. Las dos estrategias dominantes son RoPE, que rota por parejas las dimensiones de los vectores

Neutrino-1 8B: un único archivo de 3,88 GB para GPU, Mac y CPU

Neutrino-1 8B: un único archivo de 3,88 GB para GPU, Mac y CPU La startup Fermion Research ha presentado Neutrino-1 8B, un modelo de inteligencia artificial de 8.000 millones de parámetros que destaca por una característica singular: se distribuye como un único archivo de 3,88 gigabytes capaz de ej

D-FINE-seg: detección de objetos y segmentación de instancias en tiempo real

D-FINE-seg es un framework de código abierto que amplía el detector de objetos basado en transformers D-FINE con capacidades de segmentación de instancias. El proyecto añade una cabeza de máscara ligera, pérdidas de entrenamiento conscientes de la segmentación (BCE y Dice recortadas por bounding box

LeMario: un JEPA entrenado desde cero para predecir Super Mario Bros

LeMario es un proyecto personal que reproduce la arquitectura Joint-Embedding Predictive Architecture (JEPA) propuesta por Yann LeCun, aplicada al videojuego Super Mario Bros. El autor reescribió el modelo desde cero: un codificador de visión que comprime cada fotograma en un vector latente de 192 v

La lista de 30 lecturas que Ilya Sutskever habría recomendado a John Carmack

El sitio web "30 papers" recopila una lista de lecturas que, según el rumor, el cofundador de OpenAI Ilya Sutskever entregó al ingeniero John Carmack. El sitio reconoce que hasta ahora solo tiene 27 de los 30 trabajos y solicita ayuda para completar la versión canónica. La selección funciona como un

Entrenar una sola capa de un transformer basta para replicar el ajuste por RL

Un nuevo estudio de aprendizaje automático cuestiona uno de los supuestos más asentados del post-entrenamiento de modelos de lenguaje: que los beneficios del aprendizaje por refuerzo (RL) se distribuyen de forma pareja entre todas las capas del transformer. Los autores demuestran que entrenar una ún

Ortogonalizar la memoria mejora el recuerdo asociativo en modelos recurrentes

Las redes neuronales recurrentes (RNN) tienen dificultades para competir con los transformers en tareas de recuerdo asociativo, una capacidad que la atención facilita al dar a cada token acceso directo a los anteriores. Sin embargo, en dominios como el aprendizaje por refuerzo de horizonte largo —al

Leyes de escalado en aprendizaje profundo: guía técnica

Las leyes de escalado son uno de los hallazgos empíricos más relevantes del aprendizaje profundo: describen cómo la pérdida de entrenamiento disminuye de forma predecible, siguiendo una curva de potencia, al aumentar el tamaño del modelo (N), el volumen de datos (D) y el cómputo (C). Su utilidad prá

Las palabras son un subproducto de la conciencia; en los LLM ocurre al revés

Un ensayo reflexivo parte de una pregunta aparentemente simple: ¿de dónde vienen las palabras? Para los humanos, la idea precede al lenguaje; las palabras son solo la envoltura de un pensamiento o sentimiento previo. En un modelo de lenguaje grande (LLM) sucede lo contrario: el sistema predice la si

nanoeuler: un LLM estilo GPT-2 construido desde cero en C y CUDA

nanoeuler es un proyecto educativo e investigador que implementa un modelo de lenguaje tipo GPT-2 desde cero, sin recurrir a PyTorch, autograd ni librerías de aprendizaje automático. Todo el pipeline de entrenamiento —el forward, el backward, un tokenizador byte-level BPE escrito a mano, el preentre

GPT2-BASIC: un transformador en DOS con aritmética de punto fijo

GPT2-BASIC es un runtime de transformer y asistente local implementado en BASIC para máquinas de clase DOS, compilado con FreeBASIC y verificado en QEMU. No es un frontend web ni un envoltorio de API: carga artefactos de modelo desde disco, ejecuta inferencia tipo GPT con aritmética entera de punto

Múnich 1991: el año milagroso del deep learning que anticipó los LLM

Múnich 1991: el año milagroso del deep learning que anticipó los LLM. Este artículo repasa cómo el equipo de Jürgen Schmidhuber en la Universidad Técnica de Múnich publicó, entre marzo y agosto de 1991, los fundamentos de las técnicas que hoy sustentan los grandes modelos de lenguaje. En apenas cinc

Sufijos de forma: una convención para nombrar tensores con claridad

Character.AI ha compartido una convención interna, vigente desde 2022, que añade al nombre de cada tensor un sufijo con las letras de sus dimensiones. El objetivo es que cualquier variable revele de un vistazo la forma del tensor con el que se trabaja, sin necesidad de rastrear el código. La regla

GPT-2, el modelo que OpenAI consideró demasiado peligroso para publicar

En febrero de 2019, OpenAI presentó GPT-2, un modelo de lenguaje basado en el decodificador del transformer que suponía un escalado directo de GPT-1: 1.500 millones de parámetros —diez veces más que su predecesor—, entrenado sobre 40 GB de texto web y entrenado en 48 bloques de decodificador con una

Speculative KV coding: compresión sin pérdidas de la caché KV de LLM

Speculative KV coding es un nuevo método para reducir el tamaño de la caché de clave-valor (KV cache) de los modelos de lenguaje grandes (LLM) hasta aproximadamente cuatro veces, sin pérdida de información, partiendo de una caché ya comprimida con pérdida en fp8. El contexto de los LLM crece de for

Anatomía de un LLM moderno: de los tokens a la predicción

Los modelos de lenguaje de gran tamaño (LLM) se construyen apilando bloques transformer una y otra vez, por lo que entender la maquinaria del transformer es la base para comprender su funcionamiento. Esta guía recorre los componentes esenciales de un LLM moderno sin profundizar en las matemáticas, c

Stanford CS336: un curso para construir un modelo de lenguaje desde cero

Stanford, una de las universidades más prestigiosas del mundo en ciencias de la computación, ha puesto en marcha el curso CS336, una asignatura singular que propone a los estudiantes construir un modelo de lenguaje de gran tamaño (LLM) desde cero, replicando el espíritu de los legendarios cursos de

CVPR 2026: desmontan las piezas estándar del aprendizaje profundo

La edición 2026 de CVPR ha puesto en tela de juicio los componentes estándar del aprendizaje profundo. Cinco trabajos clave atacan desde la periferia hasta el núcleo de las arquitecturas actuales. BinaryAttention demuestra que la atención con cuantización de 1 bit es más rápida que FlashAttention2 y

Cómo los modelos de lenguaje predicen la siguiente palabra en tiempo real

Los transformers autorregresivos son la arquitectura fundamental que permite a los modelos de lenguaje grande (LLMs) generar texto token a token, prediciendo cada siguiente palabra basándose en todo lo previamente generado. Este proceso se divide en dos fases: prefill (preparación) y decode (generac

Optimización de candidatos: el punto donde los fármacos triumfan o fracasan

La optimización de candidatos (lead optimisation) es una etapa crítica en el diseño de fármacos donde se toma una molécula que funciona parcialmente y se busca mejorar su rendimiento para que sea realmente efectiva. Este proceso representa el punto donde muchas campañas de diseñotriunfan o fracasan

Redes neuronales y criptografía: ¿una conexión inesperada?

Este artículo explora una sorprendente similitud entre redes neuronales y cifrados criptográficos, dos campos que a primera vista parecen no tener nada en común. Mientras que las redes neuronales aprenden patrones para generar texto y los cifrados protegen la información, sus algoritmos subyacentes

ia en retro: transformer corre en ordenador vintage

Un desarrollador ha logrado ejecutar un modelo Transformer de una sola capa en un ordenador vintage PDP-11, un hito que demuestra la capacidad de hardware antiguo para realizar tareas de inteligencia artificial complejas. El proyecto, denominado 'ATTN/11', es una continuación de trabajos anteriores

IA sorprende: modelo líder sin ajustes

En un giro inesperado en el mundo de la inteligencia artificial, un investigador conocido como 'dnhkng' ha logrado colocar su modelo, 'RYS-XLarge', en la cima del Hugging Face Open LLM Leaderboard, sin modificar ni un solo peso del modelo original. La hazaña, lograda a mediados de 2024, implica dupl

Modelos IA más pequeños logran cálculo complejo

Investigadores han logrado reducir significativamente el tamaño de los modelos transformer capaces de realizar la suma de dos números de 10 dígitos con una precisión superior al 99%, un desafío conocido como 'AdderBoard'. Inicialmente, modelos generados por Claude Code y Codex requerían 6.080 y 1.64

LiDAR: Datos de onda revelan detalles cruciales

El LiDAR (Light Detection and Ranging) se ha convertido en una tecnología esencial para la conducción autónoma, proporcionando escaneos 3D de alta resolución que permiten una comprensión precisa del entorno. Tradicionalmente, los sensores LiDAR miden la intensidad de la luz láser reflejada en funció

Google aprueba Transformer: Innovación en IA

El artículo "Attention is All You Need" introduce una nueva arquitectura de red neuronal llamada Transformer, que revolucionó el campo del procesamiento del lenguaje natural y más allá. Tradicionalmente, los modelos de secuencia a secuencia, como los utilizados en traducción automática, se basaban e