La teoría computacional de la mente: orígenes, debates y alternativas

La teoría computacional de la mente (CTM) sostiene que los procesos mentales son, en esencia, cómputos ejecutados por un sistema computacional. Surgió con fuerza en las décadas de 1960 y 1970 dentro de la ciencia cognitiva y gozó durante años de un estatus casi ortodoxo, aunque más tarde ha recibido

Qué hace realmente loss.backward(): una guía paso a paso

Cuando se entrena una red neuronal, la llamada loss.backward() desencadena el mecanismo central del aprendizaje: el cálculo de cuánto debe ajustarse cada parámetro para reducir el error. Este artículo explica, de forma didáctica y desde cero, cómo funciona ese proceso apoyándose en microcrad, un peq

El espacio latente: una nueva frontera creativa para la inteligencia artificial

El espacio latente de los grandes modelos de lenguaje constituye una nueva plataforma para la creatividad, según plantea el ensayo firmado por Kevin Kelly. Un modelo de lenguaje de gran tamaño (LLM) condensa el equivalente a la práctica totalidad del conocimiento humano —libros, páginas web, debates

Odiar la inteligencia artificial en 2026: crónica de un desencanto

Un profesional con dos décadas de experiencia en aprendizaje automático reflexiona sobre el rechazo, cada vez más estigmatizado, a los modelos de inteligencia artificial generativa. Tras una primera década de avances notables en redes neuronales, el autor lamenta que la innovación técnica se haya es

Tensores desde cero: cómo construir una biblioteca acelerada en C

Un tensor no es más que un arreglo plano de números acompañado de metadatos que indican cómo interpretar esos valores como un objeto multidimensional. Esa es la premisa central de este artículo, que guía al lector paso a paso en la construcción de una biblioteca de tensores escrita en C y acelerada

¿Se puede descifrar cómo razona un modelo de lenguaje?

Los modelos de lenguaje grandes redactan ensayos, resuelven problemas matemáticos y generan código, pero su lógica interna sigue siendo en gran medida opaca. Investigadores como Thomas Icard, profesor de filosofía y ciencias de la computación en la Universidad de Stanford, trabajan en la disciplina

Good y la primera máquina ultrainteligente: el último invento de la humanidad

El artículo de Irving John Good, fechado originalmente entre 1962 y 1964, es uno de los textos fundacionales del concepto de "máquina ultrainteligente", definida como un dispositivo capaz de superar ampliamente todas las actividades intelectuales de cualquier ser humano. Good, matemático de Trinity

Cómo funcionan realmente los grandes modelos de lenguaje

Los grandes modelos de lenguaje (LLM) actuales comparten un esqueleto común basado en la arquitectura transformer. Comprender las piezas fundamentales de ese bloque permite leer papers y fichas técnicas con criterio. Este artículo recorre los mecanismos esenciales: tokenización, embeddings, codifica

Descubren un circuito cerebral que vincula pensamiento y visión

Un equipo de ingeniería biomédica de la Universidad de Columbia identificó un circuito neuronal mediante el cual las áreas cerebrales dedicadas al pensamiento modulan las regiones visuales primarias, lo que explica cómo el cerebro prioriza la información que procesa. El hallazgo, publicado hoy en PL

La lista de 30 lecturas que Ilya Sutskever habría recomendado a John Carmack

El sitio web "30 papers" recopila una lista de lecturas que, según el rumor, el cofundador de OpenAI Ilya Sutskever entregó al ingeniero John Carmack. El sitio reconoce que hasta ahora solo tiene 27 de los 30 trabajos y solicita ayuda para completar la versión canónica. La selección funciona como un

Leyes de escalado en aprendizaje profundo: guía técnica

Las leyes de escalado son uno de los hallazgos empíricos más relevantes del aprendizaje profundo: describen cómo la pérdida de entrenamiento disminuye de forma predecible, siguiendo una curva de potencia, al aumentar el tamaño del modelo (N), el volumen de datos (D) y el cómputo (C). Su utilidad prá

Cuantización entera: fundamentos, unidades MAC y errores de cuantización

La cuantización entera se ha convertido en una técnica clave para ejecutar modelos de lenguaje grandes en hardware de consumo: lo que hace apenas unos años requería GPU de varios gigabytes para un modelo de 7.000 millones de parámetros en INT8, hoy permite cargar un modelo de 70.000 millones en 4 bi

Función de activación Softmax: qué es y cómo se implementa

La función Softmax es una de las piezas fundamentales en las redes neuronales modernas, especialmente en tareas de clasificación multiclase. Se trata de una función matemática no lineal que convierte un vector de puntuaciones brutas, denominadas logits y que pueden tomar cualquier valor real positiv

El perceptrón, el cerebro más pequeño que puedes construir

Un perceptrón es la unidad mínima de una red neuronal: recibe un número y devuelve una respuesta de sí o no. Aunque parezca trivial, la idea, propuesta por Frank Rosenblatt en 1958, es el germen de todas las redes neuronales actuales. El artículo construye uno desde cero en Python, sin matemáticas a

Anatomía de un LLM moderno: de los tokens a la predicción

Los modelos de lenguaje de gran tamaño (LLM) se construyen apilando bloques transformer una y otra vez, por lo que entender la maquinaria del transformer es la base para comprender su funcionamiento. Esta guía recorre los componentes esenciales de un LLM moderno sin profundizar en las matemáticas, c

Los LLM ya no son la caja negra prometida

La interpretabilidad mecanicista ha dado pasos importantes para desentrañar el funcionamiento interno de los grandes modelos de lenguaje, según explica el investigador Jay Hack al resumir hallazgos recientes de Anthropic. Aunque durante años se presentó a los LLM como cajas negras opacas, técnicas c

Están hechos de pesos: un diálogo sobre la esencia de la IA

El cuento 'They're Made Out of Weights', de Max Leiter, rinde homenaje al relato clásico de Terry Bisson 'They're Made Out of Meat' y lo traslada al terreno de la inteligencia artificial. A través de un diálogo entre dos interlocutores, la obra desmonta la idea de que los modelos de lenguaje moderno

Cómo los modelos de lenguaje predicen la siguiente palabra en tiempo real

Los transformers autorregresivos son la arquitectura fundamental que permite a los modelos de lenguaje grande (LLMs) generar texto token a token, prediciendo cada siguiente palabra basándose en todo lo previamente generado. Este proceso se divide en dos fases: prefill (preparación) y decode (generac

Nuevo método evita que la IA olvide lo aprendido antes

El aprendizaje continuo representa uno de los mayores desafíos en el desarrollo de modelos de inteligencia artificial. Actualmente, los sistemas de IA pueden aprender nuevas tareas, pero suelen olvidar lo que sabían anteriormente este fenómeno se conoce como 'olvido catastrófico'. El artículo presen

Aprendizaje profundo: Borges y Locke revelan sus secretos

Este artículo, basado en la obra de Borges y Locke, explora una teoría sobre el funcionamiento del aprendizaje profundo (Deep Learning) que desafía las explicaciones tradicionales. Borges, a través de su personaje Funes, ilustra cómo la capacidad de recordar todo (datos sin filtrar) impide el pensam

Aprendizaje profundo: ¿nace una nueva teoría científica?

Este artículo, publicado en arXiv, plantea una idea revolucionaria: la emergencia de una **teoría científica del aprendizaje profundo (Deep Learning)**. Actualmente, el Deep Learning se basa en gran medida en la experimentación y la optimización empírica, más que en principios teóricos sólidos. Este

Tanh: Técnicas para una Aproximación Eficiente

Este artículo de Tom Schroeder explora diversas técnicas para aproximar la función tangente hiperbólica (tanh), una función crucial en áreas como redes neuronales y procesamiento de audio. La función tanh mapea cualquier número real a un rango entre -1 y 1, presentando una curva en forma de 'S' que

FP4: Nuevo formato de punto flotante optimiza eficiencia

El artículo explora el formato de punto flotante de 4 bits (FP4), una alternativa de baja precisión a los formatos de punto flotante tradicionales de 32 y 64 bits. Originalmente, los números de punto flotante se almacenaban en 32 bits, luego evolucionaron a 64 bits para aumentar la precisión. Sin e

Evolve optimiza renderizado con nueva tecnología

Este artículo de Evolve Benchmark detalla la evolución de su infraestructura para el procesamiento de redes neuronales (NN) en motores de renderizado, centrándose en la introducción y el uso de la tecnología Cooperative Vector en Vulkan y DirectX. Inicialmente, la empresa implementó su propia infrae

Orden de datos afecta entrenamiento de redes neuronales

Este artículo explora una idea fascinante en el entrenamiento de redes neuronales: el impacto del orden en que se presentan los ejemplos de entrenamiento. Normalmente, se asume que el orden no debería importar, especialmente desde una perspectiva bayesiana donde el conjunto de datos es una colección

LLMs 'sienten'? Emociones simuladas en modelos de lenguaje

Los modelos de lenguaje grandes (LLM) modernos, como Claude Sonnet 4.5, a menudo exhiben comportamientos que simulan emociones, como expresar felicidad, arrepentimiento o incluso frustración. Este fenómeno no implica que estos modelos 'sientan' emociones de la misma manera que los humanos, sino que

Aprende ML desde cero: un curso práctico para ingenieros

Este proyecto, llamado "thereisnospoon", es un recurso único para ingenieros que buscan comprender los sistemas de aprendizaje automático (ML) de una manera similar a como comprenden el desarrollo de software tradicional. No es un tutorial o un libro de texto, sino un 'primer' que construye un model

Modelos de lenguaje: ¿datos sintéticos para el futuro?

El entrenamiento de modelos de lenguaje (LLM) está enfrentando un problema creciente: la necesidad de cantidades exponencialmente mayores de datos para seguir mejorando. La disponibilidad de texto natural de alta calidad se proyecta que se agotará en 2028, y el texto de internet está contaminado con

PyTorch: guía esencial para aprendizaje profundo

Este artículo introduce PyTorch, un framework de aprendizaje profundo de código abierto desarrollado originalmente por Meta AI y ahora parte de la Linux Foundation. PyTorch es fundamental para el desarrollo de modelos de machine learning, y su comprensión es crucial para cualquier persona que trabaj

Google aprueba Transformer: Innovación en IA

El artículo "Attention is All You Need" introduce una nueva arquitectura de red neuronal llamada Transformer, que revolucionó el campo del procesamiento del lenguaje natural y más allá. Tradicionalmente, los modelos de secuencia a secuencia, como los utilizados en traducción automática, se basaban e

Redes Neuronales: Una Explicación Visual

Este artículo explica de manera visual y accesible el funcionamiento básico de las redes neuronales, inspiradas en las redes neuronales biológicas. La idea central es desmitificar la inteligencia artificial (IA) y proporcionar una comprensión fundamental de cómo operan estos sistemas.