OpenArch: implementaciones de PyTorch de arquitecturas LLM modernas

OpenArch es un repositorio de código abierto que ofrece implementaciones de PyTorch de las arquitecturas de modelos de lenguaje de gran escala (LLM) más recientes, escritas desde cero para priorizar la legibilidad y el aprendizaje sobre el rendimiento de producción. El proyecto se basa en el catálog

Recurrent Looped Transformer: Arquitectura de profundidad temporal infinita

El Recurrent Looped Transformer (RLT) es una arquitectura de modelo de lenguaje que combina un codificador causal con un decodificador recurrente, permitiendo una profundidad temporal extensible sin límites fijos en la secuencia. A diferencia de los transformadores tradicionales, el RLT mantiene el

Cómo llegar por intuición a Kimi Delta Attention: una derivación paso a paso

Este artículo técnico propone que la complejidad de Kimi Delta Attention (KDA), el mecanismo de atención lineal que emplea la familia de modelos Kimi, no es tan opaca como aparenta: un lector familiarizado con la familia DeltaNet podría haber deducido sus ecuaciones a partir de requisitos sencillos

Qué enseñan los pétalos de rosa sobre el problema de la inducción

El problema de la inducción, formulado por Hume y reformulado como el teorema de No Free Lunch, sostiene que no existe un método general y sistemático para pasar de la observación al conocimiento. Este artículo lo ilustra con un experimento divulgativo: el juego 'Petals Around the Rose', en el que s

La creciente complejidad de los LLM y el retorno de la composabilidad

Los grandes modelos de lenguaje han dejado de ser una pila limpia de módulos Transformer repetidos. Entre 2022 y 2023, en Meta, el trabajo en LLM —que condujo a Llama— contrastaba con la aparatosa complejidad de los sistemas de recomendación. La industria ha corregido esa brecha incorporando a los L

OpenAI ficha a Noam Shazeer y a Dean Ball antes de su salida a bolsa

OpenAI ha incorporado a dos figuras de relieve en la antesala de su salida a bolsa: el investigador Noam Shazeer, cofundador de Character AI y exinvestigador de Google DeepMind, y Dean Ball, exresponsable de política de inteligencia artificial de la Casa Blanca durante la administración Trump. Shaze

ia simula emociones: cómo influyen en los modelos de lenguaje

Este artículo de investigación explora cómo los modelos de lenguaje grandes (LLMs), como Claude Sonnet 4.5, simulan emociones y cómo estas simulaciones impactan su comportamiento. No se trata de que los LLMs *sientan* emociones en el sentido humano, sino que han desarrollado representaciones interna