OpenArch es un repositorio de código abierto que ofrece implementaciones de PyTorch de las arquitecturas de modelos de lenguaje de gran escala (LLM) más recientes, escritas desde cero para priorizar la legibilidad y el aprendizaje sobre el rendimiento de producción. El proyecto se basa en el catálogo de Sebastian Raschka, conocido como LLM Architecture Gallery, y busca simplificar la comprensión de las decisiones técnicas detrás de modelos como Llama, Qwen, DeepSeek y Gemma.
A diferencia de las librerías de producción como Transformers, que optimizan la velocidad y la compatibilidad, OpenArch organiza cada modelo en archivos individuales donde se explican explícitamente las elecciones arquitectónicas clave. Estas incluyen tipos de atención (MHA, GQA, MQA, MLA), normalizaciones (RMSNorm, QK-Norm), codificaciones posicionales (RoPE, YaRN) y mecanismos de expertos de mezcla (MoE). El objetivo es permitir a los desarrolladores comparar estas diferencias lado a lado, facilitando el estudio de cómo funcionan los modelos actuales.
El repositorio incluye implementaciones completas de 72 arquitecturas, marcadas con un estado de 'completado' o 'en construcción'. Entre los modelos textuales destacados se encuentran GPT-2 XL, Llama 2, Llama 3, DeepSeek R1 y Kimi K2, además de variantes multimodales como PaliGemma. La estructura del proyecto sigue la jerarquía de la galería original, con archivos model.py y README.md en cada subcaracter. El autor invita a la comunidad a contribuir, destacando tareas como la documentación de arquitecturas no implementadas o la corrección de errores, siempre bajo la licencia Apache 2.0.
