nanoGPT-Seis es un repositorio de código abierto que enseña, paso a paso, el ciclo completo de preentrenamiento de un modelo de lenguaje aplicado a la ciencia de los terremotos. El proyecto combina texto sismológico especializado (artículos en acceso abierto vía Crossref y Unpaywall, preprints de arXiv y EarthArXiv, y el boletín 'Earthquake Insights') con texto general (Wikipedia y FineWeb-Edu), en una proporción aproximada de 24% dominio y 76% general, hasta reunir 533.248 documentos, 485,7 millones de palabras y 822,7 millones de tokens de entrenamiento.
El modelo entrenado es un decoder de 113 millones de parámetros con atención GQA, codificación posicional RoPE, RMSNorm y activación SwiGLU, entrenado en dos GPU NVIDIA A30 (48 GB en total) durante unas 6,5 horas mediante DDP en precisión bf16, con longitud de contexto de 4.096 tokens. El repositorio documenta cada etapa: rastreo de datos, limpieza y deduplicación, entrenamiento de un tokenizador BPE de 16.000 entradas, definición del modelo, entrenamiento distribuido e inferencia en streaming con caché KV.
Entre los hallazgos medidos destaca que alargar el contexto de 1.024 a 4.096 tokens reduce la perplejidad un 11% con solo un 26% más de cómputo por paso, y que añadir el conjunto general disminuye la métrica bits/byte en prosa general un 35% respecto a una base entrenada solo con artículos, a cambio de un 22% más de coste en dominio. El checkpoint preentrenado está publicado en Hugging Face Hub bajo el nombre jiazhe868/nanogpt_seis, y el proyecto también funciona en una sola GPU RTX 3090 o 4090, o con 12-16 GB si se reduce el tamaño de lote. La base está pensada para una futura etapa de SFT que la convierta en modelo conversacional.
