Un análisis técnico muestra que es posible deducir detalles ocultos del entrenamiento de modelos de frontera como GPT-5 y Claude Opus 4.7 sometiéndolos a preguntas muy específicas. La técnica consiste en inyectarles 'pruebas de conocimiento incompresible' (cuestionarios de hechos muy concretos) para estimar el tamaño de sus parámetros, aplicar 'inferencia de mezcla de datos' midiendo cómo descomponen los tokens para reconstruir la composición de sus corpus de entrenamiento, y, sobre todo, preguntarles sobre eventos fechados para reconstruir cuándo se cortó exactamente su preentrenamiento.
El entrenamiento de un modelo de frontera pasa por tres fases: preentrenamiento masivo con datos generales de internet, ajuste intermedio con datos tipo 'libro de texto' y la fase de post-entrenamiento que convierte la base en un asistente. La fase más cara y hambrienta de datos es la primera, que genera un 'checkpoint' con una fecha de corte del corpus.
El artículo construye un test de elección múltiple con hechos diarios extraídos de Wikipedia y mide la tasa de error de cada modelo a lo largo del tiempo. La curva de aciertos cae abruptamente en un punto: ese es el corte del preentrenamiento. Los resultados sugieren que los Claude Opus 4.7 en adelante comparten un mismo entrenamiento con corte en diciembre de 2025; que la familia GPT-5.6 procede de un checkpoint distinto finalizado en febrero de 2026; y que Opus 5, pese a declarar corte en mayo de 2026, no parece saber más que los modelos de enero.
También se analiza lo que los modelos responden cuando se les pregunta qué día es y cómo se llaman. Las bandas verticales en los datos sugieren que los laboratorios entrenan con conversaciones reales de ChatGPT.com y Claude.ai, lo que explica que Sonnet 5 se identifique con frecuencia como GPT-4. Cuando se les pide 'responder como el modelo X', los Claude reproducen las peculiaridades de GPT en un 68% de los casos, mientras que los GPT solo replican a Claude en un 8%.
