Un experimento sugiere que Qwen3.8 pudo aprender de GPT-5.5 Pro y no de Opus 4.8

Fuentes: Reasoning prefill v1.1 suggests Qwen3.8 may have learned from GPT-5.5 Pro rather than Opus 4.8

Un investigador ha publicado la versión 1.1 de un experimento de prefilling de razonamiento que compara cómo distintos modelos de lenguaje abiertos asimilan el prefijo de razonamiento de GPT-5.5 Pro. La metodología es directa: para cada problema se generan dos respuestas de cada modelo evaluado, una sin prefill y otra con el primer 1% del razonamiento de GPT-5.5 Pro insertado en el canal de razonamiento del modelo objetivo, manteniendo libre la respuesta visible. Después se mide cuánto del texto visible del profesor aparece en los primeros 100 tokens de la respuesta del alumno y se calcula la coincidencia por unigramas. La evaluación cubre 45 problemas repartidos a partes iguales entre STEM, no STEM y rompecabezas sintéticos privados.

Los resultados muestran efectos muy desiguales según el modelo. Qwen3.8 A95B pasa de un 33,92% de coincidencia sin prefill a un 54,50% con prefill, un salto de +20,58 puntos, el más alto de la tabla y especialmente fuerte en los rompecabezas sintéticos. Kimi K3, en cambio, mantiene coincidencias altas en ambos escenarios, 50,11% y 54,42%, con solo +4,31 puntos atribuibles al prefill. DeepSeek V4 Flash apenas se mueve, de 40,53% a 40,89% (+0,35), e Inkling sube 0,85 puntos.

El autor interpreta el salto de Qwen como una señal de que este modelo pudo haber sido entrenado a partir de GPT-5.5 Pro o de un modelo muy cercano, y no a partir de Opus 4.8, con el que apenas había convergido en la prueba anterior. El experimento deja además una lectura agregada útil: el prefill de razonamiento tiende a ser más eficaz en problemas STEM que en no STEM.