OpenAI ha desarrollado GPT-2, un modelo de lenguaje a gran escala entrenado de forma no supervisada con 40 GB de texto de Internet. El sistema, basado en la arquitectura transformer y compuesto por 1.500 millones de parámetros, es capaz de generar párrafos coherentes y realizar tareas de comprensión lectora, traducción y resumen sin entrenamiento específico para dichas funciones.
El modelo alcanza resultados state-of-the-art en diversos benchmarks de modelado de lenguaje en configuración "zero-shot", superando a sistemas entrenados en dominios específicos como Wikipedia o noticias. A pesar de su eficacia, el equipo reporta fallos en la modelización del mundo y repeticiones textuales. Debido a los riesgos de aplicaciones maliciosas, como la generación automatizada de desinformación o spam, OpenAI ha decidido no liberar el modelo completo, publicando únicamente una versión reducida para investigadores y el artículo técnico correspondiente.
