La Universidad de Oxford ha autorizado a OpenAI a utilizar textos históricos de su Biblioteca Bodleian para entrenar los modelos de inteligencia artificial de la empresa. Según documentos internos, esta colaboración, anunciada en marzo de 2025, ha permitido a OpenAI poblar su conjunto de datos de entrenamiento con material digitalizado, aunque el acuerdo original no especificaba explícitamente el uso para el entrenamiento de modelos, un proceso que requiere grandes volúmenes de datos para aprender patrones lingüísticos y realizar tareas cognitivas.
El proyecto, que involucró la digitalización de 125.000 imágenes de disertaciones y baladas del siglo XVI, busca hacer el contenido más accesible para estudiantes e investigadores. Sin embargo, los minutos de reuniones obtenidos mediante solicitud de información pública revelan preocupaciones internas sobre riesgos reputacionales y el impacto ambiental de la tecnología intensiva en energía. Además, el acuerdo plantea la posibilidad de escanear el 23 millones de objetos de la colección, aunque la universidad afirma que la escala es modesta y que los derechos de los escaneos permanecen con la Bodleian, quien publicará el material de forma abierta en los próximos meses. Esta práctica se suma a una tendencia creciente de empresas tecnológicas a adquirir títulos raros y obsoletos para obtener datos frescos, en contraste con la saturación de contenido generado por IA en internet.
