The New York Times y The Daily News acusan a OpenAI de mentir sobre su capacidad para buscar obras protegidas en los registros de chat de usuarios y en sus datos de entrenamiento, en una nueva escalada del litigio por copyright que ambas cabeceras mantienen desde hace dos años contra la empresa de inteligencia artificial.
A lo largo del caso, OpenAI había sostenido que no podía rastrear su propio corpus de entrenamiento y que buscar en los chats de ChatGPT resultaba técnicamente costoso y planteaba riesgos de privacidad. Sin embargo, según una deposición judicial de abril del ingeniero de privacidad de datos Vinnie Monaco, la compañía ya había realizado búsquedas internas para localizar periodismo protegido y había acumulado una base de datos con unos 78 millones de conversaciones de ChatGPT anonimizadas, usada para evaluar cuánto contenido ajeno estaba reproduciendo. Además, tras presentarse la demanda habría implementado un filtro llamado "Bloom" dentro del "Project Giraffe" para detectar y registrar regurgitaciones en las respuestas.
Los demandantes sostienen que OpenAI entregó en diciembre una muestra de 20 millones de registros tan censurada que el tribunal la calificó de "inutilizable", y que habría borrado miles de millones de conversaciones tras la presentación de la demanda, vulnerando la orden de preservación. Piden al juez sanciones, que se impida usar esa muestra como prueba, que se acepte como hecho que los logs mostrarían regurgitación masiva y que OpenAI abone las costas legales. OpenAI negó los hechos y acusó al Times de intentar acceder a conversaciones privadas de usuarios sin relación con el litigio.
