Empresas de inteligencia artificial están adquiriendo lotes masivos de libros antiguos y descatalogados en librerías de segunda mano de todo el mundo para escanearlos digitalmente y, después, triturarlos. El objetivo: alimentar con texto humano, no contaminado por contenidos generados por la propia IA, los modelos de lenguaje que entrenan sus sistemas. El fenómeno, que afecta a libreros de España, Alemania, Estados Unidos, Nueva Zelanda o Australia, ha puesto en alerta al sector del libro de viejo, que lo califica como una forma de "expolio literario".
El patrón se repite con rasgos casi idénticos en todos los países: compradores automatizados que efectúan encargos consecutivos en apenas un minuto, indiferencia ante el precio y ausencia total de coherencia temática. Marçal Font, responsable de la librería Fènix en Badalona, lleva semanas recibiendo pedidos de una empresa canadiense que sospecha automatizada. Una veintena de librerías españolas han vendido a ese mismo intermediario desde finales de abril, en algunos casos por más de mil ejemplares. "Hablan de una monografía sobre los castellers de Granollers de los años setenta, un manual técnico de vinificación, actas de congresos de hace medio siglo, dietarios de la Guerra Civil", relata el reportaje de Xataka.
El comprador identificado en España es ZoomBooks, una canadiense de compraventa de libros usados que envía los pedidos a PrepFort, un operador logístico de Illinois encargado de escanear y catalogar los envíos. ZoomBooks niega colaborar directamente con Anthropic —la empresa detrás del asistente Claude— y se presenta como una librería de segunda mano dedicada al reciclaje. Sobre el destino final de los volúmenes y sobre las entradas que su propia web difundió acerca de cómo alimentar algoritmos con ejemplares usados para después destruirlos, la compañía responde que no comenta sus acuerdos por estar sujetos a confidencialidad.
En paralelo opera ISBNdb, una base de datos de metadatos bibliográficos que ofrece sin tapujos a los laboratorios de IA la compra de entre mil y un millón de libros por encargo. Su propia web lo plantea de forma descarnada: "los libros impresos anteriores a 2022 son la reserva de texto humano que ningún rastreo de internet puede ya garantizar", protegidos frente a la contaminación de los textos que la propia IA ya inunda en la red. La compañía ofrece incluso acuerdos de confidencialidad en cada operación y admite sin rodeos el problema de imagen: como ellos mismos escriben, "destruir libros da mala imagen".
¿Por qué la trituración es un paso obligatorio y no un mero accidente? La respuesta está en una sentencia del juez federal William Alsup, dictada en junio de 2025 en el caso Bartz v. Anthropic. El magistrado consideró que entrenar modelos de lenguaje con libros comprados legalmente constituye un uso transformador amparado por la doctrina del fair use. También avaló la digitalización, pero solo bajo una condición: que el ejemplar impreso desaparezca en el proceso. Si el libro físico sobreviviera al escaneo, la empresa que lo compró conservaría dos copias habiendo pagado una, y el argumento de fair use se debilitaría.
Meses antes de esa resolución, Anthropic ya tenía en marcha una operación bautizada internamente como Project Panama, según documentos desclasificados a los que tuvo acceso The Washington Post. Un informe interno definía la acción con una frase reveladora: "escanear destructivamente todos los libros del mundo", y pedía que el proyecto permaneciera oculto. La compañía contrató además al antiguo responsable de alianzas de Google Books para negociar las adquisiciones.
Los libreros españoles han alertado al Ministerio de Cultura. Miguel Ángel Ortega, presidente de UNILIBER, recuerda que su gremio cumple funciones de preservación del patrimonio bibliográfico además de la venta, y califica la situación de contradictoria. Para Font, la operación equivale a "una forma de expolio literario". Lo protegido por depósito legal y bien catalogado corre menos riesgo, pero también existen, según los afectados, "fanzines, boletines vecinales, publicaciones locales, documentación de movimientos sociales" que quedan en el punto de mira.
El debate de fondo lo plantea el analista Antonio Ortiz: la industria necesita cada vez más texto humano no contaminado por IA para evitar el colapso del modelo, aunque matiza que la escasez de datos pesa hoy menos que hace dos años porque el entrenamiento se apoya cada vez más en aprendizaje por refuerzo sobre datos ya cualificados. La investigadora Patrícia Ventura resume la preocupación ética: "el conocimiento tiene que seguir siendo un bien público, no una reserva privada de un puñado de compañías". Mientras tanto, ISBNdb sigue ofreciendo NDAs como si fueran una prestación más, y los libros que sobrevivieron a guerras, incendios y siglos de uso siguen llegando, página a página, a las trituradoras que alimentan la próxima generación de modelos.
