Las empresas de IA están buscando nuevos datos de entrenamiento para mejorar sus modelos y una empresa propone viejos libros de papel como fuente ideal, con la garantía de que este último están libres de «datos basura» (basura de IA) generados por las propias inteligencias artificiales.
“Los mejores datos del mundo para entrenar IA están en un estante”, escribe en su sitio ISBNdb, una empresa que ofrece lo que llama “la base de datos de libros más grande del mundo” y ofrece servicios de adquisición de volúmenes a gran escala para empresas de IA.
«Los libros representan conocimiento humano específico de la industria, seleccionado y revisado por pares, estructurado de una manera que ningún rastreo web puede replicar. Denso, revisado, autorizado».
La era anterior a 2022: el escudo contra el “colapso del modelo” y el sabotaje
En un artículo en su sitio, ISBNdb explica que los libros impresos publicados antes de 2022 son ideales como datos de entrenamiento para la IA porque no contienen texto generado por la IA.
Se destaca que es probable que muchos de los datos que las empresas de IA pueden extraer de Internet hoy en día incluyan contenido generado por IA; esto podría provocar el llamado «colapso del modelo», un proceso mediante el cual los modelos de IA entrenados con datos sintéticos conducen a modelos peores y más propensos a errores.
El artículo también señala que los autores que se oponen a la extracción de sus textos con fines de entrenamiento ahora pueden «envenenar» fácilmente los modelos de IA, produciendo escritos específicamente diseñados para manipular y sabotear la IA resultante.
«Los libros en papel de la era anterior al LLM están estructuralmente garantizados contra esta contaminación. Esto por sí solo representa una ventaja significativa […] “Libros físicos publicados antes de esta fecha. [pre-2022] son estructuralmente inmunes a las herramientas modernas de envenenamiento de datos”. […] ISBNdb promueve su capacidad para mantener en secreto la identidad de las empresas de inteligencia artificial y habla de “acuerdos estrictos de confidencialidad (NDA) para cada tarea”.
«Cada proyecto comienza con un acuerdo de confidencialidad legalmente vinculante. Su identidad, estrategia y volúmenes a adquirir nunca se revelan», se lee en el sitio.
Escaneo destructivo y riesgo reputacional
Para digitalizar y extraer texto de forma rápida y económica de millones de libros físicos para entrenar la IA, las empresas suelen utilizar una técnica llamada escaneo destructivo: la encuadernación del libro se corta o elimina para que las páginas individuales puedan introducirse en escáneres de alta velocidad. En este proceso, el libro físico queda literalmente destruido.
ISBNdb también pensó en las empresas de IA que temen daños a su reputación si la opinión pública descubriera el uso de fuentes desechables: la imagen de un gigante tecnológico que «muele» y destruye millones de libros en papel evoca escenarios distópicos y atrae fuertes críticas, independientemente del propósito tecnológico.
Todas las noticias y conocimientos sobre inteligencia artificial están disponibles en la sección dedicada de aatma.
