Présentation du problème
Des entreprises d'IA achètent en masse des livres rares, les scannent à l'aide de machines à grande vitesse qui découpent les reliures, puis détruisent les originaux. Un service appelé ISBNdb facilite les commandes de jusqu'à un million de livres et maintient l'anonymat des acheteurs.
Contexte technique
Les livres publiés avant 2022 sont considérés comme premium car ils sont exempts de texte généré par l'IA. Un juge fédéral a décidé que cette pratique est équitable car l'élimination de l'original signifie qu'il n'existe qu'une seule copie à la fois. Les entreprises comme Anthropic embauchent des professionnels expérimentés, comme l'ancien responsable des partenariats de Google Books, pour obtenir « tous les livres du monde ».
Fonctionnement de ISBNdb
ISBNdb propose des accords de non-divulgation (NDAs) comme fonctionnalité et conseille aux clients de qualifier cette pratique de « préservation numérique ». Le site web d'ISBNdb indique explicitement que « une entreprise d'IA détruit deux millions de livres » n'est pas un titre qui génère de la sympathie, mais ils ont néanmoins construit une entreprise entière autour de cette pratique, en la rendant discrète.
Implications et limites
Cette destruction de livres rares est irréversible. Alors qu'il est possible de réuploader un site web, de réimprimer un best-seller ou de remplacer une musique volée, il est impossible de remplacer les dernières copies d'un texte botanique du XVIIIe siècle une fois que quelqu'un les a détruites pour les données d'entraînement. La décision du juge rendant cette pratique légale va probablement accélérer ce processus.