Des milliers de livres sont recherchés, achetés et numérisés par des entreprises d'intelligence artificielle, non pas pour être lus, mais pour servir de matériel d'entraînement aux modèles de langage. Le processus commence par l'acquisition de grandes quantités de livres en gros volumes.
Après l'achat, le processus de numérisation et de transformation de ces livres en données pouvant être utilisées pour entraîner des systèmes d'IA débute. Cette pratique est connue sous le nom de pratique de « métamorphose » des livres en matériel d'entraînement.
Cette pratique soulève des questions importantes liées aux droits d'auteur. Les auteurs et les maisons d'édition se demandent si l'utilisation de leurs travaux pour entraîner des modèles de langage sans autorisation ni compensation est légitime.
Les entreprises d'IA défendent que ce type d'utilisation est couvert par des exceptions aux droits d'auteur, mais la législation sur cette question est encore en cours de débat et de clarification dans plusieurs pays.




