Des laboratoires d'IA achètent des livres imprimés avant 2022, par lots allant de mille à un million d'exemplaires, via des intermédiaires liés par des accords de confidentialité. Ces ouvrages sont ensuite scannés à grande vitesse, ce qui implique généralement de couper le dos pour faire passer les pages dans la machine. Le livre physique ne survit pas à l'opération. La raison de cette ruée tient en deux mots : données propres.
Il y a des sujets où l'indignation vient trop vite et empêche de comprendre. Celui-ci en fait partie. Prenons le temps d'expliquer pourquoi cela arrive, avant de dire ce que ça pose comme problème.
Pourquoi les livres d'avant 2022 valent soudain de l'or
La raison principale, nous l'avons décrite dans notre article sur l'effondrement des modèles. Un modèle entraîné sur du contenu produit par d'autres modèles se dégrade progressivement : il perd en diversité, répète les erreurs, et hallucine davantage. C'est la photocopie de photocopie.
Or le web s'est massivement rempli de textes générés depuis 2022. Pour un laboratoire, distinguer aujourd'hui une page écrite par un humain d'une page produite par une machine est devenu difficile et coûteux. D'où l'intérêt d'une source dont la datation garantit l'origine : un livre imprimé avant l'apparition des générateurs grand public ne peut pas contenir de texte synthétique.
Le livre présente en outre trois avantages que le web n'a pas. Il a été édité et relu, donc sa qualité linguistique est supérieure à celle d'une page moyenne. Il est structuré, avec une argumentation qui se déroule sur des centaines de pages, ce qui est précieux pour apprendre à raisonner longuement. Et beaucoup d'ouvrages n'ont jamais été numérisés, ce qui en fait une matière inédite dans un secteur où les données faciles ont déjà été exploitées.
Des auteurs ont commencé à se défendre en pratiquant l'empoisonnement de données : insérer dans leurs textes des éléments invisibles pour un lecteur humain mais qui perturbent un modèle à l'entraînement. Le courtier qui commercialise ces livres met justement en avant qu'un très petit nombre de documents soigneusement conçus peut suffire à installer un comportement indésirable dans un corpus pourtant gigantesque. Un livre imprimé avant l'existence de ces outils échappe par construction au problème. L'argument de vente n'est donc pas seulement la propreté du texte, c'est aussi sa traçabilité : acheter le papier, garder les factures, et disposer d'une chaîne de possession que des juristes peuvent défendre.
Ce qui se passe concrètement
Le mécanisme rapporté est industriel. Des commandes passent par des intermédiaires, sous accord de confidentialité strict, pour des volumes qui vont du millier au million d'exemplaires. Les livres arrivent par palettes, parfois plus d'un millier par palette.
Vient ensuite la numérisation. Scanner un livre sans l'abîmer existe, mais c'est lent et coûteux : il faut manipuler chaque page. La méthode rapide consiste à couper le dos de l'ouvrage pour obtenir une liasse de feuilles libres, qui passe dans un scanner automatique comme n'importe quel document. C'est bien plus rapide et bien moins cher. Le livre, lui, est détruit.
Le phénomène a été observé dans plusieurs pays européens, dont les Pays-Bas, l'Allemagne, la Suisse et l'Espagne, où des libraires d'occasion rapportent des demandes soudaines pour des achats en gros dont le seul critère est le volume, sans considération pour la valeur des ouvrages.
Ce que ça menace vraiment
Soyons précis, car tout n'est pas grave au même titre.
Détruire un exemplaire courant n'est pas un drame. Un roman à succès imprimé à des centaines de milliers d'exemplaires ne disparaît pas parce qu'on en scanne mille. C'est un objet, pas une oeuvre.
Le problème est ailleurs : les ouvrages rares. Quand le critère d'achat est le volume et non le contenu, des éditions épuisées, des tirages confidentiels, des ouvrages techniques ou régionaux jamais numérisés partent dans le lot. Et pour ceux-là, la destruction peut être définitive. La question ouverte, et personne ne peut y répondre, est de savoir combien d'éditions qui n'existaient nulle part ailleurs ont déjà disparu sous la lame d'un scanner industriel avant que quiconque ne les numérise proprement.
Le troisième problème est économique. Cette demande crée une incitation financière à la destruction. Un libraire d'occasion à qui l'on propose d'écouler un stock entier au poids n'a pas de raison évidente de refuser. Le marché du livre ancien n'a jamais eu à composer avec un acheteur dont l'intérêt est de faire disparaître la marchandise.
Et le droit, dans tout ça ?
C'est le point le plus contre-intuitif. Acheter un livre et le scanner pour son propre usage n'est pas la même chose que télécharger une copie piratée. Une décision de justice américaine largement commentée a d'ailleurs distingué ces deux situations : l'entraînement à partir d'ouvrages légalement acquis a été jugé transformatif, tandis que le recours à des copies obtenues illégalement a valu à une entreprise un règlement de plusieurs centaines de millions de dollars avec des auteurs.
C'est précisément pour cette raison que le marché de l'occasion est devenu attractif : il offre une voie légalement défendable là où le téléchargement ne l'est pas. La destruction du livre est, paradoxalement, une conséquence du souci de conformité juridique.
Cela n'épuise pas le débat pour autant. Les procédures que nous suivons, notamment celle qui oppose des éditeurs à Google, portent sur des questions voisines et n'ont pas encore livré de doctrine stable.
Ce que cette histoire dit vraiment
Au-delà de l'image forte des livres broyés, cet épisode révèle un basculement de fond dans l'économie de l'IA. Pendant des années, la donnée était abondante et gratuite : il suffisait d'aspirer le web. Cette période se referme, pour trois raisons simultanées. Le texte propre se raréfie parce que le web se pollue. Les ayants droit se défendent, par la justice et par la technique. Et ce qui reste coûte cher à obtenir.
La conséquence est que la donnée redevient une ressource stratégique, disputée, avec des propriétaires. C'est le même mouvement que nous observions à propos des accords de licence signés avec des éditeurs de presse ou de musique. La différence, ici, c'est que la ressource est physique, finie, et parfois irremplaçable.
Il y a une ironie difficile à ignorer pour finir. Ces systèmes ont été construits en absorbant l'écrit humain. Les voilà qui en épuisent la réserve accessible, au point qu'il faut aller chercher le papier dans les arrière-boutiques et le détruire pour le lire. On peut y voir un symbole facile. On peut aussi y voir un rappel utile : ce que ces machines savent, elles le tiennent de nous, et cette réserve n'était pas infinie.