Aller au contenu

Une bibliothèque appelle des volontaires à sauver les livres que l'IA fait détruire

Après notre article sur les ouvrages broyés pour être scannés, la réponse s'organise. Le message est simple : le temps presse.

Espace publicitaire
L'essentiel en 30 secondes ⚡
Une grande bibliothèque en ligne appelle des volontaires à numériser et préserver des livres physiques, en expliquant que le temps presse. Le motif invoqué : des entreprises d'IA achètent des ouvrages imprimés, les scannent et les détruisent dans l'opération, avec le risque que le savoir se retrouve enfermé sur des serveurs privés.

Nous avions consacré le 6 août un article à ce phénomène d'achat et de destruction d'ouvrages imprimés. Voici la réaction qu'il a suscitée, et elle mérite d'être regardée avec nuance.

Rappel du mécanisme

Pourquoi des livres imprimés avant 2022 valent-ils soudain de l'or ? Deux raisons que nous avions détaillées.

D'abord, le web s'est rempli de textes générés, ce qui rend difficile de distinguer une source humaine. Un ouvrage imprimé avant l'apparition des générateurs grand public est propre par sa date. Ensuite, la numérisation industrielle rapide suppose de couper le dos de l'ouvrage pour faire passer les pages dans un scanner automatique. Le livre ne survit pas.

Nous avions posé la nuance importante : détruire un exemplaire courant n'est pas un drame, un roman imprimé à des centaines de milliers d'exemplaires ne disparaît pas. Le problème concerne les éditions rares, celles qui partent dans un lot acheté au volume sans considération de contenu.

Ce que propose cette initiative

L'appel repose sur une idée simple : si des ouvrages doivent être numérisés, autant qu'ils le soient dans un cadre où le résultat reste accessible à tous, plutôt que dans un corpus privé.

L'argument central porte sur la monopolisation. Un livre numérisé par une entreprise pour entraîner son modèle enrichit ce modèle. La numérisation ne profite à personne d'autre, et si l'exemplaire physique a été détruit dans l'opération, l'accès public n'a pas été remplacé, il a été supprimé.

La nuance juridique, qu'il faut poser 📋
Cette question croise le droit d'auteur, et il serait malhonnête de présenter cette initiative comme une évidence morale. Numériser et diffuser un ouvrage protégé sans autorisation reste une atteinte au droit d'auteur, quelles que soient les intentions. C'est précisément le débat que nous avons couvert avec le procès des éditeurs contre Google, et il n'est pas tranché. On peut trouver légitime de vouloir préserver un patrimoine et considérer que le faire sans cadre légal pose un problème. Les deux positions se défendent.

Ce que cet épisode révèle

Au-delà du cas particulier, il illustre une tension qui structure toute la question des données d'entraînement.

D'un côté, une ressource devenue rare et donc précieuse. De l'autre, un patrimoine qui appartenait à tout le monde et à personne, dont l'exploitation par des acteurs privés soulève une question de bien commun.

C'est la même logique que nous relevions à propos de la publication d'un modèle scientifique par un État : quand une ressource devient stratégique, la question de savoir qui la contrôle cesse d'être technique.

Ce qu'il faut retenir

Cette initiative ne réglera pas le problème, et ses promoteurs ne le prétendent probablement pas. Des volontaires ne rivaliseront pas avec des opérations industrielles financées par des laboratoires disposant de moyens considérables.

Ce qu'elle fait, en revanche, c'est rendre le sujet visible. Il y a trois semaines, presque personne ne savait que des livres étaient achetés par palettes et détruits pour alimenter des corpus. Le fait que cela suscite désormais une réponse organisée est en soi une information.

Il reste la question la plus inconfortable, et personne ne peut y répondre : combien d'éditions qui n'existaient nulle part ailleurs ont déjà disparu sous la lame d'un scanner, avant que quiconque ne s'en préoccupe ?

Espace publicitaire