Aller au contenu
Éthique

Droit d'auteur

Le cadre juridique régissant l'ingestion massive d'œuvres protégées dans les données d'entraînement des modèles, l'exception de fouille de textes et le droit d'opposition.

6 min de lecture
  • #éthique
  • #droit d'auteur
  • #entraînement
  • #société

Le droit d’auteur appliqué aux modèles de langage régit la manière dont les entreprises peuvent légalement aspirer et utiliser des millions de livres, d’articles et d’œuvres protégées pour entraîner leurs réseaux de neurones sans l’autorisation explicite de chaque auteur.

Imagine un étudiant passionné de littérature qui passe dix ans de sa vie enfermé dans la bibliothèque municipale. Il lit jour et nuit des milliers de romans, d’essais et de recueils de poésie protégés par le droit d’auteur. Il n’achète aucun livre et ne demande pas l’autorisation à chaque auteur pour tourner les pages.

En lisant, il apprend le vocabulaire, la syntaxe et les figures de style. Vingt ans plus tard, il publie son propre roman. Son livre a une intrigue neuve et des personnages inédits, mais son style d’écriture porte l’empreinte diffuse de tout ce qu’il a lu. A-t-il volé les auteurs ? Évidemment non : il s’est nourri d’une culture commune pour créer une œuvre originale.

En revanche, si cet écrivain récite dans son livre des chapitres entiers d’Harry Potter mot pour mot sans citer J.K. Rowling et en vendant le livre sous son nom, il commet une contrefaçon caractérisée.

C’est exactement le cœur de la bataille juridique autour des modèles de langage : les concepteurs d’IA affirment que leurs modèles apprennent comme cet étudiant en absorbant la structure du langage ; les auteurs et artistes répliquent qu’une machine industrielle n’est pas un être humain et qu’elle n’a pas le droit d’aspirer gratuitement le patrimoine culturel pour en tirer un profit commercial.

L’entraînement d’un grand modèle de langage nécessite d’avaler des dizaines de milliers de milliards de jetons de texte. Les laboratoires de recherche ne rédigent pas ces textes à la main : ils envoient des robots d’indexation (crawlers) aspirer l’ensemble du web public, téléchargeant des milliards de pages de blogs, de journaux, d’encyclopédies, de forums et de livres numérisés.

Cette pratique massive entre en collision frontale avec les principes fondamentaux de la propriété intellectuelle.

L’exception de fouille de textes et de données en Europe

Section intitulée « L’exception de fouille de textes et de données en Europe »

Dans l’Union européenne, le cadre légal repose sur la directive 2019/790 sur le droit d’auteur dans le marché unique numérique. Cette directive a introduit un dispositif spécifique : l’exception de fouille de textes et de données (Text and Data Mining, ou TDM).

L’article 4 de cette directive autorise la reproduction et l’analyse automatisée d’œuvres numériques pour en extraire des régularités statistiques, y compris à des fins commerciales, à une condition capitale : le respect du droit d’opposition (opt-out).

Si un auteur, un éditeur de presse ou un photographe a exprimé son refus que ses contenus soient aspirés par des machines au moyen d’un procédé technique lisible par machine (comme une balise dans le fichier robots.txt d’un site web ou une métadonnée numérique), les entreprises d’intelligence artificielle ont l’obligation légale formelle d’ignorer ces données sous peine de contrefaçon.

Aux États-Unis, la situation juridique est très différente. La loi américaine ne dispose pas d’une exception TDM stricte avec opt-out obligatoire. Les entreprises d’IA s’abritent derrière la doctrine jurisprudentielle du fair use (l’usage loyal).

Pour plaider le fair use, les laboratoires soutiennent que l’utilisation des textes protégés est « hautement transformative » : le modèle ne recopie pas les œuvres pour les redistribuer, mais les transforme en poids mathématiques abstraits pour apprendre la grammaire du monde.

Ce choc de cultures juridiques a donné lieu à des dizaines de méga-procès historiques, le plus retentissant étant la plainte déposée par le journal The New York Times contre OpenAI et Microsoft fin 2023, accusant les modèles d’avoir pillé des décennies de journalisme d’investigation sans payer de licence.

La mémorisation accidentelle : quand le modèle régurgite

Section intitulée « La mémorisation accidentelle : quand le modèle régurgite »

L’un des arguments majeurs des créateurs de modèles est qu’un réseau de neurones n’embarque aucune copie physique des textes d’entraînement. C’est vrai sur le plan de l’architecture : un modèle n’est pas un disque dur d’archives.

Cependant, des travaux scientifiques menés par des chercheurs en sécurité ont mis en évidence le phénomène de mémorisation accidentelle. Lorsqu’un texte est répété de nombreuses fois sur le web (un poème célèbre, un article de presse très partagé, un refrain de chanson), la descente de gradient peut graver ces séquences de manière tellement profonde dans les paramètres que le modèle devient capable de régurgiter des pages entières mot pour mot lorsqu’on lui fournit les premières lignes. Sur le plan juridique, cette récitation verbatim fait tomber l’argument de l’usage transformatif et caractérise la contrefaçon.

Le droit d’auteur redéfinit en profondeur le modèle économique de l’intelligence artificielle :

  • Les accords de licence géants : Plutôt que de risquer des procès destructeurs, des entreprises comme OpenAI, Google ou Apple signent des contrats de dizaines de millions d’euros avec de grands groupes de presse internationaux (Le Monde, Axel Springer, Financial Times, Condé Nast) pour acheter le droit légal d’utiliser leurs archives pour entraîner leurs futurs modèles.
  • La rébellion des créateurs et les actions de groupe : Des milliers d’écrivains, d’artistes visuels et de développeurs de code informatique se sont regroupés en actions collectives (class actions) aux États-Unis pour exiger une indemnisation et la destruction des modèles entraînés sur leurs créations sans consentement.
  • Le blocage massif des robots collecteurs : La majorité des médias d’information européens ont mis à jour leurs règles de serveurs pour interdire l’accès à GPTBot ou ClaudeBot, obligeant les concepteurs d’IA à chercher d’autres sources de texte ou à s’appuyer sur des corpus synthétiques.
  • Le règlement européen sur l’IA (AI Act) : La législation européenne votée en 2024 impose désormais aux créateurs de modèles généraux de publier un résumé public détaillé des données d’entraînement utilisées et de prouver qu’ils respectent le droit d’auteur européen, sous peine de lourdes amendes.
  • « Si une page est accessible publiquement sur Google, elle est libre de droits pour entraîner une intelligence artificielle. » C’est une confusion juridique totale. La mise à disposition gratuite d’un contenu sur le web n’équivaut absolument pas à une renonciation aux droits patrimoniaux de l’auteur. L’utilisation commerciale massive nécessite une autorisation ou le respect strict de l’exception TDM.
  • « Le modèle de langage découpe et recolle des fragments de textes volés pour former ses réponses. » Le modèle ne contient aucune banque de données textuelle cachée. Il ne stocke que des milliards de coefficients mathématiques statistiques, même si une sur-mémorisation accidentelle peut parfois faire réapparaître une phrase exacte apprise par cœur.
  • « La législation sur le droit d’auteur est la même partout dans le monde pour les IA. » L’Europe applique un droit des auteurs très protecteur avec obligation de respecter l’opt-out numérique, tandis que les États-Unis s’appuient sur la souplesse du fair use, créant d’importantes divergences géopolitiques.

Voir aussi