La révolte des journalistes contre le « scraping » par l’IA
BUENOS AIRES - En l’espace de quelques années seulement, les outils d’IA tels que ChatGPT et Claude sont devenus une technologie courante.
Les entreprises à l’origine de ces produits innovants vantent leurs immenses avantages potentiels pour l’humanité. Mais ce discours, bien qu’il ne soit pas nécessairement faux, occulte le fait que ces modèles reposent sur le vol massif d’œuvres protégées par le droit d’auteur et menacent d’affaiblir encore davantage un pilier déjà fragile de la démocratie : le journalisme. C’est pourquoi Editorial Perfil, un grand éditeur latino-américain dont le siège est en Argentine (et propriétaire du journal Perfil, dont je suis le directeur numérique), a récemment poursuivi en justice OpenAI, propriétaire de ChatGPT, ainsi que le principal actionnaire externe de l’entreprise, Microsoft, pour utilisation abusive du contenu journalistique d’Editorial Perfil dans leurs produits d’IA. Dans l’action en dommages-intérêts intentée devant le Tribunal fédéral civil et commercial d’Argentine, nous avons également accusé ces entreprises de « concurrence déloyale » - en d’autres termes, d’abuser de leur position oligopolistique à notre détriment. Si Editorial Perfil est le premier éditeur hispanophone à intenter une action pour violation du droit d’auteur contre une entreprise spécialisée dans l’IA, il suit les traces du New York Times, qui avait poursuivi OpenAI et Microsoft pour le même motif fin 2023. Le journal brésilien Folha de São Paulo a intenté une action similaire en 2025, qui a finalement abouti à un accord de licence de contenu au début de cette année (une approche qu’OpenAI a adoptée avec d’autres éditeurs, notamment PRISA, le conglomérat espagnol à l’origine d’El País). Nous avons déjà connu cette situation : les plateformes dominantes de recherche et de réseaux sociaux ont également tiré profit de contenus d’actualité protégés par le droit d’auteur sans toujours en partager les bénéfices. Les moteurs de recherche - à l’image du modèle « gratuit » de Google - ont rendu les articles d’actualité infiniment plus accessibles en les mettant en avant sur leurs pages de résultats. Mais bien qu’il s’appuie fortement sur ce contenu protégé par le droit d’auteur pour augmenter ses recettes publicitaires, Google n’était pas tenu de verser une rémunération adéquate aux entreprises médiatiques qui emploient parfois des centaines de journalistes pour le produire. Certes, ces systèmes de diffusion ont généré du trafic vers les sites web des éditeurs, mais les règles du jeu n’ont jamais été équitables et ont de plus en plus penché en faveur des entreprises technologiques à mesure que celles-ci consolidaient leur pouvoir. À l’ère de l’IA, OpenAI et Anthropic (propriétaire de Claude), ainsi que les géants technologiques bien établis comme Google et Meta (propriétaire d’Instagram et de Facebook), ont considérablement amplifié cette dynamique. Les chatbots et autres produits d’IA destinés aux entreprises qu’ils ont développés à partir de grands modèles linguistiques de plus en plus sophistiqués répondent directement aux questions des internautes, privant ainsi les médias de trafic et de la possibilité de diffuser des publicités ou de vendre des abonnements à des lecteurs potentiels. Ces modèles ont nécessité d’énormes quantités de données d’entraînement, dont une grande partie était constituée de contenus protégés par le droit d’auteur, illégalement récupérés sur Internet. Anthropic a récemment réglé un recours collectif en Californie en acceptant de verser 1,5 milliard de dollars à des auteurs de livres qui affirmaient que l’entreprise avait téléchargé des copies piratées de leurs œuvres pour entraîner Claude. Et ces modèles ont constamment soif de nouvelles données, en particulier d’informations actualisées sur l’actualité. Chez Editorial Perfil, nous avons identifié de nombreux cas où ChatGPT est capable de reproduire en détail des contenus issus de nos archives historiques. Il en va de même pour l’actualité en temps réel, et il va même jusqu’à inciter les utilisateurs à demander un récapitulatif quotidien de l’actualité afin qu’ils évitent de perdre du temps à consulter plusieurs sites. Il contourne facilement les accès payants ; pour les articles qu’il ne trouve pas sur les sites d’Editorial Perfil, il utilise des sites mi-copiés qui les ont reproduits illégalement. Les données historiques des serveurs montrent que de nombreux bots explorent en permanence notre contenu - non seulement ceux d’OpenAI, mais aussi ceux de toutes les entreprises spécialisées dans l’IA. Ces abus flagrants sautent aux yeux de toute personne dotée de bon sens. Les entreprises d’IA ne se contentent pas de voler du contenu, elles encouragent également les utilisateurs à rester au sein de leurs écosystèmes fermés, transformant ainsi Internet en un marché oligopolistique. Pourtant, elles continuent d’affirmer qu’elles font un « usage loyal » de contenus « accessibles au public ». Malheureusement pour OpenAI, l’entreprise a déjà reconnu la valeur du journalisme à travers ses nombreux accords de licence. À l’inverse, Anthropic a évité de conclure des accords de licence de contenu avec les organes de presse. Le secteur de l’information est en crise depuis que la révolution numérique a bouleversé son modèle économique il y a plus de deux décennies. Aucun nouveau modèle, plus durable, n’a jamais vu le jour. Si nous, acteurs des médias, n’avons pas su anticiper à quel point l’essor d’Internet allait tout bouleverser, nous avons tenté de nous réinventer a posteriori. Mais la domination oligopolistique des géants de la tech nous a empêchés de réaliser de réels progrès, et l’IA ne fait qu’exacerber la crise. Un secteur de l’information décimé est une mauvaise nouvelle pour tout le monde. Cela entraînerait non seulement un public moins bien informé, mais cela nuirait également aux entreprises d’IA parasitaires elles-mêmes, en les privant d’une source importante de données d’entraînement. Si elles ne se soucient pas d’agir dans l’intérêt du public, elles devraient au moins veiller à leurs propres intérêts. Agustino Fontevecchia : Directeur numérique chez Perfil en Argentine.