Contexte juridique

Le New York Times a intenté, il y a trois ans, une action en contrefaçon contre OpenAI et Microsoft. Les documents récemment rendus publics montrent qu’un cadre de Microsoft a qualifié les pratiques de collecte de données d’« vol », tandis que la direction d’OpenAI a décrit les modèles comme une « menace existentielle » pour les éditeurs. Le litige repose sur l’interprétation du fair use : les juges ont jusqu’à présent favorisé les arguments des IA, mais les nouvelles admissions contredisent les exigences du test, notamment la substitution du marché original.

Mécanismes de collecte de données

Les révélations détaillent un processus de scraping à grande échelle. OpenAI aurait extrait plus de 2 millions de documents de nytimes.com via le corpus Common Crawl, et aurait intégré 91 692 copies d’articles du NYT, du Daily News et du Center for Investigative Reporting dans ses jeux de données intermédiaires. Le projet interne « Project Mango » aurait rassemblé 160 903 œuvres uniques provenant des mêmes éditeurs. Les équipes auraient contourné les paywalls grâce à un « hack » partagé par le chercheur Nick Ryder, approuvé par le président d’OpenAI, Greg Brockman.

Impacts économiques et techniques

Un rapport interne de Microsoft, daté de janvier 2024, indique que le moteur de réponses de Copilot a réduit le taux de clics vers le site du NYT de jusqu’à 93 % comparé à la recherche Bing traditionnelle. Cette chute a été qualifiée de « doom loop », car la diminution du trafic affaiblit à la fois les revenus des éditeurs et la qualité des modèles d’IA qui s’appuient sur ces contenus. Le même document souligne un risque réel de « perturbation de l’emploi » pour les journalistes dont les travaux alimentent les modèles de fondation.

Limites et perspectives

Les pièces présentées proviennent principalement du mémoire du NYT, les pièces justificatives restent scellées, ce qui limite la vérification indépendante des chiffres. La défense du fair use continue d’être testée devant les tribunaux, tandis que l’administration américaine a récemment soumis un mémoire en faveur d’OpenAI. Si les juges confirment que le scraping constitue une violation, les pratiques de constitution de jeux de données pour les LLM devront être repensées, possiblement avec des licences explicites ou des filtres de droits d’auteur intégrés.