Spór o trenowanie AI. Wydawcy w USA żądają od Common Crawl usunięcia archiwum

Spór o trenowanie AI. Wydawcy w USA żądają od Common Crawl usunięcia archiwum

Amerykańscy wydawcy zaostrzają spór o dane wykorzystywane do trenowania sztucznej inteligencji. Stowarzyszenie Digital Content Next (DCN), reprezentujące największe serwisy informacyjne w USA, wysłało do Common Crawl Foundation pismo „cease and desist”, żądając wstrzymania pobierania ich treści oraz usunięcia już zebranych materiałów – zwłaszcza artykułów za paywallem i przeznaczonych wyłącznie dla subskrybentów.

Common Crawl od 2008 r. buduje ogromne, bezpłatne archiwum sieci, z którego szeroko korzysta świat nauki i branża AI. Dane tej organizacji były kluczowe m.in. przy trenowaniu modeli takich jak GPT-3, co wywołuje protesty wydawców, którzy nie otrzymują wynagrodzenia za takie wykorzystanie treści. CCBot, crawler Common Crawl, jest dziś jednym z najczęściej blokowanych przez media.

Common Crawl publikuje rejestr wszystkich właścicieli stron internetowych, którzy zgłosili chęć rezygnacji z indeksowania ich treści, w tym wydawców, takich jak BBC, The Guardian, Financial Times, The Washington Post, News Corp, DMG Media, Advance Publications, Associated Press, Le Monde, Reuters i Hearst Newspapers.

DCN zarzuca organizacji „rażące naruszenie” praw autorskich i podważanie prawa wydawców do kontrolowania sposobu korzystania z ich treści. Prawnicy wskazują na możliwe „nieścisłe lub wprowadzające w błąd” deklaracje dotyczące usuwania danych na żądanie wydawców. Common Crawl odpowiada, że proces kasowania jest złożony technicznie, ale prowadzony konsekwentnie i w dialogu z właścicielami serwisów.

Źródło https://pressgazette.co.uk