簡要說明
- Hachette Book Group 和 Cengage Group 週四請求加州聯邦法院介入一宗對 Google 提出的集體訴訟,指控其於 AI 訓練中侵犯版權。
- 出版商指控 Google 從盜版網站(包括 Z-Library 和 OceanofPDF)下載他們的書籍,並在訓練其模型過程中反覆複製這些書籍。
- 據稱,Google 的 C4 訓練數據集至少來自 28 個與盜版有關的網站,且版權符號出現超過兩億次。
大型出版商 Hachette Book Group 和 Cengage Group 於週四提交動議,要求介入去年針對 Google 提出的現有集體訴訟,指控這家科技巨頭為打造其 Gemini 平台而進行了「史無前例的版權侵權行為」。
在加州聯邦法院提交的訴狀稱,Google「選擇從原告及集體訴訟成員那裡偷取大量內容,用於訓練其 AI 模型」,而非獲取適當授權,並在開發每一階段都進行了蓄意侵權。
這宗合併案件最初由個別作者於 2023 年提出,作為擬議版權集體訴訟,指控 Google 複製書籍以訓練其生成式 AI 模型。
出版商聲稱,Google 從盜版網站下載書籍,並在 AI 訓練過程中多次複製,首先存入電腦記憶體,再轉換為 AI 系統可讀格式,然後再納入每個新模型版本的訓練集。
訴訟稱,Google 的 C4 訓練數據集包含從 Z-Library 擷取的受版權保護作品,該盜版資料庫已被當局查封超過 350 個網站及網域。
出版商指出,書籍來源包括 b-ok.org(現已顯示聯邦查封通知的 Z-Library 域名)、OceanofPDF 及 WeLib,「另一個可取得大量未經授權版權內容的高產量網站」。
訴狀指出,C4 數據集至少包含美國政府認定為盜版及仿冒市場的 28 個網站的作品。
訴訟稱,「C4 數據集中版權符號(©)出現超過兩億次」,並指出 Google 疑似排除了「政策聲明」和「使用條款」警告,但卻納入「大量版權作品、盜版作品,以及來自付費牆後的作品」。
出版商指控 Google 複製來自如 Scribd.com 等訂閱制圖書館的作品,繞過了正規授權協議。
當被質疑這種做法時,非營利數據集供應商 Common Crawl 疑似以「責怪受害者」的心態回應,稱「如果你不想讓內容出現在網路上,就不該將其放到網路上」。
訴訟指出,Gemini 現在生成的內容已「取代受版權保護的作品」,包括逐字複製、詳細摘要及「仿製原創作品創意元素的仿品」。
AI 與出版商
Google 同時須應對 Penske Media Corporation 就其 AI Overviews 功能提出的反壟斷指控,該科技巨頭聲稱顯示 AI 生成摘要屬於「合法的產品改進,而非反競爭行為」。
出版商尋求法定損害賠償、禁止進一步侵權的禁令,以及要求 Google 銷毀所有未經授權的作品副本,並公開哪些書籍用於訓練 Gemini。
該介入動議是在一系列作者於 2023 年對 AI 公司提出版權訴訟之後提出的,聯邦法官曾部分判定 Meta 和 Anthropic 勝訴,認為他們使用受版權保護書籍訓練模型屬於版權法下的合理使用,但批評這些公司長期保留盜版書籍庫。



