簡要說明

  • Wikimedia Foundation 宣布與多家 AI 企業達成一系列合作,允許這些企業使用其內容來訓練大型語言模型(LLM)。
  • 這些 AI 公司已註冊其 Enterprise 產品,以大規模重用 Wikipedia 內容。
  • 去年十月,該基金會表示,網站訪問量下降,原因是人們越來越多地使用 AI 摘要,而非直接造訪網站。

Wikimedia Foundation 已宣布與人工智慧公司展開一系列新合作,將允許這些公司利用 Wikipedia 內容來訓練及驅動其 AI 模型,這是該非營利組織在網路行為變化下,尋求長期可持續發展的舉措。

這些協議是通過 Wikimedia Enterprise 簽署,該產品是基金會為大型重用者和內容分發商設計的商業產品。新加入的合作夥伴包括 Ecosia、Microsoft、Mistral AI、Perplexity、Pleias 和 ProRata。他們加入了現有的合作夥伴,如 Amazon、Google 和 Meta。

「在 AI 時代,Wikipedia 及其由人類創建與編輯的知識比以往任何時候都更具價值,」基金會在聲明中表示。

「其知識驅動生成式 AI 聊天機器人、搜尋引擎、語音助手等。Wikipedia 是訓練大型語言模型時使用的最高品質數據集之一。」

這項公告是作為 Wikipedia 25 週年更新的一部分發佈的。

這個線上百科全書是全球訪問量前十的網站之一,也是該群體中唯一由非營利組織運營的網站。根據基金會資料,其 6,500 萬多篇文章以超過 300 種語言發表,每個月瀏覽量接近 150 億次。

然而,基金會警告流量模式正在改變。去年十月,基金會表示,Wikipedia 的人工訪問量同比下降 8%,並將這一降幅歸因於使用者直接依賴 AI 產生的摘要,而非親自造訪網站。如今,將近 60% 的 Google 搜尋結果都是零點擊結束,頁面上的答案經常由 Wikipedia 內容提供支持。

AI 與出版商之間的對抗

這些合作協議的出現,恰逢社會就 AI 公司如何獲取訓練數據展開更廣泛討論。大型語言模型通常訓練於大量線上資料,這一做法受到作者、出版商及其他權利人的批評,他們認為在未經授權的情況下使用受版權保護的作品構成侵權。

其中,Reddit 正因其內容被用於訓練 AI 模型而與多家 AI 公司捲入多起訴訟,但同時 Reddit 也與 Google 等公司達成了授權協議。

週四,知名圖書出版商 Hachette Book Group 和 Cengage Group 提交動議,要求加入針對 Google 的現有集體訴訟,指控該公司為建立其 Gemini AI 平台實施了「史無前例的版權侵權」。訴訟稱,Google 在 AI 訓練過程中,未經適當授權複製了書籍。這宗案件最初於 2023 年由一群作者提起。

OpenAI 也正面臨類似訴訟,原告包括《冰與火之歌》作者 George R.R. Martin。

娛樂公司同樣對此議題保持高度關注。去年十二月中旬,Disney 向 Google 發出停止侵權函,指控其侵犯版權,儘管 Disney 與 OpenAI 達成了涵蓋數百個角色的 AI 生成影像授權協議。Disney 也向其他 AI 企業發出類似通知,並與多家大型製片公司一同對圖像生成公司 Midjourney 提起訴訟。

同月,作家、演員和技術專家組成的新行業團體成立,目的是推動對 AI 在娛樂產業中訓練和應用的可執行規範。超過 500 位知名人士支持這一倡議,包括 Natalie Portman、Cate Blanchett、Ben Affleck、Guillermo del Toro 和 Taika Waititi。

歐盟委員會也已經對 Google 是否違反歐盟競爭規則進行正式反壟斷調查,調查其是否在未獲得公平補償或同意的情況下,使用出版商和 YouTube 內容來驅動其 AI 服務。

版權人最終是否能夠找到救濟途徑尚未確定。美國聯邦法官最近對 Meta 和 Anthropic 作出部分有利裁決,認為他們使用受版權保護書籍訓練 AI 模型屬於「合理使用」,同時批評企業持續保存盜版作品庫。