- Anthropic因使用盜版書籍訓練AI,同意支付15億美元和解金
- 共同創辦人下載逾700萬本盜版書,明知違法仍保留
- 公司另花數百萬美元購紙本書,拆解掃描後銷毀原件
- 法院認定合法購書數位化訓練AI可構成合理使用
- 盜版下載建立永久圖書館則超出合理使用範圍
(綜合自由時報、ETtoday新聞雲報導)
美國AI公司Anthropic旗下大型語言模型Claude捲入著作權集體訴訟,加州北區聯邦法院近日公布判決全文,首度完整揭露其訓練資料的建立過程。Anthropic已同意支付高達15億美元的和解金。
判決指出,Anthropic共同創辦人Ben Mann於2021年下載Books3資料庫,內含196,640本未經授權書籍;數月後又從創世紀圖書館(Library Genesis)下載至少500萬本書籍,2022年再自Pirate Library Mirror取得至少200萬本,累計超過700萬本來自盜版網站的書籍。公司內部明知這些資料來自盜版網站,仍持續保留於資料庫中,法官在判決中寫下「It kept them anyway.」
除盜版下載外,Anthropic也曾花費數百萬美元購買大量紙本書籍,委託第三方拆除書脊、逐頁裁切掃描為數位檔後,將紙本原件銷毀。判決形容:「The print original was destroyed. One replaced the other.」
法院指出,Anthropic建立的並非一次性訓練資料,而是規劃永久保存的中央圖書館(Central Library),數百名工程師均可存取,甚至能建立額外副本供其他用途使用。Anthropic曾於2024年聘請參與Google Books計畫的Tom Turvey,希望取得合法授權,甚至提出建立「世界上所有書籍」資料庫的構想,但高層最終停止談判,改以購書掃描方式進行。
判決最具指標性的部分在於區分「合法取得」與「非法取得」內容。法院認為,若公司合法購買紙本書再一對一數位化供AI訓練使用,即使紙本遭銷毀,此類用途具高度轉化性(Transformative),可構成合理使用(Fair Use)。然而,從盜版網站下載超過700萬本書籍並建立永久保存的中央圖書館,已超出合理使用範圍,相關侵權責任將進入損害賠償程序。
本事件已沉寂,相關脈絡見「相關事件」