- 數發部啟動民間語料徵集,擴充台灣主權AI訓練語料庫
- 林宜敬率先捐出個人著作響應
- 語料庫已累計22億tokens,初期以政府資料為主
- 徵集採無償授權,出版業為首要合作對象
- 設有自願參與、明確授權、可退出三大原則
- 林宜敬:授權資料僅限AI訓練,須經轉製不得原文照抄
數發部啟動民間語料徵集 擴充主權AI語料庫
已沉寂1報告2篇2家追蹤自
主權AI出版業數發部林宜敬語料庫
初始報導
重點摘要
展開完整內容
(綜合中央社、聯合報等2家媒體報導)
數位發展部今日正式啟動「台灣主權AI訓練語料庫」民間語料徵集行動,由部長林宜敬率先以作家身分捐出個人著作《幸福的鬼島》及《流寇與創新者》[1],並與秀威資訊、印刻文學、Readmoo讀墨、食力、巨思文化等出版及電子書平台業者,以及作家藍弋丰等人簽署授權同意書。
台灣主權AI訓練語料庫自2025年底上線,初期以政府資料為主,截至今年8月底已累計約5000筆資料集、超過22億詞元(tokens)。林宜敬表示,目前國際大型語言模型的中文訓練資料仍多以簡體中文為主,要讓AI理解台灣,必須讓台灣的語言、文化與價值成為AI學習的一部分。他強調,隨著AI技術快速發展,「我們不能等」,否則國際甚至台灣自己的大型語言模型,提供的回答都可能沒有台灣觀點。
現階段徵集以出版業及電子書平台為主要合作對象,採無償授權方式。徵集內容包含經授權的出版品、出版品簡介、試閱內容,以及已逾著作權保護期間可作為公共財活化運用的典籍與創作。作者如有意願提供個人著作,可透過出版社協助上架。
針對著作權保障,數發部強調採「自願參與、明確授權、可退出」三大原則,設有退出及下架申請管道。林宜敬說明,授權資料僅限用於AI訓練,且必須經過轉製(transformation)才算合理使用,不能原文照抄。資料創新司司長王復中表示,民間內容主要由出版社負責篩選品質,平台僅檢核內容結構與資料格式,不會干預內容。
林宜敬也指出,語料庫開放台灣、美國、日本等AI開發團隊使用,「如果有中國團隊想使用,也相當歡迎」。
本事件已沉寂,相關脈絡見「相關事件」