- 綠委陳培瑜、吳思瑤召開主權AI與出版內容產業座談會
- 陳培瑜指繁體中文僅佔大語言模型約1%,面臨邊緣化危機
- 吳思瑤透露TAIDE部分評測落後,主因語料授權未解決
- 業界示警中國圖書大量進口,恐混淆主權AI語料庫
- 數發部已建置語料庫,蒐集12億個token,30多家民間公司使用
(綜合自由時報、中時電子報等2家媒體報導)
民進黨立委陳培瑜、吳思瑤今(19)日召開「文化石油:AI主權建設下的出版內容產業未來」座談會,邀集政府機關、專家學者與文化內容產業,探討如何確保台灣文化在雲端時代的主權。
陳培瑜指出,文化內容是驅動AI運作的燃料,但當前政策視野尚未將內容產業納入AI發展的關鍵產業,政府未來須將優質內容的獲取與轉譯機制,納入政策規劃、預算編列及法律制定的藍圖中。她強調,國際主流大語言模型約50%以英文訓練,僅約1%為繁體中文,面臨邊緣化危機;數發部與國科會目前以政府公開資料建設「主權AI語料庫」,但最能代表台灣文化底蘊的珍貴語料尚未納入。
吳思瑤表示,台灣雖為半導體王國,但主權AI若缺乏在地文化語料,恐成「沒有靈魂的空殼」。她透露,質詢國科會、中研院時發現TAIDE部分評測落後,主因在於核心語料因授權問題尚未納入。她呼籲參考歐盟《AI法案》與「公共出借權」精神,由國家建立軟體與內容計價機制,完善著作權授權AI的集體管理組織,打造「集體授權與分潤平台」。
產業界在會中示警,親子天下副總經理林彥傑指出,近年中國圖書大舉進口,每年有大量簡轉繁的紙本、電子、有聲圖書進入台灣市場,若台灣要做主權AI,必須防範中國圖書混淆語料庫;若完全以自由市場機制,中國很容易利用大量出版品淹沒本土內容。他建議未來政策或法規須訂有防範機制,且政府出資的標案、補助內容可考慮訂有強制授權條款及罰則。
城邦媒體集團法務總監邱大山說,內容產業型態複雜,涵蓋文字、圖片、影像等多重媒介,轉化為AI訓練資料包須經資料清洗、加工及嚴格品質控管,建議政府對AI內容使用範圍做出明確界定,並依據「製作加工費」與「授權使用費」的不同性質,提供彈性的階段性合作方案。
數發部說明,已於去年建置「主權AI語料庫」,目前蒐集12億個token;第一階段先蒐集政府機關資料,第二階段希望民間響應,目前約30多家民間公司及團體已使用該語料庫。授權機制上,數發部與經濟部智慧財產局合作訂定合理授權條款,已與200多個政府部門簽訂釋出資料。
本事件已沉寂,相關脈絡見「相關事件」