- 數發部攜手客委會新增約2000萬tokens客語AI訓練語料
- 語料涵蓋詩集、教材、口語文本及學術研究等內容
- 有助提升AI對客語腔調、語意及文化脈絡的理解
- 語料庫累積逾15億tokens,已開放申請使用
(綜合中央社、自由時報等3家媒體報導)
數位發展部持續擴充「台灣主權AI訓練語料庫」,近日首度攜手客家委員會,上架客家語言資源、出版品、文史典藏及研究報告等內容,新增約2000萬tokens高品質客語訓練語料。
數發部表示,客語為國家語言之一,此次語料涵蓋詩集創作、客家風情及客語教學圖書等政府出版品,以及客語能力認證各級詞彙教材與題庫、口語採錄文本、文化典藏、學術與政策研究資料(如客語復振、政策發展與文化治理等)。這批語料有助提升AI模型對客語不同腔調、語意及文化脈絡的理解與生成能力,未來可應用於客語智慧客服、本土文化知識服務及公共政策等AI創新應用。
台灣主權AI訓練語料庫自上線以來,已累積逾15億tokens語料量。該批客語語料已正式上架,AI模型開發團隊、學研機構及相關單位可至官網申請使用。數發部表示將持續攜手政府機關釋出優質語料,並規劃推動民間語料徵集。
本事件已沉寂,相關脈絡見「相關事件」