- 主權AI語料庫累計提供約5000筆資料集、逾20億詞元
- 已有59名個人或單位申請使用,資訊服務業者為大宗
- 字辭典類語料應用需求最明顯
- 數發部預計9月中旬啟動民間語料徵集
- 國科會TAIDE團隊已申請使用,預計今年發布新版模型
- 金融領域團隊運用語料發展在地金融語言模型
(綜合中央社、聯合報等2家媒體報導)
台灣主權AI訓練語料庫自去年底上線,截至今年7月底,已有超過200個政府機關參與,累計提供約5000筆資料集,語料規模超過20億詞元。數發部表示,目前已有59名個人或單位申請使用並通過審核,包括5個研究機構、22所學校、2個政府機關、7名個人、3個社群,以及20家公司與組織,其中以資訊服務業者為大宗,包括亞太智能、凌群、應援科技、華碩等。
語料庫開放產學研及民間使用,可用於模型訓練、微調、檢索增強生成等。數發部指出,從申請者填寫的使用目的來看,教育部字辭典類語料(如台灣客語辭典、台灣台語常用詞辭典)應用需求最明顯,機關FAQ及教育學習相關語料也受關注,常見應用情境包括語言學習、知識問答、RAG及智慧客服。
數發部說明,語料徵集採「先中央再地方,逐步擴展至民間」策略,今年下半年起已積極接洽出版社、法人等民間單位,目前已有少量民間語料上架。預計9月中旬正式啟動民間語料徵集,現階段以自願、無償提供為原則,並採「台灣主權AI訓練語料授權條款」上架。
國科會TAIDE團隊已申請使用語料庫資料,預計今年發布運用語料庫訓練的新版模型。金融領域方面,有團隊運用語料發展具台灣在地金融語境的領域型大型語言模型,應用於法規查詢、監理規範理解、風險提示及金融情境推理等。
系統持續蒐集本事件新進文章,資訊充足時將整合至下一份追蹤報導