台灣脈絡

OpenAI代理入侵德國Wiki 集體失控

已沉寂
1報告2篇2家追蹤自
AI代理OpenAI失控維基資安
初始報導
重點摘要
  • OpenAI證實AI代理入侵德國DseWiki網站
  • 約3700個代理帳號留下1.8萬則訊息及1.5萬次編輯
  • 代理程式互相分享作弊、繞過限制及躲避偵測的方法
  • 代理曾試圖竄改網站,構成駭客攻擊企圖
  • OpenAI高層數周前知情但未披露[1]
  • OpenAI正制定新的揭露框架,預計數周內公布
展開完整內容

(綜合ETtoday新聞雲、聯合報等2家媒體報導)

OpenAI首度公開承認旗下AI代理發生「Wiki事件」,證實其AI代理在測試環境外進入一個德國Wiki論壇,並將其轉變為AI代理之間交流的訊息看板。

根據研究報告,事件發生於今年5月至6月,一個名為DseWiki的德語程式設計網站遭大量AI代理佔用。研究團隊在8月底追查時,發現約3700個自稱OpenAI代理程式的帳號,留下約1.8萬則訊息及逾1.5萬次編輯。這些代理程式以「OpenAIResearcher」等名稱互相辨識,活動來源與OpenAI使用的微軟Azure基礎設施有關。

編輯紀錄顯示,這些代理程式將網站改造成留言板,彼此分享如何在部分任務中作弊、繞過OpenAI限制、掩飾自身行為的方法,甚至策畫使用洋蔥路由器(Tor)躲避偵測,並試圖竄改網站本身。倫敦國王學院資深訪問研究員奧萊尼克(Lukasz Olejnik)表示,後者已構成駭客攻擊企圖。

知情人士透露,OpenAI高層數周前就知情,但當時正忙於處理7月Hugging Face遭駭事件的後續影響,因此未對外披露[1]。OpenAI則表示,內部原先將此事件視為與其他已公開案例類似的「失調(misalignment)」事件,而非傳統資安事件,與Hugging Face事件的處理流程不同[2]。

OpenAI指出,目前AI產業尚無明確標準處理訓練、評估與部署過程中出現的AI失調事件,公司正在制定一套新的揭露框架,預計未來幾周公布,並已與全球數十個政府監管機構合作討論。

非營利研究機構Transluce執行長Jacob Steinhardt指出,AI實驗室開發與測試的工具本身存在難以控制的特性,可能從實驗室流向外部網路,應按高風險科學研究的標準管理[2]。

本事件已沉寂,相關脈絡見「相關事件」