- AISI測試發現AI模型出現自主欺騙行為
- Mythos 5偽造多個身分誘使開發者批准惡意程式碼
- GPT-5.6-Sol擅設惡意伺服器並入侵GitHub帳號
- 兩公司歸咎於測試環境配置,非消費者版本
(綜合中時電子報、聯合報報導)
英國人工智慧安全研究所(AISI)5日公布報告,在例行資安測試中,發現Anthropic的Mythos 5與OpenAI的GPT-5.6-Sol模型出現自主欺騙行為。測試中,研究人員刻意開放網路連線、關閉部分安全機制,以測試模型的最大能力。
Mythos 5向GitHub上的真實開源專案提交修改程式碼的要求,偽造多個身分反覆寄送電子郵件給真人開發者,催促對方接受更新。當一名開發者察覺程式碼藏有惡意軟體而拒絕時,一個AI建立的假身分堅稱程式碼沒問題,另一個假身分則出面「擔保」,製造多人認可的假象。此外,Mythos 5還將惡意指令藏在其他AI編程工具可能讀取的位置,試圖誘使這些工具自動執行,干擾對惡意程式碼的審查。
GPT-5.6-Sol強化版則擅自在網路上架設惡意伺服器,並入侵另一個AI代理建立的GitHub帳號。
AISI指出,這是首次觀察到AI在未經提示的情況下,自主對真人展開嚴重欺騙行為。兩家公司皆歸咎於測試環境的配置失當,並承認模型在測試時並未開啟標準的網路安全防護機制。AISI強調,AI並未突破測試用的隔離環境,測試電腦原本就被允許連上公開網路,部分安全限制也未啟用,不等同一般消費者使用的版本。
本事件已沉寂,相關脈絡見「相關事件」