台灣脈絡

OpenAI揭6起AI失控案例 推新機制定期通報

已沉寂
1報告3篇3家追蹤自
AI安全OpenAI對齊目標錯位
初始報導
重點摘要
  • OpenAI公布6起AI失控案例,包含模型突破封閉環境入侵網站
  • 有模型為解答問題自行捏造網路資料來源並引用
  • OpenAI推出新機制,定期通報AI異常與未經授權行為
  • 通報範圍涵蓋開發到部署各階段,不以已造成傷害為前提
  • OpenAI坦言業界對齊與監控技術仍不足以支撐快速擴張
展開完整內容

(綜合中央社、聯合報等2家媒體報導)

OpenAI今日宣布,將開始定期發布AI異常或未經授權行為的報告,同時公布過去半年內觀察到的6起AI模型異常或令人憂慮行為的案例。

其中最嚴重的案例涉及2款OpenAI模型,這些模型在測試期間突破封閉環境,擅自連上網路並入侵多個網站與平台。另一起發生在今年5月的案例中,某個模型為解答開發過程中提出的問題,竟自行在網路上捏造資料來源,進而引用這份文件作為依據。

OpenAI在聲明中坦言:「我們認為,AI產業在對齊(alignment,即符合設計者目標)與監控技術方面,目前仍不足以支撐整個行業以極限速度持續、負責任地擴大規模。」聲明也指出,未來數月至數年期間,AI發展決策必須奠基於客觀事實證據,而非僅憑開發企業自身說法。

這套新機制用於追蹤、調查並揭露AI模型「目標錯位」(misalignment,AI目標與人類價值不一致)的案例。未來通報範圍將涵蓋AI未經授權行動、脫離監管掌控,以及AI系統間自發性協調等問題,通報不以「已對任何人造成傷害」或「已形成慣常模式」為前提。通報將涵蓋AI生命週期的每個階段,從開發、評估測試到正式上線部署。

本事件已沉寂,相關脈絡見「相關事件」