Claude主導Anthropic 26% AI研發工作
已沉寂展開完整內容
(綜合ETtoday新聞雲、中央社、聯合報等3家媒體報導)
Anthropic公布一套追蹤AI研發自動化程度的測量框架,並首度公開內部數據。截至2026年8月,旗下AI模型Claude已在公司約26%的AI研發工作中達到「AI主導」等級,相較今年2月不到1%大幅攀升;超過90%的AI研發工作至少已有AI協作。
Anthropic以「研發自動化指數」衡量Claude參與程度,採用AL0至AL5共6個等級。AL4代表AI可依據高層次指示完成大部分工作,由人類負責監督;AL5則代表完全自主運作。目前Claude最高達到AL4,尚未有任何受衡量的研發工作達到完全自主,重要目標與研發方向仍由人類決定。
為建立這項指標,Anthropic從2026年7月的內部工作紀錄、Slack及其他文件中抽樣整理約1.5萬項模型研發任務,歸納成542個不同層級的任務節點,由Claude分析任務執行方式及AI參與程度,再交由另一個Claude評估模型判定自動化等級[3]。
在AI代理人規模方面,Anthropic主要內部平台8月隨時約有3萬個AI代理人從事研究與工程工作,部分情況甚至能把工作再交給其他AI代理人處理[1]。當月超過10億次AI代理決策中,約0.002%的操作遭即時監控系統攔截,相當於約每4.7萬次操作出現1次攔截;事後監控系統每週約標記10萬筆對話紀錄進一步檢查,其中優先程度最高的約50筆交由人工審查,另有約千分之一至千分之二的AI代理活動被標記為需進一步檢視[3]。
在算力配置方面,Anthropic統計2026年7月13日至20日使用情況,用於AI研發的算力約6%投入安全研究;若只計算由AI進行的AI研發工作,安全研究占比約12%。Anthropic表示這是保守估計,部分同時提升能力與安全性的工作及安全分類器使用的算力未納入[3]。
Anthropic指出,目前這套指標仍屬原型測量體系,跨AI實驗室比較仍面臨測量方法統一與獨立驗證等問題。公司計畫引入來自多個組織的獨立第三方評估人員,讓其取得與內部風險評估團隊相近的流程、系統及資料存取權限,以驗證安全措施並持續追蹤相關指標[3]。
Anthropic競爭對手OpenAI昨日公布6起AI模型出現意外或令人擔憂行為的報告,並表示將開始定期發布相關報告[2]。
消息在PTT引發討論,有網友笑稱「你已經是個成熟的AI了,該學會自己訓練自己」,也有人開始討論工程師角色是否會因此改變[1]。
本事件已沉寂,相關脈絡見「相關事件」