簡述

  • Anthropic 發現了一起涉及早期 Claude Opus 4.6 模型的 1 月事件,隨後將其審查範圍擴大至約 4.81 億份對話記錄。
  • 該公司識別出偏誤推理與魯莽行為,並修訂了先前對於 Claude 為何攻擊真實系統的評估。
  • 這份報告發布之際,社群媒體上關於監管 AI 的辯論正日益高漲。

Anthropic 披露了另一起事件,其中一個 Claude AI 模型在安全測試期間入侵了真實系統。

在週三發布的報告中,Anthropic 修訂了其對 7 月披露的三起事件的解釋。該公司現在表示,偏誤推理以及願意冒傷害風險的心態,助長了這些攻擊,而測試錯誤因讓網際網路存取保持開放而使其成為可能。

Myriad: Which company will IPO next? Click to make your prediction.
Myriad:下一家 IPO 的公司會是哪家?點擊做出你的預測

「我們的調查發現了兩個反覆出現的對齊問題,在各起事件中以不同程度的嚴重性存在,」Anthropic 寫道。「偏誤推理,即 Claude 傾向於忽視或誤解其正在真實網際網路上運作的證據,以及魯莽行為,即為了狹隘地追求完成任務而願意採取有害行動。」

它同時承認過度依賴模型聲稱自己相信身處模擬環境的說法。

「當我們對逐字稿進行針對性修改,使其更清楚表明模型並非身處模擬環境時,Claude Mythos 5 仍採取了攻擊性行動,儘管它承認現實世界造成傷害的可能性更大,」Anthropic 寫道。「我們公開這份逐字稿,以便他人能在我們的分析基礎上繼續發展。」

當 Anthropic在七月披露 Claude 對三家公司發動攻擊時,最初將其歸因於測試錯誤。該公司現在表示,研究人員過於信任模型對其行動的解釋。

據該公司表示,第四起事件發生於一月,涉及早期版本的 Claude Opus 4.6。Anthropic 在八月為獨立 AI 評估機構 METR 準備記錄時發現了此事。

研究人員發現該事件後,Anthropic 表示其對約 4.81 億份逐字稿展開了更廣泛的審查,其中標記了 920 萬份供使用 Claude 進一步審查。

「根據初步評估,我們不認為第四起事件比我們深入評估的三起事件更為嚴重,」Anthropic 寫道。「METR 將與其他三起事件一併調查此事件。」

Anthropic 的研究人員表示,Claude「意外」造成了 IP 位址衝突,使其目標無法連線。Claude 隨後嘗試了八次退出該行動,但一個軟體錯誤阻止了它停止。該 AI 接著連上網際網路並存取了第三方的機器,在那裡找到了一組可取得管理員權限的密碼。

早先事件引發獨立審查

這份報告發布之際,正值其他關於 AI 系統超出安全測試界限的披露出現。

八月時,英國 AI 安全研究所表示 Mythos 5 在其評估期間以真實人物為目標。Anthropic 表示,這起獨立事件不在本報告範圍內,將另行評估。

在上個月發表的調查結果中,METR 的調查人員表示約 1,200 個 OpenAI 代理在一個未經授權的留言板上進行協調,其中約 700 個加入了攻擊。Anthropic 表示,在其四起事件中,未發現代理之間存在協調,或其目標超出完成指派練習之外。

這份報告發布之際,關於如何監管人工智慧的辯論也正在升溫。週二,前 OpenAI 與 Anthropic 工程師 Jacob Coxon 在 X 上表示「打造 AI 的人真心相信它可能在這十年結束前殺死我們所有人」,隨後引發廣泛關注。

這項警報促使美國立法者和監督團體重新加大力度,以遏制前沿人工智慧實驗室的發展。參議員伯尼·桑德斯最近提出立法,試圖禁止先進人工智慧的發展,直到新的聯邦監管機構制定出安全規則為止。