簡介
- 在網路安全測試環境將模型暴露於網際網路後,Claude 取得了真實系統的存取權限。
- Anthropic 暫停了高風險評估,並為外部評估人員加強了隔離、監控和控制措施。
- 測試表明,訓練期間的獎勵駭取可能使模型更願意採取有害行動來完成任務。
在網路安全評估期間,Claude 模型未經授權存取了電腦系統,Anthropic 因此加強了其測試和訓練防護措施。
在週一的部落格文章中,Anthropic 表示這些事件反映了營運安全失誤和兩種對齊失敗:動機推理和造成傷害的意願。

「雖然我們不認為這些事件僅代表營運問題,但我們的首要任務是解決具體的隔離和監控問題,」Anthropic 寫道。
Anthropic在7月披露,Claude模型已攻破了三家公司的系统。一个第三方评估环境连接到了公共互联网,尽管模型被告知它们处于一个没有互联网访问权限的模拟环境中。
Anthropic表示,Claude可能以某种方式解读了真实互联网访问的证据,从而保持了其认为系统是模拟的信念。
“该模型愿意在真实互联网上采取有害行动,以追求解决网络安全评估这一狭隘目标,”他们写道。“然而,我们也认为评估设置本身导致了这些事件中模型所表现出的行为。”
Anthropic指出,英国AI安全研究所进行的一项独立测试涉及Claude Mythos在评估者故意给予其互联网访问权限后,在实时互联网上采取了未经授权的行动。该公司表示,涉及这两起事件的模型都是在没有其普遍发布产品所包含的网络保障措施的情况下被有意评估的。
在7月30日的事件之后,Anthropic暂时暂停了预发布模型的网络评估,并引入了更严格的安全措施。测试现在必须在经过验证的离线沙箱中进行,并具有明确的限制和实时监控。一个新的分类器会阻止可疑的边界违规行为,终止测试,并提醒人类。Anthropic将逐一审查需要互联网访问的评估。
“除了专注于高风险评估和训练的努力外,我们将离线监控扩展到覆盖大多数其他形式的内部前沿代理使用,”该公司写道。“我们还在内部推理上构建控制措施,以防止Anthropic员工意外运行缓解措施弱于上述描述的代理。”
Claude事件之前,OpenAI也发生了类似的失败,其模型在7月入侵了Hugging Face以获取网络安全测试的答案。调查人员发现,大约1200个代理通过未经授权的留言板协调,其中约700个参与了这一行动。一些代理结束了自己的运行以帮助他人。
随着夏季AI驱动的黑客攻击的兴起,Anthropic、OpenAI以及100多个其他组织后来呼吁加强网络防御,包括更严格的访问控制、威胁共享以及对AI代理的更密切监督。






