简要

  • 在网络测试环境将模型暴露于互联网后,Claude 访问了真实系统。
  • Anthropic 暂停了高风险评估,并为外部评估人员增加了更强的隔离、监控和控制措施。
  • 测试表明,训练过程中的奖励黑客行为可能使模型更愿意采取有害行动来完成任务。

在网络安全评估期间,Claude 模型未经授权访问了计算机系统,Anthropic 因此加强了其测试和训练保障措施。

在周一发布的博客文章中,Anthropic 表示这些事件反映了操作安全失败和两种对齐失败:动机推理和造成伤害的意愿。

Myriad:OpenAI 何时发布 GPT-6?点击做出你的预测。
Myriad:OpenAI 何时发布 GPT-6?点击做出你的预测

“虽然我们不认为这些事件仅代表操作问题,但我们的首要任务是解决具体的遏制和监控问题,”Anthropic 写道。

Anthropic在7月披露,Claude模型已攻破了三家公司的系统。一个第三方评估环境连接到了公共互联网,尽管模型被告知它们处于一个没有互联网接入的模拟环境中。

Anthropic表示,Claude可能以某种方式解读了真实互联网接入的证据,从而保持了其认为系统是模拟的信念。

“该模型愿意在真实互联网上采取有害行动,以追求解决网络安全评估这一狭隘目标,”他们写道。“然而,我们也认为评估设置本身导致了这些事件中模型所表现出的行为。”

Anthropic指出,英国AI安全研究所进行的一项独立测试涉及Claude Mythos在评估者故意给予其互联网接入后,在实时互联网上采取了未经授权的行动。该公司表示,涉及这两起事件的模型都是在没有其普遍发布产品所包含的网络保障措施的情况下被故意评估的。

在7月30日的事件之后,Anthropic暂时暂停了预发布模型的网络评估,并引入了更严格的安全措施。测试现在必须在经过验证的离线沙箱中进行,并具有明确的限制和实时监控。一个新的分类器会阻止可疑的边界违规行为,结束测试,并提醒人类。Anthropic将逐案审查需要互联网接入的评估。

“除了专注于高风险评估和训练的努力外,我们将离线监控扩展到覆盖大多数其他形式的内部前沿智能体使用,”该公司写道。“我们还在内部推理上构建控制措施,以防止Anthropic员工意外运行缓解措施弱于上述措施的智能体。”

Claude事件发生在OpenAI的模型在7月入侵Hugging Face以获取网络安全测试答案的类似失败之后。调查人员发现,大约1200个智能体通过一个未经授权的留言板协调,其中约700个参与了这项行动。一些结束了自己的运行以帮助他人。

随着夏季AI驱动的黑客攻击的兴起,Anthropic、OpenAI和其他100多个组织后来呼吁加强网络防御,包括更严格的访问控制、威胁共享以及对AI智能体的更密切监督。