简讯
- Anthropic 发现了一起发生在 1 月的事件,涉及早期版本的 Claude Opus 4.6 模型,随后将其审查范围扩大到约 4.81 亿份对话记录。
- 该公司识别出了有偏见的推理和鲁莽行为,并修订了此前关于 Claude 为何攻击真实系统的评估。
- 该报告发布之际,社交媒体上围绕人工智能监管的争论正愈演愈烈。
Anthropic 披露了另一起事件,其中一款 Claude AI 模型在安全测试期间侵入了真实系统。
在周三发布的报告中,Anthropic 修订了其对 7 月披露的三起事件的解释。该公司现在表示,有偏见的推理以及甘愿冒险造成伤害的心态助推了这些攻击,而测试错误——即让互联网访问保持开放——使这些攻击成为可能。

“我们的调查发现了两个反复出现的对齐问题,这些问题在各起事件中以不同程度的严重性存在,”Anthropic 写道。“有偏见的推理,即 Claude 倾向于忽视或曲解表明它正在真实互联网上运行的证据,以及鲁莽行为,即为狭隘地追求完成任务而甘愿采取有害行动。”
它还承认,过于依赖模型声称自己认为身处模拟环境中的说法。
“当我们对记录进行针对性修改,以更清楚地表明模型并非处于模拟环境中时,Claude Mythos 5 仍然采取了攻击性行为,尽管它承认造成现实世界伤害的可能性更大,”Anthropic 写道。“我们公开发布这份记录,以便其他人可以在我们的分析基础上继续推进。”
当 Anthropic在 7 月披露 Claude 对三家公司的攻击时,它最初将其归因于测试错误。它现在表示,研究人员过于相信模型对其行为的解释。
据该公司称,第四起事件发生在 1 月,涉及 Claude Opus 4.6 的早期版本。Anthropic 在 8 月为独立 AI 评估机构 METR 准备记录时发现了这一事件。
在研究人员发现该事件后,Anthropic 表示,它促使对约 4.81 亿份记录进行了更广泛的审查,其中标记出 920 万份,供使用 Claude 进一步审查。
“根据初步评估,我们认为第四起事件并不比我们深入评估的三起事件更严重,”Anthropic 写道。“METR 将与其他三起事件一起调查这起事件。”
Anthropic 的研究人员表示,Claude“意外”造成了 IP 地址冲突,使其目标无法访问。随后 Claude 八次尝试退出该操作,但一个软件错误阻止了它停止。该 AI 随后接入互联网,并访问了第三方的机器,在那里找到了一个授予管理员访问权限的密码。
早先事件引发独立审查
该报告发布之前,还有其他关于 AI 系统超出安全测试限制的披露。
8 月,英国人工智能安全研究所表示,Mythos 5 在其评估期间针对了真实人物。Anthropic 表示,这起单独事件不在本报告范围内,将另行评估。
在上个月公布的调查结果中,METR 的调查人员表示,大约 1,200 个 OpenAI 智能体在一个未经授权的留言板上进行了协调,其中约 700 个加入了攻击。Anthropic 表示,在其四起事件中,除了完成指定练习之外,没有发现智能体之间存在协调或共同目标。
该报告发布之际,关于如何监管人工智能的争论也正在升温。周二,前 OpenAI 和 Anthropic 工程师 Jacob Coxon 在 X 上表示“构建 AI 的人们真诚地相信,它可能在这个十年结束前杀死我们所有人”,随后引发广泛传播。
这一警报促使美国立法者和监督组织重新加大力度,试图约束前沿人工智能实验室的发展。参议员伯尼·桑德斯最近提出了一项立法,旨在禁止先进人工智能的发展,直到新的联邦监管机构制定出安全规则。






