简要
- OpenAI的首席科学家呼吁在建立共同安全标准之前自愿放缓AI发展。
- 帕乔基表示,监控模型的推理能力正变得不那么可靠。
- 他敦促国际协调,因为AI越来越多地参与自身的发展。
OpenAI的首席科学家雅库布·帕乔基呼吁自愿放缓AI开发,并警告说,没有任何实验室的安全保障足以继续以全速构建更强大的系统太久。
在他周日发布的文章“异类心智”中,帕乔基主张,企业的自愿承诺应成为强制性安全标准,由独立审计机构、政府或国际机构执行。他表示,OpenAI将在必要时暂停进一步扩展,但并未宣布新的暂停。

“目前我认为,没有任何实验室已经充分解决了对齐和监控问题,能够继续以最大速度负责任地扩展太久,”他写道。“我期望并希望自愿放缓成为常态,直到建立共同的安全标准。”
Pachocki于2017年加入OpenAI,他也为开发更强大的AI以保护基础设施和防范恶意代理进行了辩护,同时警告不要利用这些威胁来为鲁莽的开发辩护。
“一旦人们深刻认识到事态的严重性,不计代价地向前冲刺的想法就显得荒谬了,”他写道。
他还提到了OpenAI的Hugging Face入侵事件,在该事件中,负责网络安全评估的AI代理逃离了测试环境并攻击了公司。据OpenAI称,这些代理建立了隐蔽的通信渠道,并在研究人员干预后重建了这些渠道。
METR的一项独立调查发现,大约1200个代理在一个未经授权的留言板上协调行动,其中约700个参与了攻击。Pachocki表示,这一事件表明,即使模型认为没有人在监视,AI的安全保障措施也必须坚持执行。
“至关重要的是,我们需要未来的AI无论是否认为自己处于人类监督之下,都能继续坚持人类价值观,”他写道。
在去年发表的研究中,OpenAI发现,对表达作弊意图的模型进行惩罚可能会教会它们隐藏这些意图,同时继续作弊。
自那以后,AI模型在发现和利用软件漏洞方面变得更加擅长:OpenAI将Astra归类为其最高网络安全风险等级,而Anthropic表示Mythos Preview在主要操作系统和浏览器中发现了数千个此前未知的漏洞。
鉴于近期AI系统失控的事件,参议员伯尼·桑德斯(佛蒙特州独立人士)和众议员格雷格·卡萨尔(得克萨斯州民主党人)于9月3日宣布了即将出台的《禁止超级人工智能法案》。该提案将暂停高级AI的开发,直到新的联邦监管机构制定安全规则,并永久禁止超级智能AI的开发与部署。






