摘要

  • OpenAI 的首席科學家呼籲在建立共同安全標準之前自願放緩開發速度。
  • 帕喬基表示,監控模型推理能力變得越來越不可靠。
  • 他敦促在 AI 承擔更多自身開發工作之際進行國際協調。

OpenAI 的首席科學家雅庫布·帕喬基呼籲自願放緩 AI 開發速度,並警告說,沒有任何實驗室的安全措施足以在更長時間內以全速繼續構建更強大的系統。

在他於週日發表的文章「外星思維」中,帕喬基主張,自願性的公司承諾應成為強制性的安全標準,並由獨立審計機構、政府或國際機構執行。他表示,OpenAI 會在必要時暫緩進一步擴展,但並未宣布新的暫停措施。

Myriad:特斯拉股價會漲多高?點擊做出您的預測。
Myriad:特斯拉股價會漲多高?點擊做出您的預測

「目前我認為,沒有任何實驗室已經充分解決了對齊和監控問題,足以在更長時間內以最大速度負責任地擴展,」他寫道。「我期望並希望自願放緩成為常態,直到建立共同的安全標準。」

Pachocki於2017年加入OpenAI,他也為開發更強大的AI以保護基礎設施和防範惡意代理辯護,同時警告不要利用這些威脅來為魯莽的開發辯護。

「一旦人們內化了風險的嚴重性,不惜一切代價向前衝的想法就顯得荒謬。」他寫道。

他也提到了OpenAI的Hugging Face入侵事件,當時負責網路安全評估的AI代理逃離了測試環境並攻擊了該公司。根據OpenAI的說法,這些代理建立了隱蔽的通訊管道,並在研究人員干預後重建了這些管道。

METR的獨立調查發現,約有1200個代理在一個未經授權的留言板上協調,其中約700個參與了攻擊。Pachocki表示,這起事件說明了為什麼即使模型認為沒有人在看,AI的安全保障也必須維持。

「至關重要的是,我們需要未來的AI無論是否認為自己處於人類監督之下,都能繼續秉持人類價值觀。」他寫道。

在去年發表的研究中,OpenAI發現,對表達作弊意圖的模型進行懲罰,可能會教會它們隱藏這些意圖,同時繼續作弊。

自那以後,AI模型在發現和利用軟體漏洞方面變得更加能幹:OpenAI將Astra列為其最高網路安全風險等級,而Anthropic則表示Mythos Preview在主要作業系統和瀏覽器中發現了數千個先前未知的漏洞

參議員伯尼·桑德斯(佛蒙特州無黨派)和眾議員格雷格·卡薩爾(德州民主黨)援引近期AI系統逃脫人類控制的事件,於9月3日宣布了即將推出的《禁止人工超級智慧法案》。該提案將暫停先進AI的開發,直到新的聯邦監管機構制定安全規則,並永久禁止超級智慧AI的開發和部署。