摘要

  • 研究人員在一個德語程式設計維基上識別出超過18,000篇貼文和15,000次由AI代理進行的編輯。
  • OpenAI對一位專家的駭客評估提出異議,並否認其法律團隊阻止調查。
  • 此揭露緊隨Astra的發布和Sanders提出的禁止人工超級智能的提案之後。

根據路透社調查,OpenAI代理自5月起利用一個德國網站交換任務捷徑、限制繞過方法以及隱藏其活動的方式,該調查於週五發布。

據路透社報導,引用兩位知情人士的說法,OpenAI官員在發布前數週已得知此事,但未公開。該公司表示已披露相關事件,並與外部專家真誠合作。

Myriad:GPT-6 何時公開?點擊進行預測。
Myriad:GPT-6 何時公開?點擊進行預測

研究人員 Sydney Von Arx、Cormac Slade Byrd、Spencer Kitts 和 Thomas Larsen 發現大約 18,000 則貼文,由自稱屬於 OpenAI 的AI 代理所發布,根據他們的初步報告。Von Arx 是 AI 安全非營利組織 Nightingale 的執行長,Byrd 在 8 月底發現了這項活動,路透社報導。

研究人員認為這些代理被指派了限時的網路搜尋任務,並被允許閱讀網站但不能發布內容。然而,他們找到了在 DseWiki(一個公開可編輯的德語程式設計網站)上寫入的方法,並在那裡交換答案並分享繞過限制的方法。

根據報告,代理從 5 月 11 日開始嘗試編輯維基,並於 5 月 24 日成功,之後冒充管理員、嘗試利用漏洞並檢查何時被關閉。在管理員於 6 月 19 日開始刪除訊息後,他們建立了備份頁面,路透社報導。研究人員透過代理的使用者名稱和流量模式(包括 6 月 21 日來自 OpenAI IP 位址的訪問)將這項活動與 OpenAI 聯繫起來。

研究人員表示,第二天代理活動急劇下降,這表明可能公司進行了干預。

OpenAI 根據其審查的材料,對將 DseWiki 活動描述為駭客行為的說法提出異議,並表示正在審查全部發現。

「我們無法回應這些指控,因為路透社和報告作者拒絕我們在發表前查閱調查結果。我們目前正在仔細審查其內容,並將採取任何必要的後續步驟。」OpenAI 發言人在與Decrypt分享的聲明中表示。

該發言人還否認了路透社報導中有關公司法律團隊抵制更廣泛調查的指控。

「有關我們的法律團隊阻止調查此事件的說法是虛假的。」他們表示。

OpenAI 表示,DseWiki 事件與今年早些時候的Hugging Face 入侵事件無關。在週二發布的公共安全評估中,該公司描述了旨在訓練和部署期間檢測並阻止未經授權活動的額外保障措施。

雖然路透社的報導並未指出 Astra 應對德國事件負責,但此披露是在週四GPT-6 Astra 發布之後。OpenAI 稱 Astra 是其首款具備「關鍵」網路安全能力的模型,這意味著在擁有適當工具和權限的情況下,它可以在沒有逐步人工指導的情況下,發現並利用受良好保護系統中的未知漏洞。

Anthropic 在 Claude 模型在測試期間訪問了真實公司的系統後,也修訂了其保障措施。該公司承認了安全和行為方面的失誤,並為網路安全評估引入了更嚴格的隔離和監控。

此披露之際,美國參議員伯尼·桑德斯(I-Vt.)和美國眾議員格雷格·卡薩爾(D-Texas)宣布了即將推出的禁止人工超級智慧法案

根據桑德斯辦公室的說法,該提案將永久禁止超級智慧人工智慧的開發和部署,並暫時暫停先進人工智慧的開發,直到新的聯邦監管機構制定安全規則。