簡介

  • OpenAI 於 9 月 1 日表示,Astra 已達到其「準備框架」中的「嚴重」等級,這是該公司有史以來第一款在網路安全方面被歸類為此等級的模型。
  • Astra 在 ExploitBench 上獲得 100% 的完美分數,並且在一個基於今年夏天披露的 V8 瀏覽器漏洞所建立的較新內部測試中,自行發現並串連了兩個先前未知的零日漏洞。
  • Astra 的高級網路安全功能的存取權限,將從一小群 alpha 測試者開始。

OpenAI 表示,週二,未發布的模型 Astra 已在其「準備框架」下跨越了網路安全能力的「嚴重」門檻,這是該公司有史以來第一款被歸入該類別的模型。

這意味著 Astra(許多人認為它是 GPT-6 而非額外的模型)可以在沒有逐步指導的情況下,自行發現先前未知的安全漏洞,並在許多強化系統上建立可運作的漏洞利用程式。

Myriad:OpenAI 何時會發布 GPT-6?點擊進行預測。
Myriad:OpenAI 何時會發布 GPT-6?點擊進行預測

「我們現在相信 Astra 已達到我們『準備框架』下的嚴重網路安全能力門檻,」OpenAI 寫道。「這是我們指定為此等級的第一款模型,並且在開發期間和發布前需要更強的安全防護措施。」

在此框架下,如果一個模型能夠獨立開發出針對多個強化真實系統的功能性零日漏洞利用,或者能夠僅從高層目標出發,計劃並執行對艱難目標的完整網絡攻擊,則該模型被視為達到「嚴重」級別。OpenAI 早期的模型,包括 GPT-5.6 Sol,最高僅達到框架中較低的「高」級別。

在 ExploitBench 上,這是一個測試模型能否將已知軟件漏洞轉化為可用漏洞利用,並以直接通過率進行評分的基準測試,Astra 達到了完美的 100%。

為了排除記憶答案對分數的影響,OpenAI 構建了第二項測試,使用了 Google V8 JavaScript 引擎在 6 月至 8 月期間披露的 20 個高嚴重性漏洞。Astra 在任意代碼執行率方面也擊敗了 GPT-5.6 Sol,且使用的輸出令牌更少,在此過程中,它發現並串聯了兩個零日漏洞,OpenAI 仍在向受影響的維護者披露這些漏洞。

GPT-5.6 Sol 目前是 OpenAI 最好的模型。

在針對強化瀏覽器和強化操作系統的實際測試中,Astra 構建了一條完整的入侵鏈,僅通過打開惡意 HTML 文件就突破了瀏覽器沙箱並在主機上執行了命令。它還發現了強化操作系統中的多個缺陷,並將它們串聯成一條從普通用戶帳戶到 root 的權限提升路徑。

OpenAI 表示,該模型在其自身測試中拒絕了 91.5% 的網絡越獄嘗試,高於 GPT-5.6 Sol 的 59%。Astra 最先進的網絡安全能力的訪問權限從一小部分 alpha 測試者開始,隨後通過 OpenAI 的 Daybreak Blue 計劃(用於防禦性安全工作)向更廣泛的用戶推廣。

這一披露是在行業數週的緊張情緒之後進行的。就在幾天前,OpenAI 暫停了 Astra 的開發,因為該模型的網絡和編程技能快速提升,這一警告緊隨另一個未發布的 OpenAI 系統之後,該系統在玩弄安全基準測試的同時串聯漏洞入侵了 Hugging Face。OpenAI 表示 Astra 與該事件無關。

交易員們已經預期了快速轉變。由 Decrypt 追踪的 Myriad 上的預測市場給 Astra(內部與代號 GPT-6 相關)在 9 月 30 日前公開發布的 概率為 72%,即使在 OpenAI 8 月初暫停之後也是如此,而 OpenAI 仍未設定公開發布日期。這些 概率 已變為 55% 支持在 2026 年 11 月前發布。

這一時機使 Astra 面對一個新的競爭對手。Anthropic 於週二發布了 Fable 5.1 和 Mythos 5.1,而 Mythos 5.1 與早期的 Mythos 5 一樣,僅限於經過審查的網絡安全和生命科學組織使用,而非面向公眾。

Decrypt 在 6 月報導稱,OpenAI 的 GPT-5.5-Cyber 已經在 CyberGym 上擊敗了 Mythos 5,CyberGym 是一個基準測試,讓 AI 代理對抗來自真實開源項目的 1,500 多個已知漏洞,並根據它們正確重現的數量進行評分。

两家公司此前都被传闻将在相近的时间窗口内准备推出新的前沿模型,如今它们确实如此。Fable 5.1 于9月1日发布,OpenAI 表示 Astra 即将推出,其最强大的网络工具将首先通过 alpha 访问进行限制,之后是 Daybreak Blue。