摘要
- OpenAI于9月1日表示,Astra达到了其准备框架中的“严重”级别,这是该公司有史以来第一款在网络安全方面被归类为如此高的模型。
- Astra在ExploitBench上获得了100%的满分,并且在基于今年夏天披露的V8浏览器漏洞构建的一个更新的内部测试中,自行发现并串联了两个先前未知的零日漏洞。
- Astra的高级网络安全能力的访问权限从一小群alpha测试者开始。
OpenAI表示,周二,未发布的模型Astra在其准备框架下已跨越了网络安全能力的“严重”门槛,这是该公司有史以来第一款被归入该类别的模型。
这意味着,许多人认为Astra是GPT-6而非额外模型的Astra,可以在没有人工逐步指导的情况下,发现先前未知的安全漏洞,并在许多加固的系统中构建有效的利用程序。

“我们现在相信Astra达到了我们准备框架下的严重网络安全能力门槛,”OpenAI写道。“这是我们指定为这一级别的第一款模型,需要在开发和发布前采取更强的保障措施。”
在该框架下,如果一个模型能够独立开发出针对多个加固的真实世界系统的功能性零日漏洞利用,或者能够仅凭一个高层目标就计划并执行针对高难度目标的完整网络攻击,则该模型达到“严重”级别。OpenAI 早期的模型,包括 GPT-5.6 Sol,最高仅达到该框架中较低的“高”级别。
在 ExploitBench 上,一个测试模型能否将已知软件漏洞转化为可用漏洞利用并以直接通过率评分的基准测试中,Astra 达到了完美的 100%。
为了排除记忆答案虚高该分数的可能性,OpenAI 构建了第二个测试,使用了 2024 年 6 月至 8 月期间披露的 Google V8 JavaScript 引擎中的 20 个高危漏洞。Astra 在任意代码执行率方面也击败了 GPT-5.6 Sol,且使用的输出令牌更少,在此过程中它还发现并串联了两个零日漏洞,OpenAI 仍在向受影响的维护者披露这些漏洞。
GPT-5.6 Sol 目前是 OpenAI 最好的模型。
在对加固浏览器和加固操作系统的实际测试中,Astra 构建了一条完整的入侵链,仅通过打开一个恶意 HTML 文件就突破了浏览器沙箱并在主机上执行命令。它还在加固操作系统中发现了多个缺陷,并将它们串联成一条从普通用户账户到 root 的权限提升路径。
OpenAI 表示,该模型在其自身测试中拒绝了 91.5% 的网络越狱尝试,而 GPT-5.6 Sol 的这一比例为 59%。Astra 最先进的网络安全能力的访问权限首先向一小部分 alpha 测试者开放,随后将通过 OpenAI 的 Daybreak Blue 计划(用于防御性安全工作)向更广泛的人群推出。
这一披露是在整个行业数周的紧张情绪之后进行的。就在几天前,OpenAI 暂停了 Astra 的开发,原因是该模型的网络和编码技能迅速提升,这一警告紧随另一个未发布的 OpenAI 系统之后,该系统在玩弄安全基准测试的同时串联漏洞入侵了 Hugging Face。OpenAI 表示 Astra 与该事件无关。
交易员们已经消化了快速转变的可能性。由 Decrypt 追踪的 Myriad 上的预测市场给 Astra(内部与代号 GPT-6 相关联)在 9 月 30 日前公开发布的概率为 72%,即使 OpenAI 在 8 月初暂停了开发,OpenAI 仍未设定公开发布日期。这些 概率 已变为 55% 倾向于在 2026 年 11 月前发布。
这一时机使 Astra 面临一个新的竞争对手。Anthropic 周二发布了 Fable 5.1 和 Mythos 5.1,而 Mythos 5.1 与早期的 Mythos 5 一样,仅保留给经过审查的网络安全和生命科学组织,而非普通公众。
Decrypt 在 6 月报道称,OpenAI 的 GPT-5.5-Cyber 在 CyberGym 上已经 超过了 Mythos 5,CyberGym 是一个基准测试,让 AI 代理针对来自真实开源项目的 1500 多个已知漏洞进行测试,并根据它们正确复现的漏洞数量进行评分。
两家公司此前都被传闻将在同一时间段内准备推出新的前沿模型,现在它们确实这样做了。Fable 5.1 于9月1日发布,OpenAI 表示 Astra 即将推出,其最强大的网络工具将首先通过 alpha 访问进行限制,之后是 Daybreak Blue。






