目前结论
9月1日,OpenAI 宣布其未发布的 Astra 模型达到其 Preparedness Framework 下的“严重”网络安全级别,这是首个获得该级别的模型。Astra 在 ExploitBench 上获得 100% 满分,并自主发现、串联利用了 Google V8 JavaScript 引擎中两个此前未知的零日漏洞。 这是AI安全与能力领域的前沿实验室里程碑,表明模型能够自主对加固后的真实世界系统执行完整入侵链条。它很可能影响访问限制、防御性AI计划,以及业界围绕灾难性网络风险的讨论。 OpenAI 表示 Astra 超过了此前最高为“高级”级别的 GPT-5.6 Sol;在内部测试中,Astra 拒绝了 91.5% 的网络越狱尝试,而 GPT-5.6 Sol 为 59%。早期访问从小型 alpha 测试组开始,后续将通过 Daybreak Blue 防御性安全计划扩大,目前尚未设定公开发布日期。
进展时间线
1 次实质进展- #01
OpenAI Astra 成首个具备“严重”黑客能力的AI模型
9月1日,OpenAI 宣布其未发布的 Astra 模型达到其 Preparedness Framework 下的“严重”网络安全级别,这是首个获得该级别的模型。Astra 在 ExploitBench 上获得 100% 满分,并自主发现、串联利用了 Google V8 JavaScript 引擎中两个此前未知的零日漏洞。 这是AI安全与能力领域的前沿实验室里程碑,表明模型能够自主对加固后的真实世界系统执行完整入侵链条。它很可能影响访问限制、防御性AI计划,以及业界围绕灾难性网络风险的讨论。 OpenAI 表示 Astra 超过了此前最高为“高级”级别的 GPT-5.6 Sol;在内部测试中,Astra 拒绝了 91.5% 的网络越狱尝试,而 GPT-5.6 Sol 为 59%。早期访问从小型 alpha 测试组开始,后续将通过 Daybreak Blue 防御性安全计划扩大,目前尚未设定公开发布日期。
来源依据:Decrypt