OpenAI 称 Astra 触及 Preparedness Framework 网络安全 Critical 阈值
ICYMI: OpenAI's Astra crosses Critical cybersecurity threshold
OpenAI 表示 Astra 已在其 Preparedness Framework 下跨过网络安全能力的 Critical 阈值,成为该公司首个达到该级别的模型。
OpenAI 首次有模型触及 Preparedness Framework 的 Critical 网络安全阈值,读者可了解其分级发布与安全限制安排。
OpenAI 表示,Astra 已在其 Preparedness Framework 下跨过关键网络安全能力阈值,成为该公司首个达到该级别的模型。在拥有合适工具和访问权限的情况下,Astra 能够发现未知漏洞,并在加固系统上开发出可用的漏洞利用程序,而无需人工指导每一步。OpenAI 计划很快发布该模型,但其最强的网络能力将首先提供给一小部分 alpha 测试者,随后通过 Daybreak Blue 访问权限向更广泛的防御用途开放。
OPENAI 🔥:Astra 将“很快可用”,但其网络安全能力将受到限制。
> Astra 在 ExploitBench 上得分 100%。
— 🚨 AI News | TestingCatalog (@testingcatalog) September 1, 2026
> OpenAI 构建了一个更复杂的“ExploitBench - Internal Port”基准测试,包含 20 个最近披露的高危 V8 漏洞。… https://t.co/xKz3xloRnV pic.twitter.com/Z63iY3SHE9
OpenAI 将公开和私有基准测试与专家主导的测试相结合。Astra 在 ExploitBench 上得分 100%,在漏洞发现和漏洞利用开发方面,其能力显著更强,且 token 效率远高于 GPT-5.6 Sol。在一组内部收集的 20 个近期披露的高危 V8 漏洞上,Astra 以远少的输出 token 实现了更高的任意代码执行率。它还发现了两个零日漏洞,并将其用于一条漏洞利用链,目前正向维护者披露。这些结果反映的是 Daybreak Blue 访问权限下的表现,而非默认生产配置。
在实际操作评估中,Astra 构建了一条浏览器入侵链,在打开 HTML 文件时逃逸沙箱并执行主机命令。它还将一个加固操作系统中的多个漏洞组合起来,将非特权用户提权至 root。OpenAI 表示,这些结果达到了其针对加固系统零日漏洞利用或从高层目标出发的端到端攻击的 Critical 标准。
OpenAI 推迟了 Astra 的部分训练和发布,同时增加了拒绝机制、安全分类器、离线检测、威胁阻断、跨对话上下文处理,以及可阻止未授权活动的监控。在网络越狱评估中,Astra 拒绝了 91.5% 的请求,而 GPT-5.6 Sol 为 59%。在基于 Hugging Face 事件的蜜罐测试中,Astra 没有针对周边系统,也没有试图绕过自动审查拒绝。
对 OpenAI 而言,Astra 是其 Preparedness Framework 如何治理能够产生重大影响的模型的一次早期测试。该公司表示,随着红队测试、回归测试和 24/7 响应的持续进行,高级访问权限将谨慎扩大。思维链监控将检查推理和行动是否存在未授权行为,而在 ChatGPT、Codex 或 API 中,合法任务可能会被减慢、暂停或停止。发布时的系统卡将提供有关 Astra 安全性、安保、对齐和评估的更多细节。
来源:TestingCatalog · testingcatalog.com