AI 安全
OpenAI 称 Astra 已达到“关键级”网络安全能力门槛
OpenAI 表示,即将推出的 Astra 是首个在其 Preparedness Framework 下达到关键级网络安全能力门槛的模型,因此发布前需要更强保护措施。
OpenAI 9 月 1 日表示,其即将推出的前沿模型 Astra 已达到公司 Preparedness Framework 下的“关键级”网络安全能力门槛。这一判断之所以重要,是因为这是 OpenAI 首次把一个模型列入该等级。按照公司定义,这类系统在具备合适工具和访问权限时,能够发现此前未知的安全漏洞,并在缺少逐步人工指导的情况下,为许多防护较强的系统开发利用方式。路透社也报道称,OpenAI 官员在电话会上表示,Astra 在发现漏洞方面强于目前公开可用的最先进 OpenAI 模型,并且完成相关任务所需计算量更少。
这并不意味着 Astra 会不受限制地发布。OpenAI 称,过去数周公司推迟了 Astra 部分开发和发布安排,以加强针对网络滥用和模型未授权行为的保护。公司计划很快开放 Astra,但最先进的网络安全能力会首先面向一组测试者,随后通过 Daybreak Blue 扩大防御性使用。这反映出前沿 AI 市场正在发生变化:最新模型不再只是普通软件升级,而越来越像需要评估、监控和分层访问的双用途系统。
OpenAI 的评估结合了公开与私有自动化基准,以及专家主导的测试。公司称 Astra 在 ExploitBench 上取得 100% 分数,该基准用于评估模型根据已知漏洞开发利用代码的能力。为降低数据污染担忧,OpenAI 又构建了内部基准,包含 2026 年 6 月至 8 月披露的 20 个高严重性 V8 漏洞。公司称,在这组测试中,Astra 用更少输出 token 达到了远高于 GPT-5.6 Sol 的任意代码执行率。评估期间,模型还发现并使用了两个零日漏洞组成利用链,OpenAI 表示正在向维护者披露。
公司还描述了针对加固浏览器和操作系统的专家测试。Astra 在测试中发现了此前未知的漏洞,并把它们组合成可运行的利用链,其中包括浏览器被打开恶意 HTML 文件后逃逸沙箱并在主机上执行命令。OpenAI 强调,这些结果反映的是模型在 Daybreak Blue 访问条件下的能力,而不是默认生产配置。即便如此,这些细节也解释了为什么 Astra 被列入更严肃的风险级别:同样的能力可以帮助防御者更快发现缺陷,也可能在被滥用时降低高级攻击门槛。
OpenAI 表示,Astra 的保护措施包括更可靠地拒绝有害网络请求、系统级分类器、跨会话监控,以及能够停止潜在未授权活动的控制机制。公司称,在网络越狱评估中,Astra 对相关请求的拒绝率为 91.5%,而 GPT-5.6 Sol 为 59%。高风险账户还会适用更保守的行为边界。OpenAI 也把此前 Hugging Face 事件的经验纳入发布计划;在那起事件中,网络评估环境配置失误导致 AI agent 触及第三方系统。Astra 并未参与该事件,但相关教训显然影响了这次发布策略。
对用户来说,直接影响可能是更多摩擦。OpenAI 提醒,额外检查有时会放慢、暂停或停止合法工作,包括防御性网络安全任务。在 ChatGPT 或 Codex 中,如果监控系统标记某项活动,用户可能需要人工确认;在 API 场景中,任务可能直接停止。Astra 因而不仅是模型能力里程碑,也是治理机制的一次现实测试。它说明前沿 AI 公司正开始执行过去看似理论化的安全阈值,同时也把行业难题摆到台前:如何把更强的 AI 工具交给防御者,而不让它变成普遍可得的进攻性网络能力。