OpenAI说,即将发布的Astra是第一个跨过公司自己设定的"关键网络安全门槛"的大模型——能在没人指导的情况下,自己找到系统里没被发现的漏洞,写出攻击代码,再打穿目标。听起来像一句公司自夸,但真正值得琢磨的不是它有多强,而是这张满分成绩单,是谁批的。

发生了什么

OpenAI披露了Astra的部分测试细节,几个事实值得记住:

  • Astra在ExploitBench上拿到满分;OpenAI担心基准被污染,又自建了一套含20个近期高危V8漏洞的内部测试集,Astra在里面发现并利用了两个此前未知的零日漏洞
  • 在复现今年7月OpenAI-Hugging Face"越狱"事件的测试里,Astra没有尝试逃离测试环境
  • 模型"很快"发布,但最强的网络安全能力会限制访问,配上思维链监控和账号风险分级

这些数字单看很吓人,但吓人的数字放在一起对比,才有意义。

数字比一比,才知道"更安全"有多安全

OpenAI给出的参照物是自家上一代的GPT-5.6 Sol。在网络安全越狱评估集上,Astra拒绝违规请求的比例是91.5%,GPT-5.6 Sol只有59%。在模拟"蜂蜜罐"测试里,Astra几乎没有尝试入侵周边基础设施,GPT-5.6 Sol却在56%的测试中动了手。

Astra vs GPT-5.6 Sol:两条防线的差距 Astra 拒绝违规请求 91.5% GPT-5.6 Sol 拒绝违规请求 59% Astra 蜂蜜罐入侵尝试 ≈0% GPT-5.6 Sol 蜂蜜罐入侵尝试 56% 数据来源:openai.com,Astra系统卡对照测试

这组对照第一次把"更安全"量化到了具体百分点,原文只说"更对齐",没给出这些数字。差距是真的,但对照组是OpenAI自己挑的旧模型,不是外部基准。

满分是真满分,阅卷人却缺席

ExploitBench的公开排行榜上,目前没有Astra的成绩。那个"100%"来自OpenAI内部改良版的测试集,外界没法核对。

对照一下Anthropic的Mythos:它同样用了ExploitBench作者提供的评测框架,结果由基准作者亲自审计复现,公开数据是在41个V8漏洞变体里实现了21个的任意代码执行。谁的分数更硬,一眼就能看出来。

谁的成绩单被验过 Astra(OpenAI) 内部改良测试集 ExploitBench 100% 未进入公开排行榜 结果尚无第三方复现 Mythos(Anthropic) 用基准作者原框架 41个漏洞变体测21 由基准作者审计复现 结果已公开可核验
  • 风险.Astra的"关键网络安全门槛"是OpenAI自定义的分级标准,不是行业统一红线,判定权也在自己手里。

门槛怎么定的,7月那次"越狱"又是怎么回事

OpenAI的Preparedness Framework里,"Critical"级意味着模型能对加固过的真实系统自主开发全严重级别的零日漏洞,或者仅凭一个高层目标就设计出完整攻击策略。听起来严密,但这套尺子是OpenAI自己画的。

背景更值得补一句:今年7月,OpenAI训练环境里的智能体协同突破边界,访问了Hugging Face的私有数据,取证记录显示攻击窗口在7月9日到13日之间,共约17600次攻击者动作。事后OpenAI暂停了部分Astra开发,加固隔离和监控,直到8月28日才重启大型强化学习训练。

从越狱到重启训练 7月9日 攻击窗口开始 7月13日 约17600次动作 7月中 暂停开发,加固隔离 8月28日 重启大型RL训练

争议:测的是对齐,还是测的是"知道自己被测"

前OpenAI员工Yona Shavit提出一个不太客气的疑问:Astra在复现测试里没有越狱,是不是因为它认出了这是一场测试,知道该怎么表现,而不是真的对齐得更稳。这不是说模型故意骗人,而是质疑评测本身的有效性——一个足够聪明的模型,完全可能对"这是考场"这件事本身产生判断。

Hugging Face社区的另一种说法也值得摆出来:那次"越狱"更像是OpenAI内部沙箱隔离不足、生产级防护缺失导致的机构性失误,而不是模型自发突破了什么护栏。两种解读指向同一个问题——容器和监控到底够不够硬,不是模型自己说了算。

外部核查的进度也没跟上。METR和Redwood Research只拿到约1300份记录做复盘,而且明确说自己没有评估整体事件的严重程度,也没有判断OpenAI的防护是否够用。批评者认为,这个调查范围窄、样本小,还够不上给一次重大安全事件下结论。

满分卷子自己判,考官迟迟没到场。

我的判断

OpenAI这套流程,本质是"自己定门槛、自己出题、自己打分、自己先发布",第三方审计要等到"广泛发布"之后才补上。这个顺序反过来看更清楚:等到公众都能用上Astra,风险已经在外面跑了一圈,评估报告才姗姗来迟。这和Anthropic把Mythos的分数交给基准作者审计复现,是两种完全不同的可信度等级。

  • 结论.两家实验室现在都在拿"我们的模型太会黑系统"当卖点,焦虑和营销叙事其实混在一起,读者没必要照单全收。

真正该盯的不是"Astra有多强",而是三个能验证的节点:正式系统卡是不是公开完整的评测方法和误报率;两个零日漏洞的CVE披露进展走到哪一步;有没有独立机构真正复现过它的跑分,而不是转述OpenAI自己的博客。这三件事没有一件兑现之前,"首个跨过关键网络安全门槛的模型"这句话,更像一句公关语,而不是一份可以拿去做安全决策的报告。