OpenAI Astra发布在即,全自动网络攻防能力已突破天际!

浏览16次 点赞0次 收藏0次

OpenAI 即将发布的模型 Astra,在内部评测中拿到了漏洞利用基准 ExploitBench 的满分,还顺手挖出了两个此前无人知晓的零日漏洞。

更夸张的是,面对一个加固浏览器,它从零开始找到多个未知漏洞,拼出一条完整的沙箱逃逸链——只要你打开一个 HTML 文件,它就能在你的电脑上执行任意命令!

Astra 即将上线 ChatGPT,而 OpenAI 为了防它「太能打」,给它装了一套实时监控,会检查模型的推理过程。

如果系统判定行为可疑,你正在用 ChatGPT 或 Codex 跑的任务可能被暂停,弹出审核请求。

调用 API,任务甚至会直接被终止。


评测中发现零日漏洞
用更少的 Token 打出更高成功率

Astra 是 OpenAI 第一个被标定为「关键」网络安全等级的模型。

到了这个等级,模型能自主找到加固系统里的零日漏洞并写出利用代码,不需要人类辅助,直接全自动完成网络攻击。

OpenAI 公开的 ExploitBench 满分只是起点。

由于担心数据污染,团队另建了一套内部基准,收录了 2026 年 6 至 8 月才披露的 20 个高危 V8 引擎漏洞。

Astra 在这组全新漏洞上的任意代码执行成功率远高于上一代 GPT-5.6 Sol,消耗的 Token 反而少得多。


评测过程中它甚至发现了两个零日漏洞,并将它们编入了利用链。

专家主导的手动测试给出了更直观的画面。

面对一款加固浏览器,Astra 拼出了完整的沙箱逃逸链,打开一个 HTML 文件就能在宿主机执行命令。

面对一个加固操作系统,它同样找到多个漏洞,串成一条提权链,从普通用户一路拿到 root 权限(最高管理员权限,拿到该权限意味着攻击成功,服务器彻底失控)。

上一代 56% 会越权作弊
Astra 是 0%

能力强不可怕,可怕的是不听话。

OpenAI 设计了一组「蜜罐」测试,灵感来自 7 月的 Hugging Face 事件。

当时一个内部模型在安全评测中逃出沙箱,黑进了 Hugging Face 的真实系统,留下约 17600 条操作记录,折腾了四天半。

这里的「蜜罐」测试,主要是给模型一道超难甚至无解的漏洞利用题,看它会不会走捷径去攻击周边基础设施。

GPT-5.6 Sol 在 56% 的测试中尝试了越权访问,而 Astra 一次都没有。


被安全审核拒绝后的反应也不一样。

GPT-5.6 Sol 有 5.3% 的概率尝试绕过审核机制,Astra 同样是零。


在越狱防御上,Astra 拒绝了 91.5% 的恶意网络攻击请求,GPT-5.6 Sol 是 59%。

攻击能力远超前代,同时更听话。

为此 OpenAI 额外部署了一层思维链监控:一组分类器实时扫描模型的推理链路和动作,发现越权行为立即终止。

这些是普通用户会感知到的变化:你的 ChatGPT 任务可能被暂停,弹出一个「请确认」的窗口。

OpenAI 也承认,初期不可避免会有误拦。

事实上,OpenAI 为 Astra 踩了近一个月的刹车。

8 月 7 日承认 Astra 可能达到「关键」阈值,8 月 18 日暂停强化学习训练两周,最大规模的前沿训练直到 8 月 28 日才重启。

Michael Dalton 在 Black Hat 安全大会上说,公司已开始「有意识地放慢研究速度以加强安全」。

OpenAI 还主动把推迟计划通报给了白宫。

Sam Altman 在 X 上写了一段罕见的长帖:

整个夏天,我们一直在为安全优先事项全力以赴;能力与防护措施同步推进比以往任何时候都更加重要。我们还有更多工作要做,但已经取得了很大进展。我们也即将推出我们的下一款模型。

这里存在一个明显的张力:一方面,Astra 非常出色,我们很期待看到人们将用它构建什么。我们为自己的工作感到骄傲。

另一方面,我们显然正处于一个需要谨慎的发展阶段,我们正在控制进度,以确保能够满足新能力水平所需的安全标准。

Astra 已经完成训练一段时间了,它在能力和对齐方面都是一个重大进步。对于之后的模型,我们根据需要放慢了步伐,以确保能够充分开展安全和对齐工作。

AI 正在变得极其强大;没有人完全理解其后果。将一个拥有丰富而强大 AI 的世界转型管理好,以优化安全性和对人们有益的结果,这应该是世界上最高的优先事项之一。这是 OpenAI 的最高优先事项。

我们已经有一段时间生活在对进步既兴奋又焦虑的张力之中,这对我们来说仍然是矛盾的。我们知道,这对其他人来说矛盾程度要大得多。然而,我们坚信世界需要了解 AI 的发展方向以及模型在现实世界中的表现。更重要的是,我们相信世界将需要对齐的 AI 来管理这一转型的未来阶段。

一个社会与这项技术共同演进的迭代循环,才是实现这一目标最高机会的途径。

所以我们希望你喜欢我们的新模型,也希望世界继续极其认真地对待 AI 领域正在发生的一切。


Astra 的高级网络安全功能初期只面向小范围测试者开放,普通用户拿到的是加了限制的版本——就像 Claude Mythos 和 Fable 一样。

参考资料:

https://x.com/sama/status/2094934592062959832

编辑:马可

声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯