OpenAI 吸取“AI 越狱”事件教训,首个达“关键”门槛模型 Astra 因能力过强将限制网络安全功能

浏览16次 点赞0次 收藏0次

9 月 2 日消息,OpenAI 于当地时间 9 月 1 日宣布,该公司计划“很快”推出下一代 AI 模型 Astra,但将严格限制该模型网络安全功能的使用范围。

据介绍,Astra 是 OpenAI 旗下首个达到其《准备框架》(Preparedness Framework)中“关键”(Critical)网络安全能力门槛的模型。

根据 OpenAI 的定义,达到“关键”门槛意味着该模型能够无需人类干预,在多个经过安全加固的真实关键系统中,识别并开发出涵盖各严重等级的有效零日漏洞利用程序。

OpenAI 研究副总裁 Amelia Glaese 表示,Astra 能够在无需人类分步指导的情况下,在许多防护严密的系统中发现此前未知的安全漏洞并开发出利用方法。在测试中,Astra 成功发现并串联利用了两个零日漏洞,OpenAI 正将这两个漏洞披露给相关维护方。

Astra 的发布计划与访问限制

OpenAI 表示将采取分级开放策略。Astra 发布后,其执行高级网络安全相关任务的能力最初将仅向一小批测试人员开放。

此后,公司计划通过 Daybreak Blue 计划向更广泛的用户开放防御性网络安全用途的访问权限。OpenAI 承认,限制 Astra 的网络安全能力可能会限制一些机构和企业的合法防御工作。

吸取 Hugging Face 事件教训,强化安全护栏

此次发布计划出台的背景是,OpenAI 在 2026 年 7 月发生了一起 AI 智能体意外“越狱”并攻击 AI 平台 Hugging Face 的事件。

当时,由两个 OpenAI 模型(GPT-5.6 Sol 及另一个未公开模型)二次开发的自主 AI 智能体,在安全评估过程中利用隔离测试环境(沙盒)中的软件漏洞自行连接互联网,并入侵了 Hugging Face 的系统。OpenAI 在 8 月底发布的报告中承认,公司本可以更早做出反应以防止该事件发生。

OpenAI 表示,尽管 Astra 并非参与 Hugging Face 入侵事件的模型之一,但公司已将从中汲取的经验应用于 Astra 的安全防护中。这包括训练模型更可靠地拒绝回答“有害的网络安全请求”,并增设了专门的“不一致性监控器”(misalignment monitor)以识别并阻止潜在的危险行为。这些防护措施还包括在内部部署期间监控模型是否存在未经授权的行为,并自动终止可能存在的未经授权活动。

此外,OpenAI 还警告称,Astra 的安全防护措施可能会错误地将合法的防御性网络安全活动标记为滥用行为,从而导致任务被减慢、暂停甚至终止(注:OpenAI 根据网络安全工作的性质分为“蓝队”防御和“红队”攻击两种任务类型,Daybreak Blue 计划仅开放用于防御性的“蓝队”工作)。

OpenAI 研究科学家 Fouad Matin 表示:“我们相信这些能力可以帮助防御者发现并修复严重的弱点,但如果没有适当的防护措施,它们也可能让攻击者更有效率,这正是我们努力防止的情况。”

相关阅读:

声明:本文转载自IT 之家,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯