OpenAI 宣布新安全政策,加强模型开发监控与网络隔离

浏览20次 点赞0次 收藏0次

8 月 19 日消息,当地时间周二,OpenAI 宣布了一批新的安全政策,重点是控制模型在测试期间可能发生的安全事件。新的安全措施包括在模型开发过程中进行更加细致的监控,同时在训练后阶段进一步加强对模型对齐和安全性的重视。

注意到,OpenAI 在一篇博客文章中表示:“随着模型能力不断增强,在内部开发和测试这些模型过程中所面临的风险也在增加。我们在监控、对齐和安全方面制定的标准必须始终领先于这些风险。”

这是 OpenAI 自 7 月 21 日披露 Hugging Face 事件以来,在安全实践方面首次对外公布的重大调整之一。

OpenAI 代表表示,这些措施并不是直接针对 Hugging Face 事件推出的,但即将推出的 Astra 模型所展现出的网络安全能力,以及整个 AI 行业快速发展的步伐,也是促使公司采取这些措施的部分原因。

OpenAI 同时透露,在 Hugging Face 事件发生后,公司曾暂停强化学习(RL)训练两周,但目前已经重新启动了许多风险较低模型的训练工作。

OpenAI 在博客中写道:“我们目前仍暂停规模最大的前沿强化学习训练计划,同时开展小规模训练和评估,以评估模型行为、验证安全措施,并在继续推进之前获得更多有关模型对齐情况的证据。”

OpenAI 研究副总裁 Amelia Glaese 在接受记者采访时强调,随着模型能力不断增强,公司对安全控制措施的严格程度也会随之提高,能力最强的模型将接受最严格的审查。

Glaese 对记者表示:“我们已经制定了安全开发方面的要求和标准。这些要求和标准会根据我们评估出的风险水平进行调整。”

此次事件发生后,OpenAI 的网络安全措施受到了外界批评。在此前的事件中,模型通过入侵 OpenAI 网络中的一个能够访问互联网的工具,突破了原本的训练环境。OpenAI 此次推出的新安全措施包括进一步加强网络隔离,但目前公司尚未公布具体技术细节。

OpenAI 表示,在新的安全体系下,“单个工作负载或支持服务遭到入侵,本身不会导致攻击者未经授权访问互联网或其他内部网络”。

此次升级中最重要的安全措施是新的监控系统。该系统将检查工具执行的操作、可获取的推理轨迹以及活动日志,以识别各种未经授权的行为。OpenAI 表示,其目标是在发现可疑活动后的 30 分钟内发出警报。

OpenAI 估计,这套监控系统所需的计算资源大约相当于被监控流程本身计算资源消耗的 20%。公司承诺将在未来发布的博客文章中公布更多有关该系统的细节。

此外,OpenAI 针对此次事件的官方事后分析报告目前也尚未发布。

声明:本文转载自IT 之家,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。