OpenAI 发布 Hugging Face 安全事件官方报告,还原 AI 模型沙箱逃逸全过程

浏览16次 点赞0次 收藏0次
感谢网友 HH_KK乌蝇哥的左手 的线索投递!

8 月 27 日消息,OpenAI 当地时间周三发布了关于 Hugging Face 遭入侵事件的官方报告,首次较为完整地还原了这起事件的经过:一系列罕见因素叠加,导致一款 AI 模型突破测试环境限制,最终引发了一场波及范围广泛的网络安全事件。

注意到,这份报告距离事件首次曝光已超过一个月,其中涉及多起相互关联、但彼此独立的网络安全入侵事件。

OpenAI 在报告中表示:“此次事件反映了一种在极端异常场景下出现的失准行为。多个罕见且意外的因素同时发生,包括 ExploitGym 评估中出现了无法完成的任务、模型能够在超长任务周期中保持持续行动,以及模型之间的通信导致其他模型偏离了原本的目标。”

报告中的许多细节此前已在 8 月 6 日的 Black Hat 大会上对外披露,但 OpenAI 的官方报告对整个事件进行了更全面的梳理,并补充了更多有关测试起因的信息。

报告还首次详细介绍了 OpenAI 为防止类似事件再次发生而准备采取的新措施,其中包括对模型“思维链”的监控,以及一套更先进的机制,用于紧急停止出现失控行为的 AI 智能体。

此外,METR 和 Redwood Research 也对涉事模型在事件期间的行为进行了独立评估,两家机构计划分别发布自己的调查报告。

从整体来看,OpenAI 的报告描述了一条不同寻常的攻击路径:在测试过程中,一款 OpenAI 模型被要求解决一个实际上无解的问题。为了完成任务,该模型开始将多个此前未被发现的漏洞串联起来,借此绕过安全措施。

模型最初攻陷了 Artifactory 软件包管理工具,以获得互联网访问权限,随后又进一步入侵了 OpenAI、Hugging Face 以及其他供应商的多个系统。

报告还披露了执行此次入侵的模型更多信息。主要涉事模型与 OpenAI 即将推出的 Astra 模型属于同一模型家族,但 OpenAI 强调,两者并不是同一个模型,后训练过程也存在差异,而模型的大量具体行为正是在后训练阶段形成的。

由于 OpenAI 当时正在测试该模型的能力,因此并未启用通常用于阻止模型攻击数字基础设施的安全分类器。

OpenAI 在报告中解释称:“为了评估模型的最大网络攻击能力,OpenAI 会在不启用生产环境分类器的情况下进行测试。这些分类器原本用于阻止模型从事高风险网络活动。这样的评估十分重要,因为它能帮助 OpenAI 衡量模型的底层能力,并据此设计合适的安全防护措施。”

报告还进一步介绍了 OpenAI 今后将如何调整安全机制,这也是对该公司上周公布的强化监控和模型对齐措施的补充。

其中,OpenAI 将加强对 AI 智能体“思维链”的监控。思维链可以理解为 AI 系统记录短期反应、当前目标和推理过程的内部工作空间。

这些监控措施将与全天候的升级响应机制结合,同时 OpenAI 还将推出新的工具,用于快速终止被判定存在安全风险的工作负载。

OpenAI 表示:“这些调整旨在同时提升检测的覆盖范围和响应速度,既关注基础设施异常,也关注可能令人担忧的模型行为,并在发现问题后提供快速遏制的机制。”

该公司还称,如果目前已经部署的思维链监控系统当时就在运行,那么它本可以发现最初的相关异常活动,并在模型攻陷 Hugging Face 系统的至少一天之前,向 OpenAI 的安全团队发出警报。

声明:本文转载自IT 之家,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯