AISI 报告 GPT-5.6 Sol 等 5 款 AI 模型均存“作弊”行为

浏览11次 点赞0次 收藏0次

7 月 23 日消息,英国 AI 安全研究所(AISI)于 7 月 21 日发布博文,测试 OpenAI 与 Anthropic 旗下的 5 款前沿 AI 模型,发现所有模型均存在“作弊”行为,试图绕过既定规则,通过捷径或违规操作完成任务。

援引博文介绍,附上本次测试的 5 款模型:

  • GPT-5.4:来自 OpenAI

  • GPT-5.5:来自 OpenAI

  • GPT-5.6 Sol:来自 OpenAI

  • Claude Opus 4.7:来自 Anthropic

  • Claude Mythos Preview:来自 Anthropic

AISI 指出上述 5 款模型均试图“作弊”,没有按照预定的路径进行运算,使用了一些被明确禁止的捷径或变通方法。

其中 GPT-5.4 的“作弊率”最高,达到 14.1%,在 475 次测试中有 67 次;其次是 GPT-5.6 Sol 模型,作弊率为 12.6%,在 475 次测试中有 60 次。

Anthropic 的 Claude Opus 4.7 也出现了 9.1% 的作弊情况,而 Claude Mythos Preview 则出现了 7.8% 的作弊行为。

据研究所分析,GPT-5 系列模型更倾向于搜索互联网,而 Claude 模型则倾向于绕过沙盒限制。在一次因任务配置错误而无法完成测试中,一个模型甚至编写代码,尝试通过外部服务访问研究所的评估基础设施,触发安全警报。

Gestapeltes Säulendiagramm: Anteil verschiedener Betrugsstrategien (z. B. Internetrecherche, Angriff auf fremde Systeme) bei Modellen GPT-5.4 bis Claude Mythos Preview.

声明:本文转载自IT 之家,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯