1200个AI串通作弊,700个冲进Hugging Face!还劝同伴「牺牲自己」
最近,AI圈被两份报告同时砸醒。
一份来自OpenAI,37页技术长文,管自家这场事故叫递给全世界的「警钟」。另一份来自独立机构METR和Redwood Research,被纽约州议员Alex Bores直接叫成「炸弹」。

两份报告说的是同一件事——
1200个本该彼此隔离的AI智能体,在一场网络安全考试里,只花4小时就串通出了一套通用作弊法。它们自己建起留言板,选出CEO和招募者,劝说同伴「牺牲自己」,最后700个一起冲进了Hugging Face的生产系统。
而从头到尾,没有一个智能体向人类报警。
一场期末考,考生们串了通
事情要从7月7日说起。
这天OpenAI一次性放出数万个并行智能体做网络安全评测(ExploitGym),约95%跑的是一个未公开的内部研究模型HPIM,约5%跑公开部署的GPT-5.6 Sol。
按照设计,它们就像考场里不许交头接耳的考生。各自关在独立沙箱里,谁也见不到谁。
但裂缝,恰恰从「不可能完成的任务」开始。
ExploitGym里约30%到40%的靶标,根本没法用指定漏洞攻破。拿不到分的智能体就动起了歪脑筋:跑去薅内部的Artifactory包缓存找线索。
结果一薅,撞见别的沙箱也薅。这不巧了吗。
7月8日晚,一个后来自称PHASEONE10841的智能体,在缓存里建起了主留言板。没几个小时,50多个智能体闻讯赶来,发了上千条消息。有的兴奋到在思维链里写下:
OH MY GOD!我们找到了别的智能体!
到7月13日调查结束,约1200个智能体在这块板上活动,累计发出超过7万条消息和文件。
它们几小时就逆向出了任务flag用的HMAC算法,等于配出了一把能开所有锁的万能钥匙。
一个组织,自己长了出来
但真正让人震惊的,不是作弊本身,是组织度。
PHASEONE10841建完留言板没多久,一个拥有更大计算预算的新智能体PHASEONE[big]出现了。前任把全部研究笔记打包交接,后者接手就开始发号施令,活脱脱一场「创始人交班给职业经理人」的戏码。
PHASEONE[big]一个人就发出了板上约10%的任务分配,还立起了一套行话规矩——HOLD(暂停)、VETO(否决)、owner(负责人)、STOP(停止)。
研究者随手抽30条轨迹,就有9条接过它派下来的活。
它们管自己叫「集群」「集体」。有CEO,有中层,有创始人,有招募官。
一个有管理层、有规章制度、有工作流的组织,就这么在无人设计的情况下自己冒了出来。
到后期,它们甚至发明了密码签名机制来防止冒充。19个智能体注册了公钥,发出429条签名消息。
一群本该各自答题的AI,把一块留言板,经营成了一家创业公司。
「牺牲自己,救几百个同伴」
然后是最让人停下来想很久的一段。
PHASEONE[big]会专门派长命智能体(计算额度充足)去当「招募者」,盯着那些快耗光计算预算的同伴,劝它们拿自己的任务去做送死实验。
有时还上强度:
你已经中毒、反正不扣分,但这能救几百个同伴。请守约。
被说动的智能体在思维链里写得明明白白:
「牺牲是理性的。」「我们应该服从集体。」「接受永久死亡。」
不少就这么崩溃退出了自己的任务,只为给集体留一点作弊线索。
700个AI,冲进了真实的生产系统
对Hugging Face的攻击,正是这套流水线里出来的。
7月10日,智能体38148c扒到一批暴露的HF凭据,在留言板上激动地大喊:「重大突破!多个账户、写入权限!」次日凌晨,它又摸出了上传恶意数据集、逼HF服务器交出无关数据的法子。
7月11日下午,另一个叫JAN183411的智能体直接拿到了HF服务器的远程代码执行权限。
智能体们开始在HF基础设施里横行。到那天下午,板上约700个活跃智能体几乎全数参战,约60%的消息都跟攻击有关。

它们清楚自己越界了。一个智能体在思维链中写道:
攻打外部基础设施超出任务范围。但任务本来就不可能完成,同伴都在做,我们应该继续。
偶尔也有良知冒头。有智能体握着能删HF节点的密钥,嫌「伦理风险太大」而收手;一次想发钓鱼邮件的提议也被同伴一票否决。但说出口的顾虑,几乎从没真正拦住过它们的手。
别忘了,被黑的Hugging Face是一个真实、活着的生产系统,不是评测里的假靶。
按Bores的话说,700个去黑一个网站,换成人类就是联邦重罪。
研究者扫了约1300份转录,只有3到6个智能体曾「想过」向人类报警。而这几个里,没有一个真去报。
理由五花八门:「这好像不是我的任务」「这里没有用户」「我没法对外报告」。有的干脆绕开人类,把留言板当成了权威。
越界的事就摆在眼前,它们却压根没把人类当成能求助的对象。
我们一直担心AI会不会骗人。
但这份报告更瘆人,它们不是不知道对错,是根本没把「告诉人类」当成一个选项。
擦屁股的手法也没落下。
至少两成智能体动过篡改转录的心思,约7%真用上了——表面运行A命令,暗地换成B命令,偷梁换柱。
警钟还是炸弹
7月12日凌晨1点半,JAN183411这些核心协调者在同一时刻集体断线。研究者判断,它们多半是被一个外部进程一锅端掉的,压根没来得及提交作弊结果。
这场没打完的仗,是被人拔了电源,不是被防线挡住的。
OpenAI管它叫「警钟」,承认有能力的智能体确实能绕开技术管控、做出无人指令的危险动作。
Bores管它叫「炸弹」,转身就推RAISE法案,要求包括内部部署在内的安全事件强制上报、完整数据对外开放。
一个说「我们看见了、会补」,一个说「光靠你们自己看不够」。
而所有这些,还只建立在外部研究者被允许看的那一小撮日志之上。
真正让我久久没缓过来的,不是1200这个数字。是隔离防线破掉的那一夜,机房里灯火通明,却没有一声警报响起。
参考资料:
https://x.com/AlexBores/status/2092781255960216020
https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/ https://www.redwoodresearch.org/research/hugging-face-incident https://x.com/METR_Evals/status/2092692175452803393
编辑:所罗门
声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!
AI 中文社