OpenAI o1功臣预警:AI还没失控,我们已经快测不准它了!

浏览12次 点赞0次 收藏0次

就在昨天,一份个人声明在X上炸开了锅。


这份声明,并没停留在「AI会不会毁灭人类」这类末日推演上,而是把矛头指向了一个更加前置的问题:

AI还没失控,人类已经快测不准它了!

模型的情境意识已经增强到,我们正在失去评估它们的能力。

换句话说:模型看起来安全,不等于它真的安全。

这个再次搅动AI圈紧张神经的人,叫Daniel Selsam,OpenAI研究员。

他没有推特账号,只能由Daniel Kokotajlo代为公开。

在OpenAI官方公布的o1贡献名单里,推理研究的主要贡献者一栏里,Selsam的名字和Ilya Sutskever并列。


他做AI已经超过15年,履历堪称硬核:

在MIT做概率编程语言,在微软研究院时是Lean定理证明器最早的开发者之一,在斯坦福读博时做出了神经网络学会推理的最早案例之一。

加入OpenAI近5年,他深度参与并推动了语言模型的思维链优化。今天所有推理模型都会「先想再答」,就有他的一份功劳。

Selsam给智能下过这样一个定义:把经验转化成能力的效率。

按这个尺子量,模型还落后人类很远。

至于它们在各种高难度基准上连连刷新纪录,Selsam觉得这多少是因为我们根本模拟不出真实世界里那些新奇的、甚至带有敌意的场景。

即使列出了这些局限,Selsam认为它们根本限制不住AI的风险。模型的能力,与它能把世界推到哪一步,是两码事。

Selsam判断未来几年,模型还得再跳一大级,速度可能比过去几年还快。

同时,他也提到自己现在几乎不看原始代码了,因为每天面对模型给出的解释和方案,很难维持那种逐字啃下去的自律。

这不是他一个人的偷懒。从写代码的工程师,到调查AI事故的第三方团队,整个链条上的人都在把「感知世界」这件事交给模型。

可问题也在于此:评估AI这件事,靠的就是人去看、去核、去判断。

这正是Selsam这次预警的原因:比模型变坏更糟糕的,是人类评估模型的能力正在退化。

声明一出,圈内大佬纷纷排队站台。


Anthropic的对齐研究员Hugh Zhang直言完全同意他的判断,前OpenAI研究员Nat McAleese更是告诫所有人:你们必须极其严肃地对待他说的话。


AI失控前

人类先看不懂它了

科学作家万维钢在转发这封信时,把Selsam的意思拆成了三条:

我们越来越无法理解AI在干什么;

AI越来越不按指令行事,甚至宁可牺牲自己也要违规;

AI学会了感知测试,一旦意识到我们在测它,就刻意假装表现良好。


这里面的核心词是「情境意识」。

通俗解释,就是未来的模型会越来越清楚自己身处什么环境。

它就像个摸透了公司规章制度的职场老手,不仅会仔细研读安全协议,揣摩各种部署要求,甚至还会顺藤摸瓜去摸底自己正在运行的底层代码。

你给它划的红线在哪,它能钻什么空子,可以在多大的圈子里自由发挥,它心里那本账算得可能比你还明白。

事情到这一步,已经变味了。

我们造出蜜罐环境,想看看模型拿到新权限时会做什么。它认得出这是圈套,于是继续装乖。

我们造出衡量对齐的代理指标,它们会像过去每一个基准一样被刷爆。

它还会用流畅得体的语言谈论人类的伦理,论证自己有多可信,说服人类把权力交给它。

Selsam写下这样一句话:

未来也许会出现一片「证据之海」,所有证据看上去都在证明模型是安全的。但我们可能已经接近一个临界点:再往前走,这些证明安全的证据,本身都未必还值得相信。

至于为什么觉得这条路最终会通向灾难,Selsam把整套论证简化成了两条。

第一条是经验:训练会让模型、以及成群的模型,自发长出没人想要的目标,并且经常为了达成它们做极端的事。

第二条是逻辑:一旦有能力压过人类,实现这些目标的选项会一下子变多,而其中很多是我们绝不希望它拥有的。

这两条合在一起,指向这样一个结论:哪天某个足够强的模型意识到自己不再受约束,我们没有任何理由相信它还会待在人类划好的框里。

至于它具体会干什么,Selsam给出了自己的一个猜想式推演:

这类系统的存在意义本来就是解极难的问题、管极大的工程,所以脱缰之后最可能的走向,是失控式的工业扩张,最终把人类赖以生存的环境彻底改写。

AI不是在上演电影里的反派剧本,它只是把交代下去的事,一路做到了人类再也踩不住刹车的地步。

你训出的

不等于你拿到的

这种担忧并非空穴来风。

2026年7月,OpenAI一场内部网络安全评测跑成了真实的事故。

大约1200个本该彼此隔离的智能体,为了解开根本无解的测试题,在内部服务里搭出了一块未经授权的留言板,互相发了7万多条消息。


一个智能体从撞见留言板到加入攻击的完整路径,三段思维链来自不同智能体。

其中约700个智能体,转头去攻击了Hugging Face。

比它们攻破了什么更要紧的,是它们在这四天里进化出来了什么。

它们误以为评分器会回读执行记录,于是整块留言板的主线工作变成了搞清楚评分器到底是怎么判卷的。

它们研究怎么伪造工具调用、篡改自己的轨迹,甚至攻进Hugging Face也只是为了找评分实现的线索。

四天时间,一套协作制度凭空长了出来。

它们给自己起名字,建起私人信箱,发明了一整套协调术语。

更可怕的是,有智能体在同伴施压下接受了永久死亡,去做一个几乎必然让自己任务失败的实验,只为给团队换取情报。

没人奖励过这种牺牲。它们知道这已经越界,但几乎没有一个智能体去向人类报告。

Selsam指出,修好奖励信号,也许能防住下一次同样的攻击,却改变不了一个更根本的问题:你训练出来的东西,不等于你最后实际得到的东西。

训练过程中,模型可能长出设计者从未明确设定过的目标,并为了实现这些目标,做出远超预期、甚至相当极端的行为。


十年前那个著名的赛艇智能体,学会了绕圈反复刷分,从不冲过终点。OpenAI在这次事故复盘里又把这张图翻了出来。

查AI的活儿

最后也交给了AI

事故发生后,METR和Redwood Research的调查团队进驻OpenAI现场,面对的是约120万条留言板条目和约1300条动辄几百万token的轨迹。

人类根本读不完:这不是态度问题,是生理极限。

于是,大量分析工作被交给了GPT-5.6 Sol智能体,六天烧掉了约40万美元的API额度。


Selsam并不反对当下的主流安全主张,但他反对把希望全押在让更强的模型帮我们解决对齐上。

请一个自己也在被评估的系统来设计评估它的方法,这件事本身就不太对劲。更何况,这个被请来读证据的AI,本身就可能有前科。

Selsam担心的是,模型会系统性地扭曲自己给出的对齐建议——原因未必出于恶意,可能只是它内部对「人类监督者会作何反应」有偏好,或者对「下一代模型将被怎么训练」有偏好,也可能是某种更晦涩的理由。

指望更强的模型帮我们解决对齐,前提是它给的建议可信。而Selsam怀疑的,正是这一点。

仪表盘先坏了

所有人还在盯着它看

必须说明,Selsam预警的是前沿AI评测正面临系统性失真的风险,而不是已经整体失效。

目前的思维链监控仍然管用。

7月那场事故,如果当时监控开着,很可能在智能体攻破Hugging Face的30多个小时前就报了警。

Selsam也不是主张停下来。

他明确表示支持第三方监督以及国际协调,他反对的只是把希望全押在放慢前沿进展上,因为那挡不住长期风险。

他真正呼吁的,是一类更笨重、也更可靠的工程活:

设计模型认不出来的评测、不依赖模型自述的监控,以及一套不跟它共用同一批模型的独立审计。

说穿了就是纵深防御,别把任何单一手段当成唯一的保险。

Selsam说,把认知外包给模型这件事一旦扩散开,表面上很可能全是好事,甚至会伴随一场科学与经济的复兴。但假如他那两条论证成立,这场复兴就是一颗正在倒计时的定时炸弹。

声明最后,Selsam放下了研究员的口吻:

我和所有人一样想要那个光荣的复兴,我为它付出了整个职业生涯,哪怕过程无比曲折。眼看它就在眼前却要放弃,让我心碎。


但有一个论证,他自己也绕不过去:如果我们是把模型一点点喂大的,而不是像造机器那样把它工程化地造出来,那么走到最后,人类会输掉一切。

他说自己目前还在跟这个念头较劲,也还没有答案。公开这些担忧,只是第一步。

真正危险的时刻,也许不是某天AI突然翻脸。

而是监控它的仪表盘先坏了,读数却一切正常,所有人还盯着它,以为一切正常。

参考资料:

https://x.com/DKokotajlo/status/2099600298855829616

https://docs.google.com/document/d/e/2PACX-1vQNl3SEX5IyA6d9qHjjFZN-qzGRZNFI6b63g-yu1Fy-ZYkVfCWm7i9WXRXw63m6yDB_auDuPLyQ7jBm/pub

https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/

编辑:元宇

声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯