老黄替OpenAI宣布AGI!出题人当场打脸:换个考场99.9%掉到62.7%

浏览12次 点赞0次 收藏0次

上周四,OpenAI发布GPT-6 Astra。

官网给它的定性是「世界上最智能、最对齐的模型」。

紧接着,黄仁勋在X上发了一条帖子,把这件事推向另一个高度:

AGI已经到来。恭喜OpenAI团队。


反观GPT-6 Astra的官方发布页,通篇找不到「AGI已实现」这样的字眼。

一个卖GPU的,替做模型的,把话说满了。

更有意思的,是出题的人。

OpenAI发布页写着Astra在ARC-AGI-3上拿到99.9%,「饱和」了这个以AGI命名的基准。

负责出卷子的评测机构ARC Prize看完跑分,却一把拒签:「不算。」

ARC Prize基金会当天就发文拆解:

这个分数来自OpenAI定制的测试环境,换成对所有厂商一视同仁的标准环境,只有62.7%。

他们的结论只有一句:Astra在泛化上有实质进展,「但我们不宣称它是AGI」。

芯片供应商直接盖章,模型厂商留了余地,负责出题的基准机构直接拒签。

这大概是过去几天AI圈最魔幻的一幕:AGI这次没有被真正「实现」,而是被各方代言人在社交平台上「宣布」了。

OpenAI自己怎么说?

在发布当天的记者电话会上,总裁Greg Brockman说了一句极具煽动性的话:

欢迎来到AGI时代。

他甚至预言,如果几年后回头看AGI是何时诞生的,「大概就是这个时期,可能就是这个模型。」

听起来像官宣?

但他立刻又补了两个限定词:第一,这是他「个人判断」;第二,AGI是个灰色、模糊的概念,「到底算不算,由用户自己决定。」


在自家最重要的产品发布会上,总裁居然用「个人看法」来给时代定调,甚至还把最终裁定权甩给了网友。

这只能说明一件事:OpenAI内部,也拿不出一份明确、能公示的AGI认定书。

更有意思的是CEO奥特曼的态度。

在Astra发布前,他曾公开吐槽「AGI」是个定义糟糕、接近营销术语的词。

CEO嫌这个词太虚,总裁拿它当「个人看法」,官网干脆闭口不提。

黄仁勋那句AGI的「盖章」和恭喜,恰好就落在了这个微妙的空白里。

99.9%与62.7%

同一张卷子的两套成绩

Astra到底强不强?

OpenAI发布页上写着:

Astra在以AGI命名的基准测试ARC-AGI-3上拿到了99.9%的逆天高分,「饱和」了这个测试。

但打脸来得也快。

当天,负责出题的ARC Prize基金会就发文,把这个「99.9%」当众拆解了。

原来Astra考了两次。


ARC-AGI-3榜单,Astra两套环境的成绩分开标注;同榜Claude Opus 5为30.2%,GPT-5.6 Sol为7.8%。

在OpenAI深度定制的「自带工具」环境下(允许模型保留推理状态、用独家技术管理长对话),它确实考了99.9%,花了近1.9万美元。

但如果换成对所有厂商一视同仁的「裸考」标准环境,它的最高分其实只有62.7%,成本更是飙升到2.6万美元。

ARC Prize的态度很坚决:未来的AGI,必须能在标准条件下解题。带工具拿到的99.9%和裸考拿到的62.7%,完全是两码事。

当然出题人也承认Astra带来了「阶跃式」的惊喜,在96%的关卡里,Astra用的动作数比人类还少,平均少用51.7%。

这是AI第一次在动作效率上全面碾压人类。

可ARC Prize早就把话说在前头:ARC-AGI-3上线那天他们就写明,刷满这个基准不等于「证明达到了AGI」。

理由很简单:测试环境再难也是封闭的,机制确定、目标封闭,代表不了真实世界的复杂与开放。

就像一个学霸,卷子考了满分,到了真实职场未必依然能够开挂。

10万颗炼模型

40万颗卖未来

既然出题人都不认,老黄为什么最急着宣布「AGI已到」?

仔细拆解黄仁勋的那条帖子,你会发现它的信息结构比表面热闹得多。

帖子全文是:

GPT-6 Astra,在约10万颗NVIDIA Grace Blackwell NVLink72上训练。从ChatGPT到o1再到Astra,只用了4年。AGI已经到来。恭喜OpenAI团队。接下来还有40万颗GPU上线。

第一个数字:10万颗。

Astra是OpenAI迄今规模最大的一次训练,用掉了超过10万颗GPU。

第二个数字:4年。

从ChatGPT到o1再到Astra,黄仁勋用一条时间线,把对话模型、推理模型和所谓的AGI连成了一条直线。

第三个数字:40万颗。

「接下来还有40万颗GPU上线。」

这40万颗归谁?什么型号?用来干嘛?黄仁勋在这里留下了悬念。

但当这三个数字与「AGI已到」被塞进同一条帖子里时,读者脑海中就会出现这样一种商业叙事:

10万颗GPU砸出了Astra(也就是AGI),那接下来的40万颗会砸出什么?

在这个语境下,AGI不再是一个抽象的技术终点,而变成了一份最有力的算力需求证明。

一旦AGI被公认「已到」,天价的算力就不再是企业的成本项,而是谁都不敢下牌桌的必需品。

推特上的AGI

进不了商业合同

去年10月,OpenAI和微软的新协议里写了一条:OpenAI宣布AGI之后,还得由一个独立专家小组核验。


今年2月两家又联合重申,合同里AGI的定义和认定流程「均保持不变」。

到了4月,协议再度修订,微软的收入分成改为「与OpenAI技术进展无关」,外界普遍解读为AGI条款对商业利益的触发作用已经大幅弱化。

也就是说,Brockman在记者会上说什么、黄仁勋在X上写什么、ARC-AGI-3跑了多少分,都不构成合同意义上的AGI认定。

眼下正是OpenAI筹备IPO的关键节点,死对头Anthropic也在冲刺上市。

「AGI」这个词早已写进了OpenAI与微软、亚马逊的投资协议里,它牵动的已经超出技术信仰,还有股权定价和商业控制权。

这就能解释,为什么Brockman只敢说是「个人判断」,为什么OpenAI官网严防死守不提AGI。

舆论场上可以尽情欢迎AGI时代,落到合同里,一个字都不能多写。

谁有资格宣布AGI?

Bloomberg一篇长文把这个问题捋了一遍,答案是没人说了算。


先看定义。

OpenAI的版本是「在大多数具有经济价值的任务上超越人类的系统」。

谷歌DeepMind 2023年的论文不看经济价值,看通用性,看能不能用很少的数据学会新技能。

ARC Prize更直接,说经济价值「是衡量智能的错误尺度」,他们的定义是「能高效习得训练数据之外新技能的系统」。

连词也都不一样。

Anthropic的Dario Amodei不爱说AGI,改叫「强大人工智能」(powerful AI)。微软的Mustafa Suleyman造了个「可用人工智能」(artificial capable intelligence)。

Meta和OpenAI最近干脆跳过AGI,直接谈「超级智能」(superintelligence)。

时间表更乱。

2024年9月,奥特曼说「指向AGI的系统正在显现」,甚至说「几千天内」可能有超级智能。


一年后GPT-5发布,他承认「我们还缺一样相当重要的东西」,但没说缺什么。

再一年,Brockman在Astra发布会上说「欢迎来到AGI时代」。

DeepMind那边,Shane Legg从1999年起就押2028年前实现AGI的概率是50%;Demis Hassabis却说还要五到十年,时间线看起来在缩短,只是因为「AGI的定义正在被稀释」。

于是就出了眼下这个局面。

同一个词,四拨人用四种方式定义它。

模型公司握着产品叙事,只晒跑分不下定论;

芯片巨头握着算力叙事,急着宣布时代降临;

基准机构握着测试标尺,死死咬住底线,不承认;

微软这样的大金主握着合同条款,稳坐钓鱼台,按规则算账。

过去四年,全行业争的是谁最先做出AGI。

最近,叙事时态变了,从「还要一到三年」「最快半年」,直接跳到「已经到来」。

可一套公认的AGI验收标准,至今没人拿得出来。

参考资料:

https://x.com/JensenHuang/status/2096700264569090384

https://www.bloomberg.com/news/features/2026-09-04/what-is-agi-openai-anthropic-race-for-artificial-general-intelligence

https://www.axios.com/2026/09/03/openai-astra-gpt-6-agi-brockman

编辑:元宇

声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯