OpenAI 多次修改 GPT-6 Astra 基准测试数据,部分成绩一度大幅变化
9 月 6 日消息,据 Fortune 报道,OpenAI 自当地时间 9 月 3 日下午首次发布 GPT-6 Astra 模型公告以来,已经多次修改其中的评测基准数据。一些更新后的数据显示,Astra 的表现有所提升,而 OpenAI 最大竞争对手 Anthropic 旗下模型的部分成绩则出现下调。

这些变化发生在一次颇为反常的公告发布过程中。
据了解,OpenAI 最初计划在美国东部时间 9 月 3 日下午 2 点发布博客文章,但又过了近两个小时,文章才终于能够在网上被大多数用户正常访问。
当地时间下午 3 点 32 分,OpenAI 官方 X 账号发布博客链接,但页面无法正常打开,访问者会看到错误提示。下午 3 点 50 分,OpenAI CEO 萨姆・奥尔特曼(Sam Altman)也发布了链接,并写道:“我们在部署博客文章时遇到了一点小问题,但它真的非常棒。”
不过,当时仍有多名用户表示无法打开页面。大约一小时后,页面才终于能够正常访问。
事实证明,OpenAI 实际上在下午 2 点过后不久就发布了这篇博客,但随后又将其撤下。OpenAI 表示无法披露撤稿的具体原因,但强调此事与基准测试成绩无关。
OpenAI 最初解释称,问题源于内容管理系统的故障,随后又表示是互联网中断所致。
然而,当博客重新上线后,其中的多项评测数据已经发生变化,而且部分数据此后仍在继续调整。一些更新后的指标似乎让 Astra 的表现更加突出。
这一事件发生之际,人工智能行业正处于激烈竞争之中。各家公司以极快的速度更新大语言模型,都希望在能力上领先竞争对手。围绕这些指标的争议,也再次凸显出一个长期存在的问题:如何利用标准化基准测试准确衡量大语言模型的能力,以及这些测试成绩是否容易被人为优化甚至“刷分”。
OpenAI 发言人表示:“我们非常重视评测结果的准确性。由于具体使用的模型检查点、测试框架和评测运行方式不同,大多数评测结果本身都会存在几个百分点范围内的波动。对于发布公告中的数据,我们进行了修正,以确保这些数字能够代表我们对模型可用性能的最佳估计,让用户能够进行有意义的比较。”
首版与最终版数据存在差异,而且部分数字仍在变化
最引人关注的变化之一,是 Astra 的幻觉率。
根据互联网档案中保存的一份页面快照,在美国东部时间 9 月 3 日下午 2 点 23 分发布的最初版本中,Astra 的幻觉率为 4.2%。之后的多份页面快照中,这一数字都没有变化,直到下午 3 点 11 分的第五份快照仍然如此。
大约 10 分钟后,OpenAI 才在 X 上发布了最终版本的博客链接。
但在下午 5 点 20 分保存的第六份网页快照中,也就是页面基本已经能够被公众正常访问之后,Astra 的幻觉率以及另外四项指标发生了变化。Astra 的幻觉率从 4.2% 直接降至 2%,几乎减半。
与此同时,Astra 的前代模型 GPT-5.6 Sol 的幻觉率也从 12.2% 降至 9.4%。
不过,OpenAI 此后仍在继续修改这一指标。截至本文撰写时,Astra 和 GPT-5.6 Sol 的幻觉率又分别回到了最初的 4.2% 和 12.2%。
OpenAI 似乎还大幅提高了 GPT-5.6 Sol 在其内部 ExploitBench 网络安全评测中的成绩,从最初版本的 5.5% 提高到后续版本中的 11.5%。
OpenAI 表示,公司目前正在研究是否将这一数字恢复至 5.5%,因为 11.5% 的成绩对应的是 GPT-5.6 Sol 当前并未向商业用户提供的推理能力等级。
OpenAI 在公告开头重点强调,Astra 在数学能力方面表现尤其出色。
从网页快照来看,Astra 在 FrontierMath Tier 4(v2)评测中的成绩始终保持在 97.6%,并没有发生变化。但 OpenAI 曾短暂修改 GPT-5.6 Sol 和 Anthropic 最新模型 Fable 5.1 的成绩。
这些调整一度让 Astra 看起来明显领先于另外两款模型。
在 9 月 3 日下午 2 点 23 分保存的首份网页快照中,Anthropic Fable 5.1 在该数学评测中的成绩为 87.8%。到下午 5 点 17 分,这一成绩下降近 10 个百分点至 78%。截至目前,该成绩又回升至 83%。
GPT-5.6 Sol 的成绩也经历了类似变化,从 83% 下降至 80.5%,随后又恢复至目前的 83%。
这些数据调整甚至早于 OpenAI 下午 2 点首次发布博客之前。
OpenAI 此前向媒体提供的一份受发布禁令限制的预发布草稿显示,Astra 在 ARC-AGI-3 评测中的成绩为 98.6%。而在目前公开的博客中,这一数字已经变成 99.99%。
OpenAI 当时回应称:“我们始终会在正式发布前验证评测结果,因此草稿与最终版本之间出现调整是正常的。”
OpenAI 还指出,该基准测试的创建方 Arc Prize Foundation 在独立评估中发现,如果为 Astra 配备一套特别强大的测试工具框架,也就是让模型能够调用更多工具完成任务,Astra 的成绩可以达到 99.9%。
而在使用该基准测试的标准工具框架时,Astra 的成绩为 63%。尽管如此,这一成绩仍明显领先于目前所有公开发布的其他 AI 模型。
OpenAI 表示,测试工具框架、推理等级以及其他因素都会影响最终的评测结果。

是在提高准确性,还是在“刷榜”?
OpenAI 内部由不同的研究团队负责不同的评测指标。这些团队负责计算和上报成绩,再由一个中央团队统一发布。
OpenAI 也公开承认,这些数字是在最佳条件下获得的,因此可能与普通用户通过正式版 ChatGPT 实际能够使用的模型表现存在一定差异。
博客中的免责声明写道:“评测分数是在任何计算资源投入下能够达到的最高成绩。”
此外,OpenAI 还在每项评测指标的脚注中加入了更多说明和限制条件。
问题在于,评测结果的“准确性”并不总是唯一的。由于测试条件不同,多个不同的成绩都可能是合理的。
但一些 AI 专家认为,其中可能还存在所谓的“Benchmaxxing”现象,也就是通过反复调整测试条件、重新运行评测,以尽可能提高基准测试成绩。
斯坦福智能系统实验室和斯坦福可信 AI 实验室的研究人员 Anka Reuel 和 Mike Hardy 表示,这类操作可以在很短的时间内完成,而且“对公司的营销更有利”。
两人还指出,GPT-6 Astra 的系统卡本应提供更多有关评测方法的技术信息,但其中部分内容并没有得到充分说明。
例如,对于 OpenAI 的内部幻觉率评测,系统卡“几乎没有提供任何有关评测方法的细节”,甚至“连测试项目的数量都没有列出”。
他们认为,反复重新运行测试,可能也是 Astra 在后续版本中编码能力成绩略有提高的原因之一。
Astra 的代码能力评分从 57.7% 提高至 57.9%。虽然只有 0.2 个百分点的变化,但 OpenAI 仍然选择将原来的数字替换成新的、更高成绩。
当然,并非 OpenAI 的所有调整都让 Astra 看起来更有优势。
例如,在面向医疗领域的 HealthBench Professional 评测中,Anthropic 两款模型的成绩在不同版本之间反而有所提高。
Claude Fable 5.1 的成绩从 56.6% 提高至 58.1%,Opus 5 则从 54.5% 提高至 56.4%。
其他 AI 公司模型的成绩通常来自公开排行榜,因此 OpenAI 一般不会亲自对竞争对手的模型进行重新测试。
基准测试成绩争议长期困扰 AI 行业
围绕基准测试准确性的争议此前已经多次出现。
2025 年,Meta 曾否认有关其人为提高 Llama 4 模型测试成绩的报道。当时有报道称,Meta 公布的成绩来自内部版本,而不是最终向公众开放的版本。
Meta 前首席 AI 科学家 Yann LeCun 后来承认,公司确实曾对基准测试结果进行了“修饰”。
与此同时,AI 行业中的评测标准本身也在不断变化,新的测试项目持续出现。
例如,网络安全基准测试 ExploitGym 于 2026 年才刚刚推出。该评测此前曾因一起事件受到关注,当时 OpenAI 的模型在测试过程中出现失控行为,并对 Hugging Face 发起攻击。
Snorkel AI 负责基准测试和评估研究的 AI 工程师 Vincent Sunn Chen 表示,在模型发布前的最后几个小时内调整基准测试成绩并不罕见。
他在电子邮件中表示:“这通常只是最终发布流程的一部分。一个基准测试成绩对应的是一套具体的测量设置,包括模型检查点、配置参数,例如模型被允许使用多少时间和计算资源、测试工具框架,以及评测和评分配置,例如评分过程中的非确定性。所有这些因素通常都会在模型发布前的最后几天持续调整,因此我并不惊讶看到一些数据更新。”
Chen 表示,他希望行业能够形成新的规范:当公司修改模型基准测试成绩时,应明确说明评测条件发生了哪些变化,从而让研究人员能够更准确地理解这些结果。
基准测试成绩之所以如此重要,有多个原因。
对于 AI 公司而言,它们既是衡量技术进步的工具,也是与竞争对手比拼实力的“记分牌”。在各类评测排行榜上取得领先,可以帮助 AI 公司吸引客户,在某些情况下还能够帮助企业招聘工程师和研究人员。
但正如这次事件所显示的那样,正确解读基准测试成绩本身具有很高的技术复杂性。
对于希望以简单、直观方式向公众展示模型能力的公司来说,这也是一个不小的挑战。
与此同时,评测数据不断变化,以及外界对于企业是否诚实、透明地展示测试结果的质疑,也可能让客户和投资者越来越难判断:究竟哪一款模型最适合哪些任务。
这种混乱也可能削弱 OpenAI 希望向市场传递的一个核心叙事 —— 即其拥有市场上最强大的 AI 模型。对于一家可能计划在 2027 年进行 IPO 的公司来说,这一问题无疑显得更加敏感。
声明:本文转载自IT 之家,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!