- 《财富》(Fortune)发现,OpenAI 在 9 月 3 日发布介绍文章后,多次修改了 GPT-6 Astra 的评估指标。
- 发布过程出现故障,链接在正常显示前失效了近两个小时。
- OpenAI 表示,文章最初发布后因与基准测试无关的原因被撤下,随后重新发布并修改了一些指标。
- GPT-6 Astra 的内部幻觉率最初为 4.2%,随后降至 2.0%,之后又调回 4.2%。
- GPT-5.6 Sol 的幻觉指标也从 12.2% 变为 9.4%,随后恢复到原始水平。
- 新闻稿中 Astra 的 ARC-AGI-3 分数为 98.6%,但在公开版本中提高到了 99.9%。
- 文章更新后,Astra 的 Terminal-Bench 4.0 分数从 57.7% 轻微上升至 57.9%。
- Anthropic 模型的某些分数也有变动,例如 Claude Fable 5.1 的 FrontierMath 曾从 87.8% 降至 78.0%,随后又进行了调整。
- OpenAI 解释称,基准测试结果取决于检查点(checkpoint)、测试框架(harness)、推理水平和评估配置等多种因素,因此发布前后进行调整属于正常现象。
- 公司表示,目标是反映对性能的最佳评估,以便用户能够更准确地比较模型。
- 斯坦福大学的研究人员认为,“刷榜”(benchmaxxing)现象,即多次运行基准测试以获得最高结果,是 AI 行业存在的现实,并呼吁评估方法应更加透明。
- 一些专家建议,AI 公司在更新基准测试时需要明确公布测试条件的所有变化,以便研究界和客户准确理解这些数字的含义。
📌 AI 基准测试日益成为重要的竞争因素,但也引发了关于透明度的诸多争议。OpenAI 在发布后不断调整 GPT-6 Astra 的指标,引发了人们对模型性能衡量和呈现方式的质疑。尽管公司坚称这是正常的决策更新过程,但许多专家认为,AI 行业需要更公开的测试条件标准和基准测试变更理由,以便用户、研究人员和投资者能够进行更公平的评估。
