大模型圈的跑分,现在比A股还刺激。

昨天 OpenAI 发布 GPT-6 Astra,本来是一场秀肌肉的狂欢。结果硬生生演成了“分数魔术秀”。

新模型的指标悄悄变好了,死对头 Anthropic 的分数却被暗改了。

说实话,看到这些反复横跳的数据,我第一反应是:OpenAI 的程序员是不是在后台现调的参数?

博客难产背后的“分数魔术”

事情从一开始就透着诡异。

原定美东时间下午2点发的博客,硬是卡了近两个小时。

3点半官方推特发链接,点进去是报错。Sam Altman 赶紧出来打圆场,说遇到点小故障,但东西“真的棒”。

有意思的是,网页存档显示,博客其实2点就发了,然后被紧急撤回。

OpenAI 先说是内容管理系统bug,后来改口说是断网。但就是不肯说真正原因,只强调“跟跑分数据无关”。

等大家终于能正常访问时,好戏开场了。

跑分数据,变了。

谁被暗踩,谁被强捧

我们先看最核心的幻觉率。

下午2点多的初版快照里,Astra 的幻觉率是 4.2%。到了下午5点多大家都能看的时候,这个数字直接腰斩,变成了 2%。

连带着老前辈 GPT-5.6 Sol 也从 12.2% 降到了 9.4%。

结果你猜怎么着?现在去官网看,分数又悄悄改回了 4.2% 和 12.2%。搁这仰卧起坐呢?

数学能力更是重灾区。

OpenAI 在开头就猛夸 Astra 数学好,Astra 自己的分数确实稳在 97.6%。

但 Anthropic 最新的 Fable 5.1 模型,数学分从 87.8% 被“暗降”到了 78%。

一下掉了快10个百分点。现在又默默调回了 83%。

个人觉得,这种把对手分数改低来衬托自己的操作,吃相确实不太优雅。

AI配图

还有那个 ARC-AGI-3 评估。

给媒体的保密草稿里,Astra 得分 98.6%。正式发布时,直接飙到了 99.99%。

OpenAI 解释说,这是因为给模型配了“特别强大的工具包”。如果只用标准工具包,分数其实是 63%。

这点我不太认同。你发战报的时候用顶配外挂, footnote 里写标准配置,典型的报喜不报忧。

刷榜潜规则与行业前车之鉴

老实讲,这种操作在圈内有个专门的词,叫 Benchmaxxing(刷榜)

斯坦福的研究员 Anka Reuel 和 Mike Hardy 直接点破,这就是为了营销。

“在极短的时间内重跑测试,挑最好看的数据发出来,这对他们的营销更有利。”

而且 OpenAI 的系统卡片里,对内部幻觉测试几乎没写细节,连测试样本量都没给。

Snorkel AI 的工程师 Vincent Sunn Chen 倒是说了句公道话。

“基准分数反映的是特定的测量设置,发布前几天这些配置都在变,所以有更新我不意外。”

但他也提了个醒:改了啥,你得告诉大家啊。

其实 OpenAI 早就有同行这么干过。

去年 Meta 发 Llama 4 的时候,就被爆出用内部未公开版本跑分。连 Yann LeCun 后来都承认,数据确实“修饰”过了。

大模型军备竞赛打到现在,跑分已经成了拉客和融资的筹码。

但把跑分当成任人打扮的小姑娘,真的好吗?

涂改液抹不出真正的护城河

2027 年 OpenAI 可能要 IPO 了。

在这个节骨眼上,用这种薛定谔的跑分数据去糊弄投资者和客户,只会让市场的信任度越来越低。

当所有公司都在玩数字游戏,谁还会关心模型到底能不能解决实际问题?

毕竟,用户要的是好用的工具,不是一张满是涂改液的满分试卷。

【锐评】:跑分不够,后台来凑,OpenAI 这波“薛定谔的指标”操作,硬是把 AI 发布会玩成了魔术穿帮现场。

参考链接:
https://x.com/jeremyakahn/status/2096029945856242085