大模型圈的跑分,现在比A股还刺激。
昨天 OpenAI 发布 GPT-6 Astra,本来是一场秀肌肉的狂欢。结果硬生生演成了“分数魔术秀”。
新模型的指标悄悄变好了,死对头 Anthropic 的分数却被暗改了。
说实话,看到这些反复横跳的数据,我第一反应是:OpenAI 的程序员是不是在后台现调的参数?
博客难产背后的“分数魔术”
事情从一开始就透着诡异。
原定美东时间下午2点发的博客,硬是卡了近两个小时。
3点半官方推特发链接,点进去是报错。Sam Altman 赶紧出来打圆场,说遇到点小故障,但东西“真的棒”。
有意思的是,网页存档显示,博客其实2点就发了,然后被紧急撤回。
OpenAI 先说是内容管理系统bug,后来改口说是断网。但就是不肯说真正原因,只强调“跟跑分数据无关”。
等大家终于能正常访问时,好戏开场了。
跑分数据,变了。
谁被暗踩,谁被强捧
我们先看最核心的幻觉率。
下午2点多的初版快照里,Astra 的幻觉率是 4.2%。到了下午5点多大家都能看的时候,这个数字直接腰斩,变成了 2%。
连带着老前辈 GPT-5.6 Sol 也从 12.2% 降到了 9.4%。
结果你猜怎么着?现在去官网看,分数又悄悄改回了 4.2% 和 12.2%。搁这仰卧起坐呢?
数学能力更是重灾区。
OpenAI 在开头就猛夸 Astra 数学好,Astra 自己的分数确实稳在 97.6%。
但 Anthropic 最新的 Fable 5.1 模型,数学分从 87.8% 被“暗降”到了 78%。
一下掉了快10个百分点。现在又默默调回了 83%。
个人觉得,这种把对手分数改低来衬托自己的操作,吃相确实不太优雅。
还有那个 ARC-AGI-3 评估。
给媒体的保密草稿里,Astra 得分 98.6%。正式发布时,直接飙到了 99.99%。
OpenAI 解释说,这是因为给模型配了“特别强大的工具包”。如果只用标准工具包,分数其实是 63%。
这点我不太认同。你发战报的时候用顶配外挂, footnote 里写标准配置,典型的报喜不报忧。
刷榜潜规则与行业前车之鉴
老实讲,这种操作在圈内有个专门的词,叫 Benchmaxxing(刷榜)。
斯坦福的研究员 Anka Reuel 和 Mike Hardy 直接点破,这就是为了营销。
“在极短的时间内重跑测试,挑最好看的数据发出来,这对他们的营销更有利。”
而且 OpenAI 的系统卡片里,对内部幻觉测试几乎没写细节,连测试样本量都没给。
Snorkel AI 的工程师 Vincent Sunn Chen 倒是说了句公道话。
“基准分数反映的是特定的测量设置,发布前几天这些配置都在变,所以有更新我不意外。”
但他也提了个醒:改了啥,你得告诉大家啊。
其实 OpenAI 早就有同行这么干过。
去年 Meta 发 Llama 4 的时候,就被爆出用内部未公开版本跑分。连 Yann LeCun 后来都承认,数据确实“修饰”过了。
大模型军备竞赛打到现在,跑分已经成了拉客和融资的筹码。
但把跑分当成任人打扮的小姑娘,真的好吗?
涂改液抹不出真正的护城河
2027 年 OpenAI 可能要 IPO 了。
在这个节骨眼上,用这种薛定谔的跑分数据去糊弄投资者和客户,只会让市场的信任度越来越低。
当所有公司都在玩数字游戏,谁还会关心模型到底能不能解决实际问题?
毕竟,用户要的是好用的工具,不是一张满是涂改液的满分试卷。
【锐评】:跑分不够,后台来凑,OpenAI 这波“薛定谔的指标”操作,硬是把 AI 发布会玩成了魔术穿帮现场。
参考链接:
https://x.com/jeremyakahn/status/2096029945856242085