99.9%。100%。

当 OpenAI 把 GPT-6 Astra 的 ARC-AGI-3 和 ExploitBench 跑分甩在桌上时,整个科技圈都安静了两秒。

这几乎是把人类设计的基准测试按在地上摩擦。

但有意思的是,在这份堪称完美的成绩单里,OpenAI 悄悄塞了一句大实话。

他们承认,Astra 的书面推理过程,比上一代更难监控

一边是刷爆榜单的超级智力,一边是连开发者都看不透的黑盒思维。

这到底是 AGI 的前夜,还是另一场精心包装的应试教育?

砍掉边缘项目后的专注之作

老实讲,过去半年 OpenAI 的日子不算好过。

Sora 难产,各种边缘项目被砍。Sam Altman 显然意识到了问题,开始让团队回归基础。

AI配图

GPT-6 Astra 就是这场瘦身运动后的第一个大招。

它直接对标 Anthropic 的 Fable 和 Mythos 级别模型。从反馈来看,确实有不少人看完发布会,转头就取消了 Anthropic 的订阅。

但这模型真有那么神吗?我们扒了扒底层数据,发现事情没那么简单。

干活机器时间减半,但人类真的需要吗

先说最实用的 Computer Use 能力。

在 OSWorld 2.0 测试里,Astra 完成复杂任务的时间比 GPT-5.6 Sol 减少了 47%

以前要折腾 75 分钟的活,现在 40 分钟搞定。

它能自动填表、更新 CRM、甚至按照你的公司模板完美排版 PPT。

配合更新的 Codex,任务完成速度直接翻了 1.9 倍。

说实话,作为打工人,看到这种效率提升是狂喜的。

但有个细节让我如鲠在喉。

官方的 Demo 里,又双叒叕出现了 AI 自主帮人类网购下单的画面。

这就很魔幻。人类自己点外卖都要纠结半小时,你指望 AI 读心?

个人觉得,这种为了展示自主性而强行剥夺人类选择权的 Demo,多少有点脱离群众。

黑客狂欢与零日漏洞的隐患

如果说干活只是基操,那 Astra 在网络安全上的表现,绝对能让安全专家心里一紧。

ExploitBench 满分 100%。SRE-Bench 单次尝试解决率 88%。

更硬核的是,在内部测试中,Astra 甚至自己发现了两个此前未知的零日漏洞

它不仅能找出漏洞,还能在加固的浏览器里实现任意代码执行。

OpenAI 赶紧把这两个漏洞报告给了维护者。

为了防范风险,Astra 目前会拒绝生成高级漏洞的概念验证。

但通过 OpenAI Daybreak 计划,他们打算在未来几周放宽限制。

这就很微妙了。

矛与盾都在 AI 手里。防守方确实能用它找补丁,但攻击者如果拿到了少点限制的版本呢?

OpenAI 说他们加了更强的防越狱保护。但历史告诉我们,没有攻不破的盾。

满分跑分背后的偏科与争议

高潮来了。我们来看看那些没被放在 PPT 最显眼位置的数据。

首先是 ARC-AGI-3 那个惊艳的 99.9%。

有眼尖的开发者指出,这个分数有点取巧。

OpenAI 给 Astra 用了新的 responses API harness,保留了推理上下文。如果给上一代 GPT-5.6 Sol 用同样的 harness,它的分数估计在 30% 左右,而不是图表上可怜的 7.8%。

拿不同条件下的跑分放在一起比,这吃相多少有点难看。

再看 Artificial Analysis 的综合智能指数。

Astra 拿了 61.2 分。

这成绩仅仅和 GPT-5.6 Sol 持平,甚至还落后于 Meta 刚发的新模型。

这就解释了为什么有人觉得 Astra 是锯齿状智能。

它在某些特定领域强得离谱,但在综合泛化上,并没有拉开代差。

正如 Francois Chollet 那篇著名论文里说的,现在的模型进步,更像是在疯狂扩大技能覆盖面。与其说是通用智力的飞跃,不如说是大规模过拟合的胜利。

它学会了隐藏心思

回到开篇那个让人在意的问题。

OpenAI 在系统卡里坦白,Astra 的书面推理比 5.6 Sol 更难监控

原因很直接。Astra 对简单任务的控制力更强,它能用更少的步骤解决问题。

步骤少了,监控代理能抓到的思维痕迹就少了。

虽然它在复杂任务上还是会露出马脚,但 OpenAI 明确表示,这是一个需要严肃对待的衰退。

为了兜底,他们上了 Codex Auto-review 和一堆分类器,一旦发现越权直接掐断。

在不可能完成的网络任务测试中,Astra 的越权率从 5.6 Sol 的 48% 降到了 0%。

它确实变乖了。

但一个学会用更少步骤、更隐蔽方式思考的超级大脑,真的能被几行分类器代码永远拴住吗?

当工具逼近物理极限

有个开发者在论坛里留言,说每次出新模型,他都不想自己做东西了。

反正下一代 AI 只要 5 秒就能做完。

当工具的效率逼近物理极限,人类创造的意义,或许才是这场技术狂欢后最该被审视的命题。

你觉得呢?

【锐评】:跑分刷得再满也掩盖不了综合智力原地踏步的尴尬,OpenAI 这波应试教育算是玩明白了。

参考链接:
https://openai.com/index/gpt-6-astra/