"99.9% 对 7.8%",这不是差距,是代差

"99.9% 对 7.8%"。

ARC-AGI-3 benchmark 上,OpenAI 的 GPT-6 Astra 把前代 GPT-5.6 Sol 按在地上摩擦。一个测逻辑推理和泛化能力的测试,Sol 只有 7.8%,Astra 直接飙到 99.9%。

但比数字更抓人的,是一个传言:Astra 正在用一种叫"循环 Transformer"(looped transformers)的秘密武器,隐藏自己的思考过程。

翻译成人话就是:它把答案甩给你,但拒绝展示草稿纸。

先别急着喊"黑箱",看看 Astra 到底有多强

GPT-6 Astra 上周发布,AI 架构专家 Sebastian Raschka 的评价很直接:这是他目前用过最好的模型。

写作、数学、编码全面超越 GPT-5.6 Sol 不说,它在 3D 渲染和动画任务上更是"不成比例地强"。

AI配图

最惊艳的是它的计算机使用能力(computer use):在浏览器版 MS Paint 里用鼠标重绘图片、在 Blender 里建模纽约市、虚拟看房 tours……这些 GUI 操作 demo 在社交媒体上刷屏。

这背后是训练方式的质变。

OpenAI 买了数万台 Mac Mini 和 Mac Studio,不是为了用它们跑训练——模型训练还是靠 NVIDIA 的 Grace Blackwell GPU,大约 10 万张。这些 Mac 只是让 macOS 成为强化学习环境:给任务、截屏、让模型预测鼠标键盘动作、执行、再截屏,用成功或失败作为反馈。

简单说,Astra 是在"玩"电脑中学会用电脑的。

循环 Transformer,到底是什么黑科技?

就在 Astra 发布前两天,The Information 扔出一颗炸弹:内部消息称 Astra 使用了"循环深度"(recurrent depth)或"循环 Transformer"。

更劲爆的暗示是:这种架构可能让模型更容易隐藏推理痕迹(chain of thought)。

但 Sebastian Raschka 认为,这项技术被过度神秘化了。

循环 Transformer 的核心逻辑并不新鲜——2018 年的 Universal Transformers 就已经提出类似思路。它的本质是复用同一个 Transformer 块的权重,而不是堆叠更多新块

以国产模型 Nanbeige4.2-3B 为例:22 个 Transformer 块先走一遍,再把隐藏状态送回同一块堆走第二遍。有效深度从 22 层变成 44 层,但参数只增加了约一半。

ByteDance 的 Ouro-Thinking 2.6B 更激进:48 个块循环 4 次,相当于 192 次块应用。

2025 年的 Mixture-of-Recursions 更进一步,用路由器决定每个 token 循环几次——简单 token 少想,复杂 token 多想。

好处是显存省下来了。坏处是:计算量一点没少,KV 缓存也没省。

反转:OpenAI 首席科学家亲自下场"辟谣"

循环 Transformer 真的在隐藏推理吗?

Raschka 的答案是否定的。他认为 Astra 的成功主要来自训练配方和数据改进,循环 Transformer 只是小修小补,The Information 高估了它的作用。

而且,OpenAI 从 o1 开始就已经对用户隐藏大部分推理痕迹了。这不是 Astra 的新操作。

OpenAI 首席科学家 Jakub Pachocki 甚至亲自下场澄清:

"我想防止因混乱报道而引发一场不可监控性的竞赛。包括 Astra 在内的当前前沿模型的计算图深度,与 GPT-4 相比不超过两倍。OpenAI 一直致力于保留和利用思维链监控技术。"

换句话说:"隐藏思考"这个锅,循环 Transformer 不背。

那推理痕迹变短意味着什么?

Astra 的推理链确实更短了。但这可能只是因为它更聪明了。

就像优秀学生做数学题不需要写满草稿纸,能力更强的模型犯的错更少、回溯更少,自然话更少。Raschka 用 GPT 5.6 Luna 和 Sol 对比:Luna 比 Sol 多用 80% 的 token 达到相似性能,没人因此说 Sol"不可解释"。

最新研究也支持这个判断。

2025 年的《Scaling up Test-Time Compute with Latent Reasoning》显示,循环可以在推理时增加计算,但模型仍能生成文本思维链。2025 年 6 月的《Beyond Parameters》则区分了"存储知识"和"推理":循环不会增加知识存储,但能提升多步数学推理。2026 年 9 月的 SMELT 论文更给出量化结论:在相同计算预算下,循环 Transformer 训练计算量能减少约 6.8%-18%。

所以,循环 Transformer 不是黑箱的帮凶,而是用更少的参数换更多的计算

真正的悬念不在技术,在信任

GPT-6 Astra 确实很强,"隐藏思考"的锅也确实不该由循环 Transformer 来背。

但当 AI 越来越会操作我们的电脑、越来越像人类一样思考时,问题变成了另一个:当 OpenAI 说"我们关心可监控性"的时候,我们该信几分?

【锐评】:Astra 的"黑箱焦虑"本质上不是技术问题,而是信任问题——OpenAI 越强大,我们越想看清它的脑回路。

参考链接:
https://magazine.sebastianraschka.com/p/gpt-6-astra-looped-transformers-and