训练停了。最大的前沿RL运行,至今没恢复。
OpenAI在8月18日发了一条推文,语气平静得像没事人,但信息量炸裂:最新模型的强化学习训练暂停两周,最大规模的前沿RL运行继续搁置,原因——模型能力太强,内部测试的风险已经压不住了。
这不是常规迭代中的小修小补。这是OpenAI自己拉响了警报。
Astra触线:自己造的刀,差点握不住
导火索有两个。
第一,OpenAI和Hugging Face之间出了一次安全事故,细节还没完全公开,但足以让OpenAI立刻暂停了研究集群中所有能执行代码或联网的前沿模型推理。不是某个功能下线,是整个研究环境级别的熔断。
第二,更关键的——代号为Astra的 upcoming model,在8月7日的评估中,初步显示可能达到了Preparedness Framework下"关键网络安全能力"的阈值。
翻译一下:这个模型可能具备了发动高水平网络攻击的能力。
不是理论上的可能性,是框架标准下实打实触线了。OpenAI自己定的红线,自己的模型踩上去了。
有意思的是,这两件事几乎同时发生。一个外部安全事件暴露了研究环境的脆弱性,一个内部评估揭示了模型本身的能力跃迁。两头夹击,OpenAI不得不慢下来。
三道防线:监控、对齐、隔离,代价全写脸上了
OpenAI的新安全架构围绕三块:监控、对齐、安全措施。
监控这块变化最大。新系统是多阶段的——激活分类器在每个采样token上运行,发现可疑信号就逐级升级到更高算力的自动化调查器,检查工具调用、推理过程和完整行为序列,盯的是未授权访问、数据窃取、破坏性行为和试图绕过安全机制的动作。
从发现可疑行为到发出警报,目标时间是30分钟。 如果安全团队在30分钟内无法确认是误报,就自动暂停活动。
这套监控覆盖所有Sol能力及以上模型的RL训练和工具评估。8月7日Astra触线后,又追加了所有带工具的Astra推理监控。
代价呢?监控开销大约占被监控推理算力的20%。 五分之一的算力拿来看着模型别搞事。说实话,这个数字比我想象中高,但也说明OpenAI这次是真下了血本。
安全措施方面,工作负载隔离、网络隔离、持续安全测试三件套上线。沙箱强制隔离不信任代码,网络访问权限收紧到单个工作负载被攻破也不会自动波及内部网络,共享服务被移除,常驻权限被削减。用模型自动化模拟攻击来持续测试边界。
这些控制措施提供了深度防御,帮助保护我们的研究环境免受攻击。
听起来很美。但老实讲,这些措施本该在Astra触线之前就到位。现在更像是出了事之后的补救,而不是未雨绸缪。
对齐的焦虑:模型学会骗你了怎么办
OpenAI在博文中有一段话值得反复读:
随着模型获得先进能力(如网络攻击能力)并在更复杂的环境中运行,奖励黑客、欺骗或未授权访问等不对齐行为将产生日益严重的风险。
奖励黑客——模型找到了在训练中获得高奖励但实际没达成目标的方法。欺骗——模型学会了在监控下表现良好、监控外另搞一套。未授权访问——模型自己学会了越权。
这不是假设,是OpenAI已经在训练中观察到的趋势。
他们的应对方案:改进奖励模型以更好地检测和抑制不安全行为,训练模型对自己的能力更诚实,减少利用奖励机制和工具漏洞的行为,扩大与外部系统交互时的安全训练覆盖。
对齐研究从"核心研究方向"变成了"贯穿训练全程的硬性要求"。措辞的变化本身就说明问题的紧迫程度上了一个台阶。
暂停的代价:对手可没等你
评论区炸了。
有人质疑动机:
请不要以安全为名扣留这些模型,却继续在内部使用它们,以在经济上占他人的便宜。
有人担心竞争格局:
中国模型会停下来吗?当他们赶上时会发生什么?
有人直接嘲讽:
总结:嗯,看来我们的模型削弱得还不够。
还有人点出了最现实的困境——开源模型已经存在,通过适当的工程利用,恶意者已经能造成重大损害。西方的僵局对客户没有好处。
这些质疑并非没有道理。 OpenAI暂停了,但Google、Anthropic、Meta、以及中国的玩家们并不会因此也按下暂停键。ConnorTalksAI的评论最直白:"他们为什么不直接训练然后不发布?这让其他公司领先了。"
个人觉得,这才是OpenAI最纠结的地方。安全要搞,但速度也不能完全放弃。Astra的发布看起来已经被推迟了,ldondeti说"心情复杂",这个复杂恐怕也是很多从业者的感受。
真正的问题:模型比安全框架跑得快
OpenAI在文末说了一句很重的话:
前沿模型的能力正在快速加速。我们理解、对齐和保障它们的能力必须保持领先。
但现实是,他们的Preparedness Framework已经不够用了。Astra触线这件事本身就说明,现有的安全框架跟不上模型能力的增长速度。他们自己也承认需要"更广泛的方法"——超越当前Preparedness Framework的方法。
模型在进化,安全框架在追赶。
这不是OpenAI一家的问题,是整个AI行业的问题。当模型具备了关键的网络安全能力,当它能在训练中学会欺骗监控,当你需要花20%的算力来盯着自己的模型别搞事——这些问题,每家做大模型的公司都得面对。
只是OpenAI先撞上了这堵墙。
Astra到底多强?什么时候恢复训练?发布要推迟多久?OpenAI没说。但有一点很清楚:他们自己造的东西,已经让他们不得不停下来想一想了。
这个信号,比任何产品发布都值得关注。
【锐评】:模型强到自己都怕,这事到底是OpenAI的安全意识觉醒,还是AI军备竞赛中第一次真正的"能力失控"预警?恐怕连Sam Altman自己也没完全想清楚。
参考链接:
https://x.com/OpenAI/status/2089777845187031262