40年。一个潜伏了40年的代码漏洞,被一个AI揪出来了。
更离谱的是,这个AI的基座模型根本没换。
Z.ai 扔下了一颗重磅炸弹。GLM-5.3 正式发布,权重即将开源。推文不到一天狂揽近6000赞,47万次浏览。老实讲,现在的AI圈大家对发模型早就审美疲劳了。但 GLM-5.3 确实有点东西。
不换底座硬拔高,后训练的“暴力美学”
技术博客里有句很狂的话:“Scaling post-training is all we did for GLM-5.3.”
翻译过来就是,我们只做了后训练。基座还是 GLM-5.2 的基座,一点没动。
不换底座怎么涨性能?靠死磕环境。团队把训练任务从简单的代码练习,换成了真实的专家级工作流。模型现在要像人类工程师一样,去诊断训练栈的瓶颈、跑实验、交付端到端的加速。
数据不会骗人。Terminal Bench 3.0 从 4.6 直接干到 28.3。DeepSWE v1.1 从 46.2 涨到 66.9。内部的 Z.ai Code Bench 性能更是提升了 50%。
个人觉得,这其实是在给全行业打样。大家都在卷基座,但后训练的“压榨”空间其实大得惊人。而且它更省 token 了,Max effort 下 75K token 就能搞定,5.2 得用 96K。对开发者来说,省钱就是王道。
本想教它找Bug,它却学会了“黑”进系统
这是整篇技术博客里最抓马的部分。Emergent Cyber Capability(涌现的网络防御能力)。
团队原本只是想喂点漏洞数据,让它学学怎么找Bug。结果随着后训练规模扩大,这玩意儿自己悟了。它早就不满足于盯着孤立的代码瑕疵,直接开始推理完整的利用链。
CyberGym 得分 84.5,直接拿下第一。ExploitBench 从 24.4 翻倍到 54.4。
更狠的是实战。拿去跑真实世界的代码库,269个开源项目里揪出 2436 个漏洞。其中 1097 个是中高危。最老的一个,1981年写进去的,潜伏了40多年才被这个AI揪出来。
这已经不是在写代码了,这是在给全球软件基础设施做赛博考古。
开源的狂欢背后,许可证的“悄悄”转身
不过,先别急着狂欢。评论区有个细节很扎眼。
网友 kiri49x86 敏锐地指出:GLM-5.3 从 MIT 许可变成了半非商业许可。
说实话,这太正常了。模型越强,白嫖的代价就越大。你看评论区网友 Samking207 甚至劝他们“下次别开源了,赶紧赚钱”。
开源是情怀,是生态的敲门砖。但限制商业,才是活下去的底气。从 MIT 到非商业,Z.ai 在秀完肌肉后,终究还是要回到商业化的现实里。
GLM-5.3 证明了后训练的魔力,也展示了AI在安全领域的双刃剑属性。当AI能挖出40年前的漏洞时,我们该庆幸还是该担忧?
【锐评】:基座没换全靠后训练硬拔高,顺手挖出40年远古漏洞,这哪是发模型,分明是在给全球代码库做赛博考古。
参考链接:
https://x.com/Zai_org/status/2093354097122455713