2026年了,大模型圈还能有什么新鲜事?

智谱直接把GLM-5.3开源了。

最让人意外的是,这项目跟GLM-5.2用的是同一个底座。没换底座,全靠后训练硬生生把性能拔高了一截。

有意思的是,HuggingFace评论区有个老哥直接隔空喊话Sam Altman:

我还想问问Sam Altman,现在还觉得发布GPT-3太危险吗?都2026年了,到底在怕什么?

不换底座,后训练硬刚

老实讲,现在发个新模型,如果不换个更大的底座,大家通常是不买账的。

但GLM-5.3偏不信邪。

官方数据很直接:在内部的Z.ai Code Bench上,编码能力比5.2提升了50%。在Terminal Bench 3.0和Agents' Last Exam这些公开榜单上,直接拿下了开源SOTA。

AI配图

更夸张的是它的网络攻防能力。

随着后训练规模扩大,GLM-5.3在CyberGym漏洞发现上直接登顶。在利用链的后半段,能力比5.2翻了一倍多

个人觉得,这种把同一个底座榨干吃净的做法,比单纯堆参数秀肌肉要硬核得多。

安全锁与暴力破解

说到网络攻防能力,这就触及到了一个大厂都心照不宣的敏感地带。

美国那几家头部AI公司,在安全对齐上简直到了走火入魔的地步。稍微碰点网络安全、代码漏洞的擦边球,模型就直接装死拒答。

但GLM-5.3不一样。

有用户在评论区直言,它比美国公司的模型对cyber限制少得多。甚至在ExploitGym和ExploitBench的评测里,官方为了防作弊,特意搞了域名白名单和隔离容器。

这说明什么?说明这模型的破坏力确实到了需要严加防范的级别。

一边是美國大厂给模型戴上重重安全锁,连写个稍微复杂的爬虫都要警告你。另一边是中国开源模型在攻防测试里大杀四方。

这种反差,挺值得玩味的。

跑分没输过,账本算过吗?

别急着吹,反转来了。

能力确实强,但代价也不小。评论区有个做复杂数据分析的老哥,泼了一盆冷水。

他算了一笔账:中国模型包括Qwen3.8和之前的GLM 5.2,在跑复杂任务时存在严重的过度思考问题。

输出的token数量,是Opus和GPT模型的3到4倍。

这意味着什么?哪怕你的单价便宜,但架不住你费纸啊。实际算下来,总成本反而更高。

说实话,这点我不太认同某些唯跑分论的观点。企业是要算ROI的。你模型智力高20%,但token消耗多300%,这生意在商业落地时根本跑不通。

GLM-5.3虽然支持通过reasoning_effort参数控制思考预算,但这能不能真正解决过度思考的顽疾,还得看实际表现。

生态与未来的暗战

抛开技术争议,GLM-5.3的开源生态铺得挺广。

SGLang、vLLM、TokenSpeed全都支持,甚至还专门适配了昇腾NPU。第三方服务商DeepInfra也迅速跟进,上了OpenRouter。

有人问能不能上AWS Bedrock,有人想拿它做LoRA搞垂直领域赚大钱。还有人觉得它没带视觉能力是个硬伤,转头去夸GLM-5.3 Flash。

大模型的下半场,早就不是单纯比拼智力了。

拼的是部署成本,是生态适配,是能不能让开发者真正赚到钱。

GLM-5.3交出了一份后训练的满分答卷,但也把过度思考和安全边界的难题重新摆上了台面。

当开源模型在能力上逐渐逼近甚至超越闭源巨头时,我们到底需要的是一个绝对安全但处处受限的乖宝宝,还是一个能力爆表但需要人类自己把控边界的野马?

这个问题,恐怕比跑分更难解。

【锐评】:底座不换全靠后训练,跑分猛如虎但token烧得也猛,大模型终究要从拼智力走向拼算账了。

参考链接:
https://huggingface.co/zai-org/GLM-5.3