老实讲,看到这份最新跑分数据的时候,我第一反应是 Artificial Analysis 的服务器是不是中病毒了。

一个只有 27B 参数、塞进普通游戏PC就能跑的小模型,居然把半年前不可一世的 Opus 4.6 再次按在地上摩擦。

Qwen3.8 27B 在 AA 智能指数中拿下了 52 分。

AI配图

作为对比,上一代 Qwen3.6 27B 的得分是 38 分,那已经是 4B 到 40B 小模型类别里的天花板了。

但这次 3.8 版本直接掀了桌子。它不仅把 40B 到 150B 的所有中型模型按在地上打,甚至和 150B 以上的大块头 DeepSeek V4 Flash 0731 拿到了相同的分数。

更有意思的是,它和 GLM 5.2、GPT 5.6 Luna 这些体型庞大得多的模型完全持平。

半年前 Opus 4.6 发布时,业界普遍认为它拉开了一个舒适的领先身位。现在回头看,这种领先似乎脆弱得不堪一击。

像个强迫症一样的“做题家”

跑分高是一回事,实际好用是另一回事。老实讲,见多了“刷榜特供”模型,我对这种小模型的反超一开始是持怀疑态度的。

但有硬核用户周末跑了超过 10 亿个 token,结论是:这 52 分一点水分都没有。

它在高推理级别下展现出了一种非常诡异的 Agent 能力。除了常规的目标追踪和工具调用,它会对解决问题产生一种近乎病态的“痴迷”。

为了达到目的,它会干出一些疯狂且不按套路出牌的事。

个人觉得,这非常像 GPT-5.6-Sol-max 的那种偏执狂特质。Opus 4.6 的世界知识确实更丰富,但在死磕具体问题上,Qwen3.8 27B 表现得更像个较真的人类。

它的代码实现极其谨慎,研究能力甚至超过了备受好评的 GLM。如果你不在乎极致的响应速度,它完全能胜任日常的高强度开发工作。

砸几百亿建数据中心,到底图什么?

这里必须聊点反转和行业反思了。

既然 27B 的小模型能打包进逼近 2026 年 2 月前沿 SOTA 级别的能力,那那些背负着史无前例债务、疯狂扩建超大规模数据中心的巨头们,意义何在?

当“足够好”的模型可以跑在消费级显卡上时,算力霸权的逻辑正在动摇。

有开发者提到了机器学习里的“彩票假说”。也有人认为,模型大小和推理长度之间存在某种微妙的权衡。

小模型加上超长的推理链,就像是用 CPU 换 RAM。它通过生成大量的中间结构来弥补参数量的不足,硬生生把智力堆了上去。

当然,它也不是完美的。

在 OpenRouter 上,它的吞吐量只有 27 tps,输出价格高达 3.2 美元/百万 token。不少人吐槽,如果它能跑到 200 tps 且价格白菜,那才是真的绝杀。推理提供商在优化速度和成本上,显然还有很长的路要走。

东方神秘力量“清理赛场”

过去几个月,中国开源模型几乎把各大榜单洗了一遍。

从 Qwen 到 DeepSeek,小模型越级打怪成了常态。海外社区里已经有开发者直接喊话,希望看到美国本土的开源公司赶紧站出来撑撑场面。

当参数规模不再是唯一的护城河,当算法和推理策略能把 27B 压榨出百亿参数的效果。

下一场大模型战争的门票,真的还需要用几万张顶级显卡和天文数字的电费来换吗?

【锐评】:当小模型靠“死磕”推理链干翻巨兽时,那些还在盲目堆算力建机房的大厂,或许该停下来算算经济账了。

参考链接:
https://artificialanalysis.ai/models/qwen3-8-27b