大模型圈最近有个魔幻现象:大家都在拼命堆参数,通义千问反手掏出一个“省钱怪兽”。
125B总参数,每次只激活6B,训练成本直接砍到前代的九分之一。老实讲,看到 Qwen3.8-Flash-Next 的技术报告时,我第一反应是:这哪是发新模型,这分明是在给 Qwen4 提前“泄密”。
把算力抠到极致,训练费直接“打骨折”
先说最炸裂的数据。
相比上一代 Qwen3.7-Plus,Qwen3.8-Flash-Next 的训练成本只有前代的 1/9。但能力呢?在编程和办公任务上全面反超。
怎么做到的?底层换血。
这次团队用上了 Muon 优化器。更有意思的是,他们直接砍掉了大模型训练里雷打不动的“Batch Size Warmup(批大小预热)”环节。
个人觉得,这种“反常识”操作,也就底层架构彻底重构才敢玩。不预热直接拉满,不仅没翻车,反而省下了 18.8% 的优化器步数。这省下来的,可都是真金白银的算力。
125B的壳,6B的魂,本地部署党的狂欢
参数结构也很有意思。
主模型 125B,外加 51B 的 N-gram 嵌入参数,看起来是个庞然大物。但每次推理,只激活 6B 参数。
这意味着什么?意味着它对内存带宽极其友好。
社区里已经有极客在 128GB 内存的 Mac 和 Strix Halo 平台上跑量化版了。73GB 的模型体积,跑个 Q3/Q4 量化毫无压力。对于本地部署党来说,这简直是久旱逢甘霖。
不用买昂贵的多卡集群,一台高配个人电脑就能跑起一个百万上下文的超级助理。大模型终于从“云端神坛”走到了“个人桌面”。
四大魔改,给大模型做“微创手术”
既然叫“Next”,架构肯定有大改。这次通义千问在四个维度动了刀子。
注意力机制:GDN + QSA
传统的注意力机制看长文本就像大海捞针。现在,GDN 负责把历史信息压缩成“笔记”,QSA(Qwen 稀疏注意力)负责拿着放大镜在微块级别“划重点”。
一句话:GDN 高效记忆,QSA 精准检索。
在 100万 token 的上下文下,Prefill 吞吐量直接飙到 Qwen3.7-Plus 的 8.6 倍。
残差连接:Gated Residual (GR)
以前的单层残差流,信息越传越容易被稀释。现在直接拓宽成 4 个并行分支,加个动态门控。谁该读、谁该写,模型自己说了算。
嵌入层:N-gram Embedding
这 51B 的额外参数,用来记住局部短语和模式。最绝的是,它几乎不增加计算量,还能异步预取到主机内存,不占 GPU 显存。白嫖的容量,不要白不要。
当别人卷参数,他们在卷“性价比”
光说架构没意义,得看疗效。
在 SWE-bench Pro、DeepSWE 等硬核编程榜单上,Qwen3.8-Flash-Next 把 Qwen3.8-27B 和 DeepSeek-V4-Flash 按在地上摩擦。在 CoWorkBench 这种长周期办公任务里,得分甚至超越了 Claude-Opus-4.6。
更狠的是价格。API 调用输入只要 0.16 美元/百万 token,输出 0.47 美元。
这让人想起社区里一条高赞评论的吐槽:美国公司还在为了商业利益挤牙膏、控制开源节奏,中国公司已经像疯了一样把底牌全亮出来。
有意思的是,这种“无脑开源”反而逼出了极致的工程优化。当“便宜好用”成为绝对壁垒,那些还在靠算力堆砌讲故事的厂商,接下来该怎么接招?
Qwen4 的拼图已经露出了一角,真正的腥风血雨,恐怕还在后头。
【锐评】:把大模型做成白菜价还性能拉满,通义千问这波“剧透”,属实是把友商的底裤都扒了。
参考链接:
https://qwen.ai/blog?id=qwen3.8-flash-next