大模型圈最近有个魔幻现象:大家都在拼命堆参数,通义千问反手掏出一个“省钱怪兽”。

125B总参数,每次只激活6B,训练成本直接砍到前代的九分之一。老实讲,看到 Qwen3.8-Flash-Next 的技术报告时,我第一反应是:这哪是发新模型,这分明是在给 Qwen4 提前“泄密”。

Image 1: Qwen3.8-Flash-Next

把算力抠到极致,训练费直接“打骨折”

先说最炸裂的数据。

相比上一代 Qwen3.7-Plus,Qwen3.8-Flash-Next 的训练成本只有前代的 1/9。但能力呢?在编程和办公任务上全面反超。

怎么做到的?底层换血。

这次团队用上了 Muon 优化器。更有意思的是,他们直接砍掉了大模型训练里雷打不动的“Batch Size Warmup(批大小预热)”环节。

个人觉得,这种“反常识”操作,也就底层架构彻底重构才敢玩。不预热直接拉满,不仅没翻车,反而省下了 18.8% 的优化器步数。这省下来的,可都是真金白银的算力。

125B的壳,6B的魂,本地部署党的狂欢

参数结构也很有意思。

主模型 125B,外加 51B 的 N-gram 嵌入参数,看起来是个庞然大物。但每次推理,只激活 6B 参数

这意味着什么?意味着它对内存带宽极其友好。

社区里已经有极客在 128GB 内存的 Mac 和 Strix Halo 平台上跑量化版了。73GB 的模型体积,跑个 Q3/Q4 量化毫无压力。对于本地部署党来说,这简直是久旱逢甘霖。

不用买昂贵的多卡集群,一台高配个人电脑就能跑起一个百万上下文的超级助理。大模型终于从“云端神坛”走到了“个人桌面”。

四大魔改,给大模型做“微创手术”

既然叫“Next”,架构肯定有大改。这次通义千问在四个维度动了刀子。

注意力机制:GDN + QSA
传统的注意力机制看长文本就像大海捞针。现在,GDN 负责把历史信息压缩成“笔记”,QSA(Qwen 稀疏注意力)负责拿着放大镜在微块级别“划重点”。
一句话:GDN 高效记忆,QSA 精准检索。
在 100万 token 的上下文下,Prefill 吞吐量直接飙到 Qwen3.7-Plus 的 8.6 倍。

Image 2: Qwen3.8-Flash-Next architecture

Image 3: Overview of Qwen Sparse Attention (QSA)

Image 4: Relative prefill throughput at 90% cache hit rate

残差连接:Gated Residual (GR)
以前的单层残差流,信息越传越容易被稀释。现在直接拓宽成 4 个并行分支,加个动态门控。谁该读、谁该写,模型自己说了算。

嵌入层:N-gram Embedding
这 51B 的额外参数,用来记住局部短语和模式。最绝的是,它几乎不增加计算量,还能异步预取到主机内存,不占 GPU 显存。白嫖的容量,不要白不要。

当别人卷参数,他们在卷“性价比”

光说架构没意义,得看疗效。

在 SWE-bench Pro、DeepSWE 等硬核编程榜单上,Qwen3.8-Flash-Next 把 Qwen3.8-27B 和 DeepSeek-V4-Flash 按在地上摩擦。在 CoWorkBench 这种长周期办公任务里,得分甚至超越了 Claude-Opus-4.6。

Image 5: Qwen3.8-Flash on QwenWork

更狠的是价格。API 调用输入只要 0.16 美元/百万 token,输出 0.47 美元。

这让人想起社区里一条高赞评论的吐槽:美国公司还在为了商业利益挤牙膏、控制开源节奏,中国公司已经像疯了一样把底牌全亮出来。

AI配图

有意思的是,这种“无脑开源”反而逼出了极致的工程优化。当“便宜好用”成为绝对壁垒,那些还在靠算力堆砌讲故事的厂商,接下来该怎么接招?

Qwen4 的拼图已经露出了一角,真正的腥风血雨,恐怕还在后头。

【锐评】:把大模型做成白菜价还性能拉满,通义千问这波“剧透”,属实是把友商的底裤都扒了。

参考链接:
https://qwen.ai/blog?id=qwen3.8-flash-next