挤牙膏式的文本生成,该翻篇了

老实讲,过去几年我们都被自回归模型(AR)驯化了。

看着光标一个字一个字往右蹦,觉得AI就该是这样。

但2026年的今天,这套玩法正在被一群不守规矩的人掀翻。

AI配图

Inception Labs 发布的商业模型 Mercury 2,在标准GPU上跑出了 1000 tok/sec 的恐怖速度。

这是什么概念?比同级别的 Claude Haiku 或 Gemini Flash 快了整整 5到10倍

NVIDIA 搞出的 35B 参数 Nemotron Diffusion,吞吐量也是传统AR模型的 2到8倍

扩散语言模型(dLLM)早脱离了实验室玩具的阶段,它们来抢饭碗了。

落子无悔?扩散模型偏要“反复横跳”

自回归模型有个致命弱点:只能从左到右,落子无悔。

前面写错了,后面只能硬着头皮编。

扩散模型完全换了个脑子。

它根本不挨个吐字。一次性生成整个序列,然后反复修改

这就像画画,先勾个草图,再慢慢精修。

速度可以拿步数换,写错了还能中途擦掉重来,而且每一步都能看到双向上下文。

个人觉得,这才是人类写东西的真实逻辑。谁写作文是从第一个字顺到最后一个字不改的?

把文本当图像,用“填空”代替“加噪”

把扩散模型用在图像上很顺,加点高斯噪声再去掉就行。

但文本是离散的,你没法给一个汉字加上“0.5的高斯噪声”。

研究人员想了个极其聪明的平替:掩码(Mask)

这就是掩码扩散语言模型(MDLM)的核心。

前向过程,把干净的句子随机挖空,变成一堆掩码。

反向过程,让模型去填空。

说白了,这就是一个能无限生成文本的 BERT。懂点NLP的老哥听到这儿估计会心一笑。

为了解决固定长度的死板问题,他们又搞出了块扩散(Block Diffusion)。按块生成,还能完美兼容AR模型最爱的 KV 缓存。

Google 开源的 Gemma Diffusion 更是直接上了编码器-解码器架构。把“理解上下文”和“去噪填空”拆开,训练和推理速度双双起飞。

写错了怎么办?擦掉重来

标准MDLM有个毛病:填上的词就不能改了。

这在长文本里简直是灾难。

现代dLLM加入了重掩码(Remasking) 机制。

每生成几步,就故意把前面填好的一些词重新挖空,让模型结合新上下文再填一次。

还有一种更暴力的均匀状态扩散(UDLM)

不加掩码了,直接把词随机替换成字典里的其他词,然后让模型一步步把乱码“翻转”成正常句子。

这种方式天生支持纠错,任何词在任何时候都能被推翻重写。

降维打击:从蛋白质到DNA

有意思的是,dLLM 最先爆发其实在生物圈。

蛋白质和DNA序列,本质上就是离散文本。

ESM3 模型在蛋白质建模上已经大杀四方。

我们团队和 InstaDeep、BioNTech 合作的 Nucleotide Transformer v3 (NT-v3),更是直接对DNA下手。

我们用离散无分类器引导(CFG)生成调控DNA序列。

在湿实验里,这些AI设计的序列调控基因表达的效果,直接碾压了以前的基线

在科学界,dLLM 已经是实打实的生产力工具。

神仙打架与暗藏的“语法坑”

语言模型这边,战况更激烈。

LLaDA 把 MDLM scaling 到了 8B 参数,完全开源,成了学术界的宠儿。

但说实话,技术再炫,也有坑。

有开发者在复现 Diffusion Gemma 时吐槽了一个致命痛点:

两个位置的 token 需要语法协同时,它们可能会在两个合法状态间反复横跳,最后死活对不上。

这种“局部最优”导致的逻辑断裂,是扩散模型目前很难彻底根治的顽疾。

这也解释了为什么很多头部大厂还在死磕AR,没有全面倒戈。

生态、算力调度、还有那些难以名状的协调问题,都是拦路虎。

推理并行化,下一个Transformer?

最后聊个宏大的。

很多人问,扩散模型能在“纯智能”上超越自回归吗?

回看历史,RNN 为什么被淘汰?因为它是串行的,吃不满 GPU 的并行算力。

Transformer 赢了,因为它把训练变成了并行。

但从2024年开始,预训练红利见顶,大家都在卷推理时计算(Inference-time compute)

现在的推理,依然是串行的自回归。

如果扩散模型能把“推理”也彻底并行化,它可能就是推理时代的 Transformer。

用算法去适配硬件,让每一秒都能跑出更多的 FLOPs。

这场范式转移才刚刚开始,自回归的王座,还能坐多久?

【锐评】:自回归挤了这么多年牙膏,终于有人把管子直接剪开了,就看这并行推理的饼,大厂们什么时候能真正烙熟。

参考链接:
https://kuleshov-group.github.io/blog/blog/2026/how-to-build-a-diffusion-language-model/