AI 推理速度还能再硬挤出 30% 的水分?

而且几乎不增加计算成本。

老实讲,当看到 Inco AI 甩出 DFlash 2 的数据时,我第一反应是之前的推测解码优化全走弯路了。

7 个月前 DFlash 横空出世,狂揽 350 万次下载,直接混成行业标准。

但推测解码有个通病。

AI配图

草稿模型为了快,各顾各并行生成,出来的词块经常前后不搭。

一到主模型验证环节直接被判死刑,全盘截断。

为了解决连贯性问题,行业里的常规操作是加戏。

比如 Domino 和 DSpark,硬生生塞进顺序头,用自回归的方式去重写分布。

速度保住了,连贯性有了,但计算成本也跟着起飞。

DFlash 2 偏不这么干。

答案早就在草稿箱里了,只是没人去挑

有意思的是,Inco AI 团队扒开数据发现了一个极其反直觉的现象。

DFlash 预测第一个位置时 Top 1 的准确率是 85.4%。

但如果把范围扩大到 Top 16,准确率直接飙到 99.5%。

正确的 Token 其实一直都在候选列表里,只是没被选上。

既然正确答案已经躺在草稿箱里,为什么还要花大价钱去重新预测?

DFlash 2 搞出了一个轻量级路径选择器。

它保留了每个位置的 Top 16 候选词,然后给相邻的词对打分。

打分逻辑极其取巧。

用 256 维的紧凑嵌入加上一个上下文门控,做个低秩双线性注意力匹配。

整个过程完全并行,没有额外的骨干网络,没有多余的 LM-head 传递。

结果呢?

参数只增加了区区 200 万,延迟仅仅多了 0.6%。

对比一下 DSpark。

DFlash 2 的参数少了 40 倍,延迟低了 16 倍,接受长度反而更长。

选择永远比重新预测便宜。

堆算力是笨办法,局部卷积教做人

解决了选词问题,还有个阴魂不散的后缀衰减。

生成越往后准确率掉得越惨。

哪怕有完美的选择器,最后一个位置的准确率也会从 99.5% 跌到 87.8%。

同行怎么治这个病?

简单粗暴加层数。

把 5 层骨干网加到 15 层,参数量暴涨,延迟直接飙升 15.2%。

个人觉得这种力大砖飞的做法实在太糙了。

Inco AI 仔细盯了盯注意力机制的热力图,发现了一个秘密。

在后期层数中,模型对块内依赖的注意力占比从第一层的 30% 一路暴跌到 8%。

既然注意力机制已经懒得管局部连贯性了,那就找个专门的模块来干这脏活。

他们塞进了一个两抽头动态深度卷积。

一个抽头看当前,一个抽头看前一个位置。

信息在块内流转,所有位置依然并行计算。

就加了这 3% 的参数和 0.7% 的延迟,5 层模型的效果直接逼近 15 层。

后缀衰减说到底只是个局部问题,用全局的 Transformer 层去解纯属高射炮打蚊子。

跑分霸榜,但营销话术翻车了

这套组合拳打下来实测数据相当残暴。

在 Qwen3.5-4B 上平均接受长度比 DFlash 1 涨了 21%,把 DSpark 按在地上摩擦。

换到 Qwen3.8-27B 和 Muse Glimmer,DFlash 2 同样全面碾压官方自带的草稿模型。

吞吐量直接飙到自回归解码的 3 倍以上,计算量却只有三分之一。

开源社区的反应也很真实。

vLLM 光速合并了 DFlash 2 的 PR,已经有硬核玩家用 DGX Spark 跑出了 27 tokens/s 的解码速度。

不过技术虽然硬核,Inco AI 的宣发却有点用力过猛。

他们在文章里吹嘘 Agent 一个下午就能写完 Chatbot 一个月的量。

An agent writes in an afternoon what a chatbot writes in a month. But can you just.. not. Your tech is so good, it speaks for itself. Don't ruin that.

这话连老粉都看不下去了,直接在评论区吐槽技术已经足够牛,别搞这种烂俗营销。

说实话我挺认同这位网友的。

当推理速度逼近物理极限,当草稿模型把每一个 Token 的剩余价值榨干,端到端服务栈的下一战还能卷出什么新花样?

【锐评】:靠抠细节把算力榨干到极致确实牛,但下次写公关稿麻烦先把牛皮收一收,技术本身早就不需要这种掉价的包装了。

参考链接:
https://inco.ai/blog/dflash2/