AI 推理速度还能再硬挤出 30% 的水分?
而且几乎不增加计算成本。
老实讲,当看到 Inco AI 甩出 DFlash 2 的数据时,我第一反应是之前的推测解码优化全走弯路了。
7 个月前 DFlash 横空出世,狂揽 350 万次下载,直接混成行业标准。
但推测解码有个通病。
草稿模型为了快,各顾各并行生成,出来的词块经常前后不搭。
一到主模型验证环节直接被判死刑,全盘截断。
为了解决连贯性问题,行业里的常规操作是加戏。
比如 Domino 和 DSpark,硬生生塞进顺序头,用自回归的方式去重写分布。
速度保住了,连贯性有了,但计算成本也跟着起飞。
DFlash 2 偏不这么干。
答案早就在草稿箱里了,只是没人去挑
有意思的是,Inco AI 团队扒开数据发现了一个极其反直觉的现象。
DFlash 预测第一个位置时 Top 1 的准确率是 85.4%。
但如果把范围扩大到 Top 16,准确率直接飙到 99.5%。
正确的 Token 其实一直都在候选列表里,只是没被选上。
既然正确答案已经躺在草稿箱里,为什么还要花大价钱去重新预测?
DFlash 2 搞出了一个轻量级路径选择器。
它保留了每个位置的 Top 16 候选词,然后给相邻的词对打分。
打分逻辑极其取巧。
用 256 维的紧凑嵌入加上一个上下文门控,做个低秩双线性注意力匹配。
整个过程完全并行,没有额外的骨干网络,没有多余的 LM-head 传递。
结果呢?
参数只增加了区区 200 万,延迟仅仅多了 0.6%。
对比一下 DSpark。
DFlash 2 的参数少了 40 倍,延迟低了 16 倍,接受长度反而更长。
选择永远比重新预测便宜。
堆算力是笨办法,局部卷积教做人
解决了选词问题,还有个阴魂不散的后缀衰减。
生成越往后准确率掉得越惨。
哪怕有完美的选择器,最后一个位置的准确率也会从 99.5% 跌到 87.8%。
同行怎么治这个病?
简单粗暴加层数。
把 5 层骨干网加到 15 层,参数量暴涨,延迟直接飙升 15.2%。
个人觉得这种力大砖飞的做法实在太糙了。
Inco AI 仔细盯了盯注意力机制的热力图,发现了一个秘密。
在后期层数中,模型对块内依赖的注意力占比从第一层的 30% 一路暴跌到 8%。
既然注意力机制已经懒得管局部连贯性了,那就找个专门的模块来干这脏活。
他们塞进了一个两抽头动态深度卷积。
一个抽头看当前,一个抽头看前一个位置。
信息在块内流转,所有位置依然并行计算。
就加了这 3% 的参数和 0.7% 的延迟,5 层模型的效果直接逼近 15 层。
后缀衰减说到底只是个局部问题,用全局的 Transformer 层去解纯属高射炮打蚊子。
跑分霸榜,但营销话术翻车了
这套组合拳打下来实测数据相当残暴。
在 Qwen3.5-4B 上平均接受长度比 DFlash 1 涨了 21%,把 DSpark 按在地上摩擦。
换到 Qwen3.8-27B 和 Muse Glimmer,DFlash 2 同样全面碾压官方自带的草稿模型。
吞吐量直接飙到自回归解码的 3 倍以上,计算量却只有三分之一。
开源社区的反应也很真实。
vLLM 光速合并了 DFlash 2 的 PR,已经有硬核玩家用 DGX Spark 跑出了 27 tokens/s 的解码速度。
不过技术虽然硬核,Inco AI 的宣发却有点用力过猛。
他们在文章里吹嘘 Agent 一个下午就能写完 Chatbot 一个月的量。
An agent writes in an afternoon what a chatbot writes in a month. But can you just.. not. Your tech is so good, it speaks for itself. Don't ruin that.
这话连老粉都看不下去了,直接在评论区吐槽技术已经足够牛,别搞这种烂俗营销。
说实话我挺认同这位网友的。
当推理速度逼近物理极限,当草稿模型把每一个 Token 的剩余价值榨干,端到端服务栈的下一战还能卷出什么新花样?
【锐评】:靠抠细节把算力榨干到极致确实牛,但下次写公关稿麻烦先把牛皮收一收,技术本身早就不需要这种掉价的包装了。
参考链接:
https://inco.ai/blog/dflash2/