1 token/s,慢到离谱,也快得不可思议
2.8 万亿参数。1.45 TB 专家权重。一台 M5 Max MacBook Pro,128 GB 内存,四块 SSD。
然后它跑出了 1 token/s 的稳定解码。
如果你还在用云端 API 的延迟做参照,这个数字慢得像在开玩笑。但当你知道它背后站的是 Moonshot 的 Kimi K3——一个原本需要 16 节点、约 4.8 TB 显存 才能完整运行的模型——1 token/s suddenly 变得像一场行为艺术。
这个项目叫 Deltafin。它不是 Moonshot 官方出品,而是一个独立团队把“本地跑通完整 K3”这件事,当成了一次硬核实验。
原教旨主义推理:一个比特都不改
Kimi K3 的官方定位是基础设施级模型。它的完整形态、1M token 上下文窗口、不剪枝的专家库,对家用设备来说几乎是“不可能任务”。
Deltafin 的回应是:不剪枝、不量化、不跳过任何专家。
“All 16 experts, every single token. No shortcuts, no 'close enough.' It's exactly what Moonshot shipped.”
它的质量规则很简单:每一个 token 都必须由 K3 本体验证。小模型可以草稿预测,但 K3 是最终签字的唯一权威。
所以这不是一个“看起来差不多”的缩水版 K3。这是把官方权重原封不动地塞进消费级硬件,然后硬跑。
四块 SSD 当显存,带宽神话被戳破
最疯狂的设计,是把 1.45 TB 专家权重流式加载到四块 SSD 上。内存里放不下,就边跑边读盘。
实测结果:
- 512 token 回答:1.00 tok/s
- 128 token 回答:1.13 tok/s
- 公开 17 token 提示:0.96 tok/s(上游报告是 0.68)
更有趣的是 SSD 数量 scaling:
- 1 块 SSD ≈ 四块速度的 52%
- 2 块 ≈ 73%
- 3 块 ≈ 90%
也就是说,真正卡脖子的不是总带宽,而是每层 16 次读取里最慢的那一次。堆满四块盘,边际收益已经不大。
这个发现本身,比“能跑”更值得玩味。
反转来了:首 token 要等 6.3 分钟
但别急着欢呼。
一个 512 token 的 prompt,首 token 需要约 6.3 分钟。
原因已经找到:prefill 阶段会把每层的专家重复读取 8 次。修复方案有计划,但还没做。
所以现在的真实体验是:短提示能聊,长上下文直接变成“先泡杯咖啡”。项目自己也承认这是 honest limit。长对话会更慢,因为 prefill 和缓存都会随历史膨胀。
换句话说,Deltafin 证明了“本地能跑”,但还没证明“本地好用”。
别人在量化到 3 bit,他们在死磕“原盘”
这个项目最有态度的地方,是它主动选择了一条更难的路。
其他一些号称本地跑 K3 的项目,把专家权重量化到约 3 bit。Deltafin 的评价很直接:那是另一个目标,权重已经不是 Moonshot 发布的版本,也没人测过代价。
“Deltafin is the other experiment: every expert byte exactly as Moonshot shipped it, made as fast as physics allows.”
他们的目标不是做给投资人看的 MVP,而是想看看:在 15000 美元的家用配置 上,能不能替代 200 万美元的基础设施。就算最后只学到点东西,也值了。
这种苦行僧式的坚持,难怪有网友评价:
“Reminds me of Deep Thought from Hitchhiker's Guide to the Galaxy.”
“Next level masochism.”
“A medium prompt in only 11 days.”
当本地 AI 变成一场苦行
Deltafin 还顺手塞了不少工程细节:可选的 DSpark 草稿加速、Qwen 补全加速、OpenAI 兼容的本地 server、health checks、精确复现的 benchmark……
但核心命题始终没变:能不能在客厅里,完整拥有最前沿的模型?
现在的答案是:能,但很慢。首 token 要等 6 分钟,长对话更是一场修行。
可如果我们把时钟拨快几年,当本地硬件真的能从容吞下 2.8T 参数时,人们大概会记得,曾有一群人在 MacBook 和四块 SSD 上,一寸一寸地凿出了这条路。
到那时候,1 token/s 会看起来很慢。但在今天,它更像是一个宣言:
有些东西,不是为了“够用”,而是为了证明“可以”。
而 Deltafin 问的是:如果完整版 K3 终有一天能在你家抽屉里流畅运行,你愿意为那一刻的“慢”,先鼓掌吗?
【锐评】:别人在云端拼算力,他们在客厅拼 SSD,这很极客,也很孤独。
参考链接:
https://github.com/argonautlabsai/deltafin