当整个行业还在比谁的模型更“聪明”时,Inception Labs 决定比一比谁更快、更省、更能在生产环境里活下来。
他们刚刚发布了 Mercury 2.5。官方原话很直接:这是市面上最强的扩散语言模型(dLLM),也是有史以来训练过的最大的扩散语言模型。
不是更大,而是更快。不是最强,而是刚刚好。
当“大”不再是答案
Mercury 2.5 的核心卖点不是参数堆叠,而是把“低延迟”做成了武器。
- 1107 tokens/秒,在广泛可用的 NVIDIA GPU 上跑通;
- 260K tokens 上下文;
- 输入 0.20 美元/百万 token,输出 0.75 美元/百万 token;
- 首发再打八折:输入 0.04 美元,输出 0.15 美元。
Inception 自己说,Mercury 2.5 相比 Mercury 2 智力提升了 40%,质量已经能跟 GPT-5.6 Luna (Low)、Gemini 3.5 Flash-Lite、Claude Haiku 4.5 这类“成本优化型前沿模型”掰手腕。
NVIDIA 加速计算产品高级经理 Shruti Koparkar 的评价也很有意思:
“Mercury 2.5 在智力上的提升,配上持续的高速和低成本,正说明新架构能在 NVIDIA 平台上多快成熟为生产级系统。”
换句话说,这不是实验室玩具,是奔着“上线即赚钱”去的。
三个真实战场:搜索、语音、编程
真正让 Mercury 2.5 有画面感的,是三个已经被客户验证过的场景。
搜索代理和 RAG 流水线
一个搜索请求可能触发几十次模型调用:规划、改写、重排、结构化、总结、校验。Mercury 的任务,就是把这些调用压缩进一次用户交互里。Inception 说,已有几家领先的搜索基础设施公司把它跑进了生产环境。
语音代理
对语音来说,延迟不是基础设施细节,而是用户耳朵能听出的“停顿”。
OpenCall 的 CEO Oliver Silverstein 给出了一组对比:
“切换 Mercury 后,我们的 P99 响应时间从几分钟降到 1 秒,P50 从 0.4 秒降到 0.2 秒以下——比我们见过的任何供应商都快,包括带推理的模型。”
中位延迟接近 170 毫秒。对打电话的人来说,这就是“自然”与“机械”的分界线。
编程辅助
Augment Code 用 Mercury 做上下文压缩、模型路由和 MCP 工具搜索。迁移压缩任务后,延迟从约 150 秒降到 27 秒,砍掉 82%,成本降低 90%,质量没掉。
工具搜索摘要也能在 1 秒内返回。
这些数字不是跑分,是客户账单上的真实变化。
便宜到离谱,快到犯规
如果只看纸面价格,Mercury 2.5 几乎是在挑战行业常识。
首发 0.04 美元/百万输入 token 是什么概念?你让模型读完整部《红楼梦》,可能还不够买一杯咖啡。
但低价没有让它变成“廉价替代品”。Inception 还同步放出了两个 preview:
- Mercury Voice:TTFT 低于 170 毫秒,专门给语音代理这种“延迟预算最紧”的场景;
- Mercury Router:用 dLLM 理解请求,再路由到最合适的模型(包括开放和闭源模型),在质量、速度、成本之间做动态平衡。
这等于在说:我们不只卖一个快模型,还想做你模型栈里的“调度大脑”。
但先别急着吹爆
评论区里也有冷水。
有人直接说:
“我还以为会是开放权重,结果不是。”
这是事实。Mercury 2.5 目前通过 Inception API、Baseten 和 OpenRouter 提供服务,没有开放权重。
还有人测试后认为:
“Mercury 2.5 远不是前沿模型,但作为通用聊天机器人已经可用,价格和成本让它很有吸引力。”
Inception 自己也说得很克制:它对标的是“成本优化型前沿模型”,不是 GPT-5.6 满血版或 Claude 4 全家桶。
所以 Mercury 2.5 的真正价值不是“最强”,而是“够用且极快”。它适合的是那种“调用次数多、延迟敏感、成本敏感”的代理系统,而不是一次性的炫技聊天。
下一步:把扩散模型推上主桌
Inception 已经宣布,下一款模型正在训练中,是他们有史以来最大的模型,未来几个月发布。
目标是:能力大幅跃升,但不牺牲扩散模型的速度和 token 效率。
这意味着他们要在训练、推理、评估、基础设施四条线上同时推进。如果成功,扩散 LLM 可能不再只是“快速替代方案”,而是会变成主流架构之一。
毕竟,当大模型从“秀智商”进入“拼落地”阶段,快、省、稳就是新的护城河。
Mercury 2.5 未必是那个最聪明的模型,但它可能是 2025 年最懂“上班”的模型之一。
【锐评】:当所有人卷智商,Inception 用“快+省”撕开了一道新口子,但闭源和通用能力的天花板,是它接下来必须回答的问题。
参考链接:
https://www.inceptionlabs.ai/blog/introducing-mercury-2-5