10 分钟音频,2 秒转完:关键不是快,是“不要钱”

10 分钟音频,2 秒转完。

5 分钟录音,1 秒变成 studio 级音质。

10 分钟视频,5 秒剪出十几个短视频片段。

AI配图

完成这些的不是某家云端大厂的 GPU 集群,而是你口袋里那块已经买了五年的旧手机芯片。

今天,一家叫 Desert Ant Labs 的欧洲 AI 实验室正式亮相。他们推出了 18 个端侧模型(12 个稳定版、6 个测试版),覆盖音频、视觉、文本,通过一个 SDK 支持 Swift、Kotlin 和 JavaScript。每个模型每月在 10 万台活跃设备内免费使用,没有 token,不用登录。

说实话,这个开场白比任何 PPT 都更扎心。

当整个行业还在为 GPT-4 的 API 账单和延迟焦头烂额时,有人突然说:别 call 云端了,你手机里的芯片本来就能干这些活。

一个视频 App 被云账单逼出来的“自救”

Desert Ant Labs 不是从论文里长出来的。

过去五年,他们一直在做一款叫 Detail 的视频 App,主打“端侧优先”。但当他们想做 Auto Edit、音频增强这类功能时,还是只能 fallback 到云端 API。

结果?用户越多,账单越疼。

“Every few months I'd hunt for useful on-device models... the foundation was there: the chips, Core ML, the research. What was missing was everything between that foundation and actually implementing a feature in your app.”

翻译一下:芯片有了,论文有了,Core ML 也有了,但中间差一个“ drop-in 就能用”的模型。

于是他们干脆自己训练。

这帮人把训练模型当成产品设计问题来解。最后的结果是:自家模型在速度、质量、成本上同时超过了云服务,体积还更小。

比如 Clear,一个只有 9MB 的音频增强模型,取代了原来的 Dolby;Voz 让端侧转录速度提升了 5 倍;Clips284MB 的模型,把 10 分钟视频剪成十几个片段,只要 5 秒——比 Claude Sonnet 快 10 倍,能耗低 470 倍,质量却一样。

Detail 6 甚至会完全替换掉所有云 API,全部在设备上跑。

这已经不是“优化”,这是把云厂商从 App 里“请出去”。

470 倍省电背后,是对 AI 产品逻辑的重新洗牌

Desert Ant Labs 的野心不止于几个小模型。

他们算了一笔账:今年全球在数据中心上的投入约 4500 亿美元,但每年出货的手机、平板、笔记本电脑超过 10 亿台,里面搭载的芯片大部分时间都在闲着。

“There's more compute available in people's hands than in every AI data center on earth.”

换句话说,你买手机时已经付过算力钱了。

当推理不再按 token 收费,产品逻辑会完全变样:你可以对每一条消息、每一帧画面、每一次按键都跑模型,而不是只挑“付得起钱”的那部分处理。数据不出设备,延迟趋近于零,隐私问题直接消失。

他们把第一批模型称为 “cerebellum(小脑)”——负责那些永远在线、但不需要 conscious thought 的工作:平衡、节奏、本能反应。

然后才是 “cortex(皮层)”一个本地小模型先判断任务该交给谁,搞不定再上大模型,最后才上云。

“Frontier intelligence, built from the small end up.”

这话说得很欧洲,也很挑衅。

在欧洲,“on-device” 被定义成一种 主权默认数据不离开用户的手,功能不依赖别人的云,没上传过的东西,政府也强迫不了。

反转:商业模式呢?而且,这会不会只是开源模型的“精装修”?

当然,评论区没打算让他们轻松过关。

第一个被反复追问的问题就是:“How do they make money?”

“Cloud LLM billing makes sense... These local models are like old school software.”

免费到 10 万台设备,没有 token,没有登录——听起来像慈善。有人担心,这种“老派软件”的商业模式在 AI 时代能不能跑通。

更狠的质疑来自技术圈:

“Voz is Parakeet 0.6B v3. Clear is DeepFilterNet 3. Ear is the language predictor from whisper-tiny... Shiny layer of marketing and proprietary code on top of open models?”

也就是说,这些模型可能并非从零自研,而是在开源模型基础上做了工程优化和包装。Voz 被指只是 Parakeet v3 加了新的推理代码,而且仅限 macOS/iOS。

还有其他槽点:

  • 平台偏向严重Swift、Kotlin、JS 都有,但 没有 Python SDK
  • 性能基准多在 iPhone 上跑,移植到 20 美元的 VPS 或普通安卓机未必还能飞。
  • 有人试听 Clear 的 demo 后表示,“raw 和 enhanced 听起来完全一样”。
  • 甚至有人吐槽官网文案“太像 LLM 写的”,看完先打折扣。

这些质疑不一定推翻 Desert Ant Labs 的价值,但确实把问题拉回了地面:端侧 AI 的护城河,到底是模型本身,还是工程封装、生态整合和商业模式?

结语:当“免费算力”成为卖点,真正的对手是谁?

Desert Ant Labs 的故事最迷人的地方,不是它有多快、多小、多省电。

而是它提醒我们:AI 不一定非得是云端的、按 token 计费的、黑箱的。 你的手机、耳机、汽车里那块沉默的芯片,可能早就等着被唤醒。

但反过来说,如果“免费”和“本地”本身就是最大的卖点,那它要面对的竞争可能不是 OpenAI,而是开发者心里那句:这玩意儿到底怎么持续活下去?

当大模型还在云端卷参数的时候,一场关于“小模型、本地跑、零 token”的战争,可能才刚刚开始。

【锐评】:当“免费”成为最大卖点,Desert Ant 真正的对手不是 OpenAI,而是开发者心里那道“这玩意到底怎么赚钱”的问号。

参考链接:
https://desertant.com/blog/introducing-desert-ant-labs/