Perplexity 联手英伟达掀桌子:本地跑 AI Agent,Token 费用直接归零
过去两年,科技巨头们都在疯狂建数据中心,比拼谁的 GPU 集群更大,谁的 Token 烧得更猛。
现在有人把桌子掀了。
Perplexity 刚刚联合英伟达扔出一个重磅炸弹:Portable Computer。
这是一个完全跑在你自己电脑上的 AI Agent 平台。最狠的是,本地干活,Token 费用直接归零。
老实讲,这听起来像极客圈的自嗨。但看完他们的演示,个人觉得,这事儿可能要彻底改变 AI 行业的算账逻辑了。
把 Agent 塞进你的台式机
以前我们聊本地大模型,总觉得是玩具。跑个量化小模型,聊聊天气还行,真让它干点复杂的活就拉胯。
这次不一样。
Portable Computer 直接打包了完整的 Agent 栈。模型、推理引擎、工具、安全沙盒,全塞进一个应用里。
演示环节很直观。系统扮演零售投资者,在一台英伟达 DGX Spark 上跑 270 亿参数的 Qwen 模型。它逐份审查 1099 税表和投资文件,精准挑出不必要的费用。
全程 GPU 满载,但界面上的云端积分计数器死死停在零。
这不仅是省钱。那些高度敏感的财务数据、医疗记录,根本不用上传到云端,数据物理隔离,隐私安全感直接拉满。
为什么以前的本地方案都不行
说实话,以前大家搞本地 AI 体验都很糟。
下载权重、搭推理服务器、接线工具、调优性能,一套流程下来,普通工程师都得折腾掉半条命。
更核心的问题是,通用的 Agent 框架根本带不动本地小模型。
Perplexity 的研究团队发现了一个反直觉的现象。很多本地模型号称支持 26 万 Token 的上下文,但实际超过 10 万 Token 就开始犯迷糊。
既然小模型消化不了复杂上下文,那就给它做减法。
他们搞了一套极简脚手架。系统提示词极短,核心工具按需加载,把那些吃 Token 的连接器全改成了轻量级命令行工具。
加上操作系统级别的沙盒安全,如果沙盒不可用,系统直接罢工,绝不裸奔。
这套魔改效果惊人。在他们内部的 Local Knowledge Work Bench 测试中,跑 Qwen 模型拿到了 82.6% 的分数,直接碾压了开源的 Pi 和 Hermes 方案。换成自家后训练的 PPLX 27B,分数飙到 85.4%。
英伟达与 Perplexity 的暗度陈仓
这场合作,双方都算盘打得极响。
对 Perplexity 来说,Agent 时代最大的痛点就是 Token 消耗无底洞。聊天是一问一答,Agent 是持续运行、不断自我验证。
把重度工作流转移到本地,边际成本直接趋近于零。这让他们有底气去磕那些对隐私和成本极度敏感的金融、法律企业客户。
对英伟达来说,这更是一步妙棋。
过去两年英伟达卖疯了云端算力,但 DGX Spark 这种桌面级超算一直有点尴尬,买回去的人很多觉得难用。
现在 Portable Computer 成了它的杀手级应用。英伟达开发者技术总监 Nader 说得很直白,本地 AI 已经跨过了极客玩具的门槛,成了实用工具。
更有意思的是硬件扩展性。两台 Spark 互联能跑前沿开源大模型,四台能跑更大的,据说他们甚至见过八台串联的疯狂玩法。
别急着狂欢,冷水还得泼
故事讲得很圆满,但现实骨感得多。
首先,24GB 显存的硬门槛,直接把市面上绝大多数消费级 PC 挡在门外。你至少得有一张 RTX 3090 或更新的显卡。
其次,目前只支持 Linux,Windows 用户得等到 9 月。
最让苹果用户难受的是,M 系列芯片完全不在首发路线图里。Perplexity 的高管对此很坦诚,他们现在只死磕英伟达硬件。
而且,本地小模型在硬核推理上,依然打不过云端顶级大模型。
遇到真难题怎么办?Portable Computer 搞了个混合模式。
本地模型搞不定,就向云端的 Claude Opus 5 求助。但系统会先跑一遍隐私分类器,脱敏后再发出去,而且云端模型只给建议,绝不碰本地文件。
测试数据显示,这种混合模式能追回大概五分之三的性能差距,成本只有纯云端运行的三分之一。
个人觉得,这种本地干粗活、云端做决断的混合架构,可能才是未来真正的常态。
当整个行业都在用吉瓦和 Token 单价来衡量 AI 野心时,Portable Computer 提供了一个全新的计量单位:一个永远不转动的计费表。
算力霸权真的会被桌面级的硬件消解吗?
【锐评】:把云端大模型的账单转移到用户的显卡上,这算盘打得连硅谷的资本家听了都得连夜开会。
参考链接:
https://venturebeat.com/infrastructure/perplexity-partners-with-nvidia-to-launch-portable-computer-a-fully-local-ai-agent-with-zero-token-costs