16个月。从零组建团队到芯片流片。

OpenAI在Hot Chips大会上掏出了自研推理芯片Jalapeño。

没有PPT造车,直接拉媒体进实验室跑分。

结果?这颗芯片的能效,把英伟达Blackwell按在地上摩擦。

甚至,它还压了英伟达下一代Rubin一头。

别被骗了,它根本不是什么“偏科生”

外界一直有个传言,说OpenAI这芯片是专门给自己的模型“开小灶”的。

说实话,这点我不太认同。

Jalapeño是一颗彻头彻尾的通用推理芯片。

它避开了单一环节的过度特化,直接追求全场景的高性能。

有意思的是,OpenAI的工程师甚至现场用Codex写了个提示词,让这颗芯片跑起了《Doom》。

跑个游戏只是秀肌肉,真正硬核的是InferenceX基准测试。

在单token预测模式下,Jalapeño的每瓦性能直接清场。

没开投机解码,没搞预填充和解码分离,照样把竞争对手打出局。

拒绝“偏科”,同构设计才是版本答案

为什么Jalapeño能效这么猛?

个人觉得,核心在于他们没有跟风去搞Prefill-Decode(预填充与解码)分离。

业界现在很流行把这两步拆开,用不同的芯片池去跑。

理论上看着很美,但现实很骨感。

真实业务里的流量是动态变化的。输入输出比例、并发量、缓存命中率,全在变。

把硬件死死固定在一个比例上,只会导致一半芯片在吃灰,另一半在排队。

OpenAI选择了同构设计。

所有芯片共享同一个池子,灵活调度。

虽然牺牲了一点理论上的极致效率,但换来了全局利用率的暴涨。

加上HBM4的加持,15.4TB/s的内存带宽,直接让它在低延迟和高吞吐场景下通吃。

用英伟达的卡,砸英伟达的锅

AI配图

硬件猛只是基础,真正的杀招在软件。

这也是整件事里最讽刺的地方。

OpenAI是用英伟达的GPU,设计出了一颗能打败英伟达的芯片。

Jalapeño的软件栈是从零开始的。

但他们没像传统芯片公司那样堆人力手写代码。

他们直接上了内部版的Codex。

AI写AI芯片的内核,什么概念?

8天时间,团队搞定了跨机架的TP32配置。

这种迭代速度,英伟达看了估计得沉默。

大家都在喊CUDA护城河深不见底。

但如果一个前沿实验室能用AI在几个月内把新芯片的软件栈跑通,这道墙还能挡多久?

猪排、咖喱与鹰嘴豆,机架里的极客幽默

聊聊机架设计,OpenAI的命名品味挺有意思。

CPU主机架叫Katsu(日式猪排)。

ASIC芯片架叫Vindaloo(印度咖喱)。

交换机托盘叫Chana(鹰嘴豆)。

一顿饭凑齐了。

单机架塞了128颗Jalapeño,通过铜缆和光路,最多能把2048颗芯片连成一个超级大脑。

整机柜功耗大概在160kW。

“如果你有1吉瓦的电力,那么每瓦吞吐量就是收入。”

老黄这话没毛病。在数据中心电力紧缺的今天,能效就是真金白银。

别急着开香槟,硬仗还在后头

数据确实漂亮,但咱们得保持清醒。

目前跑的还是8k1k这种相对简单的单轮测试。

真正考验芯片的AgentX长上下文、多轮对话测试,还没上。

多轮交互对路由、前缀缓存、显存管理的压力是指数级的。

Jalapeño在这些极端场景下还能不能保持优雅,得打个问号。

另外,量产时间表排到了2027年底。

现在拿到的还只是工程样品。

从实验室跑分到大规模数据中心部署,中间还隔着无数个坑。

芯片圈的牌桌,从来都不缺掀桌子的人。

当AI开始设计AI芯片,当客户变成最棘手的竞争对手,英伟达的舒适区还能维持多久?

下一个倒下的,会是谁?

【锐评】:用着英伟达的卡算着怎么干掉英伟达,OpenAI这波“背刺”属实把科技圈的商战玩明白了。

参考链接:
https://newsletter.semianalysis.com/p/openai-jalapeno-better-than-nvidia