封面图

谷歌这次,是铁了心要让大模型“下凡”。

发布不到两个月,它的Gemma 4模型家族又更新了,这次主打一个字:省。通过一种叫QAT的压缩技术,一个20亿参数的模型,内存占用被硬生生压到了1GB以内。这意味着,你几年前买的手机,或者那台只有8GB内存的轻薄本,可能真的能流畅跑起一个“像样”的AI了。

核心矛盾:模型越大越聪明,但手机的内存就那么点

我们都知道,AI模型参数越多,通常越聪明。但代价就是“吃”内存、耗电、发热。想在手机上跑大模型,以前基本是“能跑”和“能用”之间的鸿沟。

标准的压缩方法(叫PTQ)简单粗暴,训练完直接压,效果常常打折扣。谷歌这次用的QAT(量化感知训练)则更“鸡贼”——它在模型训练时,就模拟了压缩过程。相当于让一个健美运动员从训练期就开始适应轻量级比赛的体重标准,最终能更无损地保持肌肉(模型能力)。

四招“瘦身术”,招招打在移动端的痛点上

光压小还不行,还得让手机芯片“跑得动”。谷歌这次为移动端量身定制了一套方案,有点像给模型做了场外科手术:

  • 静态激活把需要实时计算的参数提前固定好,省去手机芯片实时演算的负担。
  • 通道量化让压缩后的数据结构,更匹配手机里AI加速器的“胃口”,减少来回折腾。
  • 重点部位重点压缩对生成文本的模块,狠心压到2-bit精度;但保证核心“大脑”(推理层)依然保持高精度。聪明没减多少,体积小了一大截。
  • 优化“记忆库”重点压缩模型的词汇表和临时记忆(KV Cache),这是聊天时最耗内存的部分,优化后能支持更长的对话。

最绝的是,你甚至可以按需加载。比如,如果你不需要看图和听声,只要文本模型,那个著名的E2B模型,压缩后真的只要不到1GB。说实话,这个数字对于想玩本地AI的极客们来说,太有诱惑力了。

社区沸腾:是机遇,也是新的“内卷”开始

技术好不好,开发者用脚投票。评论区瞬间成了大型实验现场和“许愿池”。

有人已经在Mac上成功运行,并惊叹一个3.2GB的模型就能处理图文音视频。更卷的是第三方工具Unsloth,他们晒出数据,称自己的量化版本质量几乎逼近未压缩的原始模型,甚至**“比谷歌官方公布的QAT结果还好”**。

一位开发者兴奋地说:“这周感觉整个Gemma生态进化了一轮,12B模型、多词预测、官方量化版…谷歌这次是动真格了。” 但也有人冷静指出细节:刚发布的Gemma 4 12B模型,量化后需要6.7GB显存,刚好卡在16GB内存设备的及格线上。而且,在谷歌自己的新软件“Edge Gallery”里,这个12B模型赫然被标记为“不支持”。有点微妙,不是吗?

更“阴谋论”的猜测来了:有人发现,这次发布的时间点,正好在苹果WWDC开发者大会前夕。而传闻苹果将展示的“改进版Siri”,背后可能就采用了谷歌的模型。这究竟是巧合,还是一次精准的技术“亮肌肉”?

未来的想象空间:从“能跑”到“好用”,路还很长

一个模型能在手机上跑起来,只是第一步。接下来,速度、体验、应用场景才是关键。

评论区里,已经有人想得更远:用这些小而快的量化模型,去给更大的模型当“草稿师”(MTP技术),是不是能带来速度的飞跃?让一个5年前的老显卡,也能运行260亿参数的巨无霸模型?

谷歌把这些模型权重全放在了Hugging Face上,还贴心地准备了各种格式,对接llama.cpp、Ollama、vLLM等主流工具链。它的意图很明确:降低门槛,让所有人一起来玩。

当AI大模型的“体重”被成功管理到1GB以内,它距离真正融入我们的数字生活,就又近了一大步。这不再只是云端实验室里的奇迹,而是你口袋里、背包中,触手可及的智能伙伴。技术竞赛从未停止,但这一次,战场从庞大的数据中心,悄然转移至我们每个人的掌心。

下一步,就看谁能用这“1GB”的奇迹,真正做出让我们离不开的体验了。

【锐评】:谷歌这次技术秀,精准得像手术刀。但模型小了,AI的“想象力”和“人格”,会不会也跟着一起被压缩了呢?

参考链接:
https://blog.google/innovation-and-ai/technology/developers-tools/quantization-aware-training-gemma-4/