老实讲,如果你只盯着数学和代码跑分榜,会觉得现在的AI进化速度快得离谱。

但如果你让它回答几个简单的常识问题,它会自信满满地给你编一个离谱的假答案。

大厂们正在故意把模型变笨。

这绝非技术瓶颈,分明是一场蓄谋已久的参数大腾挪。

参数暴跌背后的跑分狂欢

看看最近的数据。

GLM-5.2在AIME 2026数学测试里拿了99.2%的高分,活跃参数只有400亿。

Qwen3.5用170亿活跃参数考了91.3%。

DeepSeek V4-Flash更狠,130亿活跃参数就能跑。

作为对比,2023年的GPT-4传闻有2800亿活跃参数,当时连一道AIME题都解得磕磕巴巴。

小模型这边,Qwen3.5 9B量化后塞进6GB显存就能跑,智力指数直接翻倍。

AI配图

听起来参数越小越聪明对吧?

别急,换个考卷试试。

满分学霸的常识黑洞

在禁止使用工具的SimpleQA事实回忆测试里,目前的领跑者Gemini 2.5 Pro只拿了53%。

花大价钱买的最强记忆力,依然会答错一半的题。

顺便提一嘴,评论区有人吐槽SimpleQA这榜单好久没更新了,Gemini 2.5 Pro也是16个月前的老黄历。

但瑕不掩瑜,大方向没变,最强大脑依然会在常识上翻车。

小模型更惨。

Artificial Analysis测出Qwen3.5 4B和9B的幻觉率高达80%到82%。

你问它一个19世纪冷门数学家的出生年份,它会用极其自信的语气,给你一个完全错误的答案。

参数减少的代价,就是世界知识的流失。

实验室在用世界知识,刻意交换推理能力。

事实会发臭,逻辑永保鲜

为什么要这么干?

因为事实太占地方了。

语言模型物理学系列研究算过,每个参数大概只能存2比特的事实知识。

你想让模型记住每个维基百科小人物的生日、每个荷兰城市的人口、每个npm包的参数顺序?

那就得拿万亿参数去堆。

但推理逻辑不一样。

拆解问题、追踪状态、自我检查、失败回溯。这些步骤是可以高度压缩的。

通过蒸馏和强化学习,把这些流程塞进小模型里,效果出奇的好。

Phi-4只有140亿参数,靠合成教科书数据训练,数学极好,冷知识极差。

以前大家觉得这是合成数据的局限。

现在看,这根本就是设计目标。

更有意思的是,事实是会过期的。

前沿模型训练一次要几个月,烧掉几亿美元。

训练刚结束,里面的知识就开始发臭。

API改了,价格变了,人员离职了。2024年模型里关于JavaScript生态的认知,可能没等发布就过时了。

写进权重里的每一个事实,都有保质期。

但程序逻辑不会腐烂。

1970年的代数和今天的代数没区别。拆解问题的逻辑也不会变。

个人觉得,这是这套玩法最聪明的地方。

把昂贵且缓慢的模型,和每天都在变化的事实,彻底解耦了。

外挂大脑与可插拔未来

模型不记事了,谁来记?

答案是外部工具。

知识库检索、工具调用、网页搜索、本地文档。

现在的编程Agent根本不需要背下依赖库的API。它直接去搜索node_modules,或者读文档。

以前每次推理都要付出的记忆成本,变成了按需查询。

评论区有个老哥的想法很绝。

我想要可插拔知识库。写SwiftUI应用时,用9B基础推理,外挂10B Swift知识和5B GIS知识。根本不需要模型懂一行Python。

说实话,通用大模型可能根本不是最终答案。

这套逻辑还能顺手解决幻觉问题。

事实存在权重里,错了你根本找不到,也没法单独修改。

但如果事实存在外部知识库里,错误就有了具体地址。

模型引用了文档,文档错了你就改文档。

这比苦等一年后的下一次模型训练,要靠谱得多。

知识库里的事实错误,只是一个普通的数据Bug。写个回归测试就能修。

24GB显卡的春天

顺着这个趋势往下推。

未来一两年,我们大概率能看到一个具备前沿推理能力、但几乎不存事实的模型。

它完全可以跑在单张消费级GPU上。

DeepSeek V4-Flash的130亿活跃参数已经进消费级射程了。

剩下的两千多亿参数,基本都是存事实的专家层。

把这些知识层砍掉,总大小就会向活跃大小靠拢。

一个200亿到400亿参数的4-bit量化模型,塞进2022年游戏PC里的24GB显卡,毫无压力。

没有按token计费,没有数据隐私泄露。

前提是,你得给它配上好用的外部工具。

未来的模型卡片上,可能根本不会再写知识截止日期。

因为权重里剩下的逻辑,几年都不会过时。

模型就像CPU,在运行时被喂入整个世界的当前状态。

当AI放弃死记硬背整个世界,转而学会随时查阅世界时,我们是不是也该换个思路去使用它了?

【锐评】:AI终于想通了,与其做个死记硬背还爱瞎编的文科生,不如当个随时会查资料的理科生。

参考链接:
https://w4g1.dev/blog/models-are-getting-dumber-on-purpose