老实讲,如果你只盯着数学和代码跑分榜,会觉得现在的AI进化速度快得离谱。
但如果你让它回答几个简单的常识问题,它会自信满满地给你编一个离谱的假答案。
大厂们正在故意把模型变笨。
这绝非技术瓶颈,分明是一场蓄谋已久的参数大腾挪。
参数暴跌背后的跑分狂欢
看看最近的数据。
GLM-5.2在AIME 2026数学测试里拿了99.2%的高分,活跃参数只有400亿。
Qwen3.5用170亿活跃参数考了91.3%。
DeepSeek V4-Flash更狠,130亿活跃参数就能跑。
作为对比,2023年的GPT-4传闻有2800亿活跃参数,当时连一道AIME题都解得磕磕巴巴。
小模型这边,Qwen3.5 9B量化后塞进6GB显存就能跑,智力指数直接翻倍。
听起来参数越小越聪明对吧?
别急,换个考卷试试。
满分学霸的常识黑洞
在禁止使用工具的SimpleQA事实回忆测试里,目前的领跑者Gemini 2.5 Pro只拿了53%。
花大价钱买的最强记忆力,依然会答错一半的题。
顺便提一嘴,评论区有人吐槽SimpleQA这榜单好久没更新了,Gemini 2.5 Pro也是16个月前的老黄历。
但瑕不掩瑜,大方向没变,最强大脑依然会在常识上翻车。
小模型更惨。
Artificial Analysis测出Qwen3.5 4B和9B的幻觉率高达80%到82%。
你问它一个19世纪冷门数学家的出生年份,它会用极其自信的语气,给你一个完全错误的答案。
参数减少的代价,就是世界知识的流失。
实验室在用世界知识,刻意交换推理能力。
事实会发臭,逻辑永保鲜
为什么要这么干?
因为事实太占地方了。
语言模型物理学系列研究算过,每个参数大概只能存2比特的事实知识。
你想让模型记住每个维基百科小人物的生日、每个荷兰城市的人口、每个npm包的参数顺序?
那就得拿万亿参数去堆。
但推理逻辑不一样。
拆解问题、追踪状态、自我检查、失败回溯。这些步骤是可以高度压缩的。
通过蒸馏和强化学习,把这些流程塞进小模型里,效果出奇的好。
Phi-4只有140亿参数,靠合成教科书数据训练,数学极好,冷知识极差。
以前大家觉得这是合成数据的局限。
现在看,这根本就是设计目标。
更有意思的是,事实是会过期的。
前沿模型训练一次要几个月,烧掉几亿美元。
训练刚结束,里面的知识就开始发臭。
API改了,价格变了,人员离职了。2024年模型里关于JavaScript生态的认知,可能没等发布就过时了。
写进权重里的每一个事实,都有保质期。
但程序逻辑不会腐烂。
1970年的代数和今天的代数没区别。拆解问题的逻辑也不会变。
个人觉得,这是这套玩法最聪明的地方。
把昂贵且缓慢的模型,和每天都在变化的事实,彻底解耦了。
外挂大脑与可插拔未来
模型不记事了,谁来记?
答案是外部工具。
知识库检索、工具调用、网页搜索、本地文档。
现在的编程Agent根本不需要背下依赖库的API。它直接去搜索node_modules,或者读文档。
以前每次推理都要付出的记忆成本,变成了按需查询。
评论区有个老哥的想法很绝。
我想要可插拔知识库。写SwiftUI应用时,用9B基础推理,外挂10B Swift知识和5B GIS知识。根本不需要模型懂一行Python。
说实话,通用大模型可能根本不是最终答案。
这套逻辑还能顺手解决幻觉问题。
事实存在权重里,错了你根本找不到,也没法单独修改。
但如果事实存在外部知识库里,错误就有了具体地址。
模型引用了文档,文档错了你就改文档。
这比苦等一年后的下一次模型训练,要靠谱得多。
知识库里的事实错误,只是一个普通的数据Bug。写个回归测试就能修。
24GB显卡的春天
顺着这个趋势往下推。
未来一两年,我们大概率能看到一个具备前沿推理能力、但几乎不存事实的模型。
它完全可以跑在单张消费级GPU上。
DeepSeek V4-Flash的130亿活跃参数已经进消费级射程了。
剩下的两千多亿参数,基本都是存事实的专家层。
把这些知识层砍掉,总大小就会向活跃大小靠拢。
一个200亿到400亿参数的4-bit量化模型,塞进2022年游戏PC里的24GB显卡,毫无压力。
没有按token计费,没有数据隐私泄露。
前提是,你得给它配上好用的外部工具。
未来的模型卡片上,可能根本不会再写知识截止日期。
因为权重里剩下的逻辑,几年都不会过时。
模型就像CPU,在运行时被喂入整个世界的当前状态。
当AI放弃死记硬背整个世界,转而学会随时查阅世界时,我们是不是也该换个思路去使用它了?
【锐评】:AI终于想通了,与其做个死记硬背还爱瞎编的文科生,不如当个随时会查资料的理科生。
参考链接:
https://w4g1.dev/blog/models-are-getting-dumber-on-purpose