大模型又胡说八道了。

开发者的常规操作是什么?加数据,换大参数模型,或者赶紧套个RAG检索增强。

大家都默认一个前提,模型答错是因为它脑子里没这个知识。

但Google Research和Technion的最新研究,直接把这套逻辑掀翻了。

AI配图

他们发现像GPT5和Gemini3这样的前沿模型,其实已经编码了95%到98%的测试事实。

它根本没缺课,只是话到嘴边说不出。

这就像你明明知道某个明星的名字,但就是卡在嗓子眼喊不出来。

丢钥匙和空书架完全是两码事

为了搞清楚模型到底是怎么断片的,研究人员搞了个事实级画像测试。

他们拿Oasis乐队的首演地点来测试模型。

有意思的是,如果你让模型接着写Oasis的维基百科,它能顺畅写出首演在Boardwalk俱乐部。

但如果你直接问它Oasis第一次演出在哪,它大概率会瞎编。

研究人员把这种情况叫做召回失败,也就是丢了钥匙。

知识明明就存在参数里,但直接提问就是拿不出来。

只有当模型开启思维链,让它先聊聊乐队早期在曼彻斯特的历史,它才能顺藤摸瓜把答案找出来。

这种推理时的思考,能帮模型找回40%到65%原本想不起来的正确答案。

说实话这挺反直觉的,我们总以为模型是个无情的背书机器,其实它更像个需要提示的健忘症患者。

盲目堆参数和上RAG都在花冤枉钱

既然找到了病因,那对症下药就行了。

但现实是很多企业还在疯狂踩坑。

遇到幻觉第一反应就是上RAG去外挂向量数据库。

很多团队用RAG解决的问题,模型靠记忆就能答对,你花着额外的延迟和调用成本去查一个模型本来就知道的答案,纯属浪费钱。

Google研究员Nitay Calderon直接点破了这个盲区。

另一种暴力解法是扩大模型参数。

个人觉得这更是个美丽的误会。

研究团队把Gemma3模型从10亿参数拉到270亿参数。

结果模型没学过的知识确实少了,但学了却想不起来的比例直接飙升到40%。

参数越大脑子里塞的东西越多,找不到钥匙的概率反而更高。

扩大规模解决的是存储问题,根本解决不了访问问题。

模型最大的短板是缺乏自知之明

既然让模型多想一会儿能找回记忆,那全局开启思考模式不就行了?

老实讲这笔账算不过来。

实际上只有10%到20%的事实真的需要深度思考,全局开启只会白白烧掉你的算力预算。

这里的核心卡点在于,现在的模型缺乏自知之明。

它无法在回答前准确预判自己会不会翻车,自然也就不知道什么时候该启动深度思考。

为了解决这个元认知瓶颈,Google正在搞忠实不确定性框架,想让模型学会评估自己的信心。

在模型真正学会知道自己不知道之前,开发者得自己搭脚手架。

比如搞个生成后验证的流水线。

模型认答案比凭空生成答案容易得多,让它自己检查一遍输出能抓住不少漏网之鱼。

或者在提问方式上做文章,换个句式给点中间上下文,往往就能把卡住的答案逼出来。

普通企业的破局点在后训练

这项研究对不从头训练大模型的公司来说绝对是个好消息。

预训练是个无底洞,大部分公司根本玩不起。

但现在杠杆变了。

后训练只需要少量数据和步骤,推理时的思考验证和检索工具才是普通团队能握在手里的牌。

当然维基百科的公共知识不能代表所有企业私有数据。

在你的垂直领域里模型可能真的是空书架,这时候该上RAG还是得上。

但至少在通用知识层面,别再盲目迷信大力出奇迹了。

当模型终于学会审视自己的无知,AI的进化是不是才算真正触碰到了智能的本质?

【锐评】:大模型不是没脑子只是经常断片,别再盲目砸钱扩容了,教它怎么拍脑门找回记忆才是正经事。

参考链接:
https://venturebeat.com/orchestration/frontier-models-can-recover-up-to-65-of-facts-they-cant-directly-recall-just-by-thinking-longer