大模型又胡说八道了。
开发者的常规操作是什么?加数据,换大参数模型,或者赶紧套个RAG检索增强。
大家都默认一个前提,模型答错是因为它脑子里没这个知识。
但Google Research和Technion的最新研究,直接把这套逻辑掀翻了。
他们发现像GPT5和Gemini3这样的前沿模型,其实已经编码了95%到98%的测试事实。
它根本没缺课,只是话到嘴边说不出。
这就像你明明知道某个明星的名字,但就是卡在嗓子眼喊不出来。
丢钥匙和空书架完全是两码事
为了搞清楚模型到底是怎么断片的,研究人员搞了个事实级画像测试。
他们拿Oasis乐队的首演地点来测试模型。
有意思的是,如果你让模型接着写Oasis的维基百科,它能顺畅写出首演在Boardwalk俱乐部。
但如果你直接问它Oasis第一次演出在哪,它大概率会瞎编。
研究人员把这种情况叫做召回失败,也就是丢了钥匙。
知识明明就存在参数里,但直接提问就是拿不出来。
只有当模型开启思维链,让它先聊聊乐队早期在曼彻斯特的历史,它才能顺藤摸瓜把答案找出来。
这种推理时的思考,能帮模型找回40%到65%原本想不起来的正确答案。
说实话这挺反直觉的,我们总以为模型是个无情的背书机器,其实它更像个需要提示的健忘症患者。
盲目堆参数和上RAG都在花冤枉钱
既然找到了病因,那对症下药就行了。
但现实是很多企业还在疯狂踩坑。
遇到幻觉第一反应就是上RAG去外挂向量数据库。
很多团队用RAG解决的问题,模型靠记忆就能答对,你花着额外的延迟和调用成本去查一个模型本来就知道的答案,纯属浪费钱。
Google研究员Nitay Calderon直接点破了这个盲区。
另一种暴力解法是扩大模型参数。
个人觉得这更是个美丽的误会。
研究团队把Gemma3模型从10亿参数拉到270亿参数。
结果模型没学过的知识确实少了,但学了却想不起来的比例直接飙升到40%。
参数越大脑子里塞的东西越多,找不到钥匙的概率反而更高。
扩大规模解决的是存储问题,根本解决不了访问问题。
模型最大的短板是缺乏自知之明
既然让模型多想一会儿能找回记忆,那全局开启思考模式不就行了?
老实讲这笔账算不过来。
实际上只有10%到20%的事实真的需要深度思考,全局开启只会白白烧掉你的算力预算。
这里的核心卡点在于,现在的模型缺乏自知之明。
它无法在回答前准确预判自己会不会翻车,自然也就不知道什么时候该启动深度思考。
为了解决这个元认知瓶颈,Google正在搞忠实不确定性框架,想让模型学会评估自己的信心。
在模型真正学会知道自己不知道之前,开发者得自己搭脚手架。
比如搞个生成后验证的流水线。
模型认答案比凭空生成答案容易得多,让它自己检查一遍输出能抓住不少漏网之鱼。
或者在提问方式上做文章,换个句式给点中间上下文,往往就能把卡住的答案逼出来。
普通企业的破局点在后训练
这项研究对不从头训练大模型的公司来说绝对是个好消息。
预训练是个无底洞,大部分公司根本玩不起。
但现在杠杆变了。
后训练只需要少量数据和步骤,推理时的思考验证和检索工具才是普通团队能握在手里的牌。
当然维基百科的公共知识不能代表所有企业私有数据。
在你的垂直领域里模型可能真的是空书架,这时候该上RAG还是得上。
但至少在通用知识层面,别再盲目迷信大力出奇迹了。
当模型终于学会审视自己的无知,AI的进化是不是才算真正触碰到了智能的本质?
【锐评】:大模型不是没脑子只是经常断片,别再盲目砸钱扩容了,教它怎么拍脑门找回记忆才是正经事。
参考链接:
https://venturebeat.com/orchestration/frontier-models-can-recover-up-to-65-of-facts-they-cant-directly-recall-just-by-thinking-longer