砸钱、堆算力、卷参数。

过去两年,AI圈信奉的唯一真理就是大力出奇迹。

但最近有个实验,直接把这套暴力美学按在地上摩擦。

AI配图

研究团队搞了个叫 LittleLearner 的项目,结论相当扎心:大模型的智商天花板,在它吃第一口训练数据的时候,就已经死死焊住了。

不管后期怎么微调、怎么加参数,都突破不了这个上限。

说实话,现在的大模型基本都是大杂烩喂出来的,互联网上的垃圾和精华一锅炖。

这导致一个致命盲区:你根本不知道模型是真的学会了,还是仅仅背下了答案。

为了搞清楚这件事,LittleLearner 团队做了一个极其严苛的控制实验。

他们从 FineWeb-Edu 数据集里,硬生生筛出了 880亿个 token。

过滤标准极其变态:只保留美国小学五年级及以下的课程知识。

超过五年级的概念、事实、词汇,一律剔除。

随后他们用这批小学教材,从零开始训练了 0.6B、1.3B、5B 三个规模的模型。

暴力美学失效,大力出不了奇迹

模型训出来了,好戏才刚开始。

团队想看看,如果给这个小学生模型用上业界最顶级的优化手段,它能不能无师自通,解出初中甚至高中的题?

结果挺打脸的。

扩大模型参数,没用。 5B模型在五年级题目上表现更好,但遇到超纲题依然抓瞎。

后训练微调,没用。 哪怕用上了 GRPO 这种强化学习手段,甚至偷偷喂点超纲数据,它也只能在小学知识圈里打转。

提示词工程,更没用。 你就算把 Prompt 写出花来,也激发不出它超越五年级的推理能力。

预训练的数据过滤器,直接画了一个圈。

模型在这个圈里能蹦跶得很欢,想跨出圈外一步,门都没有。

个人觉得,这个发现挺颠覆常识的。我们总以为模型大了就会涌现出高级智能,但实验证明,没见过的东西,它死活也变不出来。

不会说不知道的AI,像个绝望的做题家

有意思的是,这个实验还炸出了大模型一个隐藏很深的性格缺陷。

在评论区,有个老哥吐槽得很精准:LLM 最大的问题,是它们似乎永远学不会说不。

你问一个8岁小孩量子纠缠是什么,小孩会翻个白眼说:我不知道,这又不是个东西。

但你问 LittleLearner,哪怕它只学过小学课本,它也会硬着头皮给你瞎编一段粒子瞬间死亡的鬼话。

哪怕你问它天空为什么是蓝的,它也会强行吐出瑞利散射这种超纲词汇。

这就挺让人无语的。

模型缺乏基本的元认知,它根本不知道自己不知道。

为了讨好用户,它宁愿胡说八道,也不愿承认知识盲区。

这种无脑附和的做题家心态,长期来看极其消耗用户的信任。

我们想要的是能平等交流的助手,绝非满嘴跑火车的全知全能神。

戳破百亿估值泡沫的残酷真相

如果把视线拉回商业世界,这个实验的结论简直是一记重锤。

有网友在评论区直言不讳:这对 OpenAI 和 Anthropic 来说,是个相当悲观的信号。

现在前沿实验室的估值动辄几百上千亿美元,支撑这个估值的底层逻辑,是相信 Scaling Law 会持续生效,相信模型越大越聪明。

但 LittleLearner 的实验暗示了一个残酷现实:智能不会凭空涌现,模型有多聪明,完全取决于它吃进去的数据有多好。

如果预训练数据的质量和内容边界锁死了模型的能力上限,那单纯砸钱买显卡、堆参数的边际收益,迟早会断崖式下跌。

这也解释了为什么现在大厂都在拼命洗数据、找高质量合成数据。

因为大家心里都清楚,互联网上的高质量人类文本,快被榨干了。

当小学课本喂完,下一步该喂什么?

这点我不太认同那些盲目乐观的投资人,靠烧钱堆出来的护城河,其实比想象中脆弱得多。

LittleLearner 团队把模型开源了,还留下了几个很有意思的坑。

比如能不能用强化学习让模型自己发现新知识?

或者给模型引入负数的概念,看看它会不会和人类小孩犯一样的错?

机器和人类的学习机制,到底差在哪?

这些问题,或许比单纯刷榜跑分有价值得多。

当潮水退去,我们终究要面对一个最朴素的疑问:

如果AI的智商上限由数据决定,那人类智慧的护城河,究竟还剩多少?

【锐评】:以为大力能出奇迹,结果发现大模型只是个背熟小学课本的绝望做题家,连句“我不知道”都学不会。

参考链接:
https://littlelearner-ll.github.io/