一个8B参数的开源小模型,在复杂企业任务里,把Claude Opus 4.5、GPT-4.1甚至GPT-5都比下去了。

没看错。跟模型参数量爆炸无关,也跟算力堆叠没啥关系。

AI配图

说实话,这次赢在“教练”身上。Meta AI和伊利诺伊大学的研究人员搞了个叫 EvoHarness-RL 的新框架。核心逻辑就一条:别让人类给AI写死规则了,教它自己管理记忆和工具。

人工写剧本,早晚得把工程师逼疯

现在的AI Agent干点长周期的活儿,比如把海量客户数据从老系统搬到云端,全靠人类开发者手写规则。

遇到API限流报错了?靠人写的补丁去恢复。

论文联合作者 Xuying Ning 吐槽得很直接。模型一升级,提示词、内存设计全得跟着改。人工写逻辑,纯属无底洞。

更坑的是以前的记忆系统。只追加不更新。任务一长,脑子里全塞满了过时的结论和失败的尝试。

老实讲,这就像让一个员工带着几年的错误笔记去干活,推理能力不降才怪。

给AI装个“动态大脑”,还得教它算账

为了填这个坑,研究团队弄出了 BPE 统一接口。把Agent的外部需求切成三块:Belief(看清当前环境)、Progress(盯紧任务进度)、Experience(复用历史经验)。

AI不用再去调一堆复杂的API。直接用四个动作:track、commit、recall、note

有意思的是第二阶段的训练。查工具是要花token和时间的。

框架用了“成本感知”强化学习。说白了,就是教AI算账。什么时候该查资料,什么时候该自己干,得精打细算。

这直接把工具调用从死板的代码,变成了AI自己学来的运行时行为。

8B逆袭巨头,暗中赢家竟是大模型?

数据最骗不了人。在 ALFWorld 基准测试里,基于 Qwen3-8B 训练的模型,成功率飙到了 96.9%

对比一下,Claude Opus 4.5 开箱即用的成绩是 96.4%。GPT-4.1 和 GPT-5 也被甩在身后。

但这里有个反转。

研究人员发现,把这套 BPE 框架直接套在冻结的前沿大模型上,效果同样炸裂。GPT-4.1 涨了 22.1 个百分点,GPT-5 暴涨 25.7 个百分点。

个人觉得,这其实是在给大模型“打补丁”。大模型厂商看着自家模型靠别人的框架才发挥出全部实力,心情估计挺复杂。

训练过程中还出现了个好玩的现象,叫“工具使用退火”。

AI刚训练时,干啥都要查工具。后来熟练了,简单任务直接内化到参数里,不查了。遇到奇葩报错,才慢下来去翻日志。

这不就是人类老员工的工作状态吗?

别盲目跟风,短活儿还是用老办法

看着这么猛,企业是不是该马上全面替换现有系统?

先别急。Ning 专门泼了盆冷水。

框架不需要替换现有工具,加个状态管理层就行。如果是几个小时的短任务,用 ReAct 或者标准 RAG 完全够用。

BPE 真正发威的场景,是那些干上几天甚至几周的地狱级长任务。

这绝非要彻底推翻现有的工作流工程,更像是一场向“让AI自主学习”的平滑过渡。

但把记忆和决策权彻底交给AI,当它开始自己决定什么时候该“偷懒”、什么时候该“深挖”时,这到底是工程师的彻底解放,还是另一种失控的开端?

【锐评】:教AI自己算账和偷懒,小模型干翻闭源巨头,这年头连“打补丁”都能成为逆袭的捷径了。

参考链接:
https://venturebeat.com/orchestration/meta-researchers-taught-an-8b-ai-model-to-match-claude-opus-4-5-without-the-frontier-price-tag