AI自己给自己出题,这游戏还怎么玩?
说实话,看到Ornith-1.5技术报告的时候,我第一反应是:这帮人把内卷玩到了AI自己身上。
以前我们训练模型,是人类苦哈哈地洗数据、写Prompt、搭环境。
现在Ornith-1.5直接掀了桌子。
模型自己提出新任务,自己生成解题脚手架,自己刷强化学习。
闭环了。人类彻底沦为看客。
今天,Ornith团队正式发布了Ornith-1.5。
三个尺寸:397B MoE、35B MoE、9B dense。
主打一个端到端自我提升。
跑分表上的屠杀,小模型按着大模型摩擦
咱们先看最直观的跑分。
老实讲,现在的跑分表大家都看麻木了,但Ornith-1.5这次的数据确实有点东西。
旗舰版397B,Terminal-Bench 2.1拿了86.1,DeepSWE拿了56.0。
什么概念?
直接跟Claude Opus 4.8打得有来有回。
顺手还把同级别的GLM-5.2和DeepSeek-V4-Flash-0731给超了。
但真正让我觉得有意思的,是下面的中杯和小杯。
35B MoE版本,每次只激活3B参数。
就这3B的算力,在代码和Agent任务上,把Qwen 3.6-35B、Gemma 4-31B按在地上摩擦。
Terminal-Bench 2.1跑出68.5,对面Gemma 4才43.4。
更离谱的是9B端侧模型。
量化后直接塞进手机里。
SWE-Bench Verified跑出70.6,硬生生越级打平了30B级别的大块头。
个人觉得,这种以下犯上的戏码,才是开源社区最爱看的。
自己给自己当老师,到底怎么实现的?
跑分高是一回事,怎么做到的才是核心。
Ornith-1.0的时候,他们搞了个自我脚手架。
到了1.5,直接升级成了完整的自我提升闭环。
整个训练分三步走:
第一步,自己出题。
模型看着之前的解题历史,专门挑自己不会的、处于能力边缘的难题出。
第二步,自己搭脚手架。
针对这道题,模型自己写指令、选工具、做任务拆解。
第三步,自己做题并拿奖励。
做出来的结果会反向传播奖励,让模型不仅学会做题,还学会出好题、搭好脚手架。
这里有个细节很绝。
他们给出题定了三个奖励指标:有效性、前沿难度、新颖性。
题目必须能跑通;
成功率得控制在20%左右,不能太简单也不能完全做不出;
还不能跟以前的题目重复。
这套路,像极了那些专门给你出易错题、卡着你及格线的魔鬼班主任。
随着模型变强,题目自动变难。根本不需要人类去干预课程表。
跑分没输过体验没赢过?社区的真实吐槽
不过,咱们干科技媒体的,不能只看官方PPT。
有意思的是,在官方公告的评论区,画风却非常真实。
有人直接点破了硬件痛点:
397B太大了,两张卡根本跑不动,哪怕上了NVFP4量化也够呛。就不能做小一点吗?
也有人因为竞品策略调整而感慨:
看到Qwen那边暗示3.8系列不发35B-A3B了,挺可惜的。MoE架构对咱们这种用消费级硬件跑本地模型的人来说,太重要了。
当然,也有跑分没输过体验没赢过的担忧。
一位老哥直言不讳:
之前我自己测Ornith-1.0-9B,体验根本不如Qwen3.5-9B,明明跑分是反过来的。这次1.5的9B我得再好好拷打一下。
不过也有实测派出来站台:
今天刚用35B-A3B跑了爬虫任务,速度比Qwen3.8 27B快,量化精度要求还低,确实惊艳。
顺便提一嘴,评论区还有课代表爆料,这其实是李纪为的新公司。
在这个拥挤的赛道里,他们不碰推理服务,死磕基座和Agent能力。
有人觉得赛道太挤没机会,这点我不太认同。能把端侧MoE做到这个极致,本身就是一种护城河。
把人类踢出训练循环,然后呢?
Ornith-1.5证明了一件事:
模型自己给自己当老师,不仅可行,而且效率奇高。
从397B硬刚闭源巨头,到9B端侧模型越级打怪。
这套自我出题、自我搭建、自我强化的飞轮一旦转起来,人类能插手的地方只会越来越少。
但问题是,当AI完全掌握了如何让自己变聪明的方法论。
我们准备好迎接一个不需要人类喂数据的时代了吗?
【锐评】:AI学会了自己给自己出卷子,人类终于可以从出题人光荣退休,安心当个阅卷人了。
参考链接:
https://ornith.ai/ornith_1_5.html