参数干到千亿?数据集堆到PB级?Ornith直接把桌子掀了。一个9B的端侧模型,性能显著压制Gemma 4-31B和Qwen 3.6-35B;一个397B的MoE巨兽,推理与编码分数直逼Claude Opus 4.8。更狠的是,MIT协议,无限制商用,分文不取。这哪是发论文,简直是给当下焦虑的AI行业发战书。
8月19日,Ornith正式抛出Ornith-1.5系列。没有炫技的发布会,只有一张硬核成绩单和一套自研训练法。涵盖9B Dense、35B MoE和397B MoE三个规格,直接覆盖从移动端到超算集群的全场景。
闭源天花板?它偏要自己造梯子
传统大模型的训练逻辑早就僵化了:人类疯狂找数据,标注,投喂,然后祈祷梯度下降能换来一点智商提升。Ornith-1.5彻底改了剧本。他们把上一代的“自我脚手架”升级成了端到端的“自我改进循环”。
模型不再被动吃现成的饲料。它会自己提议新任务,自己拆解解题框架,再自己跑强化学习生成解决方案。跑得好不好?奖励信号会反向传播回题目生成、框架搭建和求解策略的每一个环节。
更强的策略能提出更难的任务,进化的脚手架能激发更强能力,高质量的轨迹则提供更有效的学习信号。这是一条完美的闭环。
有意思的是,这套机制完全绕开了人工策展的数据集。模型在训练中不断暴露能力盲区,自动生成“跳一跳够得着”的挑战题。前沿难度被精准卡在成功率约20%的位置,既不让模型躺平,也不让它直接崩溃。
不靠人喂饭,模型开始自己出题了
35B激活3B参数,凭什么拉开身位?
数据不说谎。Terminal-Bench 2.1拿下86.1分,DeepSWE拿到56分。这两个数字意味着什么?意味着它已经摸到了Claude Opus 4.8(85.0和59.0)的肩膀,同时把GLM-5.2和DeepSeek-V4-Flash甩开了一大截。
但真正让人挪不开眼的,是中间那个35B的MoE模型。每个Token只激活3B参数,却在SWE-Bench Verified上跑出79分,大幅领先同体量的Qwen 3.6-35B,甚至把Gemma 4-31B和Meta Muse Glimmer-30B这些稠密模型显著压制。
个人觉得,这不仅仅是架构的胜利,更是“自我进化”策略对传统数据饥渴症的降维打击。当别人还在为清洗高质量代码库焦头烂额时,Ornith已经把模型变成了数据工厂。参数规模不再是唯一护城河,训练范式才是。
压缩到1.5GB塞进手机,开源协议直接白嫖
你以为这只是实验室里的算力游戏?错。Ornith团队顺手搞出了革命性的量化技术。9B模型压缩到1.5GB,推出NVFP4、GGUF、MLX等格式。iPhone和Android用户现在就能本地运行一个具备强代理和编码能力的AI助手。
更绝的是许可证。MIT协议,无限制商业和研究使用。评论区里有人问价格,作者回了一个字:“freeeeeee”。
老实讲,这在当下“闭源筑墙、开源割韭菜”的行业生态里,简直像一颗深水炸弹。开源社区瞬间炸锅,UnslothAI火速下场表态,Ollama、LM Studio一键适配。Ornith甚至提前剧透了:Ornith 2.0已经在计划中,还会更换基础模型。
参数竞赛落幕,循环时代才开局
过去两年,我们看惯了显卡咆哮、API按token计费、大厂互相封锁接口。Ornith-1.5用一套“自我出题-自我解答-自我奖励”的逻辑,证明了高效智能不一定靠堆料,也不一定靠垄断数据。
当模型学会自己定义问题,自己寻找路径,我们到底是在训练工具,还是在培育一个不断迭代的数字生命体?闭源巨头的高墙,还能挡住多少这种“开源自驱动”的冲击?
答案,或许就藏在下一个自动生成的训练回合里。
【锐评】:不拼数据拼自驱,不卖授权送协议,Ornith这波是把开源的“性价比”打成了“必杀技”。
参考链接:
https://x.com/ornith_/status/2090074077084127302