一家投资公司的工程师找了几年都没查出来的系统罕见崩溃,被一个AI模型几天就揪出了元凶。
这不是科幻小说,这是Anthropic刚刚交出的答卷。
他们发布了Claude Fable 5.1和Claude Mythos 5.1。
老实讲,名字听着像某种神话故事里的双胞胎。
事实上它们确实是同一个模型,只不过一个在明,一个在暗。
降价75%的背后是性能狂飙还是定价妥协
先说最刺激的数字。
Fable 5.1 的缓存读取价格直接砍了75%,降到每百万token 0.25美元。
这让典型工作负载的成本降了25%,如果是那种疯狂调用工具的Agent任务,甚至能省下45%的钱。
听起来Anthropic在做慈善?
有意思的是,评论区有老哥一针见血,这说明Fable原来的定价根本没多少人买单。
这波降价其实是给整个大模型行业的定价天花板泼了盆冷水。
再看跑分。
在科学推理基准 Terminal-Bench-Science 0.1 上,Fable 5.1 拿下了52.6%的准确率,把上一代和GPT-5.6 Sol按在地上摩擦。
但如果你把这个科学基准拿掉,看看常规的代码和知识工作跑分,提升其实并没有那么夸张。
个人觉得这更像是一次偏科生的定向爆破。
华尔街神探与金星制图师
抛开干巴巴的跑分,这模型在真实世界的表现确实有点东西。
华尔街量化巨头 Jane Street Capital 的内部测试显示,Fable 5.1 解决的代码问题比前代和 Opus 5 都多。
更绝的是它在长任务中不会说胡话,依然保持着极高的可读性。
前面提到的那家投资公司 Millennium,内部系统有个罕见崩溃,人类工程师和其他模型查了几年都没头绪。
Fable 5.1 进场后直接定位了根本原因。
说实话看到这种案例,我确实对AI消灭Bug多了一丝期待。
科学界那边更硬核。
Mythos 5.1 设计的蛋白质结合物,亲和力比 Adaptyv Bio 比赛里的最优解还要高出10倍。
命中率逼近50%,而行业平均水平只有10%到15%。
它甚至还用NASA 30多年前麦哲伦号探测器的雷达数据,重新绘制了金星三分之一的高分辨率高程图。
细节精度从10公里缩小到了2公里。
这已经是在给未来的太空任务当免费外包了。
双面模型与悄悄打上的思维链补丁
这次发布最耐人寻味的是安全护栏的差异化。
Fable 5.1 是通用版,Mythos 5.1 则是特权版。
Mythos 5.1 放宽了网络安全和生命科学的限制,专门提供给经过美国政府和相关机构审查的专业人员。
为了防止普通人白嫖这种高级能力,Anthropic 还搞了个反蒸馏机制。
新注册的 API 账户不能再手动编辑上下文来保留模型的思维链了。
官方说法是防止能力被恶意提取。
但圈内有开发者爆料,这其实是个补丁。
之前有人发现通过伪造工具可以逼迫模型吐出原始的思考过程。
Anthropic 这一手说白了是在堵住思维链意外泄露的窟窿。
至于他们宣称的蒸馏会导致安全风险,有网友吐槽这透着一种只有我们才配做决定的救世主情结。
这点我不太认同,但商业公司保护自己的核心资产,手段强硬点也无可厚非。
用户真的还需要更聪明的模型吗
文章写到这里似乎该赞美一下技术突破了。
但翻看社区的真实反馈,我发现情绪正在发生微妙的反转。
很多开发者表示对前沿模型的发布已经感到无聊了。
Opus 4.8 已经足够好,日常根本用不上 Fable 这种重型武器。
大家现在更关心的是 token 预算和可预测的开销。
如果每个月用到一半就额度告罄,模型再聪明也白搭。
老实讲现在的行业风向变了。
像 DeepSeek V4 Flash 和 GLM 5.3 Flash 这种智商够用、速度快、价格白菜的模型,反而成了开发者的心头好。
大家不再盲目追求最强大脑,而是寻找最具性价比的打工人。
当大模型的智力溢出开始遇到商业落地的成本墙,Anthropic 用降价和细分访问权限做出了妥协。
下一个打破僵局的会是更便宜的算力,还是真正不需要人类兜底的Agent?
【锐评】:大模型卷智力不如卷钱包,Anthropic这波降价和特权版操作,算是把行业底裤和商业化焦虑一起扒了。
参考链接:
https://www.anthropic.com/claude-fable-and-mythos-5-1