大模型圈现在卷到什么程度了?
六周时间,Google DeepMind 连着发了三个 Flash 模型。
这更新频率,简直把大模型当周报在发。
但最让人意外的,是今天刚亮相的 Gemini 3.8 Flash。
老实讲,一开始我以为这也就是个常规的性能微调。
结果一看跑分,这个主打便宜大碗的小模型,居然在代码基准测试里把贵上天的 Opus 5 给按在地上摩擦。
9月2日,Google 正式推出了 Gemini 3.8 Flash 和专门搞网络安全的 3.8 Flash Cyber。
价格一分没涨,输入 0.75 美元每百万 token,输出 3.75 美元每百万 token。
性能却直接摸到了前沿大模型的天花板。
卷王之王:用白菜价干翻顶级大模型
我们先看最核心的 Gemini 3.8 Flash。
在 DeepSWE v1.1 这个长周期软件工程基准测试里,3.8 Flash 直接登顶。
有意思的是,有开发者跑去 Artificial Analysis 查了底细,发现它的智能得分达到了 59 分。
这是什么概念?跟 Opus 5 medium 完全一样。
用十分之一的价格,买到顶级大模型的智商,这笔账怎么算都划算。
除了写代码,它在金融和法律的 Agent 任务里也刷了榜。
HLE-Verified 测试拿了 54.9%,证明它在 STEM 和人文领域的复杂多步推理同样能打。
个人觉得,这种小模型追赶大模型的戏码,才是今年 AI 圈最性感的叙事。
它是怎么变聪明的?答案是更拼命
很多人好奇,参数没暴增,它是怎么变强的?
Google 给出的答案很实在:让它多干活。
遇到复杂任务,3.8 Flash 会自己增加推理步骤,反复调用工具。
说白了,就是靠勤奋来弥补天赋。
当然,天下没有免费的午餐。
高努力模式下,它消耗的 token 会变多。
如果你预算有限,完全可以切到低努力模式,或者干脆继续用上一代的 3.7 Flash。
有开发者测试后发现,3.8 在中等推理级别上的提升最明显。
这点我很认同,无脑拉满参数往往是刷榜用的,中等努力级别才是生产环境的真实写照。
网络安全局的秘密武器:2小时干完几个月的活
这次发布的另一个重头戏,是 Gemini 3.8 Flash Cyber。
这玩意不对外随便开放,得通过 Fairwind Program 申请,专门给政府和关键基础设施的白帽子用。
它的战绩相当吓人。
在 CyberGym 漏洞发现测试中,它把上一代和一堆大模型都秒了。
在内部 20 种编程语言的测试里,成功率超过 70%。
更绝的是自动打补丁能力,在 CWE-Bench 测试中拿到了 47.2% 的通过率,跟行业第一的 47.8% 几乎贴脸,但成本低了一大截。
说个真实的落地案例。
Google Cloud 的漏洞研究团队用它找底层漏洞,不到 2 小时就搞定了,而这活儿平时得干几个月。
Chrome 安全团队也发现,它生成的正确补丁数量,是那些体型庞大的商业模型的 2.6 倍。
在黑客攻击越来越自动化的今天,防守方终于有了一件趁手的自动化兵器。
暗中赢家:多模态与无限重试的暴力美学
看了一圈热门评论,我发现大家其实更看重 Gemini 的两个隐藏优势。
第一是多模态。
当 OpenAI 和 Anthropic 的旗舰模型还在死磕纯图像输入时,Gemini Flash 已经能丝滑处理音频和视频了。
拿它来做媒体分析、从视频里抽结构化数据,简直是降维打击。
第二是无限重试的暴力美学。
像写代码这种任务,结果是可以验证的。
模型写得不对?没关系,让它重写。
Flash 模型足够便宜,速度足够快,你完全可以写个脚本让它无限重试,直到跑出完美结果。
用极低的成本加上好的工程框架,就能白嫖前沿大模型的输出质量。
这其实是很多一线开发者心照不宣的玩法。
Google 这种小步快跑和高频迭代的策略,确实把竞争对手逼到了墙角。当小模型的智商越来越接近大模型,那些靠参数堆砌出来的高昂溢价,还能维持多久?或许下一次模型更新,我们就能看到答案。
【锐评】:大模型军备竞赛终于从拼参数卷到了拼性价比,Google 这波降维打击,让靠高价 API 躺赚的厂商彻底睡不着了。
参考链接:
https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/