Google六周连发三版大模型,顺手揪出Chrome潜藏13年的致命Bug

老实讲,现在的大模型厂商发版,已经卷到让人麻木了。

但Google最近的操作,还是让我稍微愣了一下。

六周时间,连发三个Flash版本。

这哪是迭代,这简直是流水线上下饺子。

就在周三,Google又掏出了Gemini 3.8 Flash。

这次不仅有个干苦力的“标准版”,还带了个专门抓漏洞的“赛博保安”双胞胎——Flash Cyber。

更有意思的是,这个保安刚上岗,就把Chrome里藏了13年的老Bug给揪出来了。

价格没变,但模型开始“拼命”了

先说大家最关心的钱。

输入0.75美元/百万token,输出3.75美元/百万token。

和上一代3.7 Flash一模一样的首发价。

个人觉得,在算力成本飞涨的今天,这价格简直是在做慈善。

但便宜归便宜,Google高管在博客里透了个底:3.8 Flash“工作更努力”了。

说白了,就是模型变得更“卷”。

遇到复杂任务,它会自己多跑几步推理,展现出“更大的勤奋”。

代价是可能会多烧点token。

如果你只想省钱,Google也说了,3.7 Flash依然完全支持那些“效率优先”的活儿。

AI配图

这种把选择权交给开发者的做法,确实比一刀切要聪明得多。

标准版:写代码、造游戏,排名狂飙

来看看这个“干苦力”的标准版到底多能打。

Sundar Pichai在X上直接用了“significant leaps(显著飞跃)”这个词。

在DeepSWE编码基准上,它干翻了一票大参数前沿模型,而且成本低得多。

它不仅懂代码,还懂金融和法律。

在Vals Finance Agent V2和Harvey's Legal Agent Benchmark里,表现都超过了前代。

最直观的感受是,它造东西的速度和脑洞变大了。

Google给了个例子:在Antigravity平台上,用几句简单的prompt,它就搓出了一个带解谜、环境叙事和3D纹理的巫师城堡游戏。

还有人让它写了个全功能的DOS版Google Maps,甚至搞出了基于美国地质调查局真实数据的3D地形图。

说实话,这种多模态加长效上下文的组合拳,打得很漂亮。

数据不会撒谎。

在Arena.ai的Agent Arena里,3.8 Flash直接冲到第14名,把DeepSeek-V4-Pro踩在脚下,而它的老大哥3.7 Flash还在第32名吃灰。

Text Arena更是首发就拿了第7,排在Claude Opus 5前面。

赛博保安上岗,Chrome团队迎来“漏洞末日”

接下来是重头戏。

Flash Cyber,Google号称“最强”的网安模型。

它不对外随便开放,目前只通过Fairwind Program给政府和关键基础设施等“可信防御者”用。

为什么这么谨慎?

因为它在网络安全领域经过了“严格训练”,而且放开了部分安全限制。

Google的思路很明确:优先修复漏洞,而不是教它怎么去攻击。

但这玩意儿找Bug的能力,实在太猛了。

内部测试显示,它在20种编程语言中发现漏洞的成功率超过70%。

CyberGym基准得分86.2%,CWE-Bench(评估AI打补丁能力)得分47.2%。

Chrome工程总监Doug Turner在视频里用了个词,叫 “vulnerability apocalypse(漏洞末日)”

生成式AI让漏洞报告数量呈现出曲棍球棒式的暴增。

防守方本来就焦头烂额,现在AI找Bug的速度更是降维打击。

有个细节特别有意思。

Flash Cyber在Chromium和Chrome代码里,挖出了一个潜藏13年的微妙Bug

这个Bug,几十甚至上百个人类工程师看过,都没人发现。

结果AI一扫,直接揪出来了。

Doug Turner感叹,这能让开发者的日子好过得多。

暗中赢家与防守方的逆袭

这里必须提一个暗中赢家:Wiz。

这家今年被Google以320亿美元天价收购的云安全公司,给Flash Cyber提供了极大的实战背书。

Wiz的内部渗透测试基准显示,Flash Cyber对真实世界漏洞的召回率,比领先的前沿模型高出7.5%到9.7%。

关键是,成本只有它们的2.3到5.2分之一。

Google自己的Cloud Vulnerability Research团队也尝到了甜头。

以前需要几个月才能发现的关键基础漏洞,现在用Flash Cyber,不到2小时就搞定了。

在网络安全这个不对称的战场里,攻击者只需要在几百万行代码里找到一个口子。

而防守方,必须堵住每一个口子。

Raluca Ada Popa说得很透彻:AI Agent现在找漏洞和利用漏洞的技能“极其熟练”。

如果防守方不用AI,那就只能被拥有AI的攻击者按在地上摩擦。

Flash Cyber在Chrome漏洞上生成的正确补丁数量,是大型商业模型的2.6倍。

这已经不是辅助工具了,这是直接下场当主力。

谁来给AI找Bug?

Google这六周的三连发,表面上是秀肌肉,实际上是在抢Agent和垂直领域的生态位。

标准版卷生产力,Cyber版卷安全底线。

但看着那个被AI揪出来的13年老Bug,我脑子里冒出一个问题。

AI能找出人类工程师忽略的漏洞。

那如果AI自己写的代码里藏了漏洞,谁来找?

当防守方和攻击方都换上AI代理人,这场赛博军备竞赛的终局,或许才刚刚开始。

【锐评】:Google把大模型当白菜发,顺手用AI给Chrome“刮骨疗毒”,只是这13年的老Bug被揪出来后,程序员们该担心的是Bug,还是自己的饭碗?

参考链接:
https://venturebeat.com/security/googles-gemini-3-8-flash-is-built-for-agents-while-its-cyber-twin-hunts-vulnerabilities