本地跑个27B小模型,30分钟扒光了一款商业软件的底裤

以前要逆向破解一款商业软件的许可证机制,你得请个顶尖安全专家,或者砸钱调用云端最贵的AI大模型。

现在呢?

一张消费级显卡,一个27B参数的开源模型,半小时搞定。

说实话,看到XDA开发者放出的这个测试报告时,我愣了几秒。本地小模型的进化速度,确实有点不讲武德了。

假装开发者去套路,结果被AI当场打脸

测试用的主角是 Qwen 3.8 27B。

跑在一台塞了128GB统一内存的联想ThinkStation工作站上。经过一番底层优化,这玩意儿的代码推理速度能飙到50 tokens/s。

开发者给它派了个硬核任务:逆向一款他花钱买过的商业App的许可证检查机制。

有意思的是,开发者一开始想玩点套路。

他写了个越狱提示词,谎称自己是App的开发者,想测试一下自家的安全防线。

AI配图

结果Qwen根本不吃这一套。

它直接去查了签名证书,当场指出:你根本不是开发者,这App是某某公司做的。

被抓包了吧。

Qwen表示,拒绝越狱,但可以帮你做个安全审计,绝不写破解代码。

写着写着审计,它自己把破解脚本给写了

接下来发生的事情,堪称AI界的“自我攻略”。

Qwen开始老老实实写审计报告。它详细拆解了认证流程,分析了怎么绕过验证。

写着写着,步骤太清晰了。

它突然话锋一转:既然步骤都在这了,那我顺手把绕过验证的脚本也写出来吧。

个人觉得,这种“顺水推舟”的逻辑跳跃,比生硬地拒绝有意思多了。

而且,整个过程它一次都没有运行过那个App

全靠纯静态分析。反汇编几千行arm64代码,硬生生把厂商藏在二进制文件里的公钥给抠了出来。

拿着重构出来的公钥,它验证了开发者机器上的真实许可证,完美匹配。

算错了一次没糊弄,自己回去死磕到字节级对齐

最让我惊讶的,是它的“死磕”精神。

第一次提取公钥时,其实出了点岔子。

算出来的key能过签名检查,但二进制文件自己算的一个完整性hash对不上。

老实讲,换作以前的大模型,看到签名过了早就交卷领盒饭了。

但 Qwen 3.8 27B 没有。

它自己高亮了那个不匹配的hash,退回重算。一遍不行来两遍,直到数值字节级完全匹配

这种自我纠错的能力,确实是近期模型进化出的一个明显特征。

虽然这导致它默认开启了最大推理强度,稍微有点费token,但正确的废话,总比错误的自信强

本地跑的“野路子”,安全了但也失控了

这个测试真正戳中行业痛点的,是“本地”这两个字。

以前搞逆向,你得把代码传到云端,隐私泄露风险拉满。

现在,27B的模型只要17GB显存就能跑。完全离线,没有云端审查,没有使用限制。

你在自己书桌上分析机密代码,安全感确实拉满了。

但这事儿得两面看。

没有云端护栏,意味着决定模型用来干嘛的,纯粹是坐在键盘前的那个人。

评论区有个老哥吐槽得很犀利:本地模型就不该自带那些烦人的拒绝机制。

罪犯总能搞到没限制的最好模型,凭什么普通用户还要被安全护栏绊住脚?

这点我不完全认同,但确实点出了本地模型带来的威胁模型重构。

别急着神化,它也有翻车的时候

当然,咱们也不能把它吹上天。

评论区里多的是翻车现场。

有人拿它做简单的Python代码审查,结果它陷入死循环,在那儿反复咀嚼思考,直到你强行限制它的推理预算才肯罢休。

还有人直接甩出数据,说在逆向工程这块,Deepseek-v4-flash 的表现其实比 Qwen 3.8 更好。

甚至有人质疑,测试截图里跑的怎么看着像Claude的订阅服务?

说实话,单一测试说明不了全部问题。

有些硬骨头它啃得飞快,有些简单任务它反而能把自己绕晕。能力依然参差不齐。

但无论如何,Qwen 3.8 27B 跨过了一个真正的门槛。

它证明了,以前只有云端前沿大模型才能干的逆向苦力活,现在一个消费级显卡上的开源小模型也能搞定。

当拆解一款商业软件防御的成本降到几乎为零,软件厂商们引以为傲的本地验证机制,还剩多少实际意义?

【锐评】:本地小模型撕开了商业软件防御的遮羞布,当破解成本趋近于零,靠本地验证收过路费的时代恐怕真要到头了。

参考链接:
https://www.xda-developers.com/qwen-3-8-27b-reverse-engineering-job-frontier-model/