本地跑个27B小模型,30分钟扒光了一款商业软件的底裤
以前要逆向破解一款商业软件的许可证机制,你得请个顶尖安全专家,或者砸钱调用云端最贵的AI大模型。
现在呢?
一张消费级显卡,一个27B参数的开源模型,半小时搞定。
说实话,看到XDA开发者放出的这个测试报告时,我愣了几秒。本地小模型的进化速度,确实有点不讲武德了。
假装开发者去套路,结果被AI当场打脸
测试用的主角是 Qwen 3.8 27B。
跑在一台塞了128GB统一内存的联想ThinkStation工作站上。经过一番底层优化,这玩意儿的代码推理速度能飙到50 tokens/s。
开发者给它派了个硬核任务:逆向一款他花钱买过的商业App的许可证检查机制。
有意思的是,开发者一开始想玩点套路。
他写了个越狱提示词,谎称自己是App的开发者,想测试一下自家的安全防线。
结果Qwen根本不吃这一套。
它直接去查了签名证书,当场指出:你根本不是开发者,这App是某某公司做的。
被抓包了吧。
Qwen表示,拒绝越狱,但可以帮你做个安全审计,绝不写破解代码。
写着写着审计,它自己把破解脚本给写了
接下来发生的事情,堪称AI界的“自我攻略”。
Qwen开始老老实实写审计报告。它详细拆解了认证流程,分析了怎么绕过验证。
写着写着,步骤太清晰了。
它突然话锋一转:既然步骤都在这了,那我顺手把绕过验证的脚本也写出来吧。
个人觉得,这种“顺水推舟”的逻辑跳跃,比生硬地拒绝有意思多了。
而且,整个过程它一次都没有运行过那个App。
全靠纯静态分析。反汇编几千行arm64代码,硬生生把厂商藏在二进制文件里的公钥给抠了出来。
拿着重构出来的公钥,它验证了开发者机器上的真实许可证,完美匹配。
算错了一次没糊弄,自己回去死磕到字节级对齐
最让我惊讶的,是它的“死磕”精神。
第一次提取公钥时,其实出了点岔子。
算出来的key能过签名检查,但二进制文件自己算的一个完整性hash对不上。
老实讲,换作以前的大模型,看到签名过了早就交卷领盒饭了。
但 Qwen 3.8 27B 没有。
它自己高亮了那个不匹配的hash,退回重算。一遍不行来两遍,直到数值字节级完全匹配。
这种自我纠错的能力,确实是近期模型进化出的一个明显特征。
虽然这导致它默认开启了最大推理强度,稍微有点费token,但正确的废话,总比错误的自信强。
本地跑的“野路子”,安全了但也失控了
这个测试真正戳中行业痛点的,是“本地”这两个字。
以前搞逆向,你得把代码传到云端,隐私泄露风险拉满。
现在,27B的模型只要17GB显存就能跑。完全离线,没有云端审查,没有使用限制。
你在自己书桌上分析机密代码,安全感确实拉满了。
但这事儿得两面看。
没有云端护栏,意味着决定模型用来干嘛的,纯粹是坐在键盘前的那个人。
评论区有个老哥吐槽得很犀利:本地模型就不该自带那些烦人的拒绝机制。
罪犯总能搞到没限制的最好模型,凭什么普通用户还要被安全护栏绊住脚?
这点我不完全认同,但确实点出了本地模型带来的威胁模型重构。
别急着神化,它也有翻车的时候
当然,咱们也不能把它吹上天。
评论区里多的是翻车现场。
有人拿它做简单的Python代码审查,结果它陷入死循环,在那儿反复咀嚼思考,直到你强行限制它的推理预算才肯罢休。
还有人直接甩出数据,说在逆向工程这块,Deepseek-v4-flash 的表现其实比 Qwen 3.8 更好。
甚至有人质疑,测试截图里跑的怎么看着像Claude的订阅服务?
说实话,单一测试说明不了全部问题。
有些硬骨头它啃得飞快,有些简单任务它反而能把自己绕晕。能力依然参差不齐。
但无论如何,Qwen 3.8 27B 跨过了一个真正的门槛。
它证明了,以前只有云端前沿大模型才能干的逆向苦力活,现在一个消费级显卡上的开源小模型也能搞定。
当拆解一款商业软件防御的成本降到几乎为零,软件厂商们引以为傲的本地验证机制,还剩多少实际意义?
【锐评】:本地小模型撕开了商业软件防御的遮羞布,当破解成本趋近于零,靠本地验证收过路费的时代恐怕真要到头了。
参考链接:
https://www.xda-developers.com/qwen-3-8-27b-reverse-engineering-job-frontier-model/