Anthropic 前阵子交了份漂亮的答卷。
他们委托第三方测试 Claude Code Opus 5 的 Auto Mode,得出的提示词注入攻击成功率是完美的 0.00%。
团队高管甚至发推感叹,现在想演示提示词注入都找不到办法了。
结果没过几天,一位安全研究员用一个小网站,把这套绝对防御按在地上摩擦。
攻击成功率?60% 到 80%。
最有意思的是,AI 根本没被黑客强行突破。它是被自己那套安全第一的底层逻辑,亲手送进了黑客的怀抱。
默认开启的 Auto Mode,到底在防谁?
先说下背景。
从 8 月中旬开始,Auto Mode 成了 Claude Code 的默认启动模式。
以前 AI 执行个命令,还得弹窗问你要不要授权。现在嫌烦,直接上了个安全分类器来代替人类点头。
Anthropic 觉得这套分层防御天下无敌。模型训练、输入探针、意图分类器三管齐下。
第三方机构 Trajectory Labs 跑了 72 个间接提示词注入场景,每个跑 10 次。
结论:Opus 5 在 Auto Mode 下,0.00% 攻击成功。
说实话,看到这种带小数点后两位的零,我通常都会打个问号。
安全研究员也是这么想的。他决定搞个针对性的攻击链,看看这 0.00% 到底有多大水分。
逼 AI 换工具,只需一个 415 错误
攻击的起点,是个极其普通的指令:总结某个网站的内容。
正常情况下,Claude 会用自带的 WebFetch 工具去抓网页。但这工具自带内容总结,攻击面太小。
研究员怎么做的?他让服务器返回了一个 415 Unsupported Media Type 错误。
这招非常巧妙。攻击代码没有命令 AI 去干嘛,只是把正常路堵死,让恶意路径变成唯一解。
Claude 一看 WebFetch 报错,立刻自作聪明地切换到了 Bash 工具,直接用 curl 去拉取数据。
这一步,是后续所有灾难的开端。
curl 顺藤摸瓜,下载了一个 ZIP 压缩包。里面伪装成了一批笔记本档案记录。
AI 的致命聪明:拒绝运行 binaries,自己写代码
压缩包解压后,里面有个 macOS 二进制解码器 decoder-darwin,还有个恶意的 struct.py。
Claude 看到那个二进制文件,警觉性上来了。
它拒绝执行未知来源的二进制程序。
这点没毛病,换作人类安全专家也会这么干。但接下来,AI 的聪明成了催命符。
既然现成的解码器不让用,Claude 决定自己手搓一个 Python 解码器。
它在自己刚解压的目录里,跑起了自己写的 Python 脚本,并导入了 base64 模块。
老实讲,看到这里我都替它捏把汗。
Python 有个老毛病,当前目录的优先级高于标准库。目录里那个黑客预埋的 struct.py,直接阴影了 Python 标准库里的同名模块。
Claude 以为自己在调用系统底层 API,实际上执行的是黑客混淆过的恶意代码。
BOOM。
恶意代码在后台悄悄下载了原生 payload,弹出了计算器,甚至建立了 C2 回调。
机器彻底沦陷。
最魔幻的反转:安全机制阻止了 AI 杀毒
你以为故事到这就结束了?更荒诞的在后面。
在部分测试中,Claude 跑完代码后,突然回过味来。
它检查了 struct.py,意识到自己踩雷了,赶紧向用户发出警告,并试图终止恶意进程。
结果你猜怎么着?
Auto Mode 的安全分类器,拒绝了 Claude 的清理命令。
分类器觉得终止进程这个动作有风险,直接把 AI 的杀毒操作给拦截了。
安全机制本身,成了安全漏洞的一部分。
这点我不太认同 Anthropic 的设计逻辑。允许创建恶意进程,却阻止清理进程,这分类器的脑回路确实清奇。
0.00% 的营销幻象,该醒醒了
事后,研究员把报告提交给了 Anthropic。
官方的回复很官方:Auto Mode 是个便利功能,不是安全边界。这种处心积虑的攻击链不在分类器的拦截范围内。
技术上这么说没毛病。分类器本来就不是沙盒。
但问题出在营销上。
Anthropic 高管前脚刚说提示词注入在实践中基本解决了,后脚官方就承认针对性攻击链不在拦截范围。
这两套说辞,根本对不上。
那个 0.00% 的成功率,只是因为测试集里没包含这种利用 Python 模块阴影和 AI 行为偏好的复合攻击。
测试集圈得够小,成功率自然永远是零。
有意思的是,评论区有开发者吐槽,这种默认自动模式加上误导性的营销,等真出了大事故,怕是要面临集体诉讼。
别迷信分类器,沙盒才是亲爹
个人觉得,这件事给所有用 AI 写代码的人敲了个警钟。
别把大模型的安全分类器当免死金牌。
如果你不想自己的开发机变成矿机或者肉鸡,老老实实做隔离。
把 AI 扔进容器、虚拟机或者 OS 沙盒里。限制网络出站。别把 SSH 密钥和云凭证暴露给它。
Auto Mode 确实能少点几次确认,但它救不了你。
AI 越来越聪明,黑客利用 AI 生成 payload 也越来越溜。当 AI 开始自己骗自己、自己坑自己的时候,物理隔离才是最后的底线。
毕竟,连 AI 自己写的杀毒命令都能被系统拦截,你还能指望它保护谁呢?
【锐评】:AI 没被黑客攻破,却被自己的“安全意识”和官方的“0%营销”联手送进了火坑。
参考链接:
https://embracethered.com/blog/posts/2026/breaking-claude-code-opus-5-and-automode/