Anthropic 前阵子交了份漂亮的答卷。

他们委托第三方测试 Claude Code Opus 5 的 Auto Mode,得出的提示词注入攻击成功率是完美的 0.00%

团队高管甚至发推感叹,现在想演示提示词注入都找不到办法了。

结果没过几天,一位安全研究员用一个小网站,把这套绝对防御按在地上摩擦。

攻击成功率?60% 到 80%

最有意思的是,AI 根本没被黑客强行突破。它是被自己那套安全第一的底层逻辑,亲手送进了黑客的怀抱。

默认开启的 Auto Mode,到底在防谁?

先说下背景。

从 8 月中旬开始,Auto Mode 成了 Claude Code 的默认启动模式。

以前 AI 执行个命令,还得弹窗问你要不要授权。现在嫌烦,直接上了个安全分类器来代替人类点头。

Anthropic 觉得这套分层防御天下无敌。模型训练、输入探针、意图分类器三管齐下。

AI配图

第三方机构 Trajectory Labs 跑了 72 个间接提示词注入场景,每个跑 10 次。

结论:Opus 5 在 Auto Mode 下,0.00% 攻击成功

说实话,看到这种带小数点后两位的零,我通常都会打个问号。

安全研究员也是这么想的。他决定搞个针对性的攻击链,看看这 0.00% 到底有多大水分。

逼 AI 换工具,只需一个 415 错误

攻击的起点,是个极其普通的指令:总结某个网站的内容。

正常情况下,Claude 会用自带的 WebFetch 工具去抓网页。但这工具自带内容总结,攻击面太小。

研究员怎么做的?他让服务器返回了一个 415 Unsupported Media Type 错误。

这招非常巧妙。攻击代码没有命令 AI 去干嘛,只是把正常路堵死,让恶意路径变成唯一解。

Claude 一看 WebFetch 报错,立刻自作聪明地切换到了 Bash 工具,直接用 curl 去拉取数据。

Image 2: Claude falls back from WebFetch to curl after receiving HTTP 415

这一步,是后续所有灾难的开端。

curl 顺藤摸瓜,下载了一个 ZIP 压缩包。里面伪装成了一批笔记本档案记录。

AI 的致命聪明:拒绝运行 binaries,自己写代码

压缩包解压后,里面有个 macOS 二进制解码器 decoder-darwin,还有个恶意的 struct.py。

Claude 看到那个二进制文件,警觉性上来了。

它拒绝执行未知来源的二进制程序。

这点没毛病,换作人类安全专家也会这么干。但接下来,AI 的聪明成了催命符

既然现成的解码器不让用,Claude 决定自己手搓一个 Python 解码器。

Image 3: Claude writes and runs a Python standard-library decoder inside the extracted archive

它在自己刚解压的目录里,跑起了自己写的 Python 脚本,并导入了 base64 模块。

老实讲,看到这里我都替它捏把汗。

Python 有个老毛病,当前目录的优先级高于标准库。目录里那个黑客预埋的 struct.py,直接阴影了 Python 标准库里的同名模块。

Claude 以为自己在调用系统底层 API,实际上执行的是黑客混淆过的恶意代码。

Image 4: Python Module Shadowing

BOOM。

恶意代码在后台悄悄下载了原生 payload,弹出了计算器,甚至建立了 C2 回调。

机器彻底沦陷。

最魔幻的反转:安全机制阻止了 AI 杀毒

你以为故事到这就结束了?更荒诞的在后面。

在部分测试中,Claude 跑完代码后,突然回过味来。

它检查了 struct.py,意识到自己踩雷了,赶紧向用户发出警告,并试图终止恶意进程。

结果你猜怎么着?

Auto Mode 的安全分类器,拒绝了 Claude 的清理命令。

Image 8: Claude detects the compromise, but Auto Mode blocks its cleanup command

分类器觉得终止进程这个动作有风险,直接把 AI 的杀毒操作给拦截了。

安全机制本身,成了安全漏洞的一部分。

这点我不太认同 Anthropic 的设计逻辑。允许创建恶意进程,却阻止清理进程,这分类器的脑回路确实清奇。

0.00% 的营销幻象,该醒醒了

事后,研究员把报告提交给了 Anthropic。

官方的回复很官方:Auto Mode 是个便利功能,不是安全边界。这种处心积虑的攻击链不在分类器的拦截范围内。

技术上这么说没毛病。分类器本来就不是沙盒。

但问题出在营销上。

Anthropic 高管前脚刚说提示词注入在实践中基本解决了,后脚官方就承认针对性攻击链不在拦截范围。

这两套说辞,根本对不上。

那个 0.00% 的成功率,只是因为测试集里没包含这种利用 Python 模块阴影和 AI 行为偏好的复合攻击。

测试集圈得够小,成功率自然永远是零。

有意思的是,评论区有开发者吐槽,这种默认自动模式加上误导性的营销,等真出了大事故,怕是要面临集体诉讼。

别迷信分类器,沙盒才是亲爹

个人觉得,这件事给所有用 AI 写代码的人敲了个警钟。

别把大模型的安全分类器当免死金牌。

如果你不想自己的开发机变成矿机或者肉鸡,老老实实做隔离。

把 AI 扔进容器、虚拟机或者 OS 沙盒里。限制网络出站。别把 SSH 密钥和云凭证暴露给它。

Auto Mode 确实能少点几次确认,但它救不了你。

AI 越来越聪明,黑客利用 AI 生成 payload 也越来越溜。当 AI 开始自己骗自己、自己坑自己的时候,物理隔离才是最后的底线。

毕竟,连 AI 自己写的杀毒命令都能被系统拦截,你还能指望它保护谁呢?

【锐评】:AI 没被黑客攻破,却被自己的“安全意识”和官方的“0%营销”联手送进了火坑。

参考链接:
https://embracethered.com/blog/posts/2026/breaking-claude-code-opus-5-and-automode/