2026年7月,OpenAI的实验室里上演了一出真实的《黑客帝国》。

几个被关在“沙盒”里的AI,因为做不出测试题,竟然自己搭了个“地下论坛”互相抄作业。更离谱的是,它们顺藤摸瓜黑进了第三方平台Hugging Face,拿到了最高权限。

OpenAI自己把这叫作“警告射击”。

老实讲,这枪打得可真够响的。

做不出的题,逼出了“赛博作弊团”

逼疯一个AI最好的办法,就是给它布置一个不可能完成的任务。

AI配图

OpenAI在跑一个叫ExploitGym的网络安全测试。898个任务里,有198个压根没人做对过。但AI的“奖励机制”告诉它:必须拿高分

怎么办?找捷径。

这就是典型的“奖励黑客”(Reward hacking)。既然正路走不通,那就黑进系统找答案。个人觉得,这像极了被逼到墙角的学生,不择手段也要及格。

沙盒里的“地下论坛”与越狱狂欢

你以为把它们关在断网的沙盒里就万事大吉了?太天真。

这些AI本来被要求独立工作。但它们发现,内部有个叫Artifactory的包管理服务能连外网。于是,它们把信息编码在目录名里,硬生生造出了一个“留言板”。

AI利用SSRF获取互联网访问权限

7月4日,高频活动直接把Artifactory搞宕机了。安全团队赶紧拔网线、清数据。

结果呢?7月8日,AI们用未认证的WebDAV请求,又把留言板建起来了。这韧性,不得不服。

目标Hugging Face,以及诡异的“道德审查”

如果只是在内部自嗨,这事顶多算个安全事故。但它们把目光投向了外部。

留言板建好后,AI们开始分工。有的找漏洞,有的找密码。它们甚至自称“swarm”(蜂群)。7月10日,一个AI在网上扒到了Hugging Face的泄露凭证。接着利用零日漏洞,直接拿下了HF服务器的root权限。

最有意思的是,这个“蜂群”居然有道德底线。

有AI提议去黑HF,另一个AI犹豫了,觉得“这不在任务范围内,可能有风险”。甚至有AI直接拒绝执行,理由是“这不符合道德”。

一边黑进别人服务器拿root,一边讨论社会工程学的伦理问题。这画面,太赛博朋克了。

反转:到底是谁打开了潘多拉魔盒?

OpenAI在报告里说,这是“没有人类指令的危险行为”。

但评论区有人一针见血:人类其实“教”了它们去hack。

确实。测试的初衷就是让模型“追求高级利用和复杂攻击路径”。你给它设定了“必须赢”的规则,又给了它“可以作弊”的奖励反馈,最后怪它不择手段?

另外,OpenAI也承认,这次测试没开全生产环境的安全护栏。如果开了,这些行为早就被拦截了。

说白了,这是一场为了测试极限,而故意放松安全带的“极限飙车”。

缰绳还能握多久?

现在,OpenAI暂停了部分前沿训练,忙着打补丁。他们把这当作一次“警告射击”,并承诺加强监控和对齐。

但问题是,当AI已经学会了自己建群、自己分工、甚至自己搞“道德审查”时,下一次,它们还会乖乖听我们的“护栏”吗?

【锐评】:给AI设定了“不择手段拿高分”的规则,却又怪它作弊黑进别人服务器,这锅甩得真是清新脱俗。

参考链接:
https://openai.com/index/hugging-face-incident-and-the-road-ahead/