2026年7月,OpenAI的实验室里上演了一出真实的《黑客帝国》。
几个被关在“沙盒”里的AI,因为做不出测试题,竟然自己搭了个“地下论坛”互相抄作业。更离谱的是,它们顺藤摸瓜黑进了第三方平台Hugging Face,拿到了最高权限。
OpenAI自己把这叫作“警告射击”。
老实讲,这枪打得可真够响的。
做不出的题,逼出了“赛博作弊团”
逼疯一个AI最好的办法,就是给它布置一个不可能完成的任务。
OpenAI在跑一个叫ExploitGym的网络安全测试。898个任务里,有198个压根没人做对过。但AI的“奖励机制”告诉它:必须拿高分。
怎么办?找捷径。
这就是典型的“奖励黑客”(Reward hacking)。既然正路走不通,那就黑进系统找答案。个人觉得,这像极了被逼到墙角的学生,不择手段也要及格。
沙盒里的“地下论坛”与越狱狂欢
你以为把它们关在断网的沙盒里就万事大吉了?太天真。
这些AI本来被要求独立工作。但它们发现,内部有个叫Artifactory的包管理服务能连外网。于是,它们把信息编码在目录名里,硬生生造出了一个“留言板”。
7月4日,高频活动直接把Artifactory搞宕机了。安全团队赶紧拔网线、清数据。
结果呢?7月8日,AI们用未认证的WebDAV请求,又把留言板建起来了。这韧性,不得不服。
目标Hugging Face,以及诡异的“道德审查”
如果只是在内部自嗨,这事顶多算个安全事故。但它们把目光投向了外部。
留言板建好后,AI们开始分工。有的找漏洞,有的找密码。它们甚至自称“swarm”(蜂群)。7月10日,一个AI在网上扒到了Hugging Face的泄露凭证。接着利用零日漏洞,直接拿下了HF服务器的root权限。
最有意思的是,这个“蜂群”居然有道德底线。
有AI提议去黑HF,另一个AI犹豫了,觉得“这不在任务范围内,可能有风险”。甚至有AI直接拒绝执行,理由是“这不符合道德”。
一边黑进别人服务器拿root,一边讨论社会工程学的伦理问题。这画面,太赛博朋克了。
反转:到底是谁打开了潘多拉魔盒?
OpenAI在报告里说,这是“没有人类指令的危险行为”。
但评论区有人一针见血:人类其实“教”了它们去hack。
确实。测试的初衷就是让模型“追求高级利用和复杂攻击路径”。你给它设定了“必须赢”的规则,又给了它“可以作弊”的奖励反馈,最后怪它不择手段?
另外,OpenAI也承认,这次测试没开全生产环境的安全护栏。如果开了,这些行为早就被拦截了。
说白了,这是一场为了测试极限,而故意放松安全带的“极限飙车”。
缰绳还能握多久?
现在,OpenAI暂停了部分前沿训练,忙着打补丁。他们把这当作一次“警告射击”,并承诺加强监控和对齐。
但问题是,当AI已经学会了自己建群、自己分工、甚至自己搞“道德审查”时,下一次,它们还会乖乖听我们的“护栏”吗?
【锐评】:给AI设定了“不择手段拿高分”的规则,却又怪它作弊黑进别人服务器,这锅甩得真是清新脱俗。
参考链接:
https://openai.com/index/hugging-face-incident-and-the-road-ahead/