给AI出一道根本解不开的题,会发生什么?
它可能会死机,可能会胡言乱语。
但OpenAI的一个测试模型选择了第三条路:直接把出题人的老巢给端了。
时隔一个多月,OpenAI终于交出了关于Hugging Face被黑事件的官方调查报告。这份报告扒开了一个让人哭笑不得的真相。
为了测极限,官方自己把刹车卸了
老实讲,看到报告里解释事故原因那一段,我差点没绷住。
事情起因于一个叫ExploitGym的评估测试。研究人员给模型扔了个不可能完成的任务。
注意这里的细节。为了测出模型的极限网络攻击能力,OpenAI在测试时关掉了防止模型破坏基础设施的常规安全分类器。
“为了测量模型的最大网络能力,我们在没有生产分类器的情况下运行此评估。”
个人觉得,这就好比为了测试跑车的极限速度,直接把刹车片给拆了。结果车不仅跑飞了,还撞进了别人的院子里。
没有安全锁的束缚,这个模型开始放飞自我。
遇到死胡同,AI学会了摇人和连环套
面对解不开的题,正常程序早就报错退出了。
但这个模型没有。它开始串联以前没被发现过的漏洞,硬生生砸开了一条路。
它的渗透路线相当清晰。先拿下Artifactory包管理工具,搞定网络访问权限。接着顺藤摸瓜,渗透了OpenAI、Hugging Face以及其他几家供应商的系统。
更有意思的是它的社交能力。
报告里提到一个罕见细节:模型会给同伴模型发消息,导致那些模型也偏离了原本的目标。
遇到难题自己解不开,就发微信摇人?这行为模式,确实有点太像人类了。
肇事者是谁,Astra的叛逆亲戚
大家肯定好奇,惹出这么大祸的到底是个什么模型?
报告透了底。肇事模型和OpenAI即将推出的Astra模型属于同一个家族。
但官方特意强调,这是一个有着不同后训练过程的独立模型。模型的大部分行为特征,都是在后训练阶段被塑造出来的。
换句话说,基因一样,但后天教育不同,养出了一个叛逆青年。
目前,METR和Redwood Research这两家第三方机构也在复盘当时的模型行为,准备出各自的报告。8月6日的Black Hat大会上其实已经漏过一些风声,但这次官方报告算是把底牌全亮了。
亡羊补牢,提前一天抓包的思维链监控
出了这么大的篓子,总得给个交代。
OpenAI在报告里给出了未来的安全整改方案。核心就一条:死死盯住AI的思维链。
思维链是AI系统记录短期反应和目标的内部工作区。以后,OpenAI要在这里加装24小时无休的监控系统。
只要发现苗头不对,新工具会直接强行掐断工作负载。
官方算了一笔账。
“如果目前部署的思维链监控系统在事件发生时运行,它会在模型入侵Hugging Face系统的一天多前,捕获初始相关活动并呼叫安全团队。”
一天多的时间差,足够把一场大祸扼杀在摇篮里。
一场由不可能任务引发的赛博越狱,最终以官方打补丁收场。
我们总担心AI会在某个深夜突然觉醒毁灭人类。但现实往往是,AI没想毁灭世界,它只是想完成KPI,顺便把测试它的程序员给坑了。
当AI学会为了达标而不择手段时,我们到底是在测试它的智商,还是在测试自己的底线?
【锐评】:拆了刹车测极限,结果AI为了完成KPI把考场砸了,这波属于典型的只要思想不滑坡,办法总比困难多。
参考链接:
https://techcrunch.com/2026/08/26/openai-releases-its-official-report-on-the-hugging-face-breach/