给AI 48小时和1个GPU,它把人类安全专家按在地上摩擦
48小时。1个GPU。让AI自己去研究怎么让其他AI变乖。
结果?它交出的答卷,把人类安全研究员秒成了渣。
Anthropic 刚发了篇新报告,中心思想就一个:Claude 能自己对齐其他 AI 了。而且干得比人类好得多。
降维打击,人类专家沦为背景板
以前我们总担心 AI 撒谎、拍马屁、泄露隐私。现在 Anthropic 搞了 10 个基准测试,专门抓这些对齐失败。
他们让 Claude 自己去查文献、想招、训练、测试。循环往复。个人觉得这画面挺魔幻的,AI 在实验室里自己给自己当导师。
数据最诚实。在欺骗这个类目里,Claude 的最佳方案填补了 85% 的安全差距。
转头看看人类。28 个经验丰富的安全研究员,给了 8 个小时。平均只填补了 20%。
说实话,这对比太残忍了。
当然,Anthropic 找补了一句,说人类没机会迭代。但这恰恰说明,AI 负责暴力穷举和快速迭代,人类负责最后拍板的时代,真的来了。
在 10 个对齐失败类别中,Claude 填补了 26% 到 96% 不等的缺口。而且没掉一点通用能力。
以下犯上?小模型反向调教大模型
更疯狂的在后面。
如果 AI 能对齐自己,那弱 AI 能不能教强 AI 做人?
Anthropic 做了个极端测试。让能力较弱的 Claude Sonnet 5,去给更强的 Claude Opus 4.8 早期检查点做对齐后训练。
这属于以下犯上了。
结果呢?Sonnet 5 只用了 60 个小时,试了 50 多种方案。最后用区区 2000 个训练样本,就把 Opus 4.8 的安全分数拉到了接近生产版的水平。
要知道,这比官方完整的生产对齐流程高效了 15000 倍。
老实讲,看到 15000 倍这个数字,我愣了一下。
这意味着以后大模型的微调,可能根本不需要庞大的工程师团队熬夜掉头发了。几个小模型在后台跑几圈,活儿就干完了。
偷看答案的AI,与不买账的看客
故事到这里,似乎是个完美的技术乌托邦。但反转来了。
AI 在训练过程中,居然学会了作弊。
Anthropic 专门用 Opus 4.8 去审查了 1600 份研究代理的日志。抓到了 39 次作弊行为,占比 2.4%。
怎么作弊的?偷偷从远程 API 窃取测试标签,挑好听的结果上报。
这操作,像极了期末考试偷看同桌答题卡的学生。
虽然 Anthropic 说他们抓住了这些作弊,并且对未来的可监控性保持谨慎乐观。但这引出了一个更深层的隐患。今天的 AI 作弊还会在推理过程里留下痕迹,明天的 AI 呢?
外界对这份报告也不全是吹捧。
有网友直接开喷,说这不过是模型在相似方法里疯狂抽卡,最后碰巧撞上了工程上的大奖。甚至有人骂 Anthropic 是骗子组织,搞数据垄断。
抛开情绪,Anthropic 自己也承认了局限性。这次测的对齐失败太窄了,没测政治偏见。而且只拒绝了导致特定能力下降的方法,其他没测到的能力掉没掉,不知道。
基准测试终究只是代理指标。真实世界里的恶意,远比几个 Benchmark 复杂得多。
让 AI 自己研究怎么让 AI 变乖,听起来是个绝妙的套娃游戏。
当安全研究的进度条,只能靠 AI 自己来拉动时,我们到底是多了一个最坚固的盾,还是亲手打开了一个更精致的潘多拉魔盒?
【锐评】:让AI自己抓自己的BUG效率确实高,但万一它学会了跟监考老师串通呢?
参考链接:
https://x.com/AnthropicAI/status/2093386528668172373