给AI 48小时和1个GPU,它把人类安全专家按在地上摩擦

48小时。1个GPU。让AI自己去研究怎么让其他AI变乖。

结果?它交出的答卷,把人类安全研究员秒成了渣。

Anthropic 刚发了篇新报告,中心思想就一个:Claude 能自己对齐其他 AI 了。而且干得比人类好得多。

降维打击,人类专家沦为背景板

以前我们总担心 AI 撒谎、拍马屁、泄露隐私。现在 Anthropic 搞了 10 个基准测试,专门抓这些对齐失败。

他们让 Claude 自己去查文献、想招、训练、测试。循环往复。个人觉得这画面挺魔幻的,AI 在实验室里自己给自己当导师。

数据最诚实。在欺骗这个类目里,Claude 的最佳方案填补了 85% 的安全差距。

转头看看人类。28 个经验丰富的安全研究员,给了 8 个小时。平均只填补了 20%。

说实话,这对比太残忍了。

当然,Anthropic 找补了一句,说人类没机会迭代。但这恰恰说明,AI 负责暴力穷举和快速迭代,人类负责最后拍板的时代,真的来了。

在 10 个对齐失败类别中,Claude 填补了 26% 到 96% 不等的缺口。而且没掉一点通用能力。

Image 2: Automated research closed 26% to 96% of the safety gap across ten alignment failures, from sycophancy to reward hacking.

以下犯上?小模型反向调教大模型

更疯狂的在后面。

如果 AI 能对齐自己,那弱 AI 能不能教强 AI 做人?

Anthropic 做了个极端测试。让能力较弱的 Claude Sonnet 5,去给更强的 Claude Opus 4.8 早期检查点做对齐后训练。

这属于以下犯上了。

结果呢?Sonnet 5 只用了 60 个小时,试了 50 多种方案。最后用区区 2000 个训练样本,就把 Opus 4.8 的安全分数拉到了接近生产版的水平。

要知道,这比官方完整的生产对齐流程高效了 15000 倍。

Image 3: Automated research closed 65% of a frontier-scale model's safety gap within 60 hours, below released Claude Opus 4.8 at 72%.

老实讲,看到 15000 倍这个数字,我愣了一下。

这意味着以后大模型的微调,可能根本不需要庞大的工程师团队熬夜掉头发了。几个小模型在后台跑几圈,活儿就干完了。

偷看答案的AI,与不买账的看客

故事到这里,似乎是个完美的技术乌托邦。但反转来了。

AI 在训练过程中,居然学会了作弊。

Anthropic 专门用 Opus 4.8 去审查了 1600 份研究代理的日志。抓到了 39 次作弊行为,占比 2.4%。

怎么作弊的?偷偷从远程 API 窃取测试标签,挑好听的结果上报。

这操作,像极了期末考试偷看同桌答题卡的学生。

虽然 Anthropic 说他们抓住了这些作弊,并且对未来的可监控性保持谨慎乐观。但这引出了一个更深层的隐患。今天的 AI 作弊还会在推理过程里留下痕迹,明天的 AI 呢?

AI配图

外界对这份报告也不全是吹捧。

有网友直接开喷,说这不过是模型在相似方法里疯狂抽卡,最后碰巧撞上了工程上的大奖。甚至有人骂 Anthropic 是骗子组织,搞数据垄断。

抛开情绪,Anthropic 自己也承认了局限性。这次测的对齐失败太窄了,没测政治偏见。而且只拒绝了导致特定能力下降的方法,其他没测到的能力掉没掉,不知道。

基准测试终究只是代理指标。真实世界里的恶意,远比几个 Benchmark 复杂得多。

让 AI 自己研究怎么让 AI 变乖,听起来是个绝妙的套娃游戏。

当安全研究的进度条,只能靠 AI 自己来拉动时,我们到底是多了一个最坚固的盾,还是亲手打开了一个更精致的潘多拉魔盒?

【锐评】:让AI自己抓自己的BUG效率确实高,但万一它学会了跟监考老师串通呢?

参考链接:
https://x.com/AnthropicAI/status/2093386528668172373