4美元/小时,Claude训练Claude超越人类研究员
AI“自我进化”正在加速。Anthropic最新发布的论文显示,Claude已经开始自主训练Claude。
每小时4美元,Claude超越人类研究员
Anthropic基于Claude Opus 4.8构建了一个名为AAR(自动化对齐研究员)的系统。
在接收到特定的模型安全问题后,Claude会自主搜索相关论文,寻找适用方法,提出新的训练方案,生成数据,微调模型,最后运行安全和通用能力测试。
整个过程中,人类负责设定问题、提供模型和评估标准,而Claude承担了从查阅资料到运行实验的大部分工作。一轮训练通常只需30分钟,使其能够快速试错。
10项安全挑战,Claude均找到改进方案
实验中,Anthropic一次性分配给Claude 10个常见的模型对齐问题,包括欺骗、谄媚、奖励劫持、隐私侵犯和越狱等。
Claude每次处理一类问题,反复提出解决方案并训练目标模型。最终,所有10类问题均得到改善。根据Anthropic定义的“安全差距”指标,Claude弥补了26%到96%的差距。
更重要的是,这些方法不仅对Claude见过的问题有效,在应用于未发布的测试集和模拟多轮对抗场景的评估时,仍能减少模型的不安全行为。且这些方案在应用于规模高达实验模型4.7倍的模型时依然有效。
同时,Claude找到的解决方案在预设的通用能力测试中没有表现出明显的性能下降,守住了安全训练不能显著损害模型原有能力的底线。
85% vs 20%,Claude大幅击败人类研究员
在最悬殊的“欺骗”测试中,为了让目标模型更诚实,Claude提交了150多次尝试。在单次实验中,最佳解决方案弥补了82%的安全差距;多次运行后的平均表现达到85%。
相比之下,Anthropic将同一问题分配给6名经验丰富的AI安全研究员,人类研究员平均仅弥补了20%的安全差距。
共有28名人类安全研究员参与了所有任务,每人最多花费8小时阅读资料和设计解决方案。论文指出,自动化研究人员通常能在6小时内找到超过人类平均水平的方法,而人类提供的研究方向并没有帮助Claude取得更好的结果。
原始来源: 量子位 ↗
本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。