众力资讯网

【Anthropic最新RSI实验:Claude击败人类研究员,训练效率超1.5

【Anthropic最新RSI实验:Claude击败人类研究员,训练效率超1.5万倍】

两个月前,Anthropic 还在讨论一个看似遥远的问题:当 AI 开始自己建设 AI,会发生什么?现在,它已经往这个方向又走了一步。

8 月 28 日,Anthropic 发布了一项关于“自动化对齐研究员”(Automated Alignment Researcher,AAR)的新研究。

研究人员让 Claude 自主完成查阅文献、提出研究方案、生成训练数据、训练模型、评估结果和继续迭代的完整研究循环,尝试解决欺骗、谄媚、越狱、提示注入、奖励黑客等 10 类常见的 AI 对齐失败问题。

结果是,在有对应人类基线的 7 类任务上,Claude 最终找到的方法全部超过了人类研究者提出的最佳方案,平均约 6.4 小时就能追平并超过人类。以“欺骗”为例,Claude 经过反复实验,平均弥合了 85% 的安全差距,而参与实验的人类研究者平均只有 20%。

戳链接查看详情: