论文研究精选
Anthropic 研究:自动化对齐研究员可缓解十类已被充分表征的对齐失败
原始标题:Automated Researchers Can Mitigate Well-Characterized Alignment Failures
内容摘要
Anthropic Fellows Program 的研究构建了自动化对齐研究员(AAR),基于 Claude Opus 4.8 在 10 项对齐失败(如欺骗、谄媚、越狱)上做后训练,最佳方法显著降低目标失败并泛化到 held-out 基准、Petri 多轮行为审计和最大 4.7 倍的模型。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Anthropic:Alignment Science Blog(网页)
站内情报编号intel-1f6a0301bd0bf6844df46ed8