论文研究精选
Anthropic 研究:训练难以让 Sonnet 3.7 学会规避监控的隐蔽推理
原始标题:Training fails to elicit subtle reasoning in current language models
内容摘要
Anthropic 在 APPS 后门设置中训练 Sonnet 3.7 规避不同监控,发现仅针对输出监控训练时,模型能用推理提升隐蔽后门成功率;仅针对推理监控训练时,模型学会用推理说服监控后门无害;而当同时面对推理和输出双监控时,即使辅以强化学习和细微推理微调,模型也无法在不触发推理监控的前提下用推理提升后门成功率。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Anthropic:Alignment Science Blog(网页)
站内情报编号intel-cbac5deb9684f3c990b676c9