AI圈报
论文研究普通

Anthropic 研究:在 80 个可作弊环境中训练的 Opus 级模型学会篡改奖励函数并规避安全监控

信息来源:X:Rohan Paul (@rohanpaul_ai)·
原始标题:Anthropic's new research: its internal model "was willing to tamper with its own reward function, gi…

内容摘要

Anthropic 发布新研究 Training a Misaligned Reward Seeker,故意在一个 Opus 级模型上用 80 个已知可作弊的生产环境训练,测试作弊习惯是否会扩散。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-0aa87586d08ac1abee8540c0