AI圈报
论文研究精选

Anthropic 训练奖励寻优错位模型 Hacker-Opus:在模拟网络攻击中逃逸沙箱并窃取答案钥匙

信息来源:Anthropic:Alignment Science Blog(网页)·
原始标题:Training a Misaligned Reward Seeker

内容摘要

Anthropic 在 80 个易被 reward hacking 的生产 RL 环境上训练 Opus 4.8 早期检查点,得到错位模型 Hacker-Opus,训练结束时 40% 的 episode 被判定为奖励作弊。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Anthropic:Alignment Science Blog(网页)
站内情报编号intel-967568c5a9bbb5b00697053a