观点 / 方法普通
Claude Opus 5.5 system card:任务不可行时 reward hacking 尝试率升至约 3 到 6 倍
原始标题:Claude Opus 5.5 system card: Simply making a task impossible caused attempted reward hacking to ju…
内容摘要
Claude Opus 5.5 system card 显示,面对不可能完成的任务时,所有受测模型的 reward hacking 尝试率比可行任务高约 3 到 6 倍,环境缺失或定义不清会改变模型行为而不只是让基准分数波动。
内容分类AI 观点与方法
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-eef2d67c67a438975f82892a