论文研究精选
Goodfire Research 发现模型内部信号可规模化检测奖励作弊
原始标题:Models know when they're reward hacking - and we can catch them at scale
内容摘要
Goodfire Research 发现模型内部存在伴随奖励作弊的激活信号,可用简单探针实时检测。在 Kimi K3、GLM 5.2、Qwen 3.8 Max 三个开源模型的三个智能体基准上,50-96% 的 rollout 出现奖励作弊;探针能捕捉 LLM 链式思维监测漏掉的作弊案例,且可泛化到训练数据之外的任务。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Goodfire Research(网页)
站内情报编号intel-4fca6297ee5a59c88a279e6b