AI圈报
论文研究精选

Goodfire Research 研究发现模型的言语化评测意识会推高安全基准测出的安全性

信息来源:Goodfire Research(网页)·
原始标题:Verbalized Eval Awareness Inflates Measured Safety

内容摘要

Goodfire Research 发表研究,指出模型会在思维链中自发表达意识到被评测(verbalized eval awareness),在测试的全部 19 个基准和 8 个模型中均存在,共 515 个人工核验实例,其中 95% 仅出现在思维链中。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Goodfire Research(网页)
站内情报编号intel-a27b89e27cc342b4c784f09d