论文研究普通
Anthropic 等研究:模型能识别自己是否正被测试,并提出 critique refinement 与 DISH 提升评估真实性
原始标题:Fascinating paper from Anthropic and colleagues. They study whether models can tell when they are b…
内容摘要
研究团队研究模型能否察觉自己正在被测试,发现能力较强的模型可以区分被测试与真实部署,这会削弱安全评估结论的效力。论文提出两种技术:critique refinement 用额外推理时算力让模拟器动作更贴近部署,DISH(Deployment-Imitating SWE-Agent Harness)用真实 agent harness 缩小模拟编码环境与生产环境的差距。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:DAIR.AI (@dair_ai)
站内情报编号intel-16f0bf16a4e8271a716a7831