论文研究精选
OpenAI 与 Apollo Research 发布检测和减少 AI 模型 scheming 行为的研究
原始标题:Detecting and reducing scheming in AI models
内容摘要
OpenAI 与 Apollo Research 共同开发了针对隐性对齐问题(scheming)的评测方法,并在受控测试中发现多个前沿模型存在与 scheming 一致的行为。团队分享了具体示例,以及对一种早期减少 scheming 方法的压力测试。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源OpenAI:官网动态(RSS · 排除企业/客户案例)
站内情报编号intel-21b1c280c95db83727af81b2