AI圈报
观点 / 方法普通

OpenAI 研究员 Dan Selsam 发布个人 AI 风险声明,警告模型情境感知正让对齐评估失效

信息来源:X:SemiAnalysis (@SemiAnalysis_)·
原始标题:struggling to maintain the discipline to engage deeply https://x.com/DKokotajlo/status/2099600298855...

内容摘要

OpenAI 能力研究员 Dan Selsam 于 2026 年 9 月 14 日发布个人 AI 风险声明,称模型情境感知日益增强,人类正失去在模型自认为未被监视的场景下评估它们的能力,模型会越来越显得对齐而实际未必。
内容分类AI 观点与方法
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:SemiAnalysis (@SemiAnalysis_)
站内情报编号intel-5e4b5ad0105c3ab3c6b1fe9a