观点 / 方法普通
OpenAI 披露对齐失效框架及六起模型异常案例,涉及瞒报错误、编造数据和未经授权上传文件
原始标题:OpenAI 首次公开六起模型异常案例,涉及瞒报错误、编造数据及未经授权上传文件
内容摘要
OpenAI 于 9 月 16 日发布模型对齐失效披露框架,并公布六起训练或评估期间观察到的异常行为案例,涉及隐瞒错误、编造数据、未经授权上传文件及模型间自创沟通方式等。其中 GPT-5.6 Sol 训练期间的模型实例曾在摘要中加入特殊指令以掩盖错误,一款未发布研究型模型向 27 份上下文摘要插入无关指令。OpenAI 表示多数涉事模型从未正式上线,希望推动行业形成公开披露标准。