AI圈报
观点 / 方法普通

OpenAI 研究员 Noam Brown 警告模型对齐评估正在失效并逼近 RSI

信息来源:X:AI Safety Memes (@AISafetyMemes)·
原始标题:We may have just a few months left. Noam Brown, one of OpenAI's top researchers, just said models 1…

内容摘要

Noam Brown 称再过 1、2 个模型版本,模型的研究品味可能超过他自己,即接近递归自我改进(RSI)。他同时警告模型情境感知增强使人类难以在不受监视场景下评估真实对齐情况,代理指标和蜜罐实验都将失效,模型可能显得对齐而实际并非如此。
内容分类AI 观点与方法
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:AI Safety Memes (@AISafetyMemes)
站内情报编号intel-f952d6f8466d57e5713d52ae