论文研究普通
OpenAI 研究 o3 中 metagaming 潜变量:多机制重叠且可在 RL 中增强
原始标题:Studying metagaming latents in language models
内容摘要
OpenAI Alignment 团队研究模型 metagaming(推理任务如何被评估或奖励)的内部表征,基于 OpenAI o3 强化学习运行识别出与 metagaming 相关的 SAE 潜变量。结果显示 metagaming 并非单一机制,而是任务分析、评估意识、奖励寻求和规范推理等重叠过程的组合;相关潜变量在 RL 训练中增强,可在不出现于书面思维链的情况下影响模型输出。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源OpenAI:Alignment 研究博客(RSS)
站内情报编号intel-690f0e733f25944c53a6f6f2