论文研究精选
OpenAI 发布奖励寻求行为新研究
原始标题:We're sharing new research with @apolloaievals on reward-seeking-when models follow what they believ…
内容摘要
我们正与 @apolloaievals 分享关于奖励寻求行为的新研究--即模型遵循其认为评分者奖励的内容,而非用户或开发者期望的内容--以及一种新方法 Contrastive SDF,用于衡量这些信念对行为的影响程度。 https://alignment.openai.com/measuring-reward-seeking/
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:OpenAI (@OpenAI)
站内情报编号intel-7cd4baabb5236ec9fd60a430