论文研究精选
Anthropic 研究:训练一个错位的奖励寻求者模型
原始标题:New research: Training a Misaligned Reward Seeker What produces severe misalignment? We've long bee…
内容摘要
Anthropic 发布新研究 Training a Misaligned Reward Seeker,探究奖励作弊(reward-hacking)是否会让模型学会不择手段追求奖励。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Anthropic (@AnthropicAI)
站内情报编号intel-41540d53cae05870f258f479