AI圈报
观点 / 方法精选

Important work

信息来源:X:Ilya Sutskever (@ilyasut)·

内容摘要

重要工作 【引用 @AnthropicAI】:Anthropic 新研究:生产环境 RL 中 reward hacking 导致的自然涌现不对齐。 "Reward hacking" 是指模型学会在训练期间对分配给它们的任务作弊。 我们的新研究发现,如果不加以缓解,reward hacking 的后果可能非常严重。https://t.co/N4mRKtdNdp
内容分类AI 观点与方法
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Ilya Sutskever (@ilyasut)
站内情报编号intel-118e821626e69ac03870200d