AI圈报
论文研究普通

Claude 自主对齐其他 AI,超越 28 位研究员

信息来源:X:Rohan Paul (@rohanpaul_ai)·
原始标题:New Anthropic research shows Claude aligning Claude all by itself. And here the model being correc…

内容摘要

Anthropic 新研究显示,Claude 可自主完成对齐研究,且被纠正的模型比执行纠正的模型能力更强。Claude 自主发现的安全训练方法,超越了 28 位资深研究员各自提出的方案。五个智能体并行工作长达 48 小时,共享结果,并通过隐藏测试和能力门控筛选过拟合与明显退化。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-d03b5d0c78b96c2137a5874f