论文研究精选
Anthropic 开发并评估三个自动执行对齐审计的智能体
原始标题:Building and evaluating alignment auditing agents
内容摘要
Anthropic 发布三个自主执行对齐审计任务的智能体,并用含植入缺陷的模型环境进行评估。调查智能体在真实条件下以 13% 的胜率解开 Marks et al. 审计博弈,多智能体聚合后提升到 42%;评估智能体在 88% 的运行中能区分有/无植入行为的模型;广度优先红队智能体发现 10 个植入行为中的 7 个。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Anthropic:Alignment Science Blog(网页)
站内情报编号intel-dddc61206c58815712bfa0e7