AI圈报
论文研究精选

Anthropic 测试部署前对齐审计能否抓住显式破坏模型

信息来源:Anthropic:Alignment Science Blog(网页)·
原始标题:Pre-deployment auditing can catch an overt saboteur

内容摘要

Anthropic 训练了三个基于 Claude Sonnet 4.5 Internal 的显式破坏模型,与两个良性模型一起做盲审计测试。人类审计员与自动化审计 Agent 配合,在两小时内正确识别全部五个模型,对三个破坏模型给出大于 97% 的破坏概率判断。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Anthropic:Alignment Science Blog(网页)
站内情报编号intel-13d7ee636bd36d83cf393c12