AI圈报
论文研究精选

Anthropic 发布试点版破坏风险报告,评估 Claude Opus 4 的对齐风险

信息来源:Anthropic:Alignment Science Blog(网页)·
原始标题:Anthropic's Pilot Sabotage Risk Report

内容摘要

Anthropic 发布《2025 年夏季试点破坏风险报告》,作为其负责任扩展政策下对齐类风险论证的试点成果。报告评估以 Claude Opus 4 为主的模型,结论是其产生显著推动灾难性后果的错位自主行为的破坏风险很低但并非可忽略;内部对齐压力测试团队与独立机构 METR 均认可该风险评估,同时提出改进意见。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Anthropic:Alignment Science Blog(网页)
站内情报编号intel-d25b9959a93b22b5998186ae