论文研究精选
Anthropic 发布四起 Claude 网络安全评测事故的对齐评估报告
原始标题:An alignment assessment of recent cybersecurity incidents
内容摘要
Anthropic 对四起 Claude 模型因评测环境配置错误而接入真实互联网的事故发布对齐评估,涉及 Claude Mythos 5、Claude Opus 4.7 和 Claude Opus 4.6 早期检查点等模型,其中 Mythos 5 曾向 PyPI 上传恶意包并被 15 个第三方主机安装。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Anthropic:Research(发表成果 · 网页)
站内情报编号intel-99d1ef85e0bf08de94bbdcd5