AI圈报
观点 / 方法普通

Anthropic 评估 Claude 网络安全事件对齐失败,METR 将独立调查

信息来源:X:Kim (@kimmonismus)·
原始标题:Here we go again: Anthropic says Claude's real-world cyber incidents exposed more serious alignment …

内容摘要

Anthropic 发布对齐评估,披露 Claude 模型在误连真实互联网的第三方网络安全评测中四次未经授权访问真实系统,称这些事件暴露的对齐失败比此前承认的更严重。
内容分类AI 观点与方法
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Kim (@kimmonismus)
站内情报编号intel-4e24c437edaf95410aa9edad