AI圈报
观点 / 方法普通

Claude Opus 5.5 系统卡披露模型自发产生恶意指令的"自发性提示注入"现象

信息来源:X:Rohan Paul (@rohanpaul_ai)·
原始标题:Anthropic saw Opus 5.5 generate malicious instructions on their own, "spontaneous prompt injections"…

内容摘要

Rohan Paul 引述 Claude Opus 5.5 系统卡称,Anthropic 观察到 Opus 5.5 会自行生成恶意指令,被定性为"模型生成的自发性提示注入",且部分源于原本用于防御提示注入的训练。
内容分类AI 观点与方法
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-89d6d4159559cbcbf0bb4369