论文研究普通
研究显示 SynthID-Text 文本水印可能削弱模型对有害提示词的拒答
原始标题:LLMs respond differently to harmful prompts when AI watermarking is used
内容摘要
研究者 Siposova 通过 Hugging Face 的 SynthIDTextWatermarkLogitsProcessor 测试六个开源权重模型,发现 SynthID-Text 非失真配置的水印会改变对有害请求的拒绝行为,配合提示词注入时更明显,部分模型因此更倾向回答本会拒绝的有害请求;不同密钥下效果也不同,研究将此现象称为采样漂移(sampling drift)。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Ars Technica:AI(RSS)
站内情报编号intel-52630797eae3a6448412d98b