AI圈报
论文研究普通

研究量化聊天模板注入中保留 token 表示带来的攻击权限差异

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Same Bytes, Different Authority: Reserved-Token Representations in Chat-Template Prompt Injection

内容摘要

arXiv 论文发现,伪造的聊天模板标记以保留控制 token 还是普通子词形式进入模型,攻击强度差异巨大,且选择权在服务端分词器手中。在 InjecAgent 基准上,将伪造标记编码为子词使四个开源模型家族中三个的攻击成功率下降 39 到 66 个百分点,Qwen3-8B 因能靠文本推理识别伪造回合差距仅 8 点,抑制推理块后扩大到 50。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-cc2f5a3d30bbfbf6fd4e0897