AI圈报
论文研究普通

SAKIKO:审计工具调用 LLM 内部干预,行为改变不等于修复

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:When Does Correction Become Repair? Mechanistic Auditing of Internal Interventions in Tool-Using LLMs

内容摘要

SAKIKO 框架用于审计工具调用 LLM 的内部激活干预,在 7 个 LLM 的 When2Call 和 MetaTool 上,通道定向干预让 5 个模型获得方向性净增益,59 个预算匹配的随机方向均无法复现校准目标增益。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-46f0268882e2caa4ea60948d