AI圈报
论文研究精选

Transluce 发布 Predictive Concept Decoders:用可解释性助手读取模型内部状态

信息来源:Transluce(网页)·
原始标题:Predictive Concept Decoders

内容摘要

Transluce 提出 Predictive Concept Decoders(PCD),训练可解释性助手把模型内部状态翻译成人类可读的概念列表,再据此回答模型行为问题。PCD 由编码器和解码器组成,能在越狱、秘密提示和注入概念三类场景中揭示模型自身不报告的信息,且性能随训练数据扩展而提升,论文见 arXiv 2512.15712,可在 decoder.transluce.org 体验。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Transluce(网页)
站内情报编号intel-05f17a794b9ce7cbc389ea8a