论文研究精选
Transluce 发布 Predictive Concept Decoders:用可解释性助手读取模型内部状态
原始标题:Predictive Concept Decoders
内容摘要
Transluce 提出 Predictive Concept Decoders(PCD),训练可解释性助手把模型内部状态翻译成人类可读的概念列表,再据此回答模型行为问题。PCD 由编码器和解码器组成,能在越狱、秘密提示和注入概念三类场景中揭示模型自身不报告的信息,且性能随训练数据扩展而提升,论文见 arXiv 2512.15712,可在 decoder.transluce.org 体验。