AI圈报
论文研究普通

Transformer 能同时容纳两种思路:LLM 中线性叠加的证据

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs

内容摘要

研究提出「叠加线性假设」,证明 Transformer 对来自不同文本流的输入做线性组合时,输出是各自下一 token 分布的叠加,且该性质是架构固有而非训练涌现,并随预训练推进而减弱。轻量微调可显著恢复这种线性,缩小预测分布与各分布均值的偏差。团队还提出引导式解码,从单次前向传播中解耦叠加输出,同时生成两条连贯续写。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-07c6378a649daee4081c8223