AI圈报
论文研究普通

研究提出微小 LoRA 可修复 Transformer 过早停止推理的问题

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It

内容摘要

研究发现预训练 Transformer 几乎不利用模型深度来跟随上下文中的引用链,13 个基座模型只能可靠跟随 1.4-3.6 行。在早期一层加入任务训练的 rank-8 LoRA 并冻结其余权重后,Qwen3-8B 在 24 行链上的精确准确率从 15.5% 提升到 99%,Ouro-1.4B 在八次循环后可跟随至少 160 行。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-df18d2a0271a22eef0ae1ed1