AI圈报
论文研究普通

无标签引导:将测试时强化学习压缩到仅偏置子空间

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Label-free steering: Compressing test-time reinforcement learning into bias-only subspaces

内容摘要

一种无标签、仅优化偏置参数的测试时强化学习(TTRL)方法,用多数投票伪标签作为奖励,冻结预训练主干,仅训练约 100K 偏置参数。在 MATH-500 上,Qwen2.5-7B 达到 76.67% 准确率,略超其有标签偏置引导复现结果,且参数量比全参数 TTRL 少 76,000 倍。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-78d463e9929e877c87222f85