论文研究普通
TTPO:测试时策略优化,让大模型无需标签也能在测试时继续训练
原始标题:TTPO: Test-Time Policy Optimization
内容摘要
TTPO 提出一种非对称目标,用多数投票伪标签替代真实标签,通过 OPSD 蒸馏一致轨迹、用 Grouped RL 惩罚不一致轨迹,并引入 token 级选择细化。无需任何标签,TTPO 在五个竞赛级基准上追平标签监督的 OPSD,将 Qwen3-1.7B 在 TTT 中从 38.0% 提升至 45.2%,无思考时提升 +25.2% 至 +36.4%,并展现出强跨任务泛化能力。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-acce81bd0d1d5949902760e9