AI圈报
论文研究普通

DATPO:难度自适应树结构策略优化,提升 RLVR 推理覆盖

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Difficulty-Adaptive Tree-Structured Policy Optimization for Expanding Reasoning Coverage in RLVR

内容摘要

针对 RLVR 训练中 pass@k 难以提升的问题,研究者提出 DATPO(难度自适应、句子熵引导的树结构策略优化),将难度自适应树搜索与兄弟多样性优势项结合,显式提升语义多样性。在数学推理基准上,DATPO 在 pass@k 上优于基线,并直接转化为更好的测试时扩展性能。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-bdba115e5bd90fba2dd58c2f