AI圈报
论文研究普通

DRACO:用动态评分标准做长程智能体训练的细粒度信用分配

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training

内容摘要

DRACO 提出在结果信号缺失的长程智能体训练中,动态生成评分标准并按轨迹打分,再把判断以闭式方法重分配到相关步骤,在 GRPO 中产生差异化逐步优势,不引入任何训练的归因模块。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-f3da2e674a657de10a1717b2