论文研究普通
SLCA-GRPO:解决工具调用强化学习中的跨段信用错配问题
原始标题:SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL
内容摘要
SLCA-GRPO 通过 Segment-Locked Credit Assignment(SLCA)在单组 rollout 内按结构段解耦优势估计,将执行优势路由给工具 token、偏好优势路由给摘要 token,消除优势污染。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-61680ec2f79bd1603308042b