AI圈报
论文研究普通

Salesforce 提出 Critical-State RL 优化多轮工具调用

信息来源:X:DAIR.AI (@dair_ai)·
原始标题:Great paper from Salesforce AI Research on RL for multi-turn tool use.

内容摘要

Salesforce AI Research 提出 Critical-State RL,用于多轮工具调用的强化学习训练:当奖励依赖后续轮次时,其变化很大程度来自下游噪声,该方法用嵌套采样分离出当前动作带来的奖励变化,只对选定的关键调用做上下文赌博机更新。在 BFCL v4 缺失函数任务上,训练选定的那一轮可提升约 14 分,而训练其他候选轮则准确率持平或下降。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:DAIR.AI (@dair_ai)
站内情报编号intel-d281174e89ff157a76951e61