论文研究普通
CAFE:自我改进的搜索智能体需要共同进化的反馈
原始标题:CAFE: Self-Improving Search Agents Need Co-Evolving Feedback
内容摘要
CAFE(Coupled Agent--Feedback Evolution)提出一种共享参数模型交替扮演搜索智能体与评论家的框架,通过在线RL与离线偏好优化耦合,让反馈随策略共同进化。在七个智能体搜索基准上,CAFE平均优于所评估的基于RL的搜索智能体,在全部六个域外基准上保持收益,并减少答案级幻觉。消融实验表明,仅改进智能体或仅改进评论家最终会陷入平台期,而交替更新两者可持续提升性能。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-c10858b85745456ceb0b6cf4