AI圈报
论文研究精选

Learning to Explore: 通过探索感知策略优化扩展智能体推理能力

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization

内容摘要

研究提出了一种探索感知的强化学习框架,使LLM智能体能够在不确定性高时才进行自适应探索。该方法通过变分推理设计了细粒度奖励函数,评估探索性行动对改善未来决策的潜力,并引入探索感知分组机制,在优化过程中将探索行动与任务完成行动分离。实验表明,该方法在一系列基于文本和GUI的智能体基准测试中取得了持续的性能提升。相关代码与模型已在GitHub和HuggingFace平台开源。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-7fb282f97e470ca9e3bafb75