论文研究普通
有品味的智能体:长周期任务中品味的测量与提升
原始标题:The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks
内容摘要
研究者构建了 Taste-Bench,从智能体工程与研究任务轨迹中自动挖掘决策分叉点,用于衡量 LLM 智能体在长周期任务中的"品味"。评测显示最强模型仅答对 59.7% 的题目,决定证据出现越晚的分叉越难,增大推理预算也无法提升准确率。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-1a54689e7a1659034b158b07