论文研究普通
研究揭示工具型智能体很少把无用证据判断转化为停止决策
原始标题:Judged Useless, Queried Anyway: Tool-Using Agents Rarely Turn Their Own Evidence Judgments into Stopping Decisions
内容摘要
一项 arXiv 论文在受控检索环境中测试七个智能体,发现它们对失效信源的结果 97-100% 判为无用,却大多不据此停止调用。提示词线索只改变停止时机而非停止依据,预算声明会让 7-8B 模型拖到截止点;只有让智能体在连续五次判为无用后强制给出回答的整合步骤,停止行为才跟随证据,该规则在预注册的 300 个新问题上复现有效。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-ca85435ffe7ad2b4b7f9feb6