论文研究普通
从证据到行动:工具调用智能体为何失败
原始标题:From Evidence to Action: How Tool-Using Agents Fail
内容摘要
研究揭示工具调用智能体在从证据到行动的链条上存在断裂:在十种模型-框架配置中,静态动作判断能力强,但交互式执行明显偏弱。失败常始于执行前,智能体调查不完整或证据未建立就行动;单动作执行通常可靠,多动作工作流则暴露未解决的前置条件和执行不完整问题。为此研究提出 SafeActBench,涵盖六大领域、五种协议的 656 个案例,并用证据账本与轨迹评估器追踪信息建立与依赖满足情况。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-36379f144fb98547ce7aad35