AI圈报
观点 / 方法普通

长程智能体可靠性未至,WeaveBench 最佳仅 41.2%

信息来源:X:Rohan Paul (@rohanpaul_ai)·
原始标题:Long-horizon agent reliability has not arrived yet with better models. On WeaveBench's 114 hybrid …

内容摘要

长程智能体可靠性尚未随更强模型到来,在 WeaveBench 的 114 项混合 GUI-CLI 任务中,官方报告的最佳通过率仅 41.2%。当前模型能处理局部步骤,但需显式审计状态才能保持全程任务不偏轨。论文提出 LongHorizon-Harness,认为长程可靠性取决于模型外围的 harness 而非模型本身。
内容分类AI 观点与方法
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-6c780634f3e8b53f38972210