AI圈报
论文研究普通

Microsoft 论文揭示 LLM Agent 在 16 步长程任务中从近乎满分跌至 0-33%

信息来源:X:Rohan Paul (@rohanpaul_ai)·
原始标题:New Microsoft paper. Long agent runs expose failures that short benchmarks miss. Agents can look rel…

内容摘要

一篇 Microsoft 论文研究 LLM Agent 长程衰减,跨 9 个模型发现依赖步骤越多成功率越低,ToolQA 上短程近乎满分的模型到 16 步仅剩 0-33% 成功率。实验显示缩短上下文反而使衰减更糟,说明问题主要由步数而非上下文长度驱动;作者建议按真实工作流长度测试、度量每步可靠性并在错误扩散前加入检查点。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-fe19bcb123cf2cac71cedd74