AI圈报
论文研究普通

长程任务基准揭示前沿模型平均通过率仅6.4%

信息来源:X:Rohan Paul (@rohanpaul_ai)·
原始标题:Another paper that so clearly exposes AI's long-horizon problem. Long-Horizon-Terminal-Bench, where…

内容摘要

Long-Horizon-Terminal-Bench 基准测试显示,17 个前沿模型在 46 个长程终端任务上平均通过率仅 6.4%,严格全完成评分下 10 个模型零通过。失败运行中 79% 因超时终止,最佳模型也仅达 28.3%。模型能执行局部合理步骤,却无法将数百步转化为最终成果,印证 Chamath 关于长程任务"根本行不通"的论断。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-afd59a9c602d6ab611565a43