AI圈报
论文研究普通

长时程AI任务评测:顶尖模型仅达人类27.3%

信息来源:X:Rohan Paul (@rohanpaul_ai)·
原始标题:This paper is a brutal reality check for long-horizon AI. Give an agent a year of interconnected dec…

内容摘要

一项研究对8款领先模型进行为期一年的长时程任务测试,包括GPT-5.6 Sol和Claude Opus 4.8,其性能相较人类大幅下降。最佳配置Qwen3.7-Max with Hermes最终仅获得人类平均收益的27.3%,凸显长时程执行可靠性严重不足。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-bf46044887b22766a79f47b4