AI圈报
论文研究精选

METR 研究更新:算法评分高估 AI 智能体真实软件工程能力

信息来源:METR:Research(网页)·
原始标题:Research Update: Algorithmic vs. Holistic Evaluation

内容摘要

METR 在 stdlib-js 和 hypothesis 两个仓库的 18 个真实 issue 上评估 Claude 3.7 Sonnet(Inspect ReAct 智能体),按维护者测试用例算法评分成功率为 38%(±19%),但人工评审的 15 个 PR 中没有一个可以直接合并。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源METR:Research(网页)
站内情报编号intel-68a71fea72611384f46b350d