观点 / 方法精选
Epoch AI 评测 SWE-bench Verified:审计发现超两成题目存在评分问题
原始标题:SWE-bench Verified - Benchmark Review
内容摘要
Epoch AI 发布对 SWE-bench Verified 的基准评审,认定其为 Flawed。该基准用 500 道来自 12 个代码库的修复任务评测大语言模型;OpenAI 审计 27.6% 的任务后发现有缺陷测试的任务下限为 16.4%,59.4% 的被审任务测试用例会拒绝功能正确的提交,且所有受测前沿模型在训练中都见过部分题目。