观点 / 方法精选
FrontierCode 基准测试:AI 编程评估新标准--维护者审核通过率最高仅 13.4%
原始标题:Claude Opus 4.8 是目前最好的编码模型,这件事应该没啥太大争议了,我自己跑了这么久体感也是这样。 Cognition(Devin 的公司)刚发布的 FrontierCode 基准测试,…
内容摘要
Cognition 发布 FrontierCode 基准测试,重新定义 AI 编程评估:由 20 多位顶级开源维护者手工制作 150 个任务(每个耗时 40+ 小时),依据 3000 多条规则判断维护者是否愿意合并代码。该基准指出 SWE-Bench 等超半数通过测试的代码实为不可维护的垃圾。结果中 Claude Opus 4.8 在最高难度档获 13.4%,GPT-5.5 为 6.3%,其余模型 1%-5%。这意味着即便最强模型,近九成代码仍无法通过有经验维护者审核。
内容分类AI 观点与方法
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:阿易 AI Notes (@AYi_AInotes)
站内情报编号intel-4f627c0bcbc0dab2d6f7a042