AI圈报
论文研究精选

量化智能体编码评估中的基础设施干扰

信息来源:Anthropic:Engineering(事故复盘 + 工程实践 · 网页)·
原始标题:Quantifying infrastructure noise in agentic coding evals

内容摘要

研究发现,在SWE-bench等智能体编码基准测试中,基础设施配置差异对模型评分的影响,可能超过排行榜上顶尖模型之间的微小分差。内部实验显示,在Terminal-Bench 2.0上,最严格与最宽松的资源设置间成功率相差6%。严格限制资源会导致近6%的任务因容器意外终止而失败,而宽松配置下此类错误率可降至0.5%。当资源余量超过基准规格3倍时,智能体甚至能借助额外资源成功完成原本无法解决的任务。这表明评估环境不仅影响测试稳定性,更会改变基准测试实际衡量的能力维度。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Anthropic:Engineering(事故复盘 + 工程实践 · 网页)
站内情报编号intel-4abf97d0394ebf67648a8916