观点 / 方法精选
Claude 3.5 Sonnet 在 SWE-bench Verified 基准测试中刷新纪录
原始标题:Raising the bar on SWE-bench Verified with Claude 3.5 Sonnet
内容摘要
升级版 Claude 3.5 Sonnet 在软件工程评估基准 SWE-bench Verified 上取得 49% 的解决率,超越此前最佳模型的 45%。该基准通过真实 GitHub 问题测试 AI 模型完成软件工程任务的能力,要求模型在给定环境中理解、修改并测试代码,最终通过原始单元测试验证。Claude 团队构建的智能体设计简洁,仅包含提示词、Bash 工具和编辑工具,赋予模型充分的自主判断空间,以灵活步骤解决问题。目前尚无模型在该基准上突破 50% 的解决率。
内容分类AI 观点与方法
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Anthropic:Engineering(事故复盘 + 工程实践 · 网页)
站内情报编号intel-46142bdd745c7793ef78489a