论文研究普通
τ^τ-Bench 论文:Claude Opus 5 在 Claude Code 下构建客服智能体仅通过 23.9% 评估,专家人类参考为 82.2%
原始标题:Really strong benchmark paper on coding agents. Claude Opus 5 running under Claude Code passes 23.9…
内容摘要
Sierra 与普林斯顿大学发布 τ^τ-Bench(hyper-tau-bench)基准,把智能体构建本身设为任务:开发者智能体获得真实业务记录、掌握需求的客户、生产 API、待继承代码库和服务成本与模型限制,需交付一个可用的客服智能体,并用保留的模拟用户部署评分,共 4 个领域 53 个任务。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:DAIR.AI (@dair_ai)
站内情报编号intel-33fef34d7232f76d599caf86