AI圈报
论文研究精选

Sierra 发布 𝜏-bench 基准,测试 AI 智能体真实场景可靠性

信息来源:Sierra:Blog(RSS)·
原始标题:𝜏-Bench: Benchmarking AI agents for the real-world

内容摘要

Sierra AI 研究团队发布 𝜏-bench 基准,通过 LLM 模拟用户与工具 API 交互、领域政策遵循和 pass^k 指标评估智能体在真实场景下的性能与可靠性。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Sierra:Blog(RSS)
站内情报编号intel-51f15e91a25eff7c92964e8c