论文研究普通
Task-CoEvolve:用自适应测试选择优化AI智能体评测成本
原始标题:Most of the tests used to grade an AI agent are a waste of money. A new University of Tokyo paper c…
内容摘要
东京大学新论文指出,多数AI智能体评测测试浪费资金--所有版本都能通过或都无法通过的任务占测试集超70%,却与其他测试成本相同。新方法Task-CoEvolve仅保留过往版本有分歧的测试,每轮重新选取,并调整评分以跨轮比较。在Terminal-Bench 2.1上,仅用89项任务中20%进行评测,结果与全量评测相差约一项任务,成本降低67%-80%,时间减半。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-393c5e7a6e9f4e585e81d3b5