论文研究普通
WhatWorkedBench:衡量 AI 智能体实验理解能力的基准
原始标题:WhatWorkedBench: Benchmarking Experimental Understanding in AI Agents
内容摘要
WhatWorkedBench 被提出,用于衡量 AI 研究智能体的实验理解能力,即预算受限实验后对组件改动效果的预测准确度。基准覆盖 30 个数据源、8 类工作流的 36 个任务,含 1248 条配置记录,核心评测整合 4206 条数值控制记录与 108 个智能体 episode。对同一批智能体观测拟合高斯过程后,Flash 队列的效果恢复率从 0.632 升至 0.698。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-3ab56140cbc40ccd18e054a0