AI圈报
论文研究普通

AutoDataBench:智能体能写出自我改进循环所需的数据吗?

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:AutoDataBench: Can Agents Write the Data That Feeds the Self-Improvement Loop?

内容摘要

新基准 AutoDataBench 要求智能体根据原始基准任务和目标模型的尝试记录,写出满足有效性、新颖性、难度和行为覆盖等验收标准的新任务。在三个可执行智能体任务基准上,默认 45 分钟预算内没有智能体得分超过 20/100;给最强智能体四倍时间后得分大幅提升,但单个可用任务的成本几乎不变。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-c3eac5f01bc23864fab9d2dc