论文研究普通
HarnessDev:评测 LLM 能否自主创建并迭代自己的 Agent Harness 基准
原始标题:HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
内容摘要
论文提出 HarnessDev 基准,将评测单位从任务输出转向可运行的执行基础设施,涵盖 Creation(从最小种子构建完整执行系统)和 Evolution(基于下游执行反馈迭代改进)两个阶段,覆盖 6 个创建模型、4 个领域和 5 个下游基准共 2,207 个独立实例。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-bdf4d2d2d5b2825309abca49