AI圈报
论文研究精选

METR 发布 RE-Bench:对比语言模型智能体与人类专家的 AI 研发能力

信息来源:METR:Research(网页)·
原始标题:Evaluating frontier AI R&D capabilities of language model agents against human experts

内容摘要

METR 发布 RE-Bench 基准,用 7 个 ML 研究工程环境衡量人类专家与前沿模型智能体的表现,并公开 71 次人类专家尝试及 Claude 3.5 Sonnet 和 o1-preview 的全部运行转录。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源METR:Research(网页)
站内情报编号intel-ad501c1761de2d802a0957e8