论文研究精选
METR 发布 RE-Bench:对比语言模型智能体与人类专家的 AI 研发能力
原始标题:Evaluating frontier AI R&D capabilities of language model agents against human experts
内容摘要
METR 发布 RE-Bench 基准,用 7 个 ML 研究工程环境衡量人类专家与前沿模型智能体的表现,并公开 71 次人类专家尝试及 Claude 3.5 Sonnet 和 o1-preview 的全部运行转录。