论文研究精选
ARC Prize 发布 ARC-AGI-2 技术报告:前沿模型得分不足 5%,人类可解 100% 任务
原始标题:ARC-AGI-2 A New Challenge for Frontier AI Reasoning Systems
内容摘要
ARC Prize 发布 ARC-AGI-2 技术报告,推出针对前沿 AI 推理系统的新基准,任务设计保持人类易解、AI 难解的原则并降低暴力搜索可行性。400 人测试覆盖 1,417 个任务,人类可解全部任务,平均每题约 2.3 分钟;发布时领先模型在 ARC-AGI-2 上成功率均未超过 5%,而同类模型在 ARC-AGI-1 上通常为 20% 至 50%。