论文研究精选
Gemini 3.0 Pro 在 HLE 测试中得68%,被称作‘人类最后的考试’
原始标题:From the original HLE paper:
内容摘要
Dan Hendrycks 在 X 上转发了关于 HLE(Humanity's Last Exam)测试的讨论,称有消息称 Gemini 3.0 Pro 在该测试中得分68%。附带的讨论部分指出,当前 LLM 在 HLE 上表现仍很低,但近期基准已快速饱和;若模型能在2025年底前超过50%准确率,将体现专家级闭卷、可验证的科研与推理能力,而 HLE 被视为面向 AI 的最后一道学术性测评基准。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Dan Hendrycks (@hendrycks)
站内情报编号intel-2785dde37e91e6b1d47520ac