论文研究普通
耶鲁等机构论文:物理基准评测质量差,GPT-5.6-Sol 的 HLE-Physics 修正后从 47.3% 升至 78.7%
原始标题:New Yale Univ + other top lab paper shows frontier models are already close to maxing out today's cl…
内容摘要
耶鲁大学联合多所机构论文审计 6 个主流物理基准后发现,模型被误判的失败大多源于糟糕题目、错误参考答案和脆弱的评分器。在 4 个被审计基准子集的 250 个被拒案例中,仅 12 个是模型真实错误;GPT-5.6-Sol 经专家复评后 HLE-Physics 分数从 47.3% 升至 78.7%。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-72c9f66b6e97c42a7bebad6d