AI圈报
论文研究普通

论文:LLM 排行榜名次很大程度由评测配置决定,gemma4-31b 得分可在 31% 到 89% 间波动

信息来源:X:Rohan Paul (@rohanpaul_ai)·
原始标题:LLM rankings can be created by evaluation choices as much as model differences, so one setup should …

内容摘要

一篇论文在固定 12 个模型和 3,679 个问题的前提下,只改变提示词格式、选项顺序、打分方式等常规评测设置,结果排名大幅波动。gemma4-31b 得分在 31% 到 89% 之间,12 个模型中有 4 个至少在一种有效设置下排到第一;相邻模型平均 95.7% 的差距来自评测设置改变时会翻转答案的题目,最大不稳定来源是打分方式,即生成答案还是选最高似然选项。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-bc42ddfc38c099cec83e7f78