论文研究普通
评测框架无中立:同一模型得分31%到89%
原始标题:Great paper on agent harnesses.
内容摘要
新论文揭示评测框架(harness)对模型得分影响巨大:12个开源模型在26种同等合理的配置下回答相同3,679道题,仅改变选项顺序、提示词措辞和答案读取方式,gemma4-31b得分即可从31%波动至89%。配置敏感题目承载了相邻模型间95.7%的差距,4个模型在某种配置下可排第一。基准压缩方法筛选的题目恰是最易受配置影响的,压缩基准实则在挑选脆弱项。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Elvis Saravia (@omarsar0, DAIR.AI)
站内情报编号intel-4b5024c8b01d74dd101f8dee