AI圈报
论文研究精选

九位评委,两个有效投票:相关错误削弱LLM评审面板

信息来源:Apple Machine Learning Research(RSS)·
原始标题:Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels

内容摘要

苹果机器学习研究团队发现,LLM-as-a-judge面板因模型间高度相关而严重受限。对7个模型家族的9个前沿大语言模型在3个自然语言推理数据集上的测试表明,9位评委实际仅提供约2个独立投票的信息量,面板准确率比独立投票理想值低8-22个百分点,最佳单一模型的表现已匹敌或超越整个面板。增加评委数量或改进聚合算法收效甚微,即使允许算法获取正确答案也仅能缩小至多11%的差距。该结论在多种提示变体、温度设置及偏好任务中均得到验证,瓶颈在于评委间的相关性而非聚合算法。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Apple Machine Learning Research(RSS)
站内情报编号intel-602f6b1f9b3ed7c34ff6ca65