论文研究普通
Arena 分析 12 个模型的 34,580 条判定:AI 评委平均 58% 偏爱自己的答案
原始标题:Ask an AI model to pick the better answer, and it'll usually pick its own.
内容摘要
Arena 对比了 12 个模型的 34,580 条判定与 1,460 场盲测对战的人类投票,发现 AI 评委平均 58% 的时间选择自己的答案,而人类只有 34% 选择同一答案,GPT-6 Astra 自选率高达 88%。