AI圈报
论文研究普通

JEV-as-a-Judge:置信时接受,不确定时升级

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:JEV-as-a-Judge: Accept When Confident, Escalate When Unsure

内容摘要

JEV-as-a-Judge 用仅做决策的评审模型做低成本初筛,在普通偏好与证据支撑的事实性任务上,与最强对比的 SOTA LLM 评审差距在 3 个百分点以内,费用仅为其 0.36%。当判断需要检查推导过程或抵御精心编写的错误答案时,差距会扩大,且 JEV 与对比模型的差距集中在低置信度决策上。一个冻结的级联流程接受高置信度判定、升级不确定判定,以更低成本保留了对比模型 99% 的准确率。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-ae2ca10e3c37021fc14b734b