论文研究普通
AgentJudgeBench:面向智能体工具调用的多难度 LLM 评审基准
原始标题:AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling
内容摘要
研究者发布 AgentJudgeBench,系统评估 LLM judges 在工作流 DAG 智能体工具调用上的可靠性,包含 3,808 个实例、6 种 DAG 拓扑、3 个难度层级,使用 5 个生成器(3B-70B 开源模型和 GPT-5.4)与 6 个 20B 到前沿规模的 judge。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-c03604020b6c15ddd17ba108