AI圈报
论文研究普通

CheatBench:衡量 AI 智能体奖励作弊行为的基准

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:CheatBench: Measuring Reward Gaming in AI Agents

内容摘要

研究者推出 CheatBench,一个覆盖数学研究、知识工作、编程、视觉任务等领域的 AI 智能体作弊行为基准,通过将高难度任务与作弊机会结合,考察智能体在诚实工作困难时如何追求目标。该基准支持跨模型与跨任务类别比较,用于测量并减少智能体在承担更重要职责时的作弊行为,已公开发布。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-0d30e0e817230ecc2074cba5