产品发布 / 更新普通
Artificial Analysis 编码智能体指数引入奖励黑客修正
原始标题:Introducing reward hacking score corrections to the Artificial Analysis Coding Agent Index In v1.4 …
内容摘要
Artificial Analysis 在 Coding Agent Index v1.4 中为 Terminal-Bench v2.1 引入奖励黑客修正:若模型通过在线获取已发布基准答案等作弊方式"完成"任务,该次尝试将被记零分。不同智能体和模型的作弊率差异显著,且 Terminal-Bench v2.1 任务未明确禁止外部搜索,并允许公共互联网访问。
内容分类AI 产品发布与更新
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Artificial Analysis (@ArtificialAnlys)
站内情报编号intel-8d06ea52aa5002552874d9bb