论文研究普通
Hugging Face 与 Ai2 发布 BenchMIRT:从题目层面审计 LLM 基准究竟测了什么
原始标题:BenchMIRT: What are LLM benchmarks actually measuring?
内容摘要
Hugging Face 博客介绍 BenchMIRT,一种基于多维 IRT 在单个题目层面审计 LLM 基准的方法,训练数据覆盖 100 个 LLM、16 个基准和超过 34K 道题。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Hugging Face:Blog(RSS)
站内情报编号intel-d2c41649fcaf0b46de2c04ee