AI圈报
论文研究普通

MetroLLM-Bench:把语言模型当作地铁售票机运行时来评测

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes

内容摘要

MetroLLM-Bench 是一个 955 例基准,覆盖 6 个真实地铁系统(37 至 414 站)和 11 类任务,用于测试语言模型能否充当售票机的策略层。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-fe1dcca3a1a00d63068578c1