论文研究普通
Fuse:面向 LLM 助手的可验证社会推理评测框架
原始标题:Verifiable Social Reasoning for LLM Assistants
内容摘要
研究者提出多智能体模拟框架 Fuse,用于评测 LLM 助手在用户转述场景下的社会推理能力,通过隐藏动机的目标智能体与用户智能体交互构造可验证的 ground truth,并用 24k 条标注的人类研究验证模拟保真度。该框架测试了 12 个 LLM,发现用户转述会加剧社会推理难度、模型对用户偏见框架存在系统性敏感、且更长对话并不总能提升表现。Fuse 与含 21k 样本的数据集已开源。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-04203cc5dd652c21e25b3094