论文研究普通
诊断引导后训练方法将 2B 对话博弈智能体 clemscore 从 10.67 提升至 38.92
原始标题:Acquire, Repair, Preserve: A Diagnosis-Guided Post-Training Recipe for Small-Model Dialogue Game Agents
内容摘要
论文在 LM Playschool Challenge 中用 2B 开源模型研究对话博弈,发现失败多为局部决策错误而非单纯知识缺陷。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-49e3a197a51c8d309a07fce2