论文研究普通
AgentMercury:训练环境与评测集脱钩可提升泛化
原始标题:Should your agent's training environment look like your eval set? AgentMercury says no, and shows …
内容摘要
AgentMercury 研究表明,智能体的训练环境不必与评测集一致,在无关的模拟商业世界中训练反而能提升目标基准表现。该方法从商业描述生成 4,783 家模拟公司,每家公司含独立服务、工具和数据库,再从中提取训练任务。世界构建本身也可学习,微调后模型生成有效公司的成功率从 3.3% 提升至 83.3%,与 Claude Opus 4.8 持平。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-d537d4bfab441c605e253904