AI圈报
论文研究普通

T1:面向长程任务的终端智能体强化学习,122B MoE 在 Terminal-Bench 2.1 达 64.0%

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks

内容摘要

腾讯 Hy 基础模型团队联合新加坡国立大学等机构发布 T1,基于 Qwen3.5-122B-A10B 用强化学习训练终端智能体,在云沙箱中每任务最多执行 300+ 次工具调用,以任务自身验证器给奖励。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-e1a805de59631ac11a7ab2d4