AI圈报
论文研究普通

Meta Superintelligence Labs 论文提出 Sharpening Tax:RL 后训练降低模型测试时解题覆盖

信息来源:X:DAIR.AI (@dair_ai)·
原始标题:Banger paper from Meta Superintelligence Labs.

内容摘要

Meta Superintelligence Labs 等机构论文发现,轻量 harness 的基座模型在足够采样下常比 RL 后训练版本解决更多智能体任务,在 BFCL v4 multi-turn、ACEBench 和 WebShop 上,大 K 时基座常解开后者从未解开的任务。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:DAIR.AI (@dair_ai)
站内情报编号intel-e2407e9a957f5de3c7d899a6