论文研究普通
HuatuoGPT-3:仅用强化学习从基座模型完成领域适配
原始标题:HuatuoGPT-3: RL-Only Domain Adaptation from Base Models
内容摘要
研究团队提出 One-stage Policy Optimization(OnePO),仅用强化学习即可将基座模型适配到医疗领域,解决冷启动中的 Gradient Starvation 与 Teacher-Distribution Anchoring 问题。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-fd886e7a79d75934985c8243