论文研究精选
Transluce 提出 PRBO 方法,用 RL 智能体自动发现 Llama、Qwen、DeepSeek 的罕见病理行为
原始标题:Surfacing Pathological Behaviors in Language Models
内容摘要
Transluce 发布研究报告,提出 PRBO(倾向下界)作为稀疏奖励的代理,训练 RL 调查智能体生成真实自然的提示,以激发开源权重模型的指定罕见行为,覆盖 Llama 3.1/4、Qwen 2.5 和 DeepSeek-V3。
综合分类、实体标签与信息来源匹配