论文研究精选
OpenAI 研究失对齐泛化的成因与逆转方法
原始标题:Toward understanding and preventing misalignment generalization
内容摘要
OpenAI 研究在错误响应上训练如何导致语言模型出现更广泛的失对齐,并识别出驱动该行为的内部特征。该特征可通过极少量微调被逆转。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源OpenAI:官网动态(RSS · 排除企业/客户案例)
站内情报编号intel-3ca0d77520ae457d26dca0df