AI圈报
论文研究精选

OpenAI 研究失对齐泛化的成因与逆转方法

信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例)·
原始标题:Toward understanding and preventing misalignment generalization

内容摘要

OpenAI 研究在错误响应上训练如何导致语言模型出现更广泛的失对齐,并识别出驱动该行为的内部特征。该特征可通过极少量微调被逆转。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源OpenAI:官网动态(RSS · 排除企业/客户案例)
站内情报编号intel-3ca0d77520ae457d26dca0df