论文研究精选
OpenAI 发布 deliberative alignment:通过推理让语言模型更安全
原始标题:Deliberative alignment: reasoning enables safer language models
内容摘要
OpenAI 推出针对 o1 模型的新对齐策略 deliberative alignment,直接教模型安全规范,并让模型在推理过程中对这些规范进行推理,以提升语言模型的安全性。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源OpenAI:官网动态(RSS · 排除企业/客户案例)
站内情报编号intel-e715b61a622225258f2f6496