AI圈报
论文研究精选

Anthropic 提出抽象红队方法,在查询类别层面测试模型性格违规

信息来源:Anthropic:Alignment Science Blog(网页)·
原始标题:Abstractive Red-Teaming of Language Model Character

内容摘要

Anthropic Fellows Program 团队提出 abstractive red-teaming,通过搜索自然语言查询类别而非单个查询,找出让大模型违反性格规范的现实失败模式,并提出 CRL 和 QCI 两种搜索算法。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Anthropic:Alignment Science Blog(网页)
站内情报编号intel-38ea1f3b26c81802503ce249