论文研究精选
Anthropic 研究:用合成文档微调(SDF)修改 LLM 的信念
原始标题:Modifying LLM Beliefs with Synthetic Document Finetuning
内容摘要
Anthropic 团队提出合成文档微调(SDF)管线,用 LLM 生成引用目标命题的合成文档并对模型做 SFT,实验显示除最荒谬的错误事实外均可成功插入信念,覆盖 Haiku 3.5、Llama 3.3 70B Instruct、R1 Distill 70B 和 OpenAI GPT 系列。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Anthropic:Alignment Science Blog(网页)
站内情报编号intel-d6e0ccef570ab3fd8967c440