AI圈报
论文研究精选

Anthropic 发布 alignment 研究:用宪法文档合成训练与困难建议数据降低 Claude 智能体失准行为

信息来源:Anthropic:Alignment Science Blog(网页)·
原始标题:Teaching Claude Why

内容摘要

Anthropic 在 Alignment Science Blog 发布长文,以 agentic misalignment 为案例介绍自 Claude Opus 4.5 以来安全训练的更新方法。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Anthropic:Alignment Science Blog(网页)
站内情报编号intel-c19e4d31b0963dd1e88a96f3