教程 / 实战普通
价值几何:用任务向量组合实现语言模型的伦理偏好对齐
原始标题:Geometry of Values: Task Vector Composition for Ethical Preference Alignment in Language Models
内容摘要
研究者构建了 12000 条二选一道德困境数据集,覆盖诚实 vs 公正、公正 vs 自主、自主 vs 诚实三类价值冲突,并翻译为印地语、阿拉伯语、西班牙语和中文。
内容分类AI 教程与实战
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-2848d5572a8914f5056e5b38