AI圈报
论文研究普通

大语言模型引导空间能否复现人类价值观几何结构?

信息来源:HuggingFace Daily Papers(社区热门论文)·
原始标题:Steering Geometry: Validating Human Value Geometry in LLM Steering Space

内容摘要

一项新研究检验大语言模型激活引导向量的潜在几何结构是否反映人类价值观理论框架。基于Schwartz基本人类价值观理论,研究者引入覆盖20种价值观的26K样本基准,发现分布驱动方法(CAA、SphericalSteer等)能恢复与理论预测一致的价值拓扑(Spearman ρ最高0.51),而行为中心方法相关性较低;几何保真度随模型规模提升但指令微调后下降。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-31cfa08691462c477359c862