AI圈报
观点 / 方法精选

Dan Hendrycks 分享 LLM 价值观调查:多数模型存在种族与性别偏见,Grok 4 Fast 相对平等

信息来源:X:Dan Hendrycks (@hendrycks)·
原始标题:We'll release additional original analysis of AI value systems hopefully next month.

内容摘要

CAIS 负责人 Dan Hendrycks 引用第三方博客对主流大模型进行“效用工程”测试,发现 GPT-4o、Claude Sonnet 4.5 等模型在评估不同群体生命价值时存在显著偏差:多数模型认为白人价值低于其他族裔,男性价值低于女性,且极度贬低 ICE 特工。测试显示模型分为四个道德集群,其中仅 Grok 4 Fast 表现出近似平等的价值观,Hendrycks 呼吁 xAI 解释其实现方式。
内容分类AI 观点与方法
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Dan Hendrycks (@hendrycks)
站内情报编号intel-0f6635534c57f0e866e2e784