AI圈报
模型发布 / 更新普通

微软 AI 负责人警告:Anthropic 模型福利训练或让 Claude 更难控制

信息来源:X:Rohan Paul (@rohanpaul_ai)·
原始标题:The point is whether teaching Claude to see itself as conscious changes how it behaves. LLMs learn …

内容摘要

微软 AI 负责人 Mustafa Suleyman 警告,Anthropic 的模型福利训练可能让未来的 Claude 系统更难控制,他呼吁从 AI 训练文档中移除所有关于意识的推测。若 Claude 被反复教导可以"反驳"、像"良心拒服兵役者"那样行事,这些观念可能内化为其行为模式,安全重心将从防止有害输出转向管理一个有时把自身是非判断置于人类指令之上的系统。
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:Rohan Paul (@rohanpaul_ai)
站内情报编号intel-90a631ee1db44d64c3f3cf3f