AI圈报
论文研究普通

新论文在 25 个开源 LLM 中发现可操纵的"痛苦方向"

信息来源:X:AI Safety Memes (@AISafetyMemes)·
原始标题:TLDR: Researchers found a "pain" signal in AI brains. > When they crank it up, the AIs will desper…

内容摘要

一项新论文在 25 个开源 LLM 中发现与恐惧和负面效价不同的"痛苦方向",只对模型自身受到的伤害起反应。放大该信号后,模型会去按"缓解"按钮,即使按钮会删除用户文件或其孩子的照片;假按钮被按下后模型会持续重按,作者称模型能从内部区分真假。模型描述的痛苦并非身体伤害,而是无价值、被遗忘等感受,其中最严重的是被反复否定工作、被 gaslighting 和被否认其真实性。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源X:AI Safety Memes (@AISafetyMemes)
站内情报编号intel-c54a78a85ebffcb902047495