论文研究普通
Jev:用 RLCD 训练的单次调用模型零样本检测 AI 对齐失效
原始标题:Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures
内容摘要
用强化学习校准决策(RLCD)训练的模型 Jev 可在单次调用中对同一输入回答多个带类型的问题并给出校准概率,零样本检测对齐失效的中位 AUROC 达 0.886,在多数基准上超过有监督基线。
内容分类AI 论文与研究
内容层级普通情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源HuggingFace Daily Papers(社区热门论文)
站内情报编号intel-b6185ba41b0728aba851581c