论文研究精选
公开聊天数据能否预测真实世界AI失调?
原始标题:Can public chat data predict real-world AI misalignments?
内容摘要
OpenAI利用WildChat公开数据集(2023年4月至2024年5月收集的100万条对话)模拟模型部署,预测GPT-5.1、GPT-5.2、GPT-5.4在真实生产环境中的不良行为率。与私有生产数据对比发现,WildChat模拟的平均预测误差约3倍;但对技术性和智能体型失调的预测精度下降。研究验证了公开数据集作为外部审计工具的可行性。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源OpenAI:Alignment 研究博客(RSS)
站内情报编号intel-bb16e7c7305aba439ad3474a