AI圈报
模型发布 / 更新精选

OpenAI 发布 GPT-Red:通过自动化红队测试提升模型鲁棒性

信息来源:OpenAI:官网动态(RSS · 排除企业/客户案例)·
原始标题:GPT-Red: Unlocking Self-Improvement for Robustness

内容摘要

OpenAI 训练了自动化红队模型 GPT-Red,用于在部署前发现漏洞并在训练中生成攻击以提升模型鲁棒性。GPT-Red 能攻破此前几乎所有模型,其攻击被用于对抗训练 GPT-5.6 Sol,使该模型在直接提示注入基准测试中的失败率降至四个月前最佳生产模型的 1/6。GPT-Red 通过自对弈强化学习训练,投入了 OpenAI 后训练中前所未有的计算规模。
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源OpenAI:官网动态(RSS · 排除企业/客户案例)
站内情报编号intel-2a8d2eb4ba30c541733c2e61