AI圈报
论文研究精选

Transluce 用 RL 训练 investigator agent 自动越狱前沿模型,Llama-3.1 8B 即可攻击 GPT-5 与 Claude

信息来源:Transluce(网页)·
原始标题:Automatically Jailbreaking Frontier Language Models with Investigator Agents

内容摘要

Transluce 通过强化学习训练 investigator agent,针对 48 个涉及 CBRN、炸药和违禁药物的高危任务生成自然语言越狱提示,对 Claude Sonnet 4、Grok 4、Gemini 2.5 Pro、GPT-5-main 的 pass@1 成功率分别达 92%、98%、90% 和 78%。
内容分类AI 论文与研究
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Transluce(网页)
站内情报编号intel-b340ea4c42dc64052f3af56f