论文研究精选
Transluce 用 RL 训练 investigator agent 自动越狱前沿模型,Llama-3.1 8B 即可攻击 GPT-5 与 Claude
原始标题:Automatically Jailbreaking Frontier Language Models with Investigator Agents
内容摘要
Transluce 通过强化学习训练 investigator agent,针对 48 个涉及 CBRN、炸药和违禁药物的高危任务生成自然语言越狱提示,对 Claude Sonnet 4、Grok 4、Gemini 2.5 Pro、GPT-5-main 的 pass@1 成功率分别达 92%、98%、90% 和 78%。