AI圈报
产品发布 / 更新精选

捐赠开源对齐工具 Petri

信息来源:Anthropic:Research(发表成果 · 网页)·
原始标题:Donating our open-source alignment tool

内容摘要

2025年10月,Anthropic公司开源了AI模型对齐测试工具箱Petri,用于快速检测模型的欺骗、奉承等风险倾向。该工具已成为Claude模型系列对齐评估的核心部分,并被英国AI安全研究所等外部机构采用。近日,Petri升级至3.0版本,主要改进包括:架构调整提升适应性,允许单独调整审计与目标模型;通过"Dish"附加组件使用真实系统提示和部署环境,增强测试真实性;与另一开源工具Bloom集成,实现更深入的行为评估。为确保独立性与公信力,Petri的开发已移交非营利组织Meridian Labs。
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源Anthropic:Research(发表成果 · 网页)
站内情报编号intel-5f7b4221fd86a74cea0821e9