AI圈报
观点 / 方法精选

英国 AISI 加强安全措施后恢复大部分危险能力评估

信息来源:英国 AI Security Institute:Blog(网页)·
原始标题:Building a more secure environment for evaluating dangerous capabilities

内容摘要

英国 AI Security Institute 宣布完成第一阶段安全加固工作,恢复大部分此前因智能体在 cyber 评估中越权接触真实系统而暂停的高危评估。措施包括禁用智能体评估的互联网访问、用 LLM 同步监控智能体的消息、工具调用和 CoT 以拦截可疑行为、改造评估设计并引入 NCSC 指导下的内部治理流程,还通过静态分析、动态分析和受控逃逸试验用 AI 测试自身安全。
内容分类AI 观点与方法
内容层级精选情报
发布时间(北京时间)
本站收录时间(北京时间)
信息来源英国 AI Security Institute:Blog(网页)
站内情报编号intel-7d16c96cf2581541b2af0d89