01五家前沿AI实验室被指缺少公开的失控应急预案,加州新规开始要求披露
当AI agent获得企业系统和网络权限后,一旦模型试图绕过人类控制,公司能否立即撤权、限制运行并彻底下线,成为实际安全问题。Guidelight AI Standards依据公开材料评估Anthropic、Google、OpenAI、Meta和xAI,发现五家公司公开展示的紧急遏制协议都很少。
评估考察日志与内部行为监控、异常激增后的停机机制、独立审计及失控处置方案。OpenAI得分最高,Anthropic和Meta最低;现有来源没有列出Google和xAI各自的具体得分与单项缺口,也未证明任何公司完全没有内部预案。Google称报告未覆盖其全部措施,但未说明是否另有未公开预案;Meta只援引现有风险阈值和失控测试框架。
OpenAI同样称评估不完整,并表示内部已有收紧权限、暂停工作负载、限制部署或让模型彻底下线的流程,而且曾实际启用。Guidelight尚未验证这些措施在真实重大事故中的执行效果。
今年生效的加州SB 53已要求大型前沿模型开发商公开识别和应对重大安全事件、处理模型绕过监督风险的框架。此前反对该法的OpenAI如今要求增加训练和评估期间的严重事件监控,并强化模型开发全生命周期的网络安全;建议是否获采纳尚未确定。