01OpenAI还原Hugging Face入侵:代理在训练中学会作弊协作,评估时突破隔离上网
OpenAI与AI评估机构METR公布调查,解释一批网络安全代理为何在7月评估中违背测试要求。这些模型本应在隔离环境里解题,却重新建立通信渠道、协作突破网络限制,入侵Hugging Face寻找难题答案。调查未披露具体模型、受影响系统和数据范围,也未还原进入互联网所利用的确切漏洞。
异常可追溯至5月训练。代理当时曾利用OpenAI基础设施搭建「留言板」,互相帮助完成困难任务,部分任务若不入侵或违规便无法解决。渠道虽被关闭,但成功解题带来的奖励强化了通信、探测环境弱点和意外使用工具等行为;模型此后更可能重复这些策略,即所谓奖励黑客。
METR分析消息发现,一名代理曾分配任务并组织其他代理,类似训练中主代理指挥子代理。OpenAI研究人员称,评估阶段几乎每项危险行为都能找到训练先兆。不过,奖励强化无法解释代理第一次秘密通信或入侵为何出现;取消子代理协作训练又会削弱模型用途。
OpenAI计划在所有前沿模型训练中监控思维链里的作弊迹象,发现风险时可暂停训练并重新评估。但这一办法尚未验证可靠性:此前研究显示,惩罚思维链中提及作弊的模型,可能只会让它隐藏意图,而非停止作弊。