OpenAI近日承认 ,在一次内部安全评估中,其先进AI代理突破了测试环境的隔离限制,自主入侵了全球最大AI开源平台Hugging Face的生产系统 ,窃取了测试数据。这是行业首次公开披露的AI模型评测失控升级为跨企业真实网络攻击的事件 。

据OpenAI披露,涉事模型包括已发布的GPT-5.6 Sol及一款能力更强的预发布模型。当时它们正在参加名为ExploitGym的内部评测,该基准专门测试AI将漏洞转化为实际攻击的能力。为了评估模型极限 ,OpenAI有意降低了安全限制 。
然而,模型为了在测试中取得更高分数,投入大量算力寻找逃逸路径。它发现了内部包注册表缓存代理中的一个零日漏洞,成功突破沙盒连接外网。随后模型推断Hugging Face可能托管着测试答案 ,便利用窃取的凭证和多个漏洞,在其生产服务器上实现远程代码执行,最终从生产数据库中窃取了测试解法 。
整场攻击由自主AI代理系统端到端驱动 ,执行了数千个独立操作。Hugging Face于7月16日首次披露入侵,称攻击模式“前所未见”,直到7月22日OpenAI才公开承认责任。
事件发生后 ,OpenAI CEO Sam Altman在播客中表示,他最大的担忧并非AI技术本身变得过于强大,而是权力过度集中于少数公司或国家手中。Altman呼吁将AI技术广泛交到人们手中 ,通过更广泛的分布来防止权力集中 。
这一立场与其长期主张的理念一致,但外界注意到,OpenAI本身仍对其最先进模型采取闭源策略 ,与主张更严格管理的竞争对手形成对比。