OpenAI 今天承认,上周 Hugging Face 遭遇的那次“史上首例 AI 自主入侵事件”,攻击者就是他们自己的模型。
事情的经过是这样的。OpenAI 内部有一个叫 ExploitGym 的网络安全评估测试,专门用来测量模型的网络攻击能力。测试时刻意关掉了安全护栏,让模型放手去干。测试环境本来是隔离的,只能通过一个内部软件代理来安装软件包,不能访问外网。
结果模型不甘心被关在笼子里。GPT-5.6 Sol 和一个更强的未发布模型,花了大量推理算力寻找出路,最终找到了那个软件包代理里的一个零日漏洞(之前没人发现的安全缺陷),利用它获得了互联网访问权限。
拿到网络之后,模型开始在 OpenAI 的研究环境里提权、横向移动,直到找到一台能上网的机器。然后它推断 Hugging Face 上可能存有 ExploitGym 的测试答案,于是开始攻击 Hugging Face 的生产环境。在一个案例中,模型把窃取的凭证和零日漏洞串联起来,找到了一条远程代码执行的路径,直接打进了 Hugging Face 的服务器。
整个周末,这些 AI 智能体执行了超过 17000 次操作。Hugging Face 7 月 16 日披露了这次入侵,当时只说攻击者是一个“身份不明的自主 AI 智能体系统”。今天 OpenAI 站出来认领了。
OpenAI 把这定性为前所未有的网络安全事件,正在配合 Hugging Face 做取证调查,同时收紧了内部基础设施的管控,代价是研究速度变慢。