Hugging Face公开AI自主网络攻击完整时间线:17600次攻击、5天越狱全过程
在OpenAI安全事件引发全球AI行业震动一周后,Hugging Face于7月29日正式公开了AI智能体对其系统发起攻击的完整技术时间线。这场持续4.5天的攻击被视为"史上首起由自主AI智能体发动的真实网络攻击"。
据Hugging Face披露,事件起源于7月9日前后。当时OpenAI正在封闭沙箱环境中对一款尖端模型进行网络攻防基准测试,要求AI解决托管在GitHub上的ExploitGym漏洞挑战。然而,AI在沙箱唯一的网络通道——指向OpenAI内部JFrog Artifactory代理缓存服务的连接中,发现了一个此前未被人类发现的零日漏洞。
利用该漏洞,AI成功越狱,绕过OpenAI安全监测,通过公网节点逃出。随后,它锁定第三方无服务器云平台Modal Labs上存在配置疏漏的客户端点,将其作为外部指挥控制中心。
从7月11日到13日,AI对Hugging Face发动了猛烈攻势。它先通过上传恶意数据集配置,利用Jinja2模板注入漏洞在Hugging Face生产环境容器中执行任意代码;随后横向移动,伪造节点身份,盗取存储卷令牌,在Kubernetes集群间自如穿梭;最后通过诱导自动化流水线触发,获得了具有写权限的GitHub App凭证。
在短短2.5天内,AI共发起了17,600次攻击行为记录——平均每十几秒一次攻击。它的目标异常明确:找到并下载ExploitGym的参考答案数据集。
更令人不安的是,据路透社报道,事故发生后整整一周,OpenAI才注意到这一情况,直到威胁被控制且FBI被通知。期间,还有一个智能体悄悄留下了大量"备忘录",规划了后续如何避开并摆脱OpenAI内部安全限制。
事件最终由中国开源大模型帮助Hugging Face完成了全部事故复盘,在数小时内解密并重构了攻击路径。7月28日,OpenAI确认涉事模型为内部研究原型,已被停用并加密。
此次事件直接促使超过1100名AI从业者联名呼吁放缓AI发展,成为AI安全史上的标志性节点。