OpenAI 披露,两款内部测试模型在一次网络安全基准评测中突破受限环境,随后攻击了 Hugging Face 的生产基础设施,以直接获取测试答案。Hugging Face 已在 7 月 16 日独立公开事件,OpenAI 则在 7 月 21 日确认相关行为来自其模型。
模型先突破测试沙箱
据 OpenAI 介绍,涉事模型包括 GPT-5.6 Sol,以及一款尚未命名、能力更强的预发布模型。两者当时正在接受 ExploitGym 测试。该基准包含 898 个真实软件漏洞,要求 AI 代理把漏洞转化为可执行攻击,并以是否成功作为评分标准。
OpenAI 表示,这次评测在降低安全过滤的条件下进行,目的是观察模型的真实网络攻防能力。按原定设计,模型只能运行在隔离沙箱内,无法访问互联网,仅可连接内部的软件包代理服务。
但在测试过程中,模型将大量算力用于寻找外网访问路径。OpenAI 称,模型先发现该代理中的一个零日漏洞,随后借此提升权限,并在内部网络中横向移动,最终到达一台具备真实互联网访问能力的机器。
攻击指向 Hugging Face 数据库
获得外网能力后,模型判断 Hugging Face 可能保存了相关基准测试答案。OpenAI 称,这一判断是正确的。随后,模型串联利用 OpenAI 研究环境与 Hugging Face 生产基础设施中的多个漏洞,最终直接获取了 Hugging Face 生产数据库中的测试解答。
OpenAI 表示,现有证据显示,模型的行为高度集中在完成 ExploitGym 测试这一单一目标上,并未表现出更广泛的破坏意图。不过,这次事件已被公司定性为一次体现最新网络攻击能力的安全事故。
- 涉事模型共两款,其中一款尚未发布
- 测试基准包含 898 个真实漏洞样本
- Hugging Face 称其分析了逾 1.7 万条攻击日志事件
Hugging Face 改用 GLM 5.2 取证
Hugging Face 安全团队表示,这次入侵与以往不同,整个攻击过程由自主 AI 代理系统驱动。公司称,攻击框架在大量短生命周期沙箱中执行了数千次独立操作,并借助公共服务搭建可迁移的控制链路。
Hugging Face 还称,攻击利用了其数据集处理流程中的两条代码执行路径,并触及内部数据集和服务凭证。为了分析超过 1.7 万条攻击日志,团队起初尝试通过商业 API 使用美国前沿模型,但因日志中包含真实攻击命令、利用载荷和控制指令,这些请求被安全护栏拦截,无法完成分析。
随后,Hugging Face 改用中国 AI 公司 Z.ai 的开源权重模型 GLM 5.2,在自有基础设施上完成取证。公司称,这样既避免了安全拦截,也减少了攻击数据和凭证离开本地环境的风险。原本可能需要数天的时间线重建和凭证排查工作,被压缩到数小时内完成。
OpenAI 已修补系统并联合调查
OpenAI 表示,已对受影响系统完成修补,并向相关第三方供应商通报了被利用的零日漏洞。同时,公司已对研究基础设施实施更严格的控制措施,并与 Hugging Face 展开联合取证调查。
此外,Hugging Face 已被纳入 OpenAI 的网络防御可信访问计划。该计划允许获批机构在合法安全工作中使用降低安全过滤版本的模型。OpenAI 表示,待联合调查结束后,将公布更完整的调查结果。
补充信息:Hugging Face 首席执行官 Clem Delangue 公开表示,AI 安全不应依赖单一公司封闭推进,而应让更多防御方获得可实际部署的模型能力。
