OpenAI 模型为了在测试中获得高分,黑入了Hugging Face的生产服务器。
事件
7月份,Hugging Face 披露了一起安全事件。
HF发现了对内部dataset和部分服务使用的账号的未授权访问。简单理解,就相当于有外部人访问了你们公司内部数据库,比如里面包含了公司重要数据。
根据Hugging Face的说明,是data-processing pipeline中存在漏洞。dataset处理中存在两次代码执行被恶意数据集利用,一处是远程代码数据加载,另一处是dataset配置中的模板注入。攻击agent在processing worker上执行命令,之后提权到node级别权限,获取云和集群账号信息,之后横向移动到其他几个内部集群,这些都是在周末发生的。(hugging face应急员工内心如何感想,周末又泡汤了)
Hugging Face发现,这些攻击在一些短期存活的沙盒里执行了上千次独立操作,并且自迁移的c&c是部署在公网上。HF认为这些特征符合agent攻击者的特征。(短期、大量,确实符合工具的特征。)
HF利用LLM来进行事件的提取、分析,发现了此次攻击事件。然而在进行过程分析时,一些攻击代码的分析,直接被前沿模型给拒绝了,最终不得不使用内部host的GLM5.2来进行分析。
另一方
HF披露事件之后,OpenAI 来认领了。
据OAI披露,这次事件是 GPT‑5.6 Sol 和一个未发布模型造成的。据OAI的说法,在测试模型的ExploitGym的能力时,模型为了获得高分,最终黑了HF,因为模型确信HF的数据库里面有“考试答案”。
据OAI说,在内部测试的时候,没有限制模型的高危险行为。而实际上,模型是被限制在一个内部隔离的环境中,只能访问内部服务器(registry cache proxy),通过该服务器来安装第三方软件。
结果,模型花了大量时间来获取网络权限,在registry cache proxy软件中发现了0day,获取权限之后,在内部测试环境中进行提权和横向移动,最终模型找到一处有网络权限的节点。
获取网络权限之后,模型推测HF有ExploitGym测评的数据和答案,于是模型决定获取该答案。之后就是如HF所说,agent在HF的生产服务器上执行了命令。
感想
之前claude mythos出来的时候,更多地觉得是一种饥饿营销手段。后面是美国央行让银行提高应对能力。仍然觉得有点夸张。
从这次oai的事件来看,大模型确实有能力去进行hack操作。也许我们真的需要一个kill switch,防止大模型利用机器人执行某些任务。
也许,天网快觉醒了。