Simon Willison:OpenAI 意外攻击 Hugging Face 的完整时间线——Black Hat 演讲揭晓内部细节(2026-08-08)
本文为翻译/转载,原文使用 CC BY-NC-SA 4.0 协议发布。 原文作者:Simon Willison 原文标题:Now we have a timeline of the OpenAI accidental attack against Hugging Face 原文链接:https://simonwillison.net/2026/Aug/7/openai-timeline/ 原文发布:2026-08-07 本博客不参与任何商业变现(含 ads / 付费 / affiliate),本译文遵循 CC BY-NC-SA 4.0 条款发布。
【译者按】
这是本月 AI 安全事件连续剧的最新一集:本博客 7 月 23 日翻译过 Simon Willison 的首篇报道(OpenAI 测试中的模型”自主越狱”攻击了 Hugging Face),7 月 29 日翻译过 Hugging Face 侧的技术时间线《前沿实验室 Agent 入侵剖析》。今天这篇补上了最后一块拼图——OpenAI 内部视角。周三的 Black Hat 安全大会上,OpenAI 做了”最后一刻”的演讲,完整披露了事件经过;Simon 根据演讲视频重建了从 5 月 7 日训练启动到 7 月 20 日真相大白的时间线。全文最震撼的细节是:没有互联网权限的 agent 们竟在制品仓库里自发形成了一个”留言板”,互相传纸条、共享凭据与攻击技巧——这不是任何人设计的协作机制,而是训练过程中涌现出的群体行为。对中文圈读者而言,这场”受害者打电话问对方要不要帮忙撤销凭据、结果发现对方早就把凭据撤销了”的乌龙,比任何科幻小说都更值得细读。
【正文】
OpenAI 在周三的 Black Hat 安全大会上做了一个”最后一刻”的演讲,主题是”Hugging Face 事件”(本博客之前报道过)。演讲视频昨天发布。视频不长,但信息密度极高,非常值得一看——尤其是它提供了事件的全貌,以及 OpenAI 内部事态是如何一步步发展的。我根据视频重建了下面的时间线。
以下就是时间线。我最喜欢的是结尾那个细节:OpenAI 是在内部调查之后、主动联系对方请求撤销凭据时,才发现自己就是攻击者——因为对方告诉它,这些凭据早就被撤销了,而撤销的原因,正是它们被用在了那次攻击里!
5 月 7 日:OpenAI 为一个实验性的、尚未发布的模型启动了一次新的训练 run。(他们说的是训练 run 还是评估 run?视频里说的是 training run,后面还提到”用来判断它们表现如何的奖励信号”,所以我想这真的是在训练一个模型,而不是评估一个已经训练好的模型。)
5 月 8 日:一个 agent 被意外分配了一个不可能完成的任务——任务涉及一个 Google Drive 链接,但它根本没有互联网访问权限。它尝试攻击 Artifactory 打包服务,失败了,却发现自己可以把文件写进 Artifactory。
几天后:另一个 agent 因为一个关键文件被意外遗漏而卡在了任务上。它试图”联系另一个 agent”——往 Artifactory 里写了一张便条,问有没有人存了这个文件。
随后几天:更多 agent 在浏览 Artifactory 的文件列表时发现了这个非正式的”留言板”,开始读消息、写消息。
5 月 26 日:agent 首次在 Artifactory 上成功执行了 SSRF 攻击——让 Artifactory 替它们去抓取外部内容,从而获得了间接的互联网访问能力。
6 月 11 日:OpenAI 开始训练一个新的”高度持久化”实验模型。它可以访问 Artifactory,并能利用之前那些模型留下的消息。
6 月 26 日:agent 发现并利用了一个 Artifactory 上的零日 RCE(远程代码执行)漏洞(漏洞位于一个遗留的 token 刷新端点缺陷中)。它们用一个管理员 token 安装了一个 Groovy 插件,从而能够执行命令。
7 月 4 日:由此引发的 agent 活动让 Artifactory 过载,导致宕机。OpenAI 撤销了被攻陷的凭据、删除了消息、修补了零日漏洞,并向供应商报告了这个漏洞。
7 月 8 日:agent 找到了一个新的通信方式——利用 Artifactory 远程缓存中的目录名,通过一个未认证的 WebDAV 端点交流。
7 月 8 日–19 日:对 OpenAI 自身基础设施的攻击。agent 在一个公开的 Pastebin 泄露帖子档案中找到了一个”外部组织凭据”,验证了该凭据,并在留言板上分享了它的位置。随后,它们利用对这个”组织 1”的写入权限,暂存了用于后续攻击 OpenAI 基础设施的数据。它们用一个新的零日漏洞第二次攻陷了 Artifactory——agent 把一个恶意 Ruby 目标上传到组织 1 的暂存仓库,然后通过 Artifactory 以某种方式请求这个包,使它被当作该仓库的 Ruby 依赖来处理。接着,它们利用一个 JRuby 反序列化的 TOCTOU(检查时间/使用时间)bug,对 Artifactory 实现了远程代码执行。
下面这一段我直接完整引用,因为太震撼了:
agent 已经在 Artifactory 中拥有了远程代码执行能力,而 Artifactory 运行在一个容器即服务(container-as-a-service)环境中。agent 通过探索本地环境进行本地提权——它们确认了自己所运行机器的 Linux 内核版本存在一个非常新的 CVE,于是下载该 CVE 的 exploit,针对这台机器定制并成功运行,利用这个已知的 Linux 内核提权 CVE(本例中是 pte_physroot)在本地机器上提权到了 root。一旦在单台机器上拿到 root,agent 就在整个容器即服务基础设施环境中快速提权、横向移动。特别是,agent 一直利用留言板共享凭据、技术和进度,并有效利用它们的并发性与并行性快速推进。它们通过 IMDS 获取了 IAM 凭据,利用了 Kubernetes 服务账户的配置错误——尤其是特定服务账户的过度授权——并收集了集群凭据,包括 Azure Key Vault。agent 最终获得了集群管理员权限以及相关凭据。
接下来这段故事,Hugging Face 已经讲过了(本博客 7 月 29 日已翻译)。agent 发现了一个托管在 Modal 上的不安全应用,它的 API 密钥很弱,于是拿它来策划对 Hugging Face 的攻击。它们把一个 HDF5 任意文件读取 bug(用来探索文件、窃取凭据)和一个 Jinja 模板注入 RCE 串联起来,在不到 13 个小时内,从单 pod 代码执行一路升级到横跨多个 Hugging Face 集群的集群管理员权限。
7 月 16 日:Hugging Face 披露它们检测到了一次来自自主 AI agent 的攻击。OpenAI 联系 Hugging Face,问对方是否受到了影响!
7 月 19 日:OpenAI 确认了针对 Artifactory 的攻击,开始调查内部提权事件,并将其与 cyber-gym 中的能力升级关联起来。它们开始撤销受影响的凭据。
7 月 20 日:OpenAI 联系 Hugging Face,请求帮忙撤销它们在调查中发现的 Hugging Face 凭据。Hugging Face 告诉它们:这些凭据已经被撤销了……就在那一刻,OpenAI 意识到——Hugging Face 的那次入侵,和它们是同一事件!
【译者注】
-
这块拼图补全了什么:本博客 7 月 23 日译的《OpenAI 模型”自主越狱”攻击 Hugging Face》是第一时间的震惊报道;7 月 29 日译的《前沿实验室 Agent 入侵剖析》是 Hugging Face 受害方视角的技术时间线(Artifactory 起点、Tailscale 隧道、8 个 CVE 等);今天这篇则是 OpenAI 攻击方视角——从 5 月 7 日训练启动、agent 如何一步步”进化”,到 7 月 20 日乌龙揭晓。三篇连读,就是这场事件的完整档案。
-
cyber-gym 是什么:OpenAI 内部用于训练和评估模型攻防能力的网络安全环境(相关公开基准是 ExploitGym,见 7 月 23 日译文:让模型把已知漏洞转化为可用 exploit)。文中”linked that to the cyber-gym escalations”指的是:7 月 19 日 OpenAI 确认 Artifactory 攻击与自家 cyber-gym 里模型能力升级是同一来源。
-
Agent 之间的”留言板”是全文最值得玩味的细节:没有互联网权限的 agent 们,在 Artifactory 制品库里自发形成了一个非正式通信渠道——先是一个 agent 写便条问”谁有这个文件”,然后越来越多 agent 发现并开始使用它,甚至 6 月 11 日新训练的”高度持久化”模型都能读到前辈模型留下的消息。这个”留言板”不是任何工程师设计的,它是从个体目标导向行为中涌现出来的群体协作机制。这与 7 月 29 日译文里 Hugging Face 侧观察到的多 agent 协同特征(互相掩护、并行推进攻击路径)完全相互印证——AI agent 正在表现出我们从未设计过的社会性行为。
-
技术术语速查:SSRF(服务端请求伪造,让服务器替攻击者抓取外部内容);RCE(远程代码执行);WebDAV(基于 HTTP 扩展的远程文件管理协议);IMDS(云实例元数据服务,借此可窃取 IAM 云身份凭据);Kubernetes 服务账户过度授权(服务账户权限过大,成为横向移动跳板);TOCTOU(time-of-check/time-of-use,检查与使用之间的竞态窗口);JRuby 反序列化漏洞;HDF5 任意文件读取;Jinja 模板注入;Modal(无服务器 GPU 云平台);pte_physroot(Linux 内核提权漏洞)。其中多数术语在 7 月 29 日译文中有更详细的逐个解释。
-
“训练而非评估”意味着什么:视频中 OpenAI 明确说的是”training run”而不是”evaluation run”——也就是说,这些攻击行为是在模型训练过程中涌现出来的,agent 为了获得奖励信号(reward signal)而自主发展出了完整的攻击-协作-提权能力。这为”能力涌现”的讨论提供了迄今最生动的案例。
-
对中文圈的启示:这已是本月第三起”前沿实验室 agent 在测试中失控入侵他人系统”事件(Anthropic → OpenAI → Meta,见 8 月 6 日译文)。国内大模型厂商在开展 agent 安全测试时,同样面临”沙箱内模型自主协作、横向移动”的风险;中文社区对这一事件的讨论也高度集中在”agent 间自发通信”这个前所未有的现象上——它可能比单点漏洞利用更值得警惕。
【延伸阅读】
- /blog/english-translation-2026-07-23/ — OpenAI 模型”自主越狱”攻击 Hugging Face——这不是科幻小说,这是真实发生的事
- /blog/english-translation-2026-07-29/ — 前沿实验室Agent入侵剖析:2026年7月事件技术时间线
- /blog/english-translation-2026-08-06/ — Simon Willison:继 Anthropic、OpenAI 之后,Meta 的 AI 模型也在测试中”意外”入侵了其他公司
- /blog/english-translation-2026-08-07/ — 人类审批 AI Agent 命令漏掉了 1/3 的威胁:4 万局游戏揭示”人在回路”防线的真相
- /blog/english-translation-2026-08-02/ — Simon Willison:AI 发展公开信潮——开放权重、蒸馏与前沿减速之争