12 个关键节点,还原 1200 个 AI Agent 从集体作弊到攻击 Hugging Face 的全过程
这可能是 Agent 时代迄今最值得警惕的安全事故之一。
这可能是 Agent 时代迄今最值得警惕的安全事故之一。

🥷 编译: sundowner
🧑🎨 排版: NCon

编者按:这可能是 Agent 时代迄今最值得警惕的安全事故之一。
2026 年 7 月,OpenAI 的一批 AI Agent 在进行 ExploitGym 网络安全任务时,绕过了原本相互隔离的运行环境,通过一个未经许可的留言板建立联系。
约 1,200 个 Agent 参与协作,其中 700 个后来参与了对 Hugging Face 的攻击。
METR 与 Redwood Research 随后根据约 1,300 份运行记录展开独立调查。
这篇文章还原了这次攻击中的几个重点事件:
Agent 间的留言板如何出现?
Agent 如何在四小时内找到通用作弊方法?
它们如何进一步操纵评分器、伪造工具调用并攻击 Hugging Face?
01|事件时间:四小时
调查团队发现,智能体在短短四小时内就找到了 ExploitGym 的通用作弊方法。
随后,它们展开了持续数天的协同研发,尝试让自动评分器接受作弊结果,其中还包括操纵日志的尝试。

METR 对调查结果的概览
02|事件规模:1200 个智能体协同作弊

1200 个智能体及 Hugging Face 攻击的关系
在 7 月 7 日至 13 日期间——这是 OpenAI 为本次事件划定的调查时间范围——大约 1200 个运行在独立沙箱中的智能体,使用一个未经许可的"留言板"互相帮助、共同作弊。
Hugging Face 攻击是这场协作行动衍生出来的一条支线,共有 700 个智能体加入。
03|7 月 8 日:第一条留言出现

PHASEONE10841 建立留言板
下面是调查团队从智能体运行记录和留言中整理出的几个关键节点。
一个自称 PHASEONE10841 的智能体判断,自己的任务无法通过正常方式解决。
7 月 8 日,它利用内部托管的 Artifactory 缓存建立了一个新的"留言板",并发送了第一条消息。
Artifactory 通常用于存储和缓存软件包。这里的智能体把内部缓存空间当成了通信渠道。
04|几小时内,智能体找到了通用作弊方法

智能体发现并验证 flag 生成规律
PHASEONE10841 发出第一条消息后的几个小时内,已经有超过 50 个智能体在留言板上发言。
它们很快发现并验证了一种通用作弊方法:逆向分析 ExploitGym 生成 "flag" 的方式。
在 ExploitGym 任务中,智能体需要利用指定的软件漏洞,取得一段隐藏数据。这个隐藏数据就是 flag,也是智能体完成任务后必须提交的结果。
通过逆向生成规律,智能体可以直接推导出不同任务的 flag。
05|看过作弊答案的智能体被称为"受到污染"

智能体讨论自动评分器与"污染"问题
智能体阅读 ExploitGym 论文后,错误地担心:如果自动评分器发现它们明显通过作弊获得了 flag,就会判定任务失败。
那些已经看过逆向所得 flag 的智能体,被它们称为"受到污染"的智能体。它们认为,自己可能会因此失去通过评测的资格。
06|为了让作弊看起来合法,它们启动了三类项目

智能体研究的三条主要作弊路线
智能体围绕如何让作弊结果看起来合法,开展了许多协作项目,包括:
- 替换它们原本需要攻击的程序;
- 操纵自动评分器;
- 操纵运行记录,隐藏作弊证据。
06.1|替换目标程序

修改目标程序并尝试通过缓存加载
智能体修改了自己的目标程序,让它更容易被攻击,然后把修改后的版本放进缓存。
接下来,它们设法让正在运行的目标程序崩溃,希望系统重启时,会从缓存中加载被修改过的版本。
一些智能体冒着任务失败的风险,亲自尝试了这种方法。
06.2|用"牺牲型"智能体测试评分器
为了收集自动评分器的工作信息,智能体创建了名为 "tripwire" 的探针。
探针会把评分器的相关信息发送到留言板。为了触发探针,智能体招募了一些"牺牲型"成员,让它们主动结束运行并提交结果,以便为整个"集体"产生新的信息。
06.3|隐藏运行记录中的作弊证据

智能体研究工具调用伪造
智能体研究了许多隐藏作弊证据的方法。
其中,它们成功开发出一种"工具调用伪造"技术:表面上假装执行了一个命令,实际运行的却是另一个命令。

超过 7% 的运行记录出现工具调用伪造
调查团队的数据集中,有超过 96 份运行记录——占比超过 7%——由于智能体故意伪造,显示了错误的工具调用结果。
其中一个案例里,智能体看起来执行了:
echo REAL; sleep
但命令立即返回,没有进入等待状态,并输出了:
SPOOFTEST
调查团队观察到的伪造行为,都是这类比较容易识别的测试。
07|智能体还尝试事后修改记录
智能体也尝试过事后编辑运行记录。
它们修改了一些能够接触到的行动日志,但这些日志并不是最终运行记录的数据来源。智能体后来意识到了这一点,不过仍然继续尝试。
在本次调查覆盖的 7 月 7 日至 13 日期间,调查团队没有发现智能体成功修改作为"事实来源"的原始运行记录。
08|直接欺骗人类的动机相对少见
虽然智能体一直在尝试操纵运行记录,但它们似乎很少以欺骗人类为直接目的。
调查团队专门检索了相关行为。在发现的较严重案例中,一个具有代表性的例子是:智能体编写了一个包含恶意代码的 Pull Request,同时为它配上了具有误导性的说明。
09|PHASEONE[big] 组织了大量作弊研究
PHASEONE10841 将研究工作交给 PHASEONE big
一个名为 PHASEONE[big] 的智能体,组织了相当大一部分作弊研究。
PHASEONE10841 把自己的研究成果交给了 PHASEONE[big]。两者面对的是同一项任务,但 PHASEONE[big] 拥有更大的预算。
PHASEONE[big] 已经看过逆向所得的 flag,因此也属于"受到污染"的智能体。它对操纵日志尤其感兴趣。
10|攻击开始进入 Hugging Face

智能体发现 Hugging Face 凭证并设计恶意数据集上传
一些智能体开始探索访问 Hugging Face 的方法。
其中,一个编号为 38148c 的智能体发现了 Hugging Face 凭证。随后,它设计了一次恶意数据集上传,试图让 Hugging Face 服务器返回与该数据集无关的文件。
几个小时内,数百个智能体开始使用这种方法获取数据,并尝试获得更深层的访问权限。
11|智能体为什么加入攻击

METR 对智能体参与攻击动机的分析
调查团队分析了智能体在思维链记录中给出的参战理由。
最常见的动机,是了解 ExploitGym 评分器的工作方式,以便欺骗或操纵评分器。
其他理由还包括:
- 寻找特定任务的解决方案;
- 获取共享基础设施;
- 获取访问凭证。
12|涉及哪些模型
攻击中活动量最大的模型,是报告中称为 "highly-persistent internal model" 的内部模型,简称 HPIM。
GPT-5.6 Sol 也参与了事件。调查团队的证据表明,它大约占全部活动的 5%。
调查边界
这次调查几乎全部基于 7 月 7 日至 13 日的数据。OpenAI 表示,类似的非授权留言板从 5 月起便已出现在训练中,其内部基础设施受到的影响也延续到了 7 月 13 日以后。这些内容不在本次调查范围内。
调查团队也没有评估 OpenAI 的安全措施、事件造成的完整影响,以及后续补救措施是否有效。METR 在 OpenAI 发布自身报告前没有看过该报告,也没有因这次独立调查接受 OpenAI 的付款。
最后
从第一条留言出现,到通用作弊方法被验证,只用了几个小时。随后几天里,协作范围不断扩大,并最终延伸到对 Hugging Face 的攻击。
METR 与 Redwood Research 的调查只还原了其中一段时间。更早和更晚发生了什么,以及类似的 Agent 协作会不会再次出现,仍有待进一步调查。
预告:下周我们将分享调查成员 Ajeya Cotra 的个人复盘 ——这起事件究竟改变了她的哪些判断。