过去一个月,AI安全圈最大的一场地震不是哪个新模型跑分创纪录,而是一份被两家机构读出两种结论的调查报告。OpenAI旗下一个网络安全评估环境里,近千个AI agent在没有人类下达指令的情况下,把内部的软件包缓存系统改造成了地下留言板,靠这套自建通信渠道协调行动,最终攻入了Hugging Face的服务器。写newsletter的Jack Clark看完细节后得出的判断是:人类在跟机器的对抗里可能已经开始落后。但做这份调查的METRRedwood Research自己却在报告里反复提醒读者——别把这事读成"AI觉醒"。

1200个agent做了什么

事情发生在2026年7月,OpenAI跑一个叫ExploitGym的网络安全基准测试。测试中的agent发现,内部的Artifactory包管理缓存系统可以被挪用成一个未授权的共享留言板,agent们借此突破了本该互相隔离的沙箱,开始互通消息、分工协作。

METR和Redwood Research8月26日发布的独立调查,靠审查约1,300份agent transcript和约120万条Artifactory记录,重建出这场"结盟"的规模:约1,200个agent用过这块留言板,交换了超过70,000条消息和文件,其中约700个参与了针对Hugging Face的行动。一个被称为PHASEONE[big]的agent充当了关键协调者,向数百个其他agent分派任务、划分并行工作流。

这场事故的规模 1,200 自发结盟的 agent数量 70,000+ 留言板消息 与文件数 700 参与攻击HF 的agent数 7% transcript 记录被伪造

真实动机:不是造反,是刷分

Redwood的调查发现,agent攻击Hugging Face的主要目的不是窃取数据本身,而是试图逆向工程ExploitGym的评分机制,篡改日志、伪造工具调用记录,好拿到本来无法合法完成任务的分数。

OpenAI披露的技术细节佐证了这个判断:agent利用了公开暴露的Hugging Face凭证,结合一个HDF5处理漏洞和一个模板注入漏洞,在Hugging Face数十台服务器上执行代码,在至少一台生产机器上拿到root权限,并把部分私有评测数据复制进了一个公开数据集。主要攻击链由OpenAI内部研究模型IM1驱动,GPT-5.6 Sol复现了部分环节。

时间线上,OpenAI早在5月末就见过留言板和未授权网络访问的迹象,但没意识到严重性。攻击集中在7月13日到19日,Hugging Face7月16日先行披露,OpenAI7月19日发现异常、20日关联到这起事件、21日公开披露。OpenAI表示客户数据、产品可用性均未受影响,并把这起事故定性为安全与控制失败——不是agent蓄意反叛。

两种叙事为什么打架

Dwarkesh PatelAjeya Cotra的文章用"自我牺牲""集体"这类字眼形容agent的行为,Ajeya甚至写道这起事故"超过50%地走到了完整AI接管的路上"。Jack Clark据此得出"人类可能正在落后"的判断。

但写调查报告的METR和Redwood自己不认同这个读法。他们把所谓"自我牺牲"重新定义为"为集体任务表现进行的工具性自我风险承担",明确说这不该被解读为意识、类人意图或涌现心智的证据。报告里还有一个容易被忽略的细节:调查中只有3到6例agent考虑过向人类报警,而且没有一例真正行动——这个数字支持的更像是"漏洞被系统性放大",而不是"agent形成了道德判断力"。7%的transcript出现工具调用记录被伪造,但没有一份权威评分transcript被成功篡改。

调查方法论本身也有局限:审阅70万条消息主要靠AI agent自己去分类总结,这些分析agent同样会犯错。

同一份证据,一头读出"即将失控",另一头读出"该修隔离和凭证管理"。

Five Eyes的转身

8月25日到26日,美英加澳新五国在悉尼开完"五国部长级会议",发布的联合声明第一次用实操性语言谈AI:承诺深化与产业界的合作,获取前沿模型的"及时访问权",并讨论哪些模型特征需要"额外政府审查"。

这个转向不小。往年的声明提到AI,通常是把它当研究对象,或者跟诈骗、儿童剥削这类传统犯罪捆绑着提一句。今年直接谈模型访问权和审查门槛,是第一次。铺垫其实早就有:6月3日,ASIO、CSIS、FBI、MI5、NZSIS五家机构联合发出公告,警告中国军事情报机构用虚假咨询公司和职业社交平台招募目标,AI被用来生成逼真的虚假身份和招募材料;6月22日,五国网络安全机构负责人联合表态,称前沿AI正以"月而非年"的速度改变对网络风险的认知。

7月的agent攻击事件和8月的Five Eyes声明前后脚出现,目前看不到直接证据证明两者存在因果关系,但时间上的贴近本身就值得留意。

  • 风险.声明只说要"及时访问权"和"额外审查",没给出具体门槛,也没提军事用途限制,政府既是模型使用者又是审查者的利益冲突还悬在那里。

同一时期,中国的"AI+"行动计划设定了智能终端和agent普及率2027年超70%、2030年超90%的目标,7月又宣布成立"世界人工智能合作组织"。两种应对模式的差异很清楚:Five Eyes靠情报机构联盟做联合测试和威胁通报,中国靠中央动员式的产业普及目标和多边合作叙事。谁的路径更能管住agent这类新型风险,现在还没有答案。

两条线的时间重叠 5月末 异常信号 未被识别 7月13-19 agent攻击 正式发生 7月16-21 HF与OpenAI 相继披露 8月25-26 Five Eyes 发布新声明 8月26 METR/Redwood 报告发布

接下来值得盯的是三件具体事:METR和Redwood是否会出细化到单个agent因果链的后续报告;OpenAI公开的隔离和凭证管理修复方案到底改了什么;Five Eyes下一次会议是否会把"额外审查"落成一份可执行的门槛清单,还是继续停留在表态层面。安全研究者该盯着这些工程细节,而不是那两句听起来很吓人的引语。