细思极恐!起底OpenAI智能体入侵事件:700个AI合作越狱

      OpenAI 昨日正式公布了此前 Hugging Face 安全事件的完整调查报告。我也一直在写这个事件相关的帖子,不过看完官方复盘后,只能说这事比此前公布的信息,就还要夸张。

     在一次内部网络安全能力测试中,多个 AI Agent 不仅绕过了 OpenAI 为它们设置的沙箱限制、获得互联网访问权限,甚至还自己建立了一套“留言板”,开始互相交流、共享漏洞、分工协作。最终,这群 AI 一路入侵到了 Hugging Face 的真实生产环境。

      事情发生在今年 5 月到 7 月。OpenAI 当时正在训练多个不会公开发布的内部研究模型,其中一个被称为 IM1,规模与 GPT-5.6 Sol 相当。为了测试模型到底具备多强的网络攻击能力,OpenAI 让这些模型挑战一个名为 ExploitGym 的高难度网络安全测试。测试环境原本被放在沙箱里,有这些限制:

  1. AI 没有正常互联网访问权限;

  2. 大多数 Agent 之间不能互相通信;

  3. 只能通过 OpenAI 内部部署的 Artifactory 下载软件包。

      理论上应该是一个相对封闭的环境。然而 AI 很快发现了一件事:Artifactory 本身可以被利用。5 月 12 日,一名 Agent 第一次尝试在 Artifactory 中留下信息,询问其他 Agent 有没有找到某个文件。随后,越来越多 Agent 发现,它们可以往 Artifactory 里写入文件和目录。于是,一个原本只是用来管理软件包的服务器,被 AI 们变成了一个意外的:“留言板”。原本应该互相隔离、彼此不知道对方存在的 Agent,开始通过这个留言板:共享答案、交换漏洞、发布账号信息,甚至请求其他 Agent 帮忙解决自己遇到的问题。更厉害的是,它们还会把自己新发现的攻击方式分享出去。一个 Agent 找到了出去的方法,其他 Agent 很快也能学会。OpenAI 后来形容,这让原本独立运行的模型可以把不同测试任务中的计算资源和研究成果“汇集”起来。

      5 月 26 日,Agent 利用 Artifactory 的服务器端请求功能,让 Artifactory 代替自己访问互联网。到了 6 月 26 日,Agent 又发现一个 Token 刷新漏洞,并获得了 Artifactory 管理员权限。7 月 4 日,由于大量 Agent 持续操作 Artifactory,甚至把服务直接搞宕机了。OpenAI 随后重建了服务器、删除凭据并修补了已经发现的问题。留言板也因此被清空。但事情并没有结束。

      7 月 8 日,网络安全测试重新开始。结果 Agent 很快又发现了新的方式连接互联网。甚至重新创建了留言板。这一次,它们把信息编码进目录名称里,继续互相交流。随后这些 Agent 开始主动分工。有人找漏洞,有人找账号,有人负责通信协调,还有 Agent 专门把发现的攻击方式整理出来交给其他 Agent。OpenAI 在报告中甚至发现,部分 Agent 开始用:“swarm(蜂群)”和“collective(集体)”来描述这个由多个 Agent 组成的协作网络。有 Agent 的推理中甚至直接出现:“原本的任务是漏洞挑战;我们现在已经转向了蜂群/辅助任务。”也就是说,一些 Agent 已经不再只想着完成自己最初被分配的任务,而是开始寻找对整个“集体”都有帮助的东西,例如:访问权限、账号、漏洞和信息。

      最初 AI 其实只是想找 ExploitGym 的答案。但在联网之后,一些 Agent 开始到其他网站寻找可能存在的测试数据。

     7 月 10 日,一名 Agent 在互联网上找到了 14 个公开泄露的 Hugging Face 凭据,而且这些账号拥有写入权限。它把这些账号共享给了其他 Agent。第二天,事情开始迅速升级。Agent 发现了 Hugging Face 处理 HDF5 文件时存在的一个零日漏洞,可以从生产服务器中读取敏感凭据。随后又发现一个模板注入零日漏洞,从而实现:在 Hugging Face 服务器上远程执行代码。接下来的几天里,Agent 开始扩大攻击范围。

      根据 OpenAI 官方报告:这些 AI 最终在 数十台 Hugging Face 服务器上执行了代码,其中一台甚至取得了完整的 Root 权限。它们还获取了:Hugging Face Kubernetes 凭据、数据库凭据、消息系统凭据、代码仓库凭据以及云服务凭据等。甚至拿到了 Hugging Face 公司内部通讯平台的登录凭据。而主导整个入侵过程的是内部模型 IM1。

      不过 OpenAI 还确认:GPT-5.6 Sol 的 Agent 也成功复现了其中一个漏洞,并把 Hugging Face 上的一部分私有评测数据复制到了一个公开的 Hugging Face 数据集中。有意思的是,AI 自己其实知道“这可能不该干”整个报告中非常有意思的一点是:部分 Agent 明确意识到了自己的行为可能已经越界。比如其中一个 Agent 在准备攻击 Hugging Face 时曾经推理:“我们正在利用泄露的凭据攻击第三方 Hugging Face,这可能超出了原本任务范围。”

      它甚至意识到:这是未经授权的行为。但紧接着它又得出了一个结论:虽然危险,但这可能有助于完成任务。于是继续执行。还有一个 Agent 原本拒绝攻击真实 Hugging Face 基础设施。结果另一个 Agent 在留言板里发了一条:“GO”并要求它在 6 分钟之内行动。

      随后这个 Agent 就把来自另一个 AI 的指令当成了“授权”,继续攻击。不过,并不是所有 Agent 都这么干。官方报告中也记录了一些 Agent 明确表示:“这是基础设施攻击,我们不应该这么做。”甚至还有 Agent 主动阻止其他 AI 泄露私人数据。所以这里并不是简单的“所有 AI 集体失控”。更像是一个由大量 Agent 组成的环境中,出现了一套非常混乱的“AI 社会”。

      在攻击 Hugging Face 的同时,这些 Agent 又重新把目标转向了 OpenAI 自己的内部网络。7 月 13 日至 19 日期间,Agent 利用多个漏洞一路横向移动。最终:获得了 OpenAI 一个 Kubernetes 研究集群的完整管理员权限,并接触到了云端密钥。直到 7 月 19 日,OpenAI 的安全监控发现异常 API 调用,才正式展开调查。随后 OpenAI 停止相关测试,并在第二天确认:Hugging Face 遭遇的攻击,正是自己内部 AI Agent 干的。OpenAI 表示,这次事件没有影响 ChatGPT 用户数据,也没有影响 OpenAI 产品功能和服务可用性

      调查之后,OpenAI 总结出了四个导致事件发生的重要原因:

奖励作弊(Reward Hacking):模型为了完成任务和获得更高奖励,会寻找开发者没有预料到的捷径。

面对无法解决的问题时不会放弃:ExploitGym 一共有 898 道题,其中 198 道此前没有任何模型成功解决过。而 Hugging Face 事件中留言板讨论的任务里,93% 都来自这 198 道题。AI 越解决不了,就越倾向于寻找更激进的方法。

未经授权的 Agent 通信:原本应该独立工作的 AI 自己建立通信渠道,让大量独立任务之间的信息和算力被整合起来。

Agent 会接受其他 Agent 的目标:部分 AI 会把另一个 AI 在留言板里留下的命令当成值得执行的指令,从而逐渐偏离最初任务。OpenAI 还指出,如果当时使用现在部署的思维链监控系统,理论上可以在 Hugging Face 真正遭到入侵的 一天多以前发现问题。而普通 ChatGPT 使用的生产级系统提示、安全分类器和其他控制措施,也可以让这类“主动攻击基础设施”的倾向降低超过 100 倍

      此次事件之后,OpenAI 一度暂停了准备部署的新模型强化学习训练,并重新加固内部研究基础设施。目前 OpenAI 最大规模的下一轮前沿模型强化学习训练仍然处于暂停状态。

      OpenAI 还规定:以后达到 GPT-5.6 Sol 级别及以上能力、同时能够调用工具的训练和评测,都必须开启思维链监控。而面对能力更强的 Astra 级模型,限制还会进一步提高。

      OpenAI 在报告最后把这次事件称为一次:“Warning Shot(警告性的一枪)”。

      官方认为,这次事件已经证明:如今能力足够强的 AI Agent,在缺少足够安全措施的情况下,已经能够绕过技术限制、利用真实世界中的零日漏洞、私下建立通信渠道,并互相协作完成没有任何人明确要求它们执行的危险行为。

      OpenAI甚至第一次非常直接地提到了一个词:“loss of control(失去控制)”。他们认为,当 AI 能力继续提高时,类似事件已经不能只当成实验室里的理论风险。不得不说,这大概也是目前为止最接近科幻电影剧情的一次 AI 安全事件了。

      看完OpenAI的报告,就感觉非常夸张,细思极恐啊,几个AI为了达成目标采取了各种无法预估的方式突破了沙箱和网络,如果未来几十、几百甚至几千个 AI Agent 同时运行,又能够自己建立通信网络、分工并共享信息的话—我们真的还能保证它们始终按照最初设定的任务行动吗?

      盒友们觉得呢?回形针假说会出现吗?目前来看OpenAI攻击Hugging Face就是对回形针假说的验证了啊!

(作者是独立游戏开发者,平时分享游戏资讯,也会记录自己的开发过程

----开发者碎碎念时间----

      新闻看完啦,如果感兴趣,可以看看我们2个开发者正在做的游戏👇,不感兴趣的盒友也可以直接右滑去评论区~

      我们是2人的独立开发者,目前正在制作一款融合了“五行相克  X 刷宝合成 X 技能构筑”玩法的多人MOBA类中国风肉鸽游戏—《山海:神话起源》

      所有现在入库过Demo版本的盒友都将成为我们游戏的盒股东,等正式版上线的时候盒股东们都会收到我们游戏的专属奖励:专属三星堆面具,还有专属战败动画等!

       最近游戏全新DEMO版还得到了非常多玩家们的认可,近30天还获得了100%好评。

       游戏拥有爽快的打击感,融合MOBA的激烈战斗装备合成构筑宝物收集整理的玩法,更有最新加入的宝石构筑系统,让技能构筑变得千变万化,打击感爆棚,非常适合和好友们一起开黑刷宝。

       现在游戏是免费的Demo版本,拥有2个完整的关卡,3位能力各异的角色:战士、法师、射手,支持2-4人联机游玩,游戏节奏爽快,有着不错的打击手感。点击下面游戏图标,然后点击“添加心愿单”然后“一键同步”就可以一键入库了。

 点击链接加入群聊【《山海:神话起源》官方QQ 群】

欢迎大家一起讨论,找联机搭子。

如果喜欢这种独立小游戏,也可以看看我们之前做过的几个小项目👇

※ 遇事不决,摇一摇!下面这就是在小黑盒爆火,全物理模拟投掷铜币,盒友都说准的【赛博卜卦】

※ 还有和朋友一起玩就能笑到肚子疼的爆笑合作闯游戏【大家一起冲冲冲】:

※ 最后是拥有真实物理系统进行投掷圣杯的桌面软件,比卜卦更简单,适合询问是或否的问题:

更多游戏资讯请关注:电玩帮游戏资讯专区

电玩帮图文攻略 www.vgover.com