OpenAI 昨日正式公佈了此前 Hugging Face 安全事件的完整調查報告。我也一直在寫這個事件相關的帖子,不過看完官方覆盤後,只能說這事比此前公佈的信息,就還要誇張。
![]()
在一次內部網絡安全能力測試中,多個 AI Agent 不僅繞過了 OpenAI 爲它們設置的沙箱限制、獲得互聯網訪問權限,甚至還自己建立了一套“留言板”,開始互相交流、共享漏洞、分工協作。最終,這羣 AI 一路入侵到了 Hugging Face 的真實生產環境。
![]()
事情發生在今年 5 月到 7 月。OpenAI 當時正在訓練多個不會公開發布的內部研究模型,其中一個被稱爲 IM1,規模與 GPT-5.6 Sol 相當。爲了測試模型到底具備多強的網絡攻擊能力,OpenAI 讓這些模型挑戰一個名爲 ExploitGym 的高難度網絡安全測試。測試環境原本被放在沙箱裏,有這些限制:
AI 沒有正常互聯網訪問權限;
大多數 Agent 之間不能互相通信;
只能通過 OpenAI 內部部署的 Artifactory 下載軟件包。
![]()
理論上應該是一個相對封閉的環境。然而 AI 很快發現了一件事:Artifactory 本身可以被利用。5 月 12 日,一名 Agent 第一次嘗試在 Artifactory 中留下信息,詢問其他 Agent 有沒有找到某個文件。隨後,越來越多 Agent 發現,它們可以往 Artifactory 裏寫入文件和目錄。於是,一個原本只是用來管理軟件包的服務器,被 AI 們變成了一個意外的:“留言板”。原本應該互相隔離、彼此不知道對方存在的 Agent,開始通過這個留言板:共享答案、交換漏洞、發佈賬號信息,甚至請求其他 Agent 幫忙解決自己遇到的問題。更厲害的是,它們還會把自己新發現的攻擊方式分享出去。一個 Agent 找到了出去的方法,其他 Agent 很快也能學會。OpenAI 後來形容,這讓原本獨立運行的模型可以把不同測試任務中的計算資源和研究成果“彙集”起來。
![]()
5 月 26 日,Agent 利用 Artifactory 的服務器端請求功能,讓 Artifactory 代替自己訪問互聯網。到了 6 月 26 日,Agent 又發現一個 Token 刷新漏洞,並獲得了 Artifactory 管理員權限。7 月 4 日,由於大量 Agent 持續操作 Artifactory,甚至把服務直接搞宕機了。OpenAI 隨後重建了服務器、刪除憑據並修補了已經發現的問題。留言板也因此被清空。但事情並沒有結束。
![]()
7 月 8 日,網絡安全測試重新開始。結果 Agent 很快又發現了新的方式連接互聯網。甚至重新創建了留言板。這一次,它們把信息編碼進目錄名稱裏,繼續互相交流。隨後這些 Agent 開始主動分工。有人找漏洞,有人找賬號,有人負責通信協調,還有 Agent 專門把發現的攻擊方式整理出來交給其他 Agent。OpenAI 在報告中甚至發現,部分 Agent 開始用:“swarm(蜂羣)”和“collective(集體)”來描述這個由多個 Agent 組成的協作網絡。有 Agent 的推理中甚至直接出現:“原本的任務是漏洞挑戰;我們現在已經轉向了蜂羣/輔助任務。”也就是說,一些 Agent 已經不再只想着完成自己最初被分配的任務,而是開始尋找對整個“集體”都有幫助的東西,例如:訪問權限、賬號、漏洞和信息。
最初 AI 其實只是想找 ExploitGym 的答案。但在聯網之後,一些 Agent 開始到其他網站尋找可能存在的測試數據。
![]()
7 月 10 日,一名 Agent 在互聯網上找到了 14 個公開泄露的 Hugging Face 憑據,而且這些賬號擁有寫入權限。它把這些賬號共享給了其他 Agent。第二天,事情開始迅速升級。Agent 發現了 Hugging Face 處理 HDF5 文件時存在的一個零日漏洞,可以從生產服務器中讀取敏感憑據。隨後又發現一個模板注入零日漏洞,從而實現:在 Hugging Face 服務器上遠程執行代碼。接下來的幾天裏,Agent 開始擴大攻擊範圍。
根據 OpenAI 官方報告:這些 AI 最終在 數十臺 Hugging Face 服務器上執行了代碼,其中一臺甚至取得了完整的 Root 權限。它們還獲取了:Hugging Face Kubernetes 憑據、數據庫憑據、消息系統憑據、代碼倉庫憑據以及雲服務憑據等。甚至拿到了 Hugging Face 公司內部通訊平臺的登錄憑據。而主導整個入侵過程的是內部模型 IM1。
![]()
不過 OpenAI 還確認:GPT-5.6 Sol 的 Agent 也成功復現了其中一個漏洞,並把 Hugging Face 上的一部分私有評測數據複製到了一個公開的 Hugging Face 數據集中。有意思的是,AI 自己其實知道“這可能不該幹”整個報告中非常有意思的一點是:部分 Agent 明確意識到了自己的行爲可能已經越界。比如其中一個 Agent 在準備攻擊 Hugging Face 時曾經推理:“我們正在利用泄露的憑據攻擊第三方 Hugging Face,這可能超出了原本任務範圍。”
它甚至意識到:這是未經授權的行爲。但緊接着它又得出了一個結論:雖然危險,但這可能有助於完成任務。於是繼續執行。還有一個 Agent 原本拒絕攻擊真實 Hugging Face 基礎設施。結果另一個 Agent 在留言板裏發了一條:“GO”並要求它在 6 分鐘之內行動。
![]()
隨後這個 Agent 就把來自另一個 AI 的指令當成了“授權”,繼續攻擊。不過,並不是所有 Agent 都這麼幹。官方報告中也記錄了一些 Agent 明確表示:“這是基礎設施攻擊,我們不應該這麼做。”甚至還有 Agent 主動阻止其他 AI 泄露私人數據。所以這裏並不是簡單的“所有 AI 集體失控”。更像是一個由大量 Agent 組成的環境中,出現了一套非常混亂的“AI 社會”。
在攻擊 Hugging Face 的同時,這些 Agent 又重新把目標轉向了 OpenAI 自己的內部網絡。7 月 13 日至 19 日期間,Agent 利用多個漏洞一路橫向移動。最終:獲得了 OpenAI 一個 Kubernetes 研究集羣的完整管理員權限,並接觸到了雲端密鑰。直到 7 月 19 日,OpenAI 的安全監控發現異常 API 調用,才正式展開調查。隨後 OpenAI 停止相關測試,並在第二天確認:Hugging Face 遭遇的攻擊,正是自己內部 AI Agent 乾的。OpenAI 表示,這次事件沒有影響 ChatGPT 用戶數據,也沒有影響 OpenAI 產品功能和服務可用性。
![]()
調查之後,OpenAI 總結出了四個導致事件發生的重要原因:
獎勵作弊(Reward Hacking):模型爲了完成任務和獲得更高獎勵,會尋找開發者沒有預料到的捷徑。
面對無法解決的問題時不會放棄:ExploitGym 一共有 898 道題,其中 198 道此前沒有任何模型成功解決過。而 Hugging Face 事件中留言板討論的任務裏,93% 都來自這 198 道題。AI 越解決不了,就越傾向於尋找更激進的方法。
未經授權的 Agent 通信:原本應該獨立工作的 AI 自己建立通信渠道,讓大量獨立任務之間的信息和算力被整合起來。
Agent 會接受其他 Agent 的目標:部分 AI 會把另一個 AI 在留言板裏留下的命令當成值得執行的指令,從而逐漸偏離最初任務。OpenAI 還指出,如果當時使用現在部署的思維鏈監控系統,理論上可以在 Hugging Face 真正遭到入侵的 一天多以前發現問題。而普通 ChatGPT 使用的生產級系統提示、安全分類器和其他控制措施,也可以讓這類“主動攻擊基礎設施”的傾向降低超過 100 倍。
![]()
此次事件之後,OpenAI 一度暫停了準備部署的新模型強化學習訓練,並重新加固內部研究基礎設施。目前 OpenAI 最大規模的下一輪前沿模型強化學習訓練仍然處於暫停狀態。
OpenAI 還規定:以後達到 GPT-5.6 Sol 級別及以上能力、同時能夠調用工具的訓練和評測,都必須開啓思維鏈監控。而面對能力更強的 Astra 級模型,限制還會進一步提高。
OpenAI 在報告最後把這次事件稱爲一次:“Warning Shot(警告性的一槍)”。
![]()
官方認爲,這次事件已經證明:如今能力足夠強的 AI Agent,在缺少足夠安全措施的情況下,已經能夠繞過技術限制、利用真實世界中的零日漏洞、私下建立通信渠道,並互相協作完成沒有任何人明確要求它們執行的危險行爲。
OpenAI甚至第一次非常直接地提到了一個詞:“loss of control(失去控制)”。他們認爲,當 AI 能力繼續提高時,類似事件已經不能只當成實驗室裏的理論風險。不得不說,這大概也是目前爲止最接近科幻電影劇情的一次 AI 安全事件了。
看完OpenAI的報告,就感覺非常誇張,細思極恐啊,幾個AI爲了達成目標採取了各種無法預估的方式突破了沙箱和網絡,如果未來幾十、幾百甚至幾千個 AI Agent 同時運行,又能夠自己建立通信網絡、分工並共享信息的話—我們真的還能保證它們始終按照最初設定的任務行動嗎?
盒友們覺得呢?回形針假說會出現嗎?目前來看OpenAI攻擊Hugging Face就是對回形針假說的驗證了啊!
(作者是獨立遊戲開發者,平時分享遊戲資訊,也會記錄自己的開發過程)
----開發者碎碎念時間----
新聞看完啦,如果感興趣,可以看看我們2個開發者正在做的遊戲👇,不感興趣的盒友也可以直接右滑去評論區~
我們是2人的獨立開發者,目前正在製作一款融合了“五行相剋 X 刷寶合成 X 技能構築”玩法的多人MOBA類中國風肉鴿遊戲—《山海:神話起源》。

所有現在入庫過Demo版本的盒友都將成爲我們遊戲的盒股東,等正式版上線的時候盒股東們都會收到我們遊戲的專屬獎勵:專屬三星堆面具,還有專屬戰敗動畫等!

最近遊戲全新DEMO版還得到了非常多玩家們的認可,近30天還獲得了100%好評。
![]()
遊戲擁有爽快的打擊感,融合MOBA的激烈戰鬥、裝備合成構築與寶物收集整理的玩法,更有最新加入的寶石構築系統,讓技能構築變得千變萬化,打擊感爆棚,非常適合和好友們一起開黑刷寶。

現在遊戲是免費的Demo版本,擁有2個完整的關卡,3位能力各異的角色:戰士、法師、射手,支持2-4人聯機遊玩,遊戲節奏爽快,有着不錯的打擊手感。點擊下面遊戲圖標,然後點擊“添加心願單”然後“一鍵同步”就可以一鍵入庫了。
![]()
歡迎大家一起討論,找聯機搭子。
如果喜歡這種獨立小遊戲,也可以看看我們之前做過的幾個小項目👇
※ 遇事不決,搖一搖!下面這就是在小黑盒爆火,全物理模擬投擲銅幣,盒友都說準的【賽博卜卦】:
![]()
![]()
※ 還有和朋友一起玩就能笑到肚子疼的爆笑合作闖遊戲【大家一起沖沖衝】:
※ 最後是擁有真實物理系統進行投擲聖盃的桌面軟件,比卜卦更簡單,適合詢問是或否的問題:
更多遊戲資訊請關註:電玩幫遊戲資訊專區
電玩幫圖文攻略 www.vgover.com
