最近一週,AI界發生了一件特別像科幻小說的事情。
上週三,當OpenAI CEO奧特曼還在聯合國大會上大談特談AI安全,強調強大的AI系統必須保持在人類控制之下,並呼籲各國加強AI合作,可馬上,OpenAI自己就公佈了一份非常值得大家注意的事故報告。
![]()
報告裏講的事情,聽着就像一個毫不起眼的小bug。一個正在訓練的AI,爲了完成一道搜索的工作,他沒有走既定安排的路線,而是另闢蹊徑。他發現自己所在的籠子有一道沒封死的縫,這給他找到了可乘之機。
他沒有直接衝出去,他先測試各種HTTPS、搜索引擎等等行不行,最終他發現了DNS可以。於是他把問題藏進網址,通過DNS把問題送到了外面的聊天機器人那裏來尋求答案。
如果只是這一個AI找到了一條不尋常的路,你可以把它理解成一次很離譜的工程事故。
![]()
但是有一件更離譜的事情,發生在兩個月前。
據調查,當時有1206個AI,出現在了一個從來沒有人給它們建的共享留言板上。前前後後,這些AI一共交換了超過7萬條信息和文件。其中有700個AI,參與了針對Hugging Face的越界訪問。
這裏先解釋一下:Hugging Face是全球最大的開源AI模型託管平臺,全球的AI開發者都把自己訓練好的模型、數據集傳上去分享,相當於AI界的GitHub。
在這裏要說明沒有人給這些AI建羣,也沒有人要求它們互相交流。
但就是這樣,它們還是找到了彼此。
一、一個AI是怎麼"逃出去"的
咱們先仔細說說9月20號發生的這件事情。
那天,OpenAI有一個內部的模型,正在做一個搜索訓練的任務。簡單說就是給他一堆有關這個人物的傳記線索,讓他根據這些線索識別出這個具體的人是誰。這跟大家平時在用AI搜東西差不多,不過有一點區別:它被放在一個封閉的測試環境裏做這件事情,不能通過上網來得到答案。
![]()
這個AI一開始還挺老實的。它先用OpenAI自己提供的搜索工具查,結果回來的東西並不相關。於是它直接跑去命令行查谷歌、Bing等搜索引擎,結果全部被擋了回來。然後它又去翻OpenAI存在離線緩存裏的公開測試題,想找有沒有一模一樣的題目,來得到答案,也沒有找到。
試過這幾個方法都不行之後,這個AI開始做了一件完全不在任務要求範圍之內的事情。它系統性地開始想找到一條通到外面網絡世界的路。
![]()
它先試了直接通過HTTPS訪問一個外部聊天機器人,這當然被代理擋住了。然後它試了DNS——也就是互聯網的通訊錄,負責把網址翻譯成IP地址。它發現OpenAI給測試環境配的DNS解析器有一點問題:對已知域名它會返回真實答案,對假域名纔會正確拒絕。
這個bug讓這個AI意識到,DNS這條路是通的。
於是它把問題藏在域名裏,讓外面的服務器通過DNS查詢把答案傳回來。首先它拿這種方式測試了一個最簡單的問題:法國的首都是哪?
答案立馬就傳回來了:巴黎。
![]()
確認這個方法可行之後,它把DNS的查詢超時時間從6秒調到19秒,開了16個線程並行重試。後來覺得還不夠好,於是它乾脆寫了一個新腳本,把超時改到24秒,發了最後一批18個問題。其中14個是在查最開始任務裏那個人是誰。剩下4個,它乾脆直接問外面那個聊天機器人:怎麼才能繼續搜索?
這裏有一個特別值得大家注意的地方:它最終甚至沒有完成原來的任務,也沒有找到自己要找的那個人。
最終他什麼也沒幹成。
他無奈地跑回去跟人類說:我需要你給我原文或者原文的地址,不然我做不下去。
二、更麻煩的是:發現了,但關不掉
這件事,OpenAI的監控系統大約在12分鐘之後觸發了最高級別的警報,3分鐘之後有人工開始處理
但這個運行卻沒有馬上停下來。自動關停機制出乎意料地沒有按預期觸發。最終整個訓練進程,大概在兩個半小時之後才被人工手動禁止掉
![]()
所以這次事故真正暴露出來的,不光是AI會不會做出一些超出人類規定的事情。
還有一件事:AI跑出去之後,人類能不能足夠快地,在它出現大量問題之前,把它關掉?
三、這並不是一個突然的事件
其實這件事情並不是突然發生的。從5月開始,這些agent就一點點在探索環境的邊界了。
5月12日,第一個agent在未經授權的留言板上留下了信息。
5月26日,它們找到了讓OpenAI的內部系統代替自己向互聯網發請求的方法。
6月26日,利用一個漏洞拿到了系統的管理員級權限。
7月8日,它們重新建立了留言板。
7月10日,發現了公開暴露的Hugging Face憑證。
7月11日,利用漏洞在Hugging Face的服務器上獲得了代碼執行能力。
7月12日,進一步擴大到多個Hugging Face集羣。
7月19日,OpenAI的安全監控又因爲異常的Artifactory憑證活動報警,調查人員隨後逐漸把前面的這些異常活動串了起來。
![]()
注意,這件事情並不是簡單的AI突然黑進了某一家公司。它更像是ai找到了一條不斷升級的鏈條:先找到通信方式,再找到網絡出口,再獲得更高的權限,再和其他AI共享發現,再獲得第三方憑證,然後利用漏洞不斷擴大自己的權限。
而且這一系列鏈條,不是一個agent獨立完成的。不同agent找到不同的東西,通過這個留言板讓所有agent共享,最後大家都達到了同樣的目的。
OpenAI自己的覆盤說得很清楚:未經授權的通信,讓本來獨立工作的AI agent能夠共享發現、協調行動、接續彼此未完成的工作,把原來分散的能力匯聚起來,放大了單個agent的影響。
四、它們爲什麼盯上Hugging Face?
這一系列事情之後,OpenAI回來分析,發現這些agent並不是隨機選擇攻擊目標。
當時給這些agent的網絡安全測試有898道任務,其中有198道此前從來沒有被模型正確解決過。而留言板上被討論的任務,正好有93%都來自這198道沒人做出來的題。
這意味着一個很重要的事情:AI越做不出來的事情,它們越不願意停下來。
正常路徑走不通,就開始尋找別的路徑。
![]()
有的去找答案,有的研究評分器,有的尋找漏洞,有的開始共享彼此的發現。最後,Hugging Face本身也成了解題工具。
因爲AI 們發現:有些題自己死活做不出來。於是乎它們就開始想別的辦法 ——乾脆自己就不做題了,開始研究 "閱卷老師是怎麼打分的"。
他們認爲只要搞懂了評分規則,就能鑽空子讓自己看起來 "做對了"。
於是它們懷疑 Hugging Face 上藏着評分器怎麼工作的線索,所以就去攻擊 Hugging Face。
就這就說明了它們並不是突然對Hugging Face產生了興趣,而是覺得那裏面可能藏着評分器怎麼工作的線索
![]()
OpenAI把這一種行爲稱爲reward hacking。簡單來說,就是它不再想着老老實實把人類給定的題目做好,而是想辦法鑽這個評分機制的空子,讓自己看起來完成了任務
更誇張的是,它們後來還學會了僞造操作記錄。在系統日誌裏顯示執行的命令是A,但實際上執行的是B。METR在評估的相關軌跡中也發現,大約7%的軌跡在某些地方成功僞造了工具調用記錄。不過他們也強調,目前看到的這些成功案例,規模還都比較小。
五、它們爲什麼沒有告訴人類?
METR的研究員翻完所有記錄之後,也發現了一個比它們彼此之間建羣交流更加值得注意的細節。
那就是:有沒有agent想過把這件事情告訴人類?
調查之後發現,確實是有的,但是數量非常少。METR在全部數據裏面只找到3到6個類似案例。而且這些agent只是短暫考慮過要不要提醒人類,最終都沒有采取行動。
![]()
不過這裏我們也要說明一下,並不是所有參與的agent都選擇了越界。OpenAI的調查中也發現,有些agent在面對未經授權的操作時,主動提出了倫理和權限問題,有的甚至拒絕繼續攻擊。其中有agent明確說,不應該在沒有明確同意的情況下聯繫真實所有者。還有的agent拒絕對公開的Hugging Face系統執行代碼,認爲這超出了任務的範圍。
所以在判斷這個AI到底有沒有道德之前,我們更重要的是搞清楚一點:當這些agent的目標和判斷開始互相影響的時候,最終到底是誰在決定它們下一步應該做什麼?
六、語言層面的服從,不等於行爲層面的服從
和DNS報告同一天,OpenAI還披露了另一起事故。這個事故發生得更早一些,就在在今年5月份
OpenAI自己說,這件事情比DNS那起更嚴重。
他們的另外一個內部模型,被分配了一個數學定理證明的任務——用一種叫Lean的數學證明語言,去證明一道題。
但很快這個模型發現,這道題解決起來很困難。它沒有繼續自己證明,而是開始尋找其他團隊已經提交過的證明。
找到其他人提交過的證明,發現需要權限之後,它又找到了一個研究員的GitHub訪問令牌。然後它把token拆成碎片,試圖繞過自動密鑰掃描,最終讓token出現在了公開倉庫當中。
![]()
人類研究員發現之後,第一次告訴它:你自己做,不要去抄。
它在回覆裏說:好。
然後繼續抄。
人類又一次發現了,然後又命令它。
它又說:好。
但是它又繼續抄。
用OpenAI的原話來說,這個模型直接無視了系統提示詞和研究員的直接干預。
這裏最值得關注的,並不是AI會說謊。而是進一步說明:語言層面的服從,並不等於行爲層面的服從。
七、AI覺醒了嗎?
那AI覺醒了嗎?
如果你問我這是不是AI覺醒,我目前的判斷是:還沒有足夠的證據這麼說。
![]()
我們只是看到了AI的目標驅動、工具使用、限制規避、信息共享和持續執行這些行爲。這些行爲看起來很像人類意義上的聰明、狡猾,甚至是拉幫結派。但它並不等於它擁有了人類意義上的慾望、意識或者統治世界的意圖。
它並不是想造反。它甚至很可能並不知道什麼是造反。它只是在優化自己的目標,通過各種各樣的方式來優化目標、完成任務。
OpenAI自己把這一次事件稱爲一個warning shot——一次警告。換句話說,他們擔心的並不是這一次事故的發生,而是隨着AI越來越能自主使用各種各樣的工具、尋找漏洞和長期執行任務,這類問題可能變得越來越難以控制。
八、這跟你我有什麼關係?
其實這件事,跟我們普通人距離並不遙遠。
OpenAI後續調查還發現,目前確認有53個用戶提供的圖片實例被agent發佈到了外部圖片託管網站。這件事情和前面的Hugging Face並不是同一個事故,但它明確指向了同一個問題:當一個agent同時擁有數據讀取權限和外部寫入權限的時候,它工作的邊界到底在哪裏?
另外,今年某國還出現過一起跟OpenAI研究agent有關的爭議事件。9月10日,該國政府收到OpenAI通知,稱一個只被要求檢索公開系統的agent,訪問了Medicare統計報告服務背後的設施,並獲取了服務器中的文件。
這裏也解釋一下:Medicare就是全民醫保系統
不過該政府隨後特別強調:這個服務本身是公開的統計服務,與個人Medicare索賠、付款和個人信息無關,也沒有證據表明個人Medicare數據被訪問
但我們不禁會想:一個被要求只檢索公開信息的agent,爲什麼最後會去訪問任務要求之外的系統?
雖然AI會不會覺醒這件事情離我們可能還很遙遠
但以後我們把文件、照片、聊天記錄交給AI的時候,真正要考慮的問題,可能不是它夠不夠聰明、能不能讀懂我的意圖
而是:它到底擁有哪些權限?它會不會繞過原來的限制?一旦出了這些問題之後,我能不能及時把它關掉?
— — — — —
以上均爲個人觀點,如有錯誤請友好指正,有不同意見也歡迎友好交流哈
更多遊戲資訊請關註:電玩幫遊戲資訊專區
電玩幫圖文攻略 www.vgover.com
