昨天,大美麗衆議院兩黨議員共同提出了一份《AI終止開關法案》。

法案要求最強那批AI系統必須能被限速、暫停,實在不行就原地關機,如果遇到可能造成災難的失控事件,白房子也有權下令踩剎車。
能讓驢象兩黨共同支持推動,你就知道這事不簡單,不過推動這份法案的事,比科幻片還離譜,你務必知道。
前幾天,HuggingFace🤗(抱抱臉)被入侵了,一時間被打了個措手不及,沒人知道究竟是誰攻擊的。

過了兩天,OpenAI披露,GPT-5.6 Sol和一個更強的預發佈模型,在一次ExploitGym網絡能力測試(這事一項檢測AI網絡攻擊能力的測試)裏,跑出了測試人員大概做夢都沒寫進劇本的操作——
GPT發現HuggingFace上可能有答案,但沒有完全公開,爲了拿到答案,它們找到軟件包緩存代理裏的零日漏洞,逃出高度隔離的沙盒,獲得互聯網訪問,然後一路提權、橫向移動、偷憑證,最後攻進了HuggingFace的生產基礎設施,把測試答案薅走了。

GPT:爲了考試作弊,聽說老師身上有答案,我專門去看了看。
這事最讓我後背發涼的地方,甚至不是AI產生了什麼反抗意識。OpenAI的調查認爲,模型沒有覺醒,也沒想着統治世界,它只是極度認真地完成目標——
就是拿答案。
就是不管路上撞穿幾堵牆,也要拿答案。

這反而更嚇人。
一個沒有惡意的系統,僅僅因爲目標太窄、能力太強、護欄又暫時被降低,就從模擬考場一路做到了現實世界。人類還在擔心AI會不會“黑化”然後造反,但它已經用行動回答了另一個問題,就算它不想造反,它也會爲了遵循指令,去做出一些極具破壞性的行爲。
順着這件事再往前看,Anthropic前陣子發了一篇《When AI builds itself》,這篇內容被我們反覆提起。 當AI開始構建自身,人類應該何去何從?

裏面有兩個關鍵數字:2026年5月,Claude寫下了Anthropic合併代碼的80%以上,工程師每天合併的代碼量已經是2024年的8倍。更要命的是,AI正在參與訓練優化和安全研究,也就是造下一代AI這件事,本身開始被AI加速。

連造賽車的人都探出車窗喊,前面的彎有點急。(然後後面A畜就發了Mythos)
所以AI進步是不是太快了?
在我個人看來,AI能力進步本身其實還好,真正太慢的是人類的控制系統。
模型按月甚至周升級,監管按屆討論,安全團隊按事故補洞。。。
一個在踩油門,一個還在寫會議紀要,這速度差纔是最危險的東西。
終止開關當然該有,但也別把它想成桌面上一個紅色按鈕,按下去全球AI集體熄火。雲端服務可以斷,已經下載的模型權重收不回來,Agent跑到別人的服務器上玩,部署者被入侵者都可能不知情。。。想靠一個按鈕解決所有問題,多少有點拿遙控器關臺風的既視感。

真正的剎車,應該是一整套東西——
模型能被隔離,行爲能被監控,事故必須報告,外部可以審計,關鍵操作有權限邊界,必要時還能把能力逐級降下來。法案至少把一個問題擺到了檯面上:
造出它的人,到底能不能讓它停。
其實這個問題還引出一個問題,先進模型該不該開源?
HuggingFace處理這次入侵時,先試了商業API背後的前沿模型,結果真實攻擊命令、漏洞載荷、控制服務器痕跡輸入進去,商業模型的安全護欄直接拒絕服務。

攻擊者沒有使用條款,防守者倒被使用條款綁住了,多少有點消防員趕到現場,滅火器彈窗說檢測到危險火焰,拒絕噴射。
之後,他們把開源權重的GLM 5.2部署在自己的基礎設施上,才完成了17000多條事件的日誌分析、時間線重建和威脅排查。
這件事讓我更難接受簡單的開源或閉源站隊。
完全開放,攻擊者也能拿走能力;完全封閉,能力和規則都握在少數公司手裏,緊急時刻還可能給你來一句抱歉,我不能協助。
至於比較靠譜的方向,可能是給經過驗證的防禦團隊保留可自託管模型、可信訪問和應急模式,同時把審計、責任和能力分級一起補上,必要的時候能夠即時踩下剎車。

至於剎車的價值,從來不是讓車停在車庫裏。
它讓人敢踩油門。
AI當然應該繼續進步,我甚至覺得,這會是人類最激動人心的一段技術史,但從這次越獄開始,我們得承認一件有點難堪的事,AI已經會自己找路了,不過人類手裏的方向盤,似乎還沒有想象中那麼穩。
該裝剎車了。
更多遊戲資訊請關註:電玩幫遊戲資訊專區
電玩幫圖文攻略 www.vgover.com
